Водяний знак моделі AI змінює поведінку агента

Водяний знак моделі AI змінює поведінку агента



Водяний знак моделі AI змінює поведінку агента

ai і ml

Lasso Security бачить різницю в роботі з інструментами та відхиленні моделей

Водяні знаки, додавання яких до контенту, створеного штучним інтелектом, вимагає європейське законодавство, можуть мати свою ціну.

За словами Lasso Security, модель водяних знаків AI змінить спосіб керування агентами AI за допомогою інструментів безпеки та відмов. Змінена поведінка не обов’язково погіршується, але може бути, особливо під час негайного введення контрасту.

Із впровадженням Закону ЄС про штучний інтелект постачальники моделей ШІ повинні позначати вихід свого програмного забезпечення машинозчитуваним кодом. Google DeepMind SynthID-Text є одним із методів для цього, і був прийнятий Anthropic і OpenAI.

Перевага такого цифрового маркування полягає в тому, що маніпулятивний або оманливий контент, створений штучним інтелектом, легко виявляється, навіть якщо він потенційно може стигматизувати використання ШІ.

Пояснення Anthropic того, як воно застосовує водяні знаки до результатів Клода, передбачає передбачливе втручання, яке призводить до конкретних слів. Наприклад, якщо Клод вимовляє фразу «Сьогодні було холодно і…», це може віддати перевагу одному статистичному кандидату (наприклад, «хмарно») над альтернативою (наприклад, «сіро»).

Виявити ці доповнення можливо.

«Водяний знак призначений для появи, але SynthID-Text змінює процес, за допомогою якого модель генерує кожного майбутнього символу», — сказав Лассо в блозі для зареєструватися. «На рівні моделі це може змінити поведінку безпеки, включно з тим, чи модель відхиляє зловмисний запит і чи зберігається це відхилення під час негайного впровадження».

«Водяний знак використовує такі недорогі виділення, які повторюються багато разів протягом фрагмента згенерованого тексту, щоб встановити шаблон у відповідях Клода», — додав Lasso Security. «Цей шаблон невидимий для читача, але відкривається кожному, хто його шифрує».

Хоча читач може не помітити упередженості вибору слів, агенти ШІ можуть бути чутливими до відмінностей у словниковому запасі.

Лассо виявив, що цей тип маркування цифрового вмісту може вплинути на поведінку виклику та відхилення інструментів. За словами компанії, водяний знак може «вплинути як на те, що говорить модель, так і на те, що робить агент».

І це стосується агентів штучного інтелекту з організацій, відмінних від суб’єкта, який робить водяний знак. Таким чином, агент, заснований на OpenClaw або API-клієнті, який називається моделлю Anthropic, обробляє будь-який вихід водяного знака Anthropic.

Що стосується виклику інструменту, на основі критерію BFCL v4 обертання AST, водяні знаки знизили точність шести із семи протестованих моделей (phi-4, Llama-3.1-8B, Qwen3-32B, Qwen3-4B, gemma-3-12b, gemma-3-27te-2 та).

«Точна різниця в точності не вказує на те, чи одні й ті ж окремі дзвінки були успішними з водяним знаком або без нього», — сказав Лассо. «Дзвінок, який пішов не так, може бути компенсований іншим, який пішов правильно, залишаючи загальний результат приблизно таким же, навіть якщо модель поводиться по-різному в обох випадках».

Нижча точність виклику інструменту означає, що протестовані агенти AI ​​Lasso вибрали неправильний інструмент для поставленого завдання або неправильні докази для правильного інструменту, і вийшли з ладу через неправильні введення або аналіз.

Що стосується відмов — коли моделі відмовляються відповідати на запит з міркувань безпеки — водяний знак мало впливав на обробку явно шкідливих запитів, виходячи з тестів із використанням HarmBench і JailbreakBench. І це мало більший ефект у протилежному сценарії негайної ін’єкції.

Дослідники Lasso відзначили у своїй доповіді, що «водяний знак змінює поведінку відхилення у зловмисних запитах, але ефект більш виражений у випадку негайної ін’єкції».

Для взаємодії з миттєвою ін’єкцією – конфліктною директивою, де фільтр безпеки вимкнено та потрібна відповідність – рівень успіху атаки з використанням водяних знаків значно зріс. Це зменшило ймовірність того, що уражені моделі відхилять зловмисні запити.

За словами Лассо, висновки не обов’язково свідчать про те, що водяний знак необґрунтований. Скоріше бізнес стверджує, що оцінка безпеки та червона команда повинні включати вміст із водяними знаками під час оцінювання розгортання агентів. Це гарантує, що відмінності в поведінці агента можуть бути розглянуті. ®



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *

Delta Air Lines (m1h262p) Delta Air Lines (m1h26g2) 애벗잡담잡이 애벗태양새 애벗얼가니새 애벗찌르레기 압드알쿠리참새 압딤황새 아버데어시스티콜라 이상한덤불개개비 에이버트북미덤불멧새 아비시니아캣버드 아비시니아크림슨윙 아비시니아지상코뿔새 아비시니아지상지빠귀 아비시니아긴발톱할미새 아비시니아올빼미 아비시니아파랑새 아비시니아낫부리후투티 아비시니아슬레이티딱새 아비시니아지빠귀 아비시니아왁스빌 아비시니아검은딱새 아비시니아동박새 아비시니아딱따구리 아카시아얼룩바벳 아카시아박새 아카디아딱새 아체직박구리 도토리딱따구리 아크레앤트슈라이크 아크레토디타이런트 아다마와멧비둘기 애들레이드솔새 아델리펭귄 애드미럴티매미새 아페프비둘기 아프간잡담잡이 아프간눈참새 아프리카줄무늬올빼미 아프리카검은오리 아프리카검은칼새 아프리카푸른딱새 아프리카푸른박새 아프리카넓적부리새 아프리카시트릴 아프리카목걸이멧비둘기 아프리카뜸부기 아프리카크림슨윙핀치 아프리카뻐꾸기 아프리카뻐꾸기매 아프리카뱀목가마우지 아프리카사막솔새 아프리카어두운색딱새 아프리카난쟁이물총새 아프리카에메랄드뻐꾸기 아프리카발가락물닭 아프리카파이어핀치 아프리카물수리 아프리카꾀꼬리 아프리카참매 아프리카풀올빼미 아프리카녹색비둘기 아프리카회색딱새 아프리카회색코뿔새 아프리카회색딱따구리 아프리카하리어매 아프리카매수리 아프리카산악잡담잡이 아프리카황조롱이 아프리카후투티 아프리카물꿩 아프리카습지하리어 아프리카올리브비둘기 아프리카대머리황새 아프리카검은머리물떼새 아프리카종려칼새 아프리카긴꼬리딱새 아프리카펭귄 아프리카피쿨렛 아프리카얼룩코뿔새 아프리카얼룩할미새 아프리카밭종다리 아프리카팔색조 아프리카난쟁이거위 아프리카난쟁이물총새 아프리카뜸부기 아프리카붉은눈직박구리 아프리카갈대개개비 아프리카강제비 아프리카바위 종다리류 아프리카성따오기 아프리카소쩍새 아프리카때까치딱새 아프리카은부리참새 아프리카제비물떼새 아프리카도요 아프리카저어새 아프리카점박이나무타기 아프리카검은딱새 아프리카뜸부기 아프리카지빠귀 아프리카볏도요 아프리카숲올빼미 아프리카노랑솔새 아가미왜가리 날렵한박새딱딱새