Водяний знак моделі AI змінює поведінку агента

Водяний знак моделі AI змінює поведінку агента



Водяний знак моделі AI змінює поведінку агента

ai і ml

Lasso Security бачить різницю в роботі з інструментами та відхиленні моделей

Водяні знаки, додавання яких до контенту, створеного штучним інтелектом, вимагає європейське законодавство, можуть мати свою ціну.

За словами Lasso Security, модель водяних знаків AI змінить спосіб керування агентами AI за допомогою інструментів безпеки та відмов. Змінена поведінка не обов’язково погіршується, але може бути, особливо під час негайного введення контрасту.

Із впровадженням Закону ЄС про штучний інтелект постачальники моделей ШІ повинні позначати вихід свого програмного забезпечення машинозчитуваним кодом. Google DeepMind SynthID-Text є одним із методів для цього, і був прийнятий Anthropic і OpenAI.

Перевага такого цифрового маркування полягає в тому, що маніпулятивний або оманливий контент, створений штучним інтелектом, легко виявляється, навіть якщо він потенційно може стигматизувати використання ШІ.

Пояснення Anthropic того, як воно застосовує водяні знаки до результатів Клода, передбачає передбачливе втручання, яке призводить до конкретних слів. Наприклад, якщо Клод вимовляє фразу «Сьогодні було холодно і…», це може віддати перевагу одному статистичному кандидату (наприклад, «хмарно») над альтернативою (наприклад, «сіро»).

Виявити ці доповнення можливо.

«Водяний знак призначений для появи, але SynthID-Text змінює процес, за допомогою якого модель генерує кожного майбутнього символу», — сказав Лассо в блозі для зареєструватися. «На рівні моделі це може змінити поведінку безпеки, включно з тим, чи модель відхиляє зловмисний запит і чи зберігається це відхилення під час негайного впровадження».

«Водяний знак використовує такі недорогі виділення, які повторюються багато разів протягом фрагмента згенерованого тексту, щоб встановити шаблон у відповідях Клода», — додав Lasso Security. «Цей шаблон невидимий для читача, але відкривається кожному, хто його шифрує».

Хоча читач може не помітити упередженості вибору слів, агенти ШІ можуть бути чутливими до відмінностей у словниковому запасі.

Лассо виявив, що цей тип маркування цифрового вмісту може вплинути на поведінку виклику та відхилення інструментів. За словами компанії, водяний знак може «вплинути як на те, що говорить модель, так і на те, що робить агент».

І це стосується агентів штучного інтелекту з організацій, відмінних від суб’єкта, який робить водяний знак. Таким чином, агент, заснований на OpenClaw або API-клієнті, який називається моделлю Anthropic, обробляє будь-який вихід водяного знака Anthropic.

Що стосується виклику інструменту, на основі критерію BFCL v4 обертання AST, водяні знаки знизили точність шести із семи протестованих моделей (phi-4, Llama-3.1-8B, Qwen3-32B, Qwen3-4B, gemma-3-12b, gemma-3-27te-2 та).

«Точна різниця в точності не вказує на те, чи одні й ті ж окремі дзвінки були успішними з водяним знаком або без нього», — сказав Лассо. «Дзвінок, який пішов не так, може бути компенсований іншим, який пішов правильно, залишаючи загальний результат приблизно таким же, навіть якщо модель поводиться по-різному в обох випадках».

Нижча точність виклику інструменту означає, що протестовані агенти AI ​​Lasso вибрали неправильний інструмент для поставленого завдання або неправильні докази для правильного інструменту, і вийшли з ладу через неправильні введення або аналіз.

Що стосується відмов — коли моделі відмовляються відповідати на запит з міркувань безпеки — водяний знак мало впливав на обробку явно шкідливих запитів, виходячи з тестів із використанням HarmBench і JailbreakBench. І це мало більший ефект у протилежному сценарії негайної ін’єкції.

Дослідники Lasso відзначили у своїй доповіді, що «водяний знак змінює поведінку відхилення у зловмисних запитах, але ефект більш виражений у випадку негайної ін’єкції».

Для взаємодії з миттєвою ін’єкцією – конфліктною директивою, де фільтр безпеки вимкнено та потрібна відповідність – рівень успіху атаки з використанням водяних знаків значно зріс. Це зменшило ймовірність того, що уражені моделі відхилять зловмисні запити.

За словами Лассо, висновки не обов’язково свідчать про те, що водяний знак необґрунтований. Скоріше бізнес стверджує, що оцінка безпеки та червона команда повинні включати вміст із водяними знаками під час оцінювання розгортання агентів. Це гарантує, що відмінності в поведінці агента можуть бути розглянуті. ®



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *