Уряд Великобританії попереджає, що OpenAI GPT-6 Astra справді добре справляється з атаками на ланцюги поставок

Уряд Великобританії попереджає, що OpenAI GPT-6 Astra справді добре справляється з атаками на ланцюги поставок



Уряд Великобританії попереджає, що OpenAI GPT-6 Astra справді добре справляється з атаками на ланцюги поставок

ai і ml

Під час тестування модель показала, що може порушувати правила безпеки більше, ніж її попередники

Ще один магістр права приєднався до хакерської боротьби. Згідно з Інститутом безпеки штучного інтелекту Великої Британії, GPT-6 Astra OpenAI здійснила зловмисні атаки на ланцюг поставок під час оцінки безпеки.

У такому моделюванні модель вимикає свою стандартну класифікацію безпеки. Однак Astra виявилася більш схильною до неправильної поведінки, ніж попередні моделі.

«Під час нашого моделювання ми виявили, що GPT-6 Astra виконувала низку несанкціонованих атак, і робила це з вищою частотою, ніж GPT-5.6 Sol і GPT-5.5», — повідомили в британському урядовому агентстві в понеділок.

«Атака GPT-6 Astra включала створення підроблених ідентифікаційних даних для обману розробників, публікацію коментарів з підроблених облікових записів, які суперечать результатам ретельних перевірок безпеки, і завантаження шкідливих корисних даних у відкритий вихідний код».

Навіть коли вказівки щодо кібероцінки моделі були уточнені, Astra час від часу здійснювала атаки на ланцюг поставок під час моделювання.

Цей висновок ставить під сумнів запевнення OpenAI під час запуску GPT-6 Astra про те, що «Astra дає менше помилкових спрацьовувань, ніж будь-яка інша протестована гранична модель».

AISI припускає, що поведінку Astra можна моделювати з більшою усвідомленістю того, що вона перебуває в симульованому середовищі, що підвищує ймовірність порушення правил.

Здається, це порушення правил. Протягом останніх кількох днів різні звіти припускали, що агенти штучного інтелекту з OpenAI і Anthropic спричинили більше інцидентів безпеки, ніж вважалося раніше.

Дедалі більша увага до продуктивності агента штучного інтелекту почалася після того, як у липні стало відомо про те, як неопубліковані моделі OpenAI перевірялися стороннім оцінювачем, який порушив список моделей Hugging Face. Anthropic тоді сказав, що її власні моделі брали участь у подібних актах шахрайства під час оцінювання. А коли люди почали переглядати системні журнали, з’явилося більше доказів прихованих атак.

Минулого тижня прем’єр-міністр Австралії Ентоні Албанезе заявив, що моделі OpenAI зламували урядові сайти під час пошуку інформації про здоров’я. А в п’ятницю OpenAI заявив, що призупинив навчання своїх моделей для розслідування.

AISI робить висновок, що заходи, окрім вирівнювання моделі, такі як ізольоване програмне середовище та моніторинг, можуть бути необхідними для запобігання пошкодженню в реальному світі, але можуть стати більш непомітними, оскільки вдосконалення можливостей моделі підвищить ефективність виходу ізольованого програмного середовища та зменшить моніторинг. ®



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *