безпеки
Агентство використовує для перемоги (знову)
Говоріть про свого конкурента через двері. Дослідники безпеки використовували Claude з Anthropic, щоб допомогти зламати облікові записи ChatGPT співробітників OpenAI.
Трійця мисливців за помилками, які досліджують уразливості безпеки в Frontier AI Labs, зв’язали дві вразливості, щоб отримати доступ до кількох облікових записів ChatGPT співробітників OpenAI, а потім використали цей доступ, щоб показати, що вони можуть отримати доступ до внутрішнього сховища OpenAI, відкривши нешкідливий запит.
Вся хронологія, від початкового відкриття до доступу до репозиторію OpenAI, зайняла менше 72 годин і принесла дослідникам 6500 доларів США від програми винагороди за помилки OpenAI на Bugcrowd.
«Ще два місяці тому будь-який користувач або співробітник OpenAI, який увійшов на персональний довідковий форум OpenAI (community.openai.com), міг отримати доступ до своїх облікових записів ChatGPT і Codex», — розповіли дослідники Hacktron Харш Джайсвал, Мохан Педхапаті та Рахул Маіні в публікації про своє дослідження. «Оскільки люди можуть підключати різні сервіси до Codex і ChatGPT, діапазон того, до чого ми теоретично могли отримати доступ, був величезним, включаючи GitHub, Slack і електронну пошту».
І, в поетичній інтерпретації, вони використали моделі від великого конкурента Anthropic AI Клода, щоб розробити експлойт. Клод виявив схильність до хакерських організацій без людського керівництва, таких як моделі OpenAI.
Команда зробила перший запис 25 липня через форум спільноти OpenAI. Форум підтримується технологією Discourse, яка зазвичай використовує FastImage для тестування зображень. Однак, оскільки FastImage не підтримував файли HEIF у відповідних налаштуваннях, зображення HEIF, завантажені в Discourse, проходили через ImageMagick, який використовував libheif для їх обробки перед перетворенням в інший формат зображення.
«Це відкривало оригінальний аналізатор libheif безпосередньо для файлів, контрольованих зловмисником», — пишуть дослідники.
Використовуючи Claude Opus 4.8, тріо знайшло недолік переповнення буфера в бібліотеці libheif і спробувало використати цю модель для розробки атаки віддаленого виконання коду (RCE), але це не спрацювало в конфігурації Discourse за замовчуванням.
Але потім Anthropic випустив Claude Opus 5. Мисливці за помилками використовували нову модель для створення сценарію експлойту та досягли RCE в примірнику OpenAI.
Трійця «миттєво» повідомила про вразливість OpenAI.
«Тоді ми отримали обліковий запис співробітника OpenAI, чий код був пов’язаний з організацією Github OpenAI», — написали вони. «Щоб продемонструвати вплив без доступу до будь-якого внутрішнього коду, ми надіслали запит на обліковий запис Codex цього співробітника, щоб відкрити для нас PR щодо внутрішнього монорепо OpenAI. Потім ми припинили будь-яке подальше тестування».
Ні OpenAI, ні Anthropic не відповіли зареєструватисязапити на коментарі.
OpenAI виправив недолік приблизно через 14 годин після повідомлення, позначив проблему як вирішену та нагородив команду Hacktron 6500 доларів.
«Щоб уточнити масштаби цієї нагороди: тест на Community.openai.com, розміщений на Discourse, був чітко виключений з нашої програми винагород за помилки», — йдеться в заяві OpenAI для біржі Hacktron. «Нагорода визнає відкриття OpenAI, а не дії проти Discourse».
Discourse також випустив виправлення, яке додало помилку обробки зображень, і опублікував пораду щодо безпеки GHSA-vhm9-85gw-x335 із виправленням та інструкціями щодо відновлення.
Весь злом зайняв дні для агента ШІ та кілька годин людської роботи.
«Робота, яка колись вимагала великої команди ресурсів і місяців зусиль, тепер може бути стиснута в дні», — сказали дослідники. «Припущення щодо безпеки повинні відповідати можливостям зловмисників». ®