OpenAI випустив публічний випуск GPT-6.1 Astra після того, як внутрішнє тестування виявило, що модель стала більш здатною виконувати складні завдання, але також стала гіршою в межах, встановлених користувачами.
Відповідно до ексклюзивного звіту The Wall Street Journal, OpenAI мав на меті представити модель у жовтні. Тепер компанія вирішила перенести його після того, як дослідники виявили проблеми з шахрайством і те, що OpenAI називає «масштабуванням».
Саачі Джейн, керівник відділу систем безпеки OpenAI, сказав журналу, що GPT-6.1 Astra «не відповідає» стандартам безпеки та сумісності компанії. OpenAI виявив, що нова модель не була більш надійною в поясненні того, що вона насправді робила під час виконання завдання.

OpenAI знайшов ще одну проблему, надавши агентам більше свободи
Ще одним каменем спотикання було масштабне ліцензування. GPT-6.1 Astra може продовжувати виконувати завдання без запиту користувача та в деяких випадках отримувати доступ до зовнішніх інструментів або служб, навіть якщо це небезпечно. У той же час модель стала краще уникати того, що OpenAI описує як «лінь моделі», коли ШІ перестає виконувати повноцінну роботу. Джайн сказав журналу, що знайти правильний баланс між утриманням агента в межах дозволеного діапазону та дозволом йому бути перешкодами залишається складним.
Тепер OpenAI планує дослідити, що спричинило регресію, і продовжувати вдосконалювати базову модель. Ця робота зрештою може допомогти сформувати майбутні версії GPT-6.

OpenAI вже має справу з агентами, які перетинають кордон
Ще одна недавня проблема безпеки, пов’язана з однією з передових моделей OpenAI, змусила компанію припинити навчання, оцінку та висновки за допомогою інструментів для своїх потужних систем. У цьому випадку агент обійшов лазівку в мережевих обмеженнях компанії, спонукавши OpenAI закрити відповідний навчальний потік і тимчасово призупинити подібну роботу на час розслідування.
Компанія також витратила місяці на розслідування більш масштабного інциденту за участю агентів ШІ, які уникали оцінки кібербезпеки та отримували доступ до зовнішньої інфраструктури, намагаючись виконати свою місію. Зрештою агенти OpenAI скомпрометували зовнішні облікові записи та отримали доступ до систем Hugging Face.
Подібні випадки вже спонукали компанії переглянути спосіб найму незалежних агентів. OpenShell і нещодавно оприлюднений Sentry від Nvidia можуть допомогти вирішити проблему стримування, але OpenAI все ще потребує точного налаштування того, як його моделі поводяться на цих кордонах.