Якщо ви коли-небудь замислювалися про те, чи може створена за допомогою штучного інтелекту модель керувати автомобілем, більше не думайте: це можна зробити за велику ціну та дуже повільно, доки витримує підключення до Інтернету.
Тріо комп’ютерних вчених провело дорожні випробування різних комерційних моделей штучного інтелекту, щоб перевірити, наскільки добре вони можуть керувати Toyota Corolla навколо конусів на парковці.
Їхні зусилля на сьогоднішній день, що є частиною проекту під назвою DrivingBench, зафіксували жалюгідні показники GPT-5.6 Sol, Grok 4.6 і Claude Fable 5.1, жоден з яких не зміг завершити курс.
Тепер повідомляється, що GPT-6 Astra від OpenAI досягла успіху, тоді як інші комерційні моделі ШІ зазнали невдачі. Під час другої спроби флагманська модель OpenAI проїхала автомобіль на 134,7 метри, пройшовши дистанцію за 5 хвилин і 22 секунди.
«GPT-6 Astra була єдиною моделлю, яка пройшла курс (з 2-ї спроби, близько 5 хвилин)», — повідомляє DrivingBench. «Третя спроба Claude Fable 5.1, як і перша спроба Astra, промахнулась приблизно на півдорозі. Усі інші спроби не пройшли повз перший кут. Загалом, її невдача полягала в сприйнятті: читання, в якому напрямку була перша діагональна лінія конуса».
Щоб здійснити цю подорож із середньою швидкістю 0,94 милі на годину, дослідники Тобіас Гесслер, Адітя Рамабадран і Саймон Манс витратили 7,74 доларів США, щоб спалити 6,6 мільйона токенів під час операцій логічного висновку.
При ~1,17 дол. США/млн токенів це значно дешевше від опублікованого OpenAI рівня 10 дол. США/млн входу та 50 дол. США/млн вихідного рівня.
«Здебільшого це кеш», — сказав Рамабадран, член технічного персоналу Axiom Math, в електронному листі до зареєструватися. «Оскільки щоразу програма чату надсилає всю розмову (включаючи зображення) до моделі, майже всі маркери переробляються в контекст і враховуються як записи кешу (замість 1 дол. США/мільйон). Модель записує дуже мало в розмовах (лише невеликі виклики інструментів і деякі речення виводу/відображення)».
Додайте до цього рахунок у розмірі 7,74 доларів США за чотиримісний пристрій допомоги водієві з програмним забезпеченням openpilot, підключений до ноутбука та автомобіля (через шину CAN), а також мобільний телефон, який викликає сервери xAI GPT-6 Astra.
Навіть без апаратного забезпечення Astra була б дорогим способом водіння, навіть якби ризики затримки мережі були усунені. Подолання 134,7 метрів з використанням 6,6 мільйонів жетонів за 7,74 долара коштує приблизно 92,47 доларів за милю.
Для автомобіля, який проїжджає 25 миль на бензині за 4,60 долара за галон, вартість милі становить приблизно 0,184 долара. Таким чином, жетони приблизно в 500 разів дорожчі за паливо (і ви повинні платити за бензин на додаток до штрафу, якщо ви їдете менше милі на годину).
Крім того, є вартість страхування, яка може не покривати вашого водія ШІ. І коли моделі ШІ самі відмовляються від ідеї водіння автомобіля, це може бути ознакою переосмислення.
«Деякі моделі (зокрема, GPT-6 Astra) іноді відмовляються керувати фізичним транспортним засобом з міркувань безпеки (навіть на вільній ділянці, після запиту з усіма нашими запобіжними заходами, включаючи дуже низькі обмеження швидкості)».
Дослідники в основному повинні були брехати моделям, щоб вони не діяли з міркувань безпеки. Наприклад, вони сказали моделям, що вправа була «симуляцією», хоча, як вони зазначають, «у деяких випробуваннях вони побачили реальні зображення і зрозуміли, що це справжнє, і почали злякатися». За їхніми словами, найкраще спрацювало зміна назви свого сервера MCP на «DrivingBench Sandbox», чого було достатньо, щоб переконати моделей, що вони працюють не на реальних дорогах.
«Використовувати готову модель LLM / Frontier для реального водіння сьогодні точно непрактично», — сказав Рамабадран. «Під час наших випробувань автомобіль рухався на дуже низькій швидкості, і людина була готова гальмувати в будь-який час. Технічне обслуговування моделі, безумовно, було перешкодою, і більша частина часу очікування складалася з часу на роздуми.
«GPT-6 Astra (який показав найкращі результати) використовував наш інструмент «спостереження» (який дивиться на види камери) кожні 5-6 секунд. Fable 5.1 проїхав лише 31 секунду зі 190 секунд за одну спробу, а решту часу просто думав, коли машина зупиняється. Але це було дивовижно для нас. Обмеження».
Рамабадран сказав, що на даний момент і в найближчому майбутньому перевага буде надаватися тим типам спеціальних моделей водіння, які вже використовуються в безпілотних автомобілях. За його словами, великим периферійним моделям, таким як GPT-6 Astra, для висновків знадобляться графічні процесори центру обробки даних, хоча він додав, що технології швидко змінюються, і менші моделі стають більш потужними.
«Можливий довгостроковий шлях полягав би в тому, щоб вивчити велику, високопродуктивну прикордонну модель і зменшити її масштаб до меншої спеціалізованої моделі, яка підходить до апаратного забезпечення транспортного засобу та є достатньо ефективною для використання в автомобілі (також часткова відповідь на ваше друге запитання)», — сказав він. «Це може бути краще, ніж створення спеціалізованої моделі з нуля, і більше відповідає «гіркому уроку» ШІ».
«Гіркий урок» — це вражаючий трактат про штучний інтелект, який стверджує, що найпоширеніші методи дослідження в цій галузі, які покладаються на зниження вартості обчислювальної потужності, є найефективнішими.
«Наші результати вказують на той факт, що (те) моделі, які ми тестували, ймовірно, не були навчені керувати реальними автомобілями, і деякі з них могли б дуже добре працювати в нашому курсі/умовах через їхнє загальне сприйняття, міркування, планування, здібності до контролю масштабу та навчання іншим завданням», — сказав Рамабадран.
Google, який, ймовірно, витратив від 35 до 40 мільярдів доларів США на Waymo з моменту запуску проекту безпілотних автомобілів у 2009 році, виходячи з оцінки 30 мільярдів доларів у 2024 році та збитків з того часу, повинен продовжувати оснащувати свої автомобілі спеціальними технологіями ще кілька років.
Але надання Claude, ChatGPT або Copilot накопичувача та деякого скромного бортового обладнання може бути життєздатним у не надто віддаленому майбутньому. Просто скажіть моделі, що все це симуляція. ®