
Розробка Google Android Bench продовжується сьогодні з версією 2.0, яка відображає, як ШІ може виконувати складніші завдання розробки.
Перша версія «зосереджена на поступових змінах існуючих сховищ», таких як виправлення помилок або менші запити. Android Bench 2.0 призначений для «надзвичайно складних завдань, на виконання яких у інженера знадобляться дні або навіть тиждень», наприклад додавання нових функцій, створення програм з нуля та перетворення кросплатформних програм на Android.
Цей новий фокус вимагав «точнішого оцінювання та оцінювання», що виходить за рамки прохідних чи неспроможних оцінок. Google переходить від двійкових до постійних значень:
Ми обчислюємо цю швидкість завершення, поєднуючи такі фактори, як функціональність, візуальна точність і уникнення регресії. Ми також застосовуємо об’єктивні штрафи за відхилення від інструкцій з оцінки чи структурних обмежень.
Google оцінив Gemini 3.7/3.8 Flash, OpenAI GPT-6, Anthropic Fable 5.1, Kimi K3 і Qwen 3.8 Max. GPT-6 Astra виходить на перше місце з показником проходження 28% (порівняно з результатами в діапазоні 90% за попереднього підходу).

Google поділився ідеєю про те, як «перенесення кросплатформних програм на Android залишається відкритою проблемою — жодна модель не досягає 100% передачі, а граничні моделі досягають не більше 80%».
- «…Штучний інтелект краще пише новий код, ніж рефакторинг існуючого коду. Рефактори та міграції стають складнішими, оскільки успіх залежить від складності архітектури, а не від обсягу коду».
- «Моделі демонструють сильні можливості в чітко визначених і визначених перетвореннях, таких як перетворення Java на Kotlin, заміна Retrofit на Ktor або впровадження рівня ViewModel».
- «…моделі відчувають труднощі, коли завдання вимагають перевірки під час виконання (наприклад, графіки впровадження залежностей), передбачають порушення фреймворку або стикаються з прогалинами в знаннях через неопубліковані бібліотеки».
Щоб оцінити агент, Android Bench запустив «агентів від відповідного постачальника моделі», наприклад Gemini 3.8 Flash із Google Antigravity та GPT-5.6 Sol із Codex. Google каже, що «дизайн інструментів позитивно впливає на результати розробників», а Android Bench планує включити різні комбінації моделей і агентів у майбутньому.


FTC: ми використовуємо партнерські посилання для автоматичного заробітку. більше.