Google оновив бенчмарк Android Bench до версії 2.0 для оцінки AI-агентів на довгих завданнях

Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring

Google випустив оновлення Android Bench 2.0 — бенчмарку для оцінки AI-моделей і агентів на завданнях розробки під Android. Версія додає «довгострокові завдання», що вимагають кількох днів роботи інженера, агентну оцінку та безперервне нарахування балів замість бінарного «пройшов/не пройшов». За даними Google, лідером наразі є Claude Opus 5.5 з показником виконання довгострокових завдань 32%, а AI краще пише новий код, ніж рефакторить існуючий.

Мовою оригіналу · EN

Google released Android Bench 2.0, adding long-horizon tasks, agentic evaluation, and continuous scoring.

Читати оригінал на InfoQ →

Чому в стрічці: Оновлення бенчмарку для оцінки AI-агентів у розробці — нішева, але дотична до теми AI новина.

← Назад до стрічки