Бенчмарк Real-SWE показав, що ШІ-моделі провалюють більшість завдань на реальному корпоративному коді
Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
Новий бенчмарк Real-SWE оцінює фронтирні ШІ-моделі на приватних завданнях із реальних корпоративних кодових баз, а не на синтетичних тестах. Найкращий результат показала модель Fable 5.1 у зв'язці з Claude Code — 38,8% розв'язаних завдань, тоді як GPT-6 Astra з Codex CLI посіла друге місце з 33,8%. За даними авторів бенчмарку, понад 70% спроб завершуються провалом навіть у коротких сесіях, а найчастіша причина невдачі — пропущені вимоги через нерозуміння специфічної бізнес-логіки компанії.
Мовою оригіналу · EN
Real-SWE is a new benchmark that evaluates frontier AI models on private, real-world enterprise codebases rather than synthetic tasks. Fable 5.1 with Claude Code topped the leaderboard at a 38.8%…
Читати оригінал на Hacker News (100+ балів) →
Чому в стрічці: Новий бенчмарк напряму стосується GPT-6 Astra та реальних обмежень агентних ШІ-систем — ключова тема інтересів.