У дослідженні ByteDance Seed лише 34 з 64 змін агентного каркаса ШІ виявились стійкими

Can LLMs Engineer Their Own Agent Harness? ByteDance Seed’s HarnessDev Says Only 34 of 64 Changes Generalize

Дослідники ByteDance Seed та партнерів перевірили, чи здатні мовні моделі самостійно створювати й вдосконалювати «каркас» ШІ-агента — код виконання, інструментів і перевірки навколо моделі. За результатами експерименту HarnessDev, лише 34 з 64 змін, внесених моделями під час «еволюції» каркаса, узгоджено вплинули і на тестові, і на приховані задачі. Найкраща модель, Opus 4.8, впритул наблизилася до створеного людьми еталону у написанні текстів та ML-експериментах, але суттєво відстала у програмуванні та пошуку.

Мовою оригіналу · EN

Researchers from ByteDance Seed and partners tested whether LLMs can build and evolve their own agent harness — the execution loop, tools and verification code around a model. Their HarnessDev study…

Читати оригінал на MarkTechPost →

Чому в стрічці: Технічне дослідження про самовдосконалення агентних каркасів ШІ — профільний інтерес до AI-агентів.

← Назад до стрічки