Стартап Earendil розробив метрики для вимірювання «неохайності» коду від ШІ-агентів

Measuring the sloppiness of code

Дослідник стартапу Earendil запропонував кількісні метрики «слопу» — зайвої складності та дублювання коду, який генерують ШІ-агенти. За даними бенчмарку SlopCodeBench, код агентів у середньому вдвічі «багатослівніший» і «еродованіший» за код у встановлених людських репозиторіях. Автор зазначає, що навіть найсучасніші моделі показують 0% успіху в тесті, який імітує ітеративну розробку з поступовим стиранням контексту, що ставить під сумнів здатність агентів самостійно позбуватися накопиченого технічного боргу.

Мовою оригіналу · EN

A researcher at startup Earendil proposes quantitative metrics — verbosity and erosion — to measure the 'sloppiness' of AI-generated code, since AI-as-judge and simple LOC counts prove unreliable. On…

Читати оригінал на Hacker News (100+ балів) →

Чому в стрічці: Технічний есей на Hacker News про якість коду ШІ-агентів — жанр, що стабільно конвертується в кліки користувача.

← Назад до стрічки