Бенчмарк спростував заяви про економію 60% токенів від інструменту RTK для AI-агентів

RTK reports token savings, but our cost benchmarks disagree

Дослідники протестували популярний інструмент RTK, який стискає термінальний вивід для AI-агентів, на бенчмарку Terminal-Bench 2.1 з моделями Fable 5.0 (Claude Code) та DeepSeek V4 Pro (OpenCode). Попри поширену в соцмережах заяву про економію до 60% токенів, реальні витрати практично не змінилися для Fable і зросли на 17-18% для DeepSeek. За словами авторів, які витратили понад $1500 на 1740 тестових прогонів, метрика «rtk gain», яку рекламує інструмент, не відображає фактичну економію коштів, оскільки не враховує додаткові ходи агента.

Мовою оригіналу · EN

Researchers benchmarked RTK, a popular tool that compresses terminal output for AI coding agents, on Terminal-Bench 2.1 using Claude Code with Fable 5.0 and OpenCode with DeepSeek V4 Pro. Despite a…

Читати оригінал на Hacker News (100+ балів) →

Чому в стрічці: Глибокий технічний аналіз реальної економії коштів AI-агентів — тема, яку користувач активно читає на Hacker News.

← Назад до стрічки