Дешева модель GPT-5.6 Luna знайшла 75% багів GPT-6 Astra за 3,6% її вартості
GPT-5.6 Luna vs. GPT-6 Astra: Is a $1.20 Model Good Enough for Code Review?

Дослідження Entelligence порівняло перевірку пул-реквестів моделями GPT-5.6 Luna та GPT-6 Astra: Luna знайшла 69 підтверджених багів проти 92 в Astra, витративши лише 3,6% від її вартості. Точність Luna виявилася нижчою — близько чверті її зауважень не підтвердилися, тоді як у Astra лише 4 з 96. Найбільший розрив зафіксували в коді автентифікації й дозволів: на бенчмарку Keycloak Astra знайшла 14 багів проти 6 у Luna.
Мовою оригіналу · EN
A study by Entelligence compared GPT-5.6 Luna and GPT-6 Astra on code review across 50 pull requests: Luna found 69 verified bugs versus Astra's 92, at just 3.6% of the cost. Luna's precision was…
Читати оригінал на Hacker News (100+ балів) →
Чому в стрічці: Прямо в ядрі інтересу: бенчмарк GPT-6 Astra на реальних задачах код-рев'ю, як минулі кліки.