Дослідження: ШІ-агенти погано застосовують техніки тестування коду навіть за прямими вказівками
How well do agents use test/verification techniques?
Автор блогу danluu.com протестував 26 технік і бібліотек тестування (TDD, формальні методи, property-based testing, фазинг тощо), даючи ШІ-агентам на базі GPT-5.6 Sol пряму вказівку їх використовувати при реалізації Zstd та інших протоколів на Rust. Виявилося, що жодна техніка суттєво не покращує коректність коду: агенти або пишуть звичні поверхневі тести всередині «обгортки» потрібної техніки, або застосовують її формально, не отримуючи реальної користі. TDD показав гірші результати, як і передбачалося, а формальні методи не перевершили прості вказівки без інструкцій.
Мовою оригіналу · EN
A blogger tested 26 prompt conditions (TDD, formal methods, property-based testing, fuzzing, etc.) instructing coding agents (codex with GPT-5.6 Sol) to use specific testing techniques while…
Читати оригінал на Hacker News (100+ балів) →
Чому в стрічці: Технічне дослідження про можливості ШІ-агентів у тестуванні коду — збігається зі стійким інтересом користувача до теми AI та Hacker News.