Perplexity навчила агента ШІ виправляти власні помилки на реальних сесіях

Perplexity Trains Its Computer Agent on Real Mistakes With Hint-Guided Self-Distillation

Компанія Perplexity опублікувала дослідження про новий метод донавчання агента Perplexity Computer на реальних, зокрема невдалих, сесіях користувачів. Метод поєднує fine-tuning на успішних прикладах із «hint-guided self-distillation» для виправлення помилкових кроків. У живому A/B-тесті частка невдалих викликів інструментів знизилася з 2,24% до 1,77% — статистично значуще зниження на 21,2%. Ваги моделі та код навчання компанія поки не публікує.

Мовою оригіналу · EN

Perplexity Research published a study training its Computer agent on real, including failed, user sessions using hint-guided self-distillation combined with rejection sampling fine-tuning. In a live…

Читати оригінал на MarkTechPost →

Чому в стрічці: Технічна новина про новий метод донавчання AI-агентів, релевантна інтересу до AI-моделей.

← Назад до стрічки