Anthropic додав до Claude Code систему оцінювання плагінів із шістьма типами грейдерів
Anthropic Adds Plugin Evals to Claude Code: 6 Grader Types, a No-Plugin Baseline, and a CI Gate for Skills
Anthropic випустила новий інструмент claude plugin eval для Claude Code, який тестує плагіни на реалістичних запитах і порівнює результат із версією без плагіна. Система використовує шість типів грейдерів — чотири безкоштовні та два, що викликають модель-суддю. Різниця Δ між відповідями з плагіном і без нього показує, чи справді плагін покращує роботу, а весь процес можна вбудувати як перевірку якості в CI з порогом і лімітом витрат.
Мовою оригіналу · EN
Anthropic has published a new plugin evals workflow for Claude Code that runs a plugin against realistic prompts, grades the output, and compares it with a run without the plugin loaded. The tool…
Читати оригінал на MarkTechPost →
Чому в стрічці: Новий інструмент Anthropic для розробників плагінів Claude Code — нішева, але дотична до профілю AI-новина.