Anthropic додав до Claude Code систему оцінювання плагінів із шістьма типами грейдерів

Anthropic Adds Plugin Evals to Claude Code: 6 Grader Types, a No-Plugin Baseline, and a CI Gate for Skills

Anthropic випустила новий інструмент claude plugin eval для Claude Code, який тестує плагіни на реалістичних запитах і порівнює результат із версією без плагіна. Система використовує шість типів грейдерів — чотири безкоштовні та два, що викликають модель-суддю. Різниця Δ між відповідями з плагіном і без нього показує, чи справді плагін покращує роботу, а весь процес можна вбудувати як перевірку якості в CI з порогом і лімітом витрат.

Мовою оригіналу · EN

Anthropic has published a new plugin evals workflow for Claude Code that runs a plugin against realistic prompts, grades the output, and compares it with a run without the plugin loaded. The tool…

Читати оригінал на MarkTechPost →

Чому в стрічці: Новий інструмент Anthropic для розробників плагінів Claude Code — нішева, але дотична до профілю AI-новина.

← Назад до стрічки