UK AI Security Institute та EvalEval відкрили доступ до відтворюваних результатів оцінювання ШІ
How UK AISI and EvalEval Are Making Benchmark Results Reproducible

Британський UK AI Security Institute почав публікувати верифіковані результати тестування провідних мовних моделей через інфраструктуру EvalEval Coalition, повідомляє Hugging Face. Дані охоплюють п'ять бенчмарків — включно з HealthBench, FrontierMath та Humanity's Last Exam — для шести флагманських моделей Claude та GPT, а також два кіберевалюації. Мета ініціативи — зробити оцінювання ШІ-систем відтворюваним і порівнюваним між дослідниками.
Мовою оригіналу · EN
The UK AI Security Institute (AISI) is now sharing verified evaluation results through EvalEval's Evaluation Cards infrastructure, covering five benchmarks including HealthBench, FrontierMath and…
Читати оригінал на Hugging Face →
Чому в стрічці: Стосується стандартизації оцінювання ШІ-моделей і охоплює Claude — дотично до сталого інтересу користувача до AI-безпеки та керування.