BottleCap AI випустила ThinkingCap-Qwen3.8-27B зі скороченням токенів мислення на 37%
BottleCap AI Releases ThinkingCap-Qwen3.8-27B: 37.2% Fewer Thinking Tokens at a 0.86pp Accuracy Cost
Компанія BottleCap AI випустила ThinkingCap-Qwen3.8-27B — тонке налаштування моделі Qwen3.8-27B, яке в середньому на 37,2% скорочує кількість токенів «мислення» при падінні точності лише на 0,86 відсоткового пункту. Модель є прямою заміною оригіналу для vLLM і SGLang та доступна у форматах FP8, NVFP4, GGUF і MLX. Найбільше падіння точності — на тесті AIME 2026, тоді як результати з довгим контекстом навіть покращилися.
Мовою оригіналу · EN
BottleCap AI released ThinkingCap-Qwen3.8-27B, a fine-tune of Qwen3.8-27B that cuts thinking tokens by 37.2% on average across 12 benchmarks for a 0.86pp accuracy drop. It's a drop-in replacement…
Читати оригінал на MarkTechPost →
Чому в стрічці: Нішевий, але технічно цікавий AI-реліз про ефективність reasoning-моделей.