Тест Tom's Hardware: Qwen 3.8 27B впирається у вузькі місця софту навіть на RTX 5090
Benchmarking Qwen 3.8 27B on RTX 5090 and beyond — VRAM capacity alone can't overcome severe software and inference engine bottlenecks

За даними Tom's Hardware, тестування відкритої моделі Qwen 3.8 27B на відеокартах RTX 5090, 4090, 3090 та системах DGX Spark, Mac Studio й Ryzen AI Halo показало, що самого обсягу відеопам'яті недостатньо для швидкої роботи з великим контекстом. Рушій llama.cpp демонстрував критичні затримки — до 30 хвилин очікування першого токена на RTX 5090 при довгому контексті. Кращі результати давали vLLM та SGLang, але повний контекст у 262 тисячі токенів вимагав двох карт RTX 5090 вартістю понад 13 тисяч доларів.
Мовою оригіналу · EN
Tom's Hardware benchmarked Alibaba's open-weight Qwen 3.8 27B across RTX 5090, 4090, 3090, DGX Spark, Mac Studio and Ryzen AI Halo, finding that VRAM capacity alone doesn't guarantee good…
Читати оригінал на Tom's Hardware →
Чому в стрічці: Детальний бенчмарк локального запуску популярної відкритої AI-моделі — цікаво тех-аудиторії.