Розробники випустили slotstream для запуску 104-гігабайтної моделі Qwen на Mac

Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s

Розробник опублікував на Hacker News інструмент slotstream, який дозволяє запускати 104-гігабайтну модель Qwen3.8-Flash-Next на Mac із 48 ГБ оперативної пам'яті, стрімячи ваги безпосередньо з диска. Швидкість генерації становить близько 12 токенів за секунду, а інструмент сумісний з API Ollama та OpenAI. Проєкт поширюється як єдиний бінарник на Swift без залежності від Python.

Мовою оригіналу · EN

A developer released slotstream, a tool that streams a 104GB Qwen3.8-Flash-Next mixture-of-experts model from SSD to run on Macs with as little as 48GB of RAM, reaching about 12 tokens/second warm…

Читати оригінал на Hacker News (100+ балів) →

Чому в стрічці: Конкретна технічна розробка для локального запуску LLM — відповідає стійкому інтересу користувача до AI-інструментів

← Назад до стрічки