Розробники випустили slotstream для запуску 104-гігабайтної моделі Qwen на Mac
Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s
Розробник опублікував на Hacker News інструмент slotstream, який дозволяє запускати 104-гігабайтну модель Qwen3.8-Flash-Next на Mac із 48 ГБ оперативної пам'яті, стрімячи ваги безпосередньо з диска. Швидкість генерації становить близько 12 токенів за секунду, а інструмент сумісний з API Ollama та OpenAI. Проєкт поширюється як єдиний бінарник на Swift без залежності від Python.
Мовою оригіналу · EN
A developer released slotstream, a tool that streams a 104GB Qwen3.8-Flash-Next mixture-of-experts model from SSD to run on Macs with as little as 48GB of RAM, reaching about 12 tokens/second warm…
Читати оригінал на Hacker News (100+ балів) →
Чому в стрічці: Конкретна технічна розробка для локального запуску LLM — відповідає стійкому інтересу користувача до AI-інструментів