Розробники випустили WebLLM — рушій для запуску мовних моделей у браузері

WebLLM: high-performance in-browser LLM inference engine

Проєкт WebLLM, представлений на Hacker News, дозволяє запускати великі мовні моделі напряму в браузері з апаратним прискоренням через WebGPU без потреби у сервері. Рушій сумісний з OpenAI API, підтримує стрімінг, JSON-режим та роботу через Web Worker, а також низку відкритих моделей — Llama 3, Phi 3, Gemma, Mistral, Qwen. Розробники позиціонують інструмент як спосіб будувати приватні AI-асистенти без передачі даних на сервер.

Мовою оригіналу · EN

WebLLM is an open-source, in-browser LLM inference engine that uses WebGPU for hardware acceleration without any server-side processing. It offers full OpenAI API compatibility, including streaming…

Читати оригінал на Hacker News (100+ балів) →

Чому в стрічці: Конкретна технічна розробка в AI-екосистемі (локальний інференс у браузері), відповідає стійкому інтересу до AI-новин.

← Назад до стрічки