Perplexity розповіла, як Ivy, Tulip і ROSE обслуговують ембеддинг-модель pplx-embed
Perplexity Details Its GPU Embedding Stack: How Ivy, Tulip and ROSE Serve pplx-embed
Компанія Perplexity опублікувала технічний опис інфраструктури для обробки ембеддингів на GPU, яка обслуговує модель pplx-embed у пошуку, Computer та API Platform. За даними інженерів компанії, систему побудовано на трьох сервісах — Ivy, Tulip та ROSE, — які повторно використовують ядра з наявного LLM-стека замість окремого рушія для ембеддингів. Використання цілісних CUDA-графів та асинхронних буферів LazyTensor дозволяє зменшити накладні витрати на запуск і пришвидшити обробку запитів.
Мовою оригіналу · EN
Perplexity Engineering published a detailed account of its GPU-based embedding serving infrastructure behind pplx-embed, used across Search, Computer and the API Platform. The stack consists of three…
Читати оригінал на MarkTechPost →
Чому в стрічці: Технічна AI-інфраструктурна стаття від MarkTechPost — джерела з високою заанжованістю користувача.