Бенчмарк порівняв швидкість голосових AI-агентів за показником Time to First Token
Lowest-Latency Inference APIs for Voice and Realtime Agents: A Time to First Token TTFT-First Benchmark
Аналітичний огляд MarkTechPost порівняв затримку десятків інференс-API для голосових AI-агентів на всіх рівнях стеку — LLM, розпізнавання мовлення, синтез мовлення та мовлення-в-мовлення. За даними Artificial Analysis станом на 30 серпня 2026 року, найшвидшу видачу першого токена (0,23 с) показав Baseten із моделлю gpt-oss-120b, тоді як показник Time to First Token сам собою визнано оманливим — для голосу важливіша швидкість формування першого повного речення.
Мовою оригіналу · EN
A MarkTechPost benchmark compares inference API latency across the full voice AI stack — LLM, STT, TTS and speech-to-speech models. Per Artificial Analysis data retrieved August 30, 2026, Baseten's…
Читати оригінал на MarkTechPost →
Чому в стрічці: Технічний бенчмарк латентності AI-інференсу — релевантний для інтересу до AI та технологій.