API за инференс с най-ниска латентност за гласови и агенти в реално време: бенчмарк с приоритет на времето до първия токен (TTFT)
Времето до първия токен (TTFT) е метриката, която екипите използват, за да изберат API за инференция за гласови приложения. Това е и метриката, която ги подвежда. TTFT отбелязва момента, в който започва генерирането; моделът за преобразуване на текст в реч не може да проговори, докато не пристигне цяла клауза. Между тези две точки се крие разликата между агент, който се усеща разговорен, и такъв, който бива прекъсван. Този материал сравнява всеки слой от гласовия стек, включително LLM, преобразуване на реч в текст, преобразуване на текст в реч и преобразуване на реч в реч.
Защо TTFT е правилната отправна точка, но не и финалната метрика
Гласовият агент е бюджет за латентност с езиков модел вътре в него. Всеки етап изразходва милисекунди, които потребителят може да чуе.
Времето до първия токен (TTFT) е интервалът между изпращането на заявка за инференция и получаването на първия токен. Дефиницията на IBM го определя като момента, в който системата преминава от неактивно към видимо активно състояние.
При чата TTFT е почти цялата история. При гласа той е само един от членовете на сумата.
Причината е механична. Моделът за преобразуване на текст в реч не може да синтезира половин дума. Той се нуждае от цяла клауза или изречение, преди да произведе аудио. LiveKit нарича получената метрика време до първото изречение (TTFS) и твърди в своята публикация за внедряването на Gemma 4, че именно TTFS усещат реално потребителите.
Това ви дава два, а не един, регулатора. TTFT определя кога започва генерирането. Токените в секунда определят колко бързо завършва първото изречение. Доставчик, който печели по единия показател и губи по другия, няма да се усеща бърз.
Бюджетът за латентност: колко всъщност струва един гласов ход
Прегледът на гласовите агенти на LiveKit разделя един ход на STT с приблизително 100–200 ms, LLM с 300–500 ms при стрийминг, TTS със 100–200 ms и мрежа с 50–150 ms през WebRTC. Практическата цел от край до край според него е 700 ms до 1,2 s.
Kwindla Hultman Kramer, създател на Pipecat, препоръчва цел от медианна латентност от глас до глас 800 ms, като за доказателство на концепцията приема и по-свободните 1 500 ms. Грубата му аритметика разделя това на четири части от приблизително 200 ms: транспорт и обработка на медията, STT плюс определяне на края на фразата, инференция на LLM и TTS.
По-ранната работа на Daily върху най-бързия гласов бот дава човешката отправна точка. Типичното време за отговор на човек в разговор е около 500 ms. Паузи над 800 ms започват да звучат неестествено.
Бенчмаркът на Daily за LLM за гласови агенти от февруари 2026 г. превежда това директно в изискване към LLM. Естественият разговор изисква време от глас до глас под 1 500 ms, което се равнява на приблизително 700 ms бюджет за TTFT за текстов LLM в конвейер от транскрипция към LLM към глас.
Това число от 700 ms е летвата, спрямо която трябва да се сравнява всеки доставчик.
Как да разчитате бенчмарк за TTFT, без да бъдете подведени
Преди таблиците: пет методологични факта, които променят значението на числата:
1. Формата на работното натоварване е решаваща: Artificial Analysis промени работното си натоварване по подразбиране през март 2026 г. Сайтът вече отчита подсказки с 10 хил. входни токена вместо с 1 хил. По-дългите подсказки увеличават както TTFT, така и скоростта на изхода. LiveKit твърди, че това е по-близо до реалността за гласа, тъй като производствените агенти зареждат предварително политики, персона, правила за ескалация, извлечени данни и схеми на инструментите.
2. Местоположението на сървъра е част от измерването: Artificial Analysis тества от виртуална машина в зоната us-central1-a на Google Cloud. Сайтът изрично посочва, че TTFT включва мрежовата латентност и може да облагодетелства или ощети доставчиците според местоположението, от което обслужват.
3. Токените за разсъждение се броят: В дефиницията на Artificial Analysis TTFT за модел с разсъждение е първият токен за разсъждение, а не първият токен от отговора. Това са отделни колони.
4. Измервайте от страната на получателя: Daily отбелязва, че доставчиците на модели понякога посочват TTFT вътрешно за своите стекове за инференция. Daily измерва от изпращането на заявката до първия използваем токен от API.
5. Изпълненията не са възпроизводими: Daily е категоричен по този въпрос: TTFT се променя значително между отделните изпълнения на бенчмарка, а доставчиците променят стековете си за инференция и понякога теглата, без да променят имената на моделите.
Слой 1: Време до първия токен на LLM
Данните по-долу са от класацията на доставчиците на API на Artificial Analysis, извлечени на 30 август 2026 г. Колоната „първи фрагмент“ е TTFT. Работното натоварване е 10 хил. входни токена, единична подсказка, медиана за 72 часа.
Най-ниска измерена латентност до първия фрагмент
| Доставчик | Модел | TTFT | Скорост на изхода |
|---|---|---|---|
| Baseten | gpt-oss-120b (high) | 0.23s | 266 ток./сек. |
| Baseten | gpt-oss-120b (low) | 0.24s | 271 ток./сек. |
| DeepInfra | Nemotron 3 Ultra | 0.28s | 371 ток./сек. |
| Cohere | North Mini Code | 0.32s | 104 ток./сек. |
| Cohere | Command A+ | 0.40s | 239 ток./сек. |
| Baseten | Inkling Small | 0.42s | 337 ток./сек. |
| Modular | Gemma 4 31B (NVFP4) | 0.44s | 243 ток./сек. |
| Nebius | GLM-5.3-Flash | 0.46s | 206 ток./сек. |
| Fireworks | Nemotron 3.5 Lightning | 0.46s | 501 ток./сек. |
| Together AI | Kimi K2.7 Code | 0.47s | 245 ток./сек. |
| Cerebras | gpt-oss-120b (high) | 0.49s | 1 697 ток./сек. |
Капанът на пропускателната способност
Производителите на силиций оптимизират различна метрика от тази, от която се нуждаят гласовите агенти.
| Доставчик | Модел | TTFT | Скорост на изхода |
|---|---|---|---|
| Cerebras | gpt-oss-120b (high) | 0.49s | 1 697 ток./сек. |
| Celeris | Celeris-1 | 0.62s | 1 612 ток./сек. |
| Cerebras | Gemma 4 31B | 0.53s | 1 351 ток./сек. |
| Groq | gpt-oss-20b (high) | 0.82s | 957 ток./сек. |
| SambaNova | gpt-oss-120b (high) | 0.92s | 706 ток./сек. |
| Groq | gpt-oss-120b (low) | 0.69s | 473 ток./сек. |
| Inception | Mercury 2 | 3.07s | 770 ток./сек. |
Mercury 2 е най-ясната илюстрация. Това е езиков модел, базиран на дифузия, който генерира 770 токена в секунда. Първият му фрагмент пристига след 3,07 s. Това е четири пъти повече от целия бюджет за LLM при естествен разговор.
Cerebras и Groq са различен случай. TTFT при тях е приличен, а пропускателната способност е изключителна. Конкретно за TTFS тази комбинация е силна, защото изречението завършва почти веднага след пристигането на първия токен.
Фронтирни и собствени крайни точки
| Доставчик | Модел | TTFT | Скорост на изхода |
|---|---|---|---|
| Amazon Bedrock | GPT-5.6 Luna (non-reasoning) | 0.59s | 181 ток./сек. |
| Amazon Bedrock | GPT-5.6 Terra (non-reasoning) | 0.72s | 103 ток./сек. |
| OpenAI | GPT-5.6 Luna (non-reasoning) | 0.74s | 113 ток./сек. |
| Gemini 3.7 Flash (low), AI Studio | 0.84s | 315 ток./сек. | |
| Anthropic | Claude 4.5 Haiku (non-reasoning) | 0.84s | 82 ток./сек. |
| Amazon Bedrock | Nova Micro | 0.86s | 264 ток./сек. |
| Gemini 3.5 Flash (minimal), AI Studio | 0.90s | 202 ток./сек. | |
| OpenAI | GPT-5.6 Sol (non-reasoning) | 1.06s | 71 ток./сек. |
Обърнете внимание на един и същ модел при различни хостове. GPT-5.6 Luna без разсъждение показва 0,59 s в Amazon Bedrock и 0,74 s в собствения API на OpenAI. Хостингът и маршрутизирането са толкова важни, колкото и теглата.
Отклонението, измерено от доставчика
LiveKit публикува данни за TTFT за собствения си продукт за инференция. Gemma 4 31B в LiveKit Inference показва 192 ms спрямо 911 ms за Gemini 2.5 Flash, 966 ms за GPT-5.5, 1 006 ms за GPT-4.1 и 1 876 ms за същата Gemma 4 31B през OpenRouter.
LiveKit е прозрачен относно механизма, което прави твърдението по-достоверно от повечето други. Компанията изпълнява Gemma зад SGLang със спекулативно декодиране и умишлено не уплътнява докрай всеки GPU, така че забавянето от изчакване в опашка да остане ниско. Според нея топла заявка започва да връща токени за около 100 ms. Компромисът е цената от 1,20 долара за 1 млн. изходни токена.
Същата публикация отчита TTFS за пълни разговори: 354 ms за Gemma 4 31B в LiveKit, 1 034 ms за Gemini 2.5 Flash, 1 088 ms за GPT-4.1, 1 267 ms за Gemini 3.0 Flash и 1 404 ms за GPT-5.5.
Към това са добавени и показатели за способностите. В IFBench, независимо оценен от Artificial Analysis, Gemma 4 31B получава 75,6% спрямо 75,9% за GPT-5.5, 43% за GPT-4.1 и 39% за Gemini 2.5 Flash. В τ²-bench GPT-5.5 води с 93,9%, а Gemma 4 31B има 76,9%.
Слой 2: Преобразуване на реч в текст и откриване на края на хода
При гласа латентността на STT не е скоростта на транскрипция. Тя е колко време след като потребителят спре да говори е необходимо на конвейера да разбере, че потребителят е спрял да говори.
Artificial Analysis измерва две неща в своята класация за стрийминг STT, като и двете започват от края на речта, открит чрез SileroVAD: време до първия частичен транскрипт и време до финалния транскрипт. Индексът AA-WER Streaming се основава на приблизително 8 часа аудио, претеглени така: AA-AgentTalk 50%, VoxPopuli 25%, Earnings-22 25%.
Публикувани от доставчиците данни за латентността:
| Модел | Твърдение | Тип източник |
|---|---|---|
| Deepgram Flux | ~260 ms p50 за откриване на края на хода при настройките по подразбиране | Документация на доставчика |
| Deepgram Nova-3 | Под 300 ms латентност при стрийминг | Документация на доставчика |
| AssemblyAI Universal-Streaming | ~300 ms за емитиране на непроменяеми думи | Доставчик |
| Cartesia Ink-2 | 100 ms латентност на транскрипта | Доставчик |
| Speechmatics Voice SDK | 0,451 ± 0,022 s от края на речта до финалните резултати | Вътрешен инструмент на доставчика |
Deepgram Flux е най-интересният от архитектурна гледна точка продукт. Той интегрира откриването на края на хода в модела за разпознаване, вместо да добавя VAD върху него. Deepgram заявява, че това може да намали латентността на отговора на агента с 200–600 ms спрямо традиционен конвейер STT плюс VAD. Моделът предоставя eot_threshold (0.5–0.9), eager_eot_threshold (0.3–0.9) и събитие EagerEndOfTurn, което ви позволява да стартирате LLM по-рано.
Именно последната възможност е по-важна от суровото число. Ако можете да започнете генерирането при предварителен сигнал, изваждате TTFT на LLM от критичния път, когато прогнозата е правилна.
AssemblyAI Universal-Streaming обръща обичайния модел „частични резултати, после финални“ чрез излъчване на непроменяеми транскрипти. AssemblyAI отчита медианно емитиране на дума от 307 ms спрямо 516 ms за Deepgram Nova-3 при собственото си измерване през 2025 г. Документацията му също препоръчва използването на неформатирани транскрипти за гласови агенти, тъй като форматирането пристига по-късно и рядко променя поведението на LLM.
Твърденията за точност тук са спорни и са публикувани от доставчици. AssemblyAI отчита 6,99% WER за Universal-3.5 Pro Realtime в отворения бенчмарк за гласови агенти на Pipecat, пред 9,04% за Google Chirp3, 9,76% за ElevenLabs Scribe v2 и 15,58% за Deepgram Flux. Изпълнете теста сами, преди да приемете резултата за окончателен.
LiveKit също документира предварително генериране, което стартира LLM върху частичен транскрипт. Условието е реално: ако отговорът трябва да бъде генериран наново след финалния транскрипт, изразходвате токени и не спестявате нищо.
Слой 3: Време до първото аудио при преобразуване на текст в реч
Именно тук числата на доставчиците се разминават най-силно с това, което усещат потребителите.
ElevenLabs посочва, че Flash v2.5 осигурява приблизително 75 ms. Собствената му документация внимателно уточнява: 75 ms се отнася само до времето за инференция на модела. Страницата на компанията за понятията, свързани с латентността, отива по-далеч, като посочва мрежовия двупосочен обмен обикновено между 20 и 200 ms според географията и отбелязва, че повечето аудиоплейъри буферират преди възпроизвеждане, като буферирането от 500 ms е обичайно. Компанията също посочва, че Eleven v3 не е създаден за работа в реално време и препоръчва Flash v2.5, Flash v2 или Multilingual v2 за своята Agents Platform.
Cartesia посочва TTS под 90 ms и латентност на транскрипта от 100 ms за Sonic-3.6 и Ink-2. Материалът на Marktechpost за представянето на Sonic-3.6 отбелязва, че и двете стойности са посочена от доставчика латентност на модела, а не измерено време за двупосочен обмен от край до край. Преди това Cartesia твърдеше 82 ms от край до край до първото аудио за Sonic 3.5. Sonic работи върху модели на състоянието, а не върху трансформъри, които се мащабират линейно, вместо квадратично, с дължината на последователността.
По отношение на качеството арената Provider Voice на Artificial Analysis използва Elo оценки от слушатели, които не знаят източника; данните са извлечени на 30 август 2026 г.:
| Модел | Elo | Цена за 1 млн. знака |
|---|---|---|
| Cartesia Sonic 3.6 | 1 288 | $49.00 |
| SpeechifyAI Simba 3.2 | 1 243 | $10.00 |
| Alibaba Qwen-Audio-3.0-TTS-Plus | 1 243 | $27.60 |
| Inworld Realtime TTS-2 Flash (preview) | 1 228 | $10.40 |
| BreezeBlue Breeze TTS 2 (open weights) | 1 220 | $34.00 |
| ElevenLabs v3 Conversational | 1 215 | $50.00 |
| Google Gemini 3.1 Flash TTS | 1 210 | $18.30 |
| ElevenLabs Flash v2.5 | 1 083 | $50.00 |
Разликата между Sonic 3.6 с 1 288 и Flash v2.5 с 1 083 е цената в качеството на нисколатентния клас, който реално използват повечето агенти.
Слой 4: Време до първото аудио при преобразуване на реч в реч
Моделите за преобразуване на реч в реч обединяват STT, LLM и TTS в един проход. По-малко обиколки би трябвало да означават по-ниска латентност.
LiveKit подхожда внимателно към този въпрос, като отбелязва, че моделите в реално време не гарантират по-висока скорост във всеки случай и че добре настроеният конвейер може да бъде силно конкурентен.
Данните подкрепят тази предпазливост. От класацията на Artificial Analysis за преобразуване на реч в реч, TTFA, измерено върху Big Bench Audio, извлечено на 30 август 2026 г.:
| Модел | TTFA | Разсъждение върху реч | Успеваемост на задачата | S2S индекс |
|---|---|---|---|---|
| Deepslate Opal | 0.44s | 85% | — | — |
| Gemini 2.5 Flash Native Audio Dialog | 0.63s | 69% | — | — |
| Grok Voice Think Fast 2.0 High | 0.70s | 97% | 94.7% | 79.0% |
| Grok Voice Fast 1.0 | 0.78s | 93% | — | — |
| Qwen3.5 Omni Flash Realtime | 0.79s | 59% | 29.1% | — |
| OpenAI GPT-Realtime-1.5 | 0.81s | 81% | 85.1% | 70.3% |
| OpenAI GPT Realtime Mini (Oct ’25) | 0.81s | 64% | 79.6% | 56.8% |
| OpenAI GPT-Realtime-2.1 Mini Minimal | 0.85s | 63% | 76.7% | 52.8% |
| Google Gemini 3.1 Flash Live Minimal | 0.96s | 71% | 74.6% | 63.9% |
| OpenAI GPT-Realtime-2.1 Minimal | 0.97s | 87% | 89.4% | 70.3% |
| Amazon Nova 2.0 Sonic (Mar 2026) | 1.14s | 88% | 57.1% | — |
| OpenAI GPT-Realtime-2 (High) | 1.14s | 97% | 89.8% | 73.6% |
| OpenAI GPT-Realtime-2.1 High | 1.21s | 96% | 91.5% | 73.9% |
| Google Gemini 3.1 Flash Live High | 2.99s | 97% | 71.8% | 71.5% |
| OpenAI GPT-Realtime-2.1 Mini High | 4.28s | 75% | — | — |
Grok Voice Think Fast 2.0 High е отличникът в тази класация: 0,70 s TTFA с 97% разсъждение върху реч и 94,7% успеваемост на задачите.
Наказанието за усилието за разсъждение се вижда в рамките на отделните семейства модели. Gemini 3.1 Flash Live преминава от 0,96 s до 2,99 s между нивата Minimal и High. GPT-Realtime-2.1 на OpenAI преминава от 0,97 s до 1,21 s, като печели 2,1 процентни пункта успеваемост на задачите.
OpenAI пусна gpt-realtime-2.1 и gpt-realtime-2.1-mini в началото на юли 2026 г. и заяви, че подобреното кеширане е намалило латентността p95 с поне 25% при всички негови гласови модели в реално време. Именно опашната латентност кара телефонния агент да изглежда повреден, така че това е по-полезно твърдение от подобрение на медианата.
Разликата в способностите
Бенчмаркът на Daily количествено показва защо повечето производствени агенти все още използват каскадни конвейери. В теста aiwf_medium_context GPT Realtime получава 86,7% спрямо 94,9% за GPT-4.1. По оценката на Daily Ultravox 0.7 е първият модел за преобразуване на реч в реч, който се представя добре при дълги разговори с множество ходове, и е с отворени тегла.
Artificial Analysis също сравнява четири „каскадни системи по подразбиране“ на доставчици, което дава полезен контекст за това, което платформите реално предлагат: Deepgram Voice Agent (Nova-3 + GPT-4o Mini + Aura-2), ElevenLabs Agents (Scribe v2 Realtime + Gemini 2.5 Flash + Eleven Flash v2), Cartesia Line (Ink + Gemini 2.5 Flash + Sonic) и Inworld Realtime (Inworld STT 1 + Gemini 2.5 Flash + Inworld TTS 1.5 Mini).
Три от четирите използват Gemini 2.5 Flash. Това е показателен консенсус.
Референтни бюджети
Съставени от проверените по-горе данни за компонентите. Това са планови оценки, а не измервания на работеща система.
Агресивен каскаден конвейер, хостван в САЩ, с общо местоположение:
| Етап | Бюджет |
|---|---|
| Транспорт и медия (WebRTC) | 50–150 ms |
| STT + край на хода (Flux с настройки по подразбиране) | ~260 ms |
| Първи фрагмент от LLM (клас под 0,5 s) | 230–500 ms |
| Завършване на изречението при 250+ ток./сек. | ~100 ms |
| Първо аудио от TTS + мрежа | 150–300 ms |
| Общо | ~790 ms–1,3 s |
Това достига или леко надхвърля целта от 800 ms, което съответства на тезата на Kwindla, че 800 ms е трудно, но постижимо.
Преобразуване на реч в реч, един модел:
| Етап | Бюджет |
|---|---|
| Транспорт и медия | 50–150 ms |
| TTFA на модела (минимално ниво на разсъждение) | 700 ms–1,0 s |
| Общо | ~750 ms–1,15 s |
Сравнимо, но с по-малка наблюдаемост и, според бенчмарка на Daily, измерима разлика в способностите при извикване на инструменти и следване на инструкции.
Какво да правите с това
- Изберете метриката, която ограничава архитектурата ви. Ако след TTS модела има друг етап, оптимизирайте TTFS, а не TTFT. Това означава TTFT и токени в секунда заедно.
- Разположете компонентите заедно, преди да оптимизирате моделите. LiveKit оценява съвместното разполагане на агента и модела като мярка с много силен ефект, по-важна от избора на модел. Ако използвате SIP, дръжте и транка географски близо.
- Ограничете усилието за разсъждение изрично. Това е най-големият единичен лост в таблиците по-горе и е конфигурационен флаг в повечето съвременни крайни точки.
- Предвидете бюджет за извиквания на инструменти. Kwindla отбелязва, че всеки ход с извикване на инструмент приблизително удвоява латентността на LLM. LiveKit препоръчва ограничаване на
max_tool_steps, обединяване на външните API извиквания и възпроизвеждане на звук за мислене, така че тишината да не е единствената обратна връзка за потребителя. - Инструментирайте, преди да настройвате. LiveKit Agents SDK предоставя
e2e_latency, време до първия токен на LLM и време до първия байт на TTS за всеки ход. Pipecat предоставя еквивалентните данни чрезenable_metricsи наблюдатели. Съхранявайте логовете външно и следете за регресии. - Измервайте p95, а не само p50. Основното подобрение на OpenAI през юли 2026 г. беше намаляване на опашната латентност, защото именно там гласовите агенти се повреждат.
- Внимавайте за инфраструктурни капани. LiveKit документира, че самохостваните агенти в AWS върху burstable типове инстанции като t3 или t4g могат да достигнат сериозна латентност и таймаути при откриване на края на хода дори при привидно ниско натоварване на CPU.
Основни изводи
- Най-бързият независимо измерен първи фрагмент при натоварване от 10 хил. токена: Baseten, обслужващ gpt-oss-120b за 0,23 s, според Artificial Analysis.
- Пропускателната способност и TTFT са различни продукти: Cerebras достига 1 697 ток./сек., но има TTFT от 0,49 s; Mercury 2 на Inception достига 770 ток./сек. при 3,07 s.
- Твърденията на доставчиците за латентност, като 75 ms на ElevenLabs и под 90 ms на Cartesia, са само време за инференция на модела и изключват мрежата.
- Усилието за разсъждение е най-големият единичен лост за TTFT: Gemini 3.1 Flash Live преминава от 0,96 s до 2,99 s между нивата Minimal и High.
- TTFT сам по себе си не предсказва как се усеща един агент. Времето до първото изречение го прави, защото синтезът на реч изисква цяла клауза.
Източници
- Artificial Analysis: Класация на доставчиците на LLM API
- Artificial Analysis: Методология за бенчмаркинг на производителността
- Artificial Analysis: Класация за преобразуване на реч в реч
- Artificial Analysis: Класация за стрийминг преобразуване на реч в текст
- Artificial Analysis: Класация Provider Voice за преобразуване на текст в реч
- LiveKit: Разбиране и подобряване на латентността на гласовите агенти
- LiveKit: Оптимизиран за латентност инференс, Gemma 4
- LiveKit: Гласови агенти
- Daily: Бенчмаркинг на LLM за приложения с гласови агенти
- Daily: Съвети за изграждане на гласов изкуствен интелект
- Deepgram: Миграция от Nova-3 към Flux
- Deepgram: Измерване на STT латентността
- AssemblyAI: Представяне на Universal-Streaming
- ElevenLabs: Разбиране на латентността
- ElevenLabs: Оптимизиране на латентността
- Cartesia: Sonic-3.6 и Ink-2
- OpenAI: Ръководство за Realtime и Audio
- Изходен код на бенчмарка aiewf-eval
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.