API інференсу з найнижчою затримкою для голосових агентів і агентів реального часу: бенчмарк із пріоритетом часу до першого токена (TTFT)
Час до першого токена (TTFT) — це метрика, яку команди використовують для вибору API інференсу для голосових систем. Водночас саме ця метрика часто вводить їх в оману. TTFT фіксує момент початку генерації, але модель синтезу мовлення не може почати говорити, доки не отримає повне речення або підрядну частину. Між цими двома моментами й виникає різниця між агентом, який сприймається як співрозмовник, і тим, якого переривають. У цьому матеріалі протестовано кожен рівень голосового стека, зокрема LLM, перетворення мовлення на текст, перетворення тексту на мовлення та перетворення мовлення на мовлення.
Чому TTFT — правильна відправна точка, але не кінцева метрика
Голосовий агент — це бюджет затримки, усередині якого працює мовна модель. Кожен етап витрачає мілісекунди, які чує користувач.
Час до першого токена (TTFT) — це інтервал між надсиланням запиту на інференс і отриманням у відповідь першого токена. У визначенні IBM це момент, коли система переходить від стану бездіяльності до видимої активності.
Для чату TTFT майже вичерпує всю історію. Для голосу це лише один доданок у сумі.
Причина механічна. Модель синтезу мовлення не може синтезувати половину слова. Їй потрібна повна підрядна частина або речення, перш ніж вона створить аудіо. LiveKit називає відповідну метрику часом до першого речення (TTFS) і стверджує у своєму матеріалі про розгортання Gemma 4, що саме TTFS реально відчувають користувачі.
Отже, у вас є два регулятори, а не один. TTFT визначає, коли починається генерація. Кількість токенів за секунду визначає, наскільки швидко завершується перше речення. Постачальник, який перемагає за одним показником і програє за іншим, не сприйматиметься як швидкий.
Бюджет затримки: скільки насправді коштує один голосовий хід
Огляд голосових агентів LiveKit розкладає один хід на STT приблизно 100–200 мс, LLM — 300–500 мс із потоковою передачею, TTS — 100–200 мс і мережу — 50–150 мс через WebRTC. Практичний наскрізний орієнтир становить 700 мс–1,2 с.
Квіндла Гультман Крамер, співтворець Pipecat, радить орієнтуватися на медіанну затримку від голосу до голосу 800 мс, а для прототипу допускає 1 500 мс. Його приблизний розрахунок ділить цей час на чотири частини — близько 200 мс кожна: транспорт і обробка медіа, STT разом із визначенням кінця фрази, інференс LLM і TTS.
Попередня робота Daily над найшвидшим голосовим ботом дає людський орієнтир. Типовий час відповіді людини в розмові становить близько 500 мс. Паузи понад 800 мс починають здаватися неприродними.
Лютневий бенчмарк LLM для голосових агентів Daily за 2026 рік безпосередньо переводить це у вимогу до LLM. Для природної розмови потрібна затримка від голосу до голосу менш ніж 1 500 мс, що відповідає приблизно 700 мс бюджету TTFT для текстової LLM у зв’язці транскрипція–LLM–голос.
Ці 700 мс — орієнтир, з яким слід порівнювати кожного постачальника.
Як читати бенчмарк TTFT і не дати себе ввести в оману
Перш ніж перейти до таблиць, варто знати п’ять методологічних фактів, які змінюють значення чисел:
1. Форма робочого навантаження має вирішальне значення: Artificial Analysis у березні 2026 року змінила типове робоче навантаження. Тепер сайт звітує про запити з 10 тис. вхідних токенів замість 1 тис. Довші запити збільшують і TTFT, і швидкість виведення. LiveKit вважає це ближчим до реальності для голосових систем, оскільки виробничі агенти на початку контексту містять політики, персону, правила ескалації, отримані дані та схеми інструментів.
2. Розташування сервера вже враховане в показнику: Artificial Analysis проводить тести з віртуальної машини в зоні Google Cloud us-central1-a. Сервіс прямо зазначає, що TTFT включає мережеву затримку, тому розташування серверів може давати постачальникам перевагу або, навпаки, погіршувати їхні результати.
3. Токени міркування враховуються: у визначенні Artificial Analysis TTFT для моделі з міркуванням — це перший токен міркування, а не перший токен відповіді. Це окремі стовпці.
4. Вимірюйте з боку отримувача: Daily зазначає, що постачальники моделей іноді вказують внутрішній TTFT своїх стеків інференсу. Daily вимірює час від надсилання запиту до першого придатного токена, отриманого через API.
5. Результати запусків не відтворюються: Daily прямо говорить про це: TTFT суттєво змінюється між запусками бенчмарку, а постачальники змінюють стеки інференсу, а іноді й ваги, не змінюючи назв моделей.
Рівень 1: час LLM до першого токена
Наведені нижче дані взято з рейтингу постачальників API Artificial Analysis, отриманого 30 серпня 2026 року. У стовпці «перший фрагмент» наведено TTFT. Робоче навантаження — 10 тис. вхідних токенів, один запит, медіана за 72 години.
Найнижча виміряна затримка до першого фрагмента
| Постачальник | Модель | TTFT | Швидкість виведення |
|---|---|---|---|
| Baseten | gpt-oss-120b (high) | 0.23s | 266 ток./с |
| Baseten | gpt-oss-120b (low) | 0.24s | 271 ток./с |
| DeepInfra | Nemotron 3 Ultra | 0.28s | 371 ток./с |
| Cohere | North Mini Code | 0.32s | 104 ток./с |
| Cohere | Command A+ | 0.40s | 239 ток./с |
| Baseten | Inkling Small | 0.42s | 337 ток./с |
| Modular | Gemma 4 31B (NVFP4) | 0.44s | 243 ток./с |
| Nebius | GLM-5.3-Flash | 0.46s | 206 ток./с |
| Fireworks | Nemotron 3.5 Lightning | 0.46s | 501 ток./с |
| Together AI | Kimi K2.7 Code | 0.47s | 245 ток./с |
| Cerebras | gpt-oss-120b (high) | 0.49s | 1 697 ток./с |
Пастка пропускної здатності
Виробники чипів оптимізують іншу метрику, не ту, яка потрібна голосовим агентам.
| Постачальник | Модель | TTFT | Швидкість виведення |
|---|---|---|---|
| Cerebras | gpt-oss-120b (high) | 0.49s | 1 697 ток./с |
| Celeris | Celeris-1 | 0.62s | 1 612 ток./с |
| Cerebras | Gemma 4 31B | 0.53s | 1 351 ток./с |
| Groq | gpt-oss-20b (high) | 0.82s | 957 ток./с |
| SambaNova | gpt-oss-120b (high) | 0.92s | 706 ток./с |
| Groq | gpt-oss-120b (low) | 0.69s | 473 ток./с |
| Inception | Mercury 2 | 3.07s | 770 ток./с |
Mercury 2 — найяскравіший приклад. Це мовна модель на основі дифузії, яка генерує 770 токенів за секунду. Її перший фрагмент надходить через 3.07 с. Це в чотири рази перевищує весь бюджет LLM для природної розмови.
Cerebras і Groq — інший випадок. Їхній TTFT цілком гідний, а пропускна здатність виняткова. Саме для TTFS це сильне поєднання, оскільки речення завершується майже одразу після надходження першого токена.
Передові та пропрієтарні кінцеві точки
| Постачальник | Модель | TTFT | Швидкість виведення |
|---|---|---|---|
| Amazon Bedrock | GPT-5.6 Luna (non-reasoning) | 0.59s | 181 ток./с |
| Amazon Bedrock | GPT-5.6 Terra (non-reasoning) | 0.72s | 103 ток./с |
| OpenAI | GPT-5.6 Luna (non-reasoning) | 0.74s | 113 ток./с |
| Gemini 3.7 Flash (low), AI Studio | 0.84s | 315 ток./с | |
| Anthropic | Claude 4.5 Haiku (non-reasoning) | 0.84s | 82 ток./с |
| Amazon Bedrock | Nova Micro | 0.86s | 264 ток./с |
| Gemini 3.5 Flash (minimal), AI Studio | 0.90s | 202 ток./с | |
| OpenAI | GPT-5.6 Sol (non-reasoning) | 1.06s | 71 ток./с |
Зверніть увагу на ту саму модель на різних хостах. GPT-5.6 Luna без міркування показує 0.59 с на Amazon Bedrock і 0.74 с у власному API OpenAI. Хостинг і маршрутизація мають не менше значення, ніж ваги моделей.
Викидний результат, виміряний постачальником
LiveKit публікує показники TTFT для власного продукту інференсу. Gemma 4 31B на LiveKit Inference показала 192 мс, тоді як Gemini 2.5 Flash — 911 мс, GPT-5.5 — 966 мс, GPT-4.1 — 1 006 мс, а та сама Gemma 4 31B через OpenRouter — 1 876 мс.
LiveKit прозоро пояснює механізм, що робить твердження переконливішим за більшість інших. Сервіс запускає Gemma за SGLang зі спекулятивним декодуванням і навмисно не заповнює GPU повністю, щоб зменшити затримку в черзі. За словами компанії, теплий запит починає повертати токени приблизно через 100 мс. Компромісом є вартість — $1.20 за 1 млн вихідних токенів.
У тому самому матеріалі наведено TTFS для повних розмов: 354 мс для Gemma 4 31B на LiveKit, 1 034 мс для Gemini 2.5 Flash, 1 088 мс для GPT-4.1, 1 267 мс для Gemini 3.0 Flash і 1 404 мс для GPT-5.5.
Поруч наведено й показники можливостей. На IFBench, незалежно оціненому Artificial Analysis, Gemma 4 31B набирає 75.6% проти 75.9% у GPT-5.5, 43% у GPT-4.1 і 39% у Gemini 2.5 Flash. На τ²-bench лідирує GPT-5.5 із результатом 93.9%, тоді як Gemma 4 31B має 76.9%.
Рівень 2: перетворення мовлення на текст і визначення завершення ходу
Для голосових систем затримка STT — це не швидкість транскрибування. Це час після припинення мовлення користувачем, через який конвеєр розуміє, що користувач припинив говорити.
Artificial Analysis вимірює дві величини у своєму рейтингу потокових STT-систем, причому обидві починають відлік від завершення мовлення, визначеного SileroVAD: час до першої часткової транскрипції та час до фінальної транскрипції. Індекс AA-WER Streaming базується приблизно на 8 годинах аудіо з вагами AA-AgentTalk 50%, VoxPopuli 25%, Earnings-22 25%.
Опубліковані постачальниками показники затримки:
| Модель | Заявлений показник | Тип джерела |
|---|---|---|
| Deepgram Flux | ~260 мс p50 для визначення кінця ходу за стандартних налаштувань | Документація постачальника |
| Deepgram Nova-3 | Менше 300 мс потокової затримки | Документація постачальника |
| AssemblyAI Universal-Streaming | ~300 мс незмінної видачі слів | Постачальник |
| Cartesia Ink-2 | 100 мс затримки транскрипції | Постачальник |
| Speechmatics Voice SDK | 0.451 ± 0.022 с від завершення мовлення до фінальних результатів | Внутрішній інструмент постачальника |
Deepgram Flux — найцікавіша з архітектурного погляду система. Вона вбудовує визначення кінця ходу в модель розпізнавання, а не додає VAD поверх неї. Deepgram стверджує, що це може скоротити затримку відповіді агента на 200–600 мс порівняно з традиційним конвеєром STT плюс VAD. Система підтримує eot_threshold (0.5–0.9), eager_eot_threshold (0.3–0.9) і подію EagerEndOfTurn, яка дає змогу раніше запустити LLM.
Остання можливість важливіша за саме число. Якщо можна почати генерацію за сигналом раннього завершення, TTFT LLM повністю вилучається з критичного шляху, коли прогноз правильний.
AssemblyAI Universal-Streaming змінює звичну модель «часткові результати, потім фінальні», видаючи незмінні транскрипції. У власному вимірюванні 2025 року AssemblyAI повідомила про медіанну видачу слів через 307 мс проти 516 мс у Deepgram Nova-3. Документація також рекомендує використовувати неформатовані транскрипції для голосових агентів, оскільки форматування з’являється пізніше й рідко змінює поведінку LLM.
Твердження щодо точності тут є спірними й походять від постачальників. AssemblyAI повідомляє, що Universal-3.5 Pro Realtime має 6.99% WER у відкритому бенчмарку голосових агентів Pipecat, випереджаючи Google Chirp3 із 9.04%, ElevenLabs Scribe v2 із 9.76% і Deepgram Flux із 15.58%. Перш ніж вважати ці результати остаточними, перевірте їх самостійно.
LiveKit також документує превентивну генерацію, яка запускає LLM на частковій транскрипції. Застереження цілком реальне: якщо після фінальної транскрипції відповідь доводиться генерувати заново, ви витрачаєте токени й нічого не заощаджуєте.
Рівень 3: час перетворення тексту на мовлення до першого аудіо
Саме тут цифри постачальників найбільше розходяться з реальним досвідом користувачів.
ElevenLabs стверджує, що Flash v2.5 забезпечує приблизно 75 мс. Власна документація компанії ретельно уточнює: 75 мс — це лише час інференсу моделі. На сторінці про затримку компанія також вказує, що час проходження мережі в обидва боки зазвичай становить 20–200 мс залежно від географії, і зазначає, що більшість аудіопрогравачів буферизують дані перед відтворенням, причому буферизація на 500 мс є поширеною. Також ElevenLabs зазначає, що Eleven v3 не призначена для роботи в реальному часі, і рекомендує для Agents Platform Flash v2.5, Flash v2 або Multilingual v2.
Cartesia заявляє затримку TTS менше 90 мс і затримку транскрипції 100 мс для Sonic-3.6 та Ink-2. У матеріалі Marktechpost про випуск Sonic-3.6 уточнюється, що це заявлена постачальником затримка моделі, а не виміряний час проходження запиту від кінця до кінця. Раніше Cartesia заявляла 82 мс від кінця до кінця до першого аудіо для Sonic 3.5. Sonic працює на моделях простору станів, а не на трансформерах, тому масштабується лінійно, а не квадратично, зі збільшенням довжини послідовності.
Щодо якості, арена Provider Voice Artificial Analysis використовує Elo за оцінками слухачів, які не бачать назви моделей; дані отримано 30 серпня 2026 року:
| Модель | Elo | Ціна за 1 млн символів |
|---|---|---|
| Cartesia Sonic 3.6 | 1,288 | $49.00 |
| SpeechifyAI Simba 3.2 | 1,243 | $10.00 |
| Alibaba Qwen-Audio-3.0-TTS-Plus | 1,243 | $27.60 |
| Inworld Realtime TTS-2 Flash (preview) | 1,228 | $10.40 |
| BreezeBlue Breeze TTS 2 (open weights) | 1,220 | $34.00 |
| ElevenLabs v3 Conversational | 1,215 | $50.00 |
| Google Gemini 3.1 Flash TTS | 1,210 | $18.30 |
| ElevenLabs Flash v2.5 | 1,083 | $50.00 |
Різниця між Sonic 3.6 із показником 1,288 і Flash v2.5 із 1,083 — це ціна якості рівня з низькою затримкою, який фактично використовує більшість агентів.
Рівень 4: час перетворення мовлення на мовлення до першого аудіо
Моделі перетворення мовлення на мовлення об’єднують STT, LLM і TTS в один прохід. Менша кількість обмінів даними має означати нижчу затримку.
LiveKit обережно зазначає, що моделі реального часу не гарантовано будуть швидшими в кожному випадку, а добре налаштований конвеєр може бути дуже конкурентоспроможним.
Дані підтверджують це застереження. У рейтингу систем перетворення мовлення на мовлення Artificial Analysis TTFA виміряно на Big Bench Audio; дані отримано 30 серпня 2026 року:
| Модель | TTFA | Міркування на основі мовлення | Успішність завдання | Індекс S2S |
|---|---|---|---|---|
| Deepslate Opal | 0.44s | 85% | — | — |
| Gemini 2.5 Flash Native Audio Dialog | 0.63s | 69% | — | — |
| Grok Voice Think Fast 2.0 High | 0.70s | 97% | 94.7% | 79.0% |
| Grok Voice Fast 1.0 | 0.78s | 93% | — | — |
| Qwen3.5 Omni Flash Realtime | 0.79s | 59% | 29.1% | — |
| OpenAI GPT-Realtime-1.5 | 0.81s | 81% | 85.1% | 70.3% |
| OpenAI GPT Realtime Mini (Oct ’25) | 0.81s | 64% | 79.6% | 56.8% |
| OpenAI GPT-Realtime-2.1 Mini Minimal | 0.85s | 63% | 76.7% | 52.8% |
| Google Gemini 3.1 Flash Live Minimal | 0.96s | 71% | 74.6% | 63.9% |
| OpenAI GPT-Realtime-2.1 Minimal | 0.97s | 87% | 89.4% | 70.3% |
| Amazon Nova 2.0 Sonic (Mar 2026) | 1.14s | 88% | 57.1% | — |
| OpenAI GPT-Realtime-2 (High) | 1.14s | 97% | 89.8% | 73.6% |
| OpenAI GPT-Realtime-2.1 High | 1.21s | 96% | 91.5% | 73.9% |
| Google Gemini 3.1 Flash Live High | 2.99s | 97% | 71.8% | 71.5% |
| OpenAI GPT-Realtime-2.1 Mini High | 4.28s | 75% | — | — |
Grok Voice Think Fast 2.0 High — беззаперечний лідер цієї таблиці: TTFA 0.70 с, 97% міркування на основі мовлення та 94.7% успішності завдань.
Штраф за рівень міркування помітний у межах окремих сімейств моделей. Gemini 3.1 Flash Live переходить від 0.96 с до 2.99 с між режимами Minimal і High. OpenAI GPT-Realtime-2.1 переходить від 0.97 с до 1.21 с, отримуючи натомість 2.1 відсоткового пункта успішності завдань.
OpenAI випустила gpt-realtime-2.1 і gpt-realtime-2.1-mini на початку липня 2026 року й заявила, що вдосконалене кешування скоротило затримку p95 щонайменше на 25% в усіх її голосових моделях Realtime. Саме хвостова затримка змушує телефонного агента здаватися зламаним, тому це корисніше твердження, ніж покращення медіани.
Розрив у можливостях
Бенчмарк Daily кількісно показує, чому більшість виробничих агентів досі використовують каскадні конвеєри. У тесті aiwf_medium_context GPT Realtime отримала 86.7% проти 94.9% у GPT-4.1. За оцінкою Daily, Ultravox 0.7 стала першою моделлю перетворення мовлення на мовлення, яка добре працює в довгих багатоходових розмовах; крім того, вона має відкриті ваги.
Artificial Analysis також тестує чотири «каскадні системи за замовчуванням» від постачальників, що дає корисний контекст щодо того, що саме платформи пропонують: Deepgram Voice Agent (Nova-3 + GPT-4o Mini + Aura-2), ElevenLabs Agents (Scribe v2 Realtime + Gemini 2.5 Flash + Eleven Flash v2), Cartesia Line (Ink + Gemini 2.5 Flash + Sonic) та Inworld Realtime (Inworld STT 1 + Gemini 2.5 Flash + Inworld TTS 1.5 Mini).
Три з чотирьох використовують Gemini 2.5 Flash. Це показовий консенсус.
Еталонні бюджети
Складено на основі перевірених вище показників компонентів. Це оцінки для планування, а не вимірювання запущеної системи.
Агресивний каскадний конвеєр, розміщений у США, із спільним розташуванням компонентів:
| Етап | Бюджет |
|---|---|
| Транспорт і медіа (WebRTC) | 50–150 мс |
| STT + кінець ходу (Flux за стандартних налаштувань) | ~260 мс |
| Перший фрагмент LLM (рівень до 0.5 с) | 230–500 мс |
| Завершення речення при 250+ ток./с | ~100 мс |
| Перше аудіо TTS + мережа | 150–300 мс |
| Разом | ~790 мс–1.3 с |
Це відповідає або трохи перевищує орієнтир у 800 мс, що узгоджується з формулюванням Квіндли: 800 мс — це жорсткий, але досяжний показник.
Перетворення мовлення на мовлення, одна модель:
| Етап | Бюджет |
|---|---|
| Транспорт і медіа | 50–150 мс |
| TTFA моделі (мінімальний рівень міркування) | 700 мс–1.0 с |
| Разом | ~750 мс–1.15 с |
Порівнюваний результат, але з меншою спостережуваністю та, згідно з бенчмарком Daily, вимірюваним розривом у можливостях виклику інструментів і дотримання інструкцій.
Що з цим робити
- Оберіть метрику, яка визначає межі вашої архітектури. Якщо далі в конвеєрі стоїть модель TTS, оптимізуйте TTFS, а не TTFT. Це означає, що потрібно враховувати TTFT і кількість токенів за секунду разом.
- Спочатку розмістіть компоненти поруч, а вже потім оптимізуйте моделі. LiveKit оцінює спільне розташування агента й моделі як чинник із дуже великим впливом, важливішим за вибір моделі. Якщо ви використовуєте SIP, тримайте транк географічно близько також.
- Явно обмежуйте рівень міркування. Це найпотужніший окремий регулятор у наведених вище таблицях, а для більшості сучасних кінцевих точок він задається прапорцем конфігурації.
- Закладайте бюджет на виклики інструментів. Квіндла зазначає, що будь-який хід із викликом інструмента приблизно подвоює затримку LLM. LiveKit рекомендує обмежити
max_tool_steps, об’єднувати зовнішні API-виклики й відтворювати звук обдумування, щоб тиша не була єдиним зворотним зв’язком для користувача. - Спочатку додайте інструментування, а вже потім налаштовуйте. Agents SDK від LiveKit на кожному ходу надає
e2e_latency, час LLM до першого токена та час TTS до першого байта. Pipecat надає еквівалентні дані черезenable_metricsі спостерігачі. Зберігайте журнали зовні та стежте за регресіями. - Вимірюйте p95, а не лише p50. Головним покращенням OpenAI у липні 2026 року стало саме скорочення хвостової затримки, адже саме на цьому рівні голосові агенти ламаються.
- Слідкуйте за інфраструктурними пастками. LiveKit документує, що агенти на AWS, розміщені на інстансах із можливістю тимчасового збільшення продуктивності, як-от t3 або t4g, можуть стикатися із серйозною затримкою та тайм-аутами визначення ходу навіть за начебто низького використання CPU.
Ключові висновки
- Найшвидший незалежно виміряний перший фрагмент на робочому навантаженні з 10 тис. токенів: Baseten із gpt-oss-120b — 0.23 с, за даними Artificial Analysis.
- Пропускна здатність і TTFT — різні характеристики: Cerebras досягає 1 697 ток./с, але має TTFT 0.49 с; Mercury 2 від Inception досягає 770 ток./с при 3.07 с.
- Заявлені постачальниками показники затримки, як-от 75 мс у ElevenLabs і менше 90 мс у Cartesia, — це лише час інференсу моделі, без урахування мережі.
- Рівень міркування — найпотужніший окремий регулятор TTFT: Gemini 3.1 Flash Live переходить від 0.96 с до 2.99 с між режимами Minimal і High.
- Один лише TTFT не прогнозує, як сприйматиметься агент. Це визначає час до першого речення, оскільки для синтезу мовлення потрібна повна підрядна частина.
Джерела
- Artificial Analysis: рейтинг постачальників API LLM
- Artificial Analysis: методологія оцінювання продуктивності
- Artificial Analysis: рейтинг систем перетворення мовлення на мовлення
- Artificial Analysis: рейтинг потокових систем перетворення мовлення на текст
- Artificial Analysis: рейтинг голосових систем постачальників перетворення тексту на мовлення
- LiveKit: як зрозуміти та покращити затримку голосового агента
- LiveKit: інференс із оптимізованою затримкою, Gemma 4
- LiveKit: голосові агенти
- Daily: порівняльне тестування LLM для сценаріїв голосових агентів
- Daily: поради щодо створення голосового ШІ
- Deepgram: міграція з Nova-3 на Flux
- Deepgram: вимірювання затримки STT
- AssemblyAI: представлення Universal-Streaming
- ElevenLabs: розуміння затримки
- ElevenLabs: оптимізація затримки
- Cartesia: Sonic-3.6 та Ink-2
- OpenAI: посібник із Realtime та аудіо
- Джерело бенчмарку aiewf-eval
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.