Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

API інференсу з найнижчою затримкою для голосових агентів і агентів реального часу: бенчмарк із пріоритетом часу до першого токена (TTFT)

Час до першого токена (TTFT) — це метрика, яку команди використовують для вибору API інференсу для голосових систем. Водночас саме ця метрика часто вводить їх в оману. TTFT фіксує момент початку генерації, але модель синтезу мовлення не може почати говорити, доки не отримає повне речення або підрядну частину. Між цими двома моментами й виникає різниця між агентом, який сприймається як співрозмовник, і тим, якого переривають. У цьому матеріалі протестовано кожен рівень голосового стека, зокрема LLM, перетворення мовлення на текст, перетворення тексту на мовлення та перетворення мовлення на мовлення.

Чому TTFT — правильна відправна точка, але не кінцева метрика

Голосовий агент — це бюджет затримки, усередині якого працює мовна модель. Кожен етап витрачає мілісекунди, які чує користувач.

Час до першого токена (TTFT) — це інтервал між надсиланням запиту на інференс і отриманням у відповідь першого токена. У визначенні IBM це момент, коли система переходить від стану бездіяльності до видимої активності.

Для чату TTFT майже вичерпує всю історію. Для голосу це лише один доданок у сумі.

Причина механічна. Модель синтезу мовлення не може синтезувати половину слова. Їй потрібна повна підрядна частина або речення, перш ніж вона створить аудіо. LiveKit називає відповідну метрику часом до першого речення (TTFS) і стверджує у своєму матеріалі про розгортання Gemma 4, що саме TTFS реально відчувають користувачі.

Отже, у вас є два регулятори, а не один. TTFT визначає, коли починається генерація. Кількість токенів за секунду визначає, наскільки швидко завершується перше речення. Постачальник, який перемагає за одним показником і програє за іншим, не сприйматиметься як швидкий.

Бюджет затримки: скільки насправді коштує один голосовий хід

Огляд голосових агентів LiveKit розкладає один хід на STT приблизно 100–200 мс, LLM — 300–500 мс із потоковою передачею, TTS — 100–200 мс і мережу — 50–150 мс через WebRTC. Практичний наскрізний орієнтир становить 700 мс–1,2 с.

Квіндла Гультман Крамер, співтворець Pipecat, радить орієнтуватися на медіанну затримку від голосу до голосу 800 мс, а для прототипу допускає 1 500 мс. Його приблизний розрахунок ділить цей час на чотири частини — близько 200 мс кожна: транспорт і обробка медіа, STT разом із визначенням кінця фрази, інференс LLM і TTS.

Попередня робота Daily над найшвидшим голосовим ботом дає людський орієнтир. Типовий час відповіді людини в розмові становить близько 500 мс. Паузи понад 800 мс починають здаватися неприродними.

Лютневий бенчмарк LLM для голосових агентів Daily за 2026 рік безпосередньо переводить це у вимогу до LLM. Для природної розмови потрібна затримка від голосу до голосу менш ніж 1 500 мс, що відповідає приблизно 700 мс бюджету TTFT для текстової LLM у зв’язці транскрипція–LLM–голос.

Ці 700 мс — орієнтир, з яким слід порівнювати кожного постачальника.

Як читати бенчмарк TTFT і не дати себе ввести в оману

Перш ніж перейти до таблиць, варто знати п’ять методологічних фактів, які змінюють значення чисел:

1. Форма робочого навантаження має вирішальне значення: Artificial Analysis у березні 2026 року змінила типове робоче навантаження. Тепер сайт звітує про запити з 10 тис. вхідних токенів замість 1 тис. Довші запити збільшують і TTFT, і швидкість виведення. LiveKit вважає це ближчим до реальності для голосових систем, оскільки виробничі агенти на початку контексту містять політики, персону, правила ескалації, отримані дані та схеми інструментів.

2. Розташування сервера вже враховане в показнику: Artificial Analysis проводить тести з віртуальної машини в зоні Google Cloud us-central1-a. Сервіс прямо зазначає, що TTFT включає мережеву затримку, тому розташування серверів може давати постачальникам перевагу або, навпаки, погіршувати їхні результати.

3. Токени міркування враховуються: у визначенні Artificial Analysis TTFT для моделі з міркуванням — це перший токен міркування, а не перший токен відповіді. Це окремі стовпці.

4. Вимірюйте з боку отримувача: Daily зазначає, що постачальники моделей іноді вказують внутрішній TTFT своїх стеків інференсу. Daily вимірює час від надсилання запиту до першого придатного токена, отриманого через API.

5. Результати запусків не відтворюються: Daily прямо говорить про це: TTFT суттєво змінюється між запусками бенчмарку, а постачальники змінюють стеки інференсу, а іноді й ваги, не змінюючи назв моделей.

Рівень 1: час LLM до першого токена

Наведені нижче дані взято з рейтингу постачальників API Artificial Analysis, отриманого 30 серпня 2026 року. У стовпці «перший фрагмент» наведено TTFT. Робоче навантаження — 10 тис. вхідних токенів, один запит, медіана за 72 години.

Найнижча виміряна затримка до першого фрагмента

ПостачальникМодельTTFTШвидкість виведення
Basetengpt-oss-120b (high)0.23s266 ток./с
Basetengpt-oss-120b (low)0.24s271 ток./с
DeepInfraNemotron 3 Ultra0.28s371 ток./с
CohereNorth Mini Code0.32s104 ток./с
CohereCommand A+0.40s239 ток./с
BasetenInkling Small0.42s337 ток./с
ModularGemma 4 31B (NVFP4)0.44s243 ток./с
NebiusGLM-5.3-Flash0.46s206 ток./с
FireworksNemotron 3.5 Lightning0.46s501 ток./с
Together AIKimi K2.7 Code0.47s245 ток./с
Cerebrasgpt-oss-120b (high)0.49s1 697 ток./с

Пастка пропускної здатності

Виробники чипів оптимізують іншу метрику, не ту, яка потрібна голосовим агентам.

ПостачальникМодельTTFTШвидкість виведення
Cerebrasgpt-oss-120b (high)0.49s1 697 ток./с
CelerisCeleris-10.62s1 612 ток./с
CerebrasGemma 4 31B0.53s1 351 ток./с
Groqgpt-oss-20b (high)0.82s957 ток./с
SambaNovagpt-oss-120b (high)0.92s706 ток./с
Groqgpt-oss-120b (low)0.69s473 ток./с
InceptionMercury 23.07s770 ток./с

Mercury 2 — найяскравіший приклад. Це мовна модель на основі дифузії, яка генерує 770 токенів за секунду. Її перший фрагмент надходить через 3.07 с. Це в чотири рази перевищує весь бюджет LLM для природної розмови.

Cerebras і Groq — інший випадок. Їхній TTFT цілком гідний, а пропускна здатність виняткова. Саме для TTFS це сильне поєднання, оскільки речення завершується майже одразу після надходження першого токена.

Передові та пропрієтарні кінцеві точки

ПостачальникМодельTTFTШвидкість виведення
Amazon BedrockGPT-5.6 Luna (non-reasoning)0.59s181 ток./с
Amazon BedrockGPT-5.6 Terra (non-reasoning)0.72s103 ток./с
OpenAIGPT-5.6 Luna (non-reasoning)0.74s113 ток./с
GoogleGemini 3.7 Flash (low), AI Studio0.84s315 ток./с
AnthropicClaude 4.5 Haiku (non-reasoning)0.84s82 ток./с
Amazon BedrockNova Micro0.86s264 ток./с
GoogleGemini 3.5 Flash (minimal), AI Studio0.90s202 ток./с
OpenAIGPT-5.6 Sol (non-reasoning)1.06s71 ток./с

Зверніть увагу на ту саму модель на різних хостах. GPT-5.6 Luna без міркування показує 0.59 с на Amazon Bedrock і 0.74 с у власному API OpenAI. Хостинг і маршрутизація мають не менше значення, ніж ваги моделей.

Викидний результат, виміряний постачальником

LiveKit публікує показники TTFT для власного продукту інференсу. Gemma 4 31B на LiveKit Inference показала 192 мс, тоді як Gemini 2.5 Flash — 911 мс, GPT-5.5 — 966 мс, GPT-4.1 — 1 006 мс, а та сама Gemma 4 31B через OpenRouter — 1 876 мс.

LiveKit прозоро пояснює механізм, що робить твердження переконливішим за більшість інших. Сервіс запускає Gemma за SGLang зі спекулятивним декодуванням і навмисно не заповнює GPU повністю, щоб зменшити затримку в черзі. За словами компанії, теплий запит починає повертати токени приблизно через 100 мс. Компромісом є вартість — $1.20 за 1 млн вихідних токенів.

У тому самому матеріалі наведено TTFS для повних розмов: 354 мс для Gemma 4 31B на LiveKit, 1 034 мс для Gemini 2.5 Flash, 1 088 мс для GPT-4.1, 1 267 мс для Gemini 3.0 Flash і 1 404 мс для GPT-5.5.

Поруч наведено й показники можливостей. На IFBench, незалежно оціненому Artificial Analysis, Gemma 4 31B набирає 75.6% проти 75.9% у GPT-5.5, 43% у GPT-4.1 і 39% у Gemini 2.5 Flash. На τ²-bench лідирує GPT-5.5 із результатом 93.9%, тоді як Gemma 4 31B має 76.9%.

Рівень 2: перетворення мовлення на текст і визначення завершення ходу

Для голосових систем затримка STT — це не швидкість транскрибування. Це час після припинення мовлення користувачем, через який конвеєр розуміє, що користувач припинив говорити.

Artificial Analysis вимірює дві величини у своєму рейтингу потокових STT-систем, причому обидві починають відлік від завершення мовлення, визначеного SileroVAD: час до першої часткової транскрипції та час до фінальної транскрипції. Індекс AA-WER Streaming базується приблизно на 8 годинах аудіо з вагами AA-AgentTalk 50%, VoxPopuli 25%, Earnings-22 25%.

Опубліковані постачальниками показники затримки:

МодельЗаявлений показникТип джерела
Deepgram Flux~260 мс p50 для визначення кінця ходу за стандартних налаштуваньДокументація постачальника
Deepgram Nova-3Менше 300 мс потокової затримкиДокументація постачальника
AssemblyAI Universal-Streaming~300 мс незмінної видачі слівПостачальник
Cartesia Ink-2100 мс затримки транскрипціїПостачальник
Speechmatics Voice SDK0.451 ± 0.022 с від завершення мовлення до фінальних результатівВнутрішній інструмент постачальника

Deepgram Flux — найцікавіша з архітектурного погляду система. Вона вбудовує визначення кінця ходу в модель розпізнавання, а не додає VAD поверх неї. Deepgram стверджує, що це може скоротити затримку відповіді агента на 200–600 мс порівняно з традиційним конвеєром STT плюс VAD. Система підтримує eot_threshold (0.5–0.9), eager_eot_threshold (0.3–0.9) і подію EagerEndOfTurn, яка дає змогу раніше запустити LLM.

Остання можливість важливіша за саме число. Якщо можна почати генерацію за сигналом раннього завершення, TTFT LLM повністю вилучається з критичного шляху, коли прогноз правильний.

AssemblyAI Universal-Streaming змінює звичну модель «часткові результати, потім фінальні», видаючи незмінні транскрипції. У власному вимірюванні 2025 року AssemblyAI повідомила про медіанну видачу слів через 307 мс проти 516 мс у Deepgram Nova-3. Документація також рекомендує використовувати неформатовані транскрипції для голосових агентів, оскільки форматування з’являється пізніше й рідко змінює поведінку LLM.

Твердження щодо точності тут є спірними й походять від постачальників. AssemblyAI повідомляє, що Universal-3.5 Pro Realtime має 6.99% WER у відкритому бенчмарку голосових агентів Pipecat, випереджаючи Google Chirp3 із 9.04%, ElevenLabs Scribe v2 із 9.76% і Deepgram Flux із 15.58%. Перш ніж вважати ці результати остаточними, перевірте їх самостійно.

LiveKit також документує превентивну генерацію, яка запускає LLM на частковій транскрипції. Застереження цілком реальне: якщо після фінальної транскрипції відповідь доводиться генерувати заново, ви витрачаєте токени й нічого не заощаджуєте.

Рівень 3: час перетворення тексту на мовлення до першого аудіо

Саме тут цифри постачальників найбільше розходяться з реальним досвідом користувачів.

ElevenLabs стверджує, що Flash v2.5 забезпечує приблизно 75 мс. Власна документація компанії ретельно уточнює: 75 мс — це лише час інференсу моделі. На сторінці про затримку компанія також вказує, що час проходження мережі в обидва боки зазвичай становить 20–200 мс залежно від географії, і зазначає, що більшість аудіопрогравачів буферизують дані перед відтворенням, причому буферизація на 500 мс є поширеною. Також ElevenLabs зазначає, що Eleven v3 не призначена для роботи в реальному часі, і рекомендує для Agents Platform Flash v2.5, Flash v2 або Multilingual v2.

Cartesia заявляє затримку TTS менше 90 мс і затримку транскрипції 100 мс для Sonic-3.6 та Ink-2. У матеріалі Marktechpost про випуск Sonic-3.6 уточнюється, що це заявлена постачальником затримка моделі, а не виміряний час проходження запиту від кінця до кінця. Раніше Cartesia заявляла 82 мс від кінця до кінця до першого аудіо для Sonic 3.5. Sonic працює на моделях простору станів, а не на трансформерах, тому масштабується лінійно, а не квадратично, зі збільшенням довжини послідовності.

Щодо якості, арена Provider Voice Artificial Analysis використовує Elo за оцінками слухачів, які не бачать назви моделей; дані отримано 30 серпня 2026 року:

МодельEloЦіна за 1 млн символів
Cartesia Sonic 3.61,288$49.00
SpeechifyAI Simba 3.21,243$10.00
Alibaba Qwen-Audio-3.0-TTS-Plus1,243$27.60
Inworld Realtime TTS-2 Flash (preview)1,228$10.40
BreezeBlue Breeze TTS 2 (open weights)1,220$34.00
ElevenLabs v3 Conversational1,215$50.00
Google Gemini 3.1 Flash TTS1,210$18.30
ElevenLabs Flash v2.51,083$50.00

Різниця між Sonic 3.6 із показником 1,288 і Flash v2.5 із 1,083 — це ціна якості рівня з низькою затримкою, який фактично використовує більшість агентів.

Рівень 4: час перетворення мовлення на мовлення до першого аудіо

Моделі перетворення мовлення на мовлення об’єднують STT, LLM і TTS в один прохід. Менша кількість обмінів даними має означати нижчу затримку.

LiveKit обережно зазначає, що моделі реального часу не гарантовано будуть швидшими в кожному випадку, а добре налаштований конвеєр може бути дуже конкурентоспроможним.

Дані підтверджують це застереження. У рейтингу систем перетворення мовлення на мовлення Artificial Analysis TTFA виміряно на Big Bench Audio; дані отримано 30 серпня 2026 року:

МодельTTFAМіркування на основі мовленняУспішність завданняІндекс S2S
Deepslate Opal0.44s85%
Gemini 2.5 Flash Native Audio Dialog0.63s69%
Grok Voice Think Fast 2.0 High0.70s97%94.7%79.0%
Grok Voice Fast 1.00.78s93%
Qwen3.5 Omni Flash Realtime0.79s59%29.1%
OpenAI GPT-Realtime-1.50.81s81%85.1%70.3%
OpenAI GPT Realtime Mini (Oct ’25)0.81s64%79.6%56.8%
OpenAI GPT-Realtime-2.1 Mini Minimal0.85s63%76.7%52.8%
Google Gemini 3.1 Flash Live Minimal0.96s71%74.6%63.9%
OpenAI GPT-Realtime-2.1 Minimal0.97s87%89.4%70.3%
Amazon Nova 2.0 Sonic (Mar 2026)1.14s88%57.1%
OpenAI GPT-Realtime-2 (High)1.14s97%89.8%73.6%
OpenAI GPT-Realtime-2.1 High1.21s96%91.5%73.9%
Google Gemini 3.1 Flash Live High2.99s97%71.8%71.5%
OpenAI GPT-Realtime-2.1 Mini High4.28s75%

Grok Voice Think Fast 2.0 High — беззаперечний лідер цієї таблиці: TTFA 0.70 с, 97% міркування на основі мовлення та 94.7% успішності завдань.

Штраф за рівень міркування помітний у межах окремих сімейств моделей. Gemini 3.1 Flash Live переходить від 0.96 с до 2.99 с між режимами Minimal і High. OpenAI GPT-Realtime-2.1 переходить від 0.97 с до 1.21 с, отримуючи натомість 2.1 відсоткового пункта успішності завдань.

OpenAI випустила gpt-realtime-2.1 і gpt-realtime-2.1-mini на початку липня 2026 року й заявила, що вдосконалене кешування скоротило затримку p95 щонайменше на 25% в усіх її голосових моделях Realtime. Саме хвостова затримка змушує телефонного агента здаватися зламаним, тому це корисніше твердження, ніж покращення медіани.

Розрив у можливостях

Бенчмарк Daily кількісно показує, чому більшість виробничих агентів досі використовують каскадні конвеєри. У тесті aiwf_medium_context GPT Realtime отримала 86.7% проти 94.9% у GPT-4.1. За оцінкою Daily, Ultravox 0.7 стала першою моделлю перетворення мовлення на мовлення, яка добре працює в довгих багатоходових розмовах; крім того, вона має відкриті ваги.

Artificial Analysis також тестує чотири «каскадні системи за замовчуванням» від постачальників, що дає корисний контекст щодо того, що саме платформи пропонують: Deepgram Voice Agent (Nova-3 + GPT-4o Mini + Aura-2), ElevenLabs Agents (Scribe v2 Realtime + Gemini 2.5 Flash + Eleven Flash v2), Cartesia Line (Ink + Gemini 2.5 Flash + Sonic) та Inworld Realtime (Inworld STT 1 + Gemini 2.5 Flash + Inworld TTS 1.5 Mini).

Три з чотирьох використовують Gemini 2.5 Flash. Це показовий консенсус.

Еталонні бюджети

Складено на основі перевірених вище показників компонентів. Це оцінки для планування, а не вимірювання запущеної системи.

Агресивний каскадний конвеєр, розміщений у США, із спільним розташуванням компонентів:

ЕтапБюджет
Транспорт і медіа (WebRTC)50–150 мс
STT + кінець ходу (Flux за стандартних налаштувань)~260 мс
Перший фрагмент LLM (рівень до 0.5 с)230–500 мс
Завершення речення при 250+ ток./с~100 мс
Перше аудіо TTS + мережа150–300 мс
Разом~790 мс–1.3 с

Це відповідає або трохи перевищує орієнтир у 800 мс, що узгоджується з формулюванням Квіндли: 800 мс — це жорсткий, але досяжний показник.

Перетворення мовлення на мовлення, одна модель:

ЕтапБюджет
Транспорт і медіа50–150 мс
TTFA моделі (мінімальний рівень міркування)700 мс–1.0 с
Разом~750 мс–1.15 с

Порівнюваний результат, але з меншою спостережуваністю та, згідно з бенчмарком Daily, вимірюваним розривом у можливостях виклику інструментів і дотримання інструкцій.

Що з цим робити

  • Оберіть метрику, яка визначає межі вашої архітектури. Якщо далі в конвеєрі стоїть модель TTS, оптимізуйте TTFS, а не TTFT. Це означає, що потрібно враховувати TTFT і кількість токенів за секунду разом.
  • Спочатку розмістіть компоненти поруч, а вже потім оптимізуйте моделі. LiveKit оцінює спільне розташування агента й моделі як чинник із дуже великим впливом, важливішим за вибір моделі. Якщо ви використовуєте SIP, тримайте транк географічно близько також.
  • Явно обмежуйте рівень міркування. Це найпотужніший окремий регулятор у наведених вище таблицях, а для більшості сучасних кінцевих точок він задається прапорцем конфігурації.
  • Закладайте бюджет на виклики інструментів. Квіндла зазначає, що будь-який хід із викликом інструмента приблизно подвоює затримку LLM. LiveKit рекомендує обмежити max_tool_steps, об’єднувати зовнішні API-виклики й відтворювати звук обдумування, щоб тиша не була єдиним зворотним зв’язком для користувача.
  • Спочатку додайте інструментування, а вже потім налаштовуйте. Agents SDK від LiveKit на кожному ходу надає e2e_latency, час LLM до першого токена та час TTS до першого байта. Pipecat надає еквівалентні дані через enable_metrics і спостерігачі. Зберігайте журнали зовні та стежте за регресіями.
  • Вимірюйте p95, а не лише p50. Головним покращенням OpenAI у липні 2026 року стало саме скорочення хвостової затримки, адже саме на цьому рівні голосові агенти ламаються.
  • Слідкуйте за інфраструктурними пастками. LiveKit документує, що агенти на AWS, розміщені на інстансах із можливістю тимчасового збільшення продуктивності, як-от t3 або t4g, можуть стикатися із серйозною затримкою та тайм-аутами визначення ходу навіть за начебто низького використання CPU.

Ключові висновки

  • Найшвидший незалежно виміряний перший фрагмент на робочому навантаженні з 10 тис. токенів: Baseten із gpt-oss-120b — 0.23 с, за даними Artificial Analysis.
  • Пропускна здатність і TTFT — різні характеристики: Cerebras досягає 1 697 ток./с, але має TTFT 0.49 с; Mercury 2 від Inception досягає 770 ток./с при 3.07 с.
  • Заявлені постачальниками показники затримки, як-от 75 мс у ElevenLabs і менше 90 мс у Cartesia, — це лише час інференсу моделі, без урахування мережі.
  • Рівень міркування — найпотужніший окремий регулятор TTFT: Gemini 3.1 Flash Live переходить від 0.96 с до 2.99 с між режимами Minimal і High.
  • Один лише TTFT не прогнозує, як сприйматиметься агент. Це визначає час до першого речення, оскільки для синтезу мовлення потрібна повна підрядна частина.

Джерела

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини