Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

API инференса с минимальной задержкой для голосовых агентов и агентов реального времени: бенчмарк с приоритетом времени до первого токена (TTFT)

Время до первого токена (TTFT) — это метрика, которую команды используют для выбора API инференса для голосовых систем. Но это также метрика, которая вводит их в заблуждение. TTFT показывает момент начала генерации; модель преобразования текста в речь не может начать говорить, пока не получит целую фразу. Между этими двумя моментами и скрывается разница между агентом, который ощущается как собеседник, и агентом, которого постоянно перебивают. В этом материале рассматривается каждый уровень голосового стека, включая LLM, преобразование речи в текст, преобразование текста в речь и преобразование речи в речь.

Почему TTFT — правильная отправная точка, но не конечный ориентир

Голосовой агент — это бюджет задержки, внутри которого работает языковая модель. Каждый этап расходует миллисекунды, которые слышит пользователь.

Время до первого токена (TTFT) — это интервал между отправкой запроса на инференс и получением первого токена в ответ. Определение IBM описывает его как момент, когда система переходит из состояния простоя в состояние видимой активности.

Для чата TTFT почти исчерпывающе описывает ситуацию. Для голоса это лишь один элемент суммы.

Причина механическая. Модель преобразования текста в речь не может синтезировать половину слова. Ей нужна законченная фраза или предложение, прежде чем она начнёт создавать аудио. LiveKit называет соответствующую метрику временем до первого предложения (TTFS) и утверждает в своей публикации о развёртывании Gemma 4, что именно TTFS ощущают пользователи.

Таким образом, у вас есть два регулятора, а не один. TTFT определяет, когда начинается генерация. Число токенов в секунду определяет, насколько быстро завершается первое предложение. Провайдер, который выигрывает по одному показателю и проигрывает по другому, не будет ощущаться быстрым.

Бюджет задержки: сколько на самом деле стоит один голосовой ход

Обзор голосовых агентов LiveKit разбивает один ход на STT — примерно 100–200 мс, LLM — 300–500 мс при потоковой передаче, TTS — 100–200 мс и сеть — 50–150 мс поверх WebRTC. Практическая целевая сквозная задержка составляет, по оценке LiveKit, от 700 мс до 1,2 с.

Квиндла Хультман Крамер, соавтор Pipecat, рекомендовал ориентироваться на медианную задержку от голоса до голоса в 800 мс, при этом для прототипа допустима более высокая задержка — 1 500 мс. В его приблизительном расчёте эти показатели делятся на четыре части примерно по 200 мс: транспорт и обработка медиаданных, STT плюс определение конца фразы, инференс LLM и TTS.

Предыдущая работа Daily над самым быстрым голосовым ботом задаёт ориентир, основанный на человеческом поведении. Типичное время ответа человека в разговоре составляет около 500 мс. Паузы дольше 800 мс начинают ощущаться неестественными.

Февральский бенчмарк LLM для голосовых агентов Daily за 2026 год напрямую переводит это в требование к LLM. Для естественного разговора задержка от голоса до голоса должна быть менее 1 500 мс, что даёт примерно 700 мс бюджета TTFT для текстовой LLM внутри контура «транскрипция — LLM — голос».

Именно эти 700 мс — планка, с которой следует сравнивать каждого провайдера.

Как читать бенчмарк TTFT и не попасть в ловушку

Прежде чем перейти к таблицам, рассмотрим пять методологических фактов, которые меняют смысл цифр:

1. Форма рабочей нагрузки имеет решающее значение: Artificial Analysis в марте 2026 года изменила рабочую нагрузку по умолчанию. Теперь сайт сообщает данные для запросов с 10 тыс. входных токенов вместо 1 тыс. Более длинные запросы увеличивают и TTFT, и скорость вывода. LiveKit утверждает, что это ближе к реальности для голосовых систем, поскольку производственные агенты заранее загружают политики, персону, правила эскалации, извлечённые данные и схемы инструментов.

2. Расположение сервера уже заложено в результатах: Artificial Analysis проводит тесты с виртуальной машины в зоне Google Cloud us-central1-a. Сервис прямо указывает, что TTFT включает сетевую задержку и может давать провайдерам преимущество или, наоборот, ухудшать их результаты в зависимости от места обслуживания.

3. Токены рассуждений учитываются: в определении Artificial Analysis TTFT для рассуждающей модели — это первый токен рассуждения, а не первый токен ответа. Это отдельные столбцы.

4. Измеряйте со стороны получателя: Daily отмечает, что провайдеры моделей иногда указывают TTFT внутри своих стеков инференса. Daily измеряет интервал от отправки запроса до первого пригодного токена, полученного от API.

5. Запуски невоспроизводимы: Daily прямо говорит об этом: TTFT существенно меняется от одного запуска бенчмарка к другому, а провайдеры изменяют стеки инференса и иногда веса, не меняя названия моделей.

Уровень 1: время LLM до первого токена

Приведённые ниже данные взяты из рейтинга провайдеров API Artificial Analysis, получены 30 августа 2026 года. Столбец «первый фрагмент» — это TTFT. Рабочая нагрузка: 10 тыс. входных токенов, один запрос, медианное значение за 72 часа.

Минимальная измеренная задержка до первого фрагмента

ПровайдерМодельTTFTСкорость вывода
Basetengpt-oss-120b (high)0.23 с266 токенов/с
Basetengpt-oss-120b (low)0.24 с271 токен/с
DeepInfraNemotron 3 Ultra0.28 с371 токен/с
CohereNorth Mini Code0.32 с104 токена/с
CohereCommand A+0.40 с239 токенов/с
BasetenInkling Small0.42 с337 токенов/с
ModularGemma 4 31B (NVFP4)0.44 с243 токена/с
NebiusGLM-5.3-Flash0.46 с206 токенов/с
FireworksNemotron 3.5 Lightning0.46 с501 токен/с
Together AIKimi K2.7 Code0.47 с245 токенов/с
Cerebrasgpt-oss-120b (high)0.49 с1 697 токенов/с

Ловушка пропускной способности

Производители чипов оптимизируют другой показатель, не тот, который нужен голосовым агентам.

ПровайдерМодельTTFTСкорость вывода
Cerebrasgpt-oss-120b (high)0.49 с1 697 токенов/с
CelerisCeleris-10.62 с1 612 токенов/с
CerebrasGemma 4 31B0.53 с1 351 токен/с
Groqgpt-oss-20b (high)0.82 с957 токенов/с
SambaNovagpt-oss-120b (high)0.92 с706 токенов/с
Groqgpt-oss-120b (low)0.69 с473 токена/с
InceptionMercury 23.07 с770 токенов/с

Mercury 2 — самый наглядный пример. Это языковая модель на основе диффузии, генерирующая 770 токенов в секунду. Первый фрагмент поступает через 3,07 с. Это в четыре раза больше всего бюджета LLM для естественного разговора.

Cerebras и Groq — другой случай. Их TTFT вполне достойный, а пропускная способность исключительна. Именно для TTFS такое сочетание хорошо, поскольку предложение завершается почти сразу после поступления первого токена.

Передовые и проприетарные конечные точки

ПровайдерМодельTTFTСкорость вывода
Amazon BedrockGPT-5.6 Luna (non-reasoning)0.59 с181 токен/с
Amazon BedrockGPT-5.6 Terra (non-reasoning)0.72 с103 токена/с
OpenAIGPT-5.6 Luna (non-reasoning)0.74 с113 токенов/с
GoogleGemini 3.7 Flash (low), AI Studio0.84 с315 токенов/с
AnthropicClaude 4.5 Haiku (non-reasoning)0.84 с82 токена/с
Amazon BedrockNova Micro0.86 с264 токена/с
GoogleGemini 3.5 Flash (minimal), AI Studio0.90 с202 токена/с
OpenAIGPT-5.6 Sol (non-reasoning)1.06 с71 токен/с

Обратите внимание на одну и ту же модель на разных хостах. GPT-5.6 Luna без рассуждений показывает 0,59 с на Amazon Bedrock и 0,74 с на собственном API OpenAI. Хостинг и маршрутизация важны не меньше, чем веса.

Выброс среди измерений, опубликованных провайдером

LiveKit публикует значения TTFT для собственного продукта инференса. Gemma 4 31B на LiveKit Inference показала 192 мс против 911 мс у Gemini 2.5 Flash, 966 мс у GPT-5.5, 1 006 мс у GPT-4.1 и 1 876 мс у той же Gemma 4 31B через OpenRouter.

LiveKit прозрачно описывает механизм, что делает утверждение более убедительным, чем большинство подобных заявлений. Компания запускает Gemma за SGLang со спекулятивным декодированием и намеренно не размещает слишком много моделей на каждом GPU, чтобы задержка в очереди оставалась низкой. По словам LiveKit, тёплый запрос начинает возвращать токены примерно через 100 мс. Компромисс — стоимость в размере 1,20 доллара за 1 млн выходных токенов.

В той же публикации приводятся значения TTFS для полных разговоров: 354 мс для Gemma 4 31B на LiveKit, 1 034 мс для Gemini 2.5 Flash, 1 088 мс для GPT-4.1, 1 267 мс для Gemini 3.0 Flash и 1 404 мс для GPT-5.5.

Приведены и показатели возможностей. В IFBench, независимо оценённом Artificial Analysis, Gemma 4 31B набирает 75,6% против 75,9% у GPT-5.5, 43% у GPT-4.1 и 39% у Gemini 2.5 Flash. В τ²-bench лидирует GPT-5.5 с результатом 93,9%, тогда как Gemma 4 31B набирает 76,9%.

Уровень 2: преобразование речи в текст и определение хода

Для голоса задержка STT — это не скорость транскрибации. Это время, которое проходит после того, как пользователь перестал говорить, прежде чем конвейер понимает, что пользователь закончил говорить.

Artificial Analysis измеряет два показателя в своём рейтинге потокового STT, причём отсчёт в обоих случаях начинается с момента окончания речи, обнаруженного SileroVAD: время до первой частичной транскрипции и время до финальной транскрипции. Индекс AA-WER Streaming основан примерно на 8 часах аудио с весами AA-AgentTalk 50%, VoxPopuli 25% и Earnings-22 25%.

Опубликованные провайдерами значения задержки:

МодельЗаявлениеТип источника
Deepgram Flux~260 мс p50 для определения конца хода при настройках по умолчаниюДокументация провайдера
Deepgram Nova-3Задержка потоковой передачи менее 300 мсДокументация провайдера
AssemblyAI Universal-Streaming~300 мс до выдачи неизменяемого словаПровайдер
Cartesia Ink-2Задержка транскрипции 100 мсПровайдер
Speechmatics Voice SDK0,451 ± 0,022 с от окончания речи до финальных результатовВнутренний инструмент провайдера

Deepgram Flux — наиболее интересный с архитектурной точки зрения вариант. Он встраивает определение конца хода в модель распознавания, а не добавляет VAD поверх неё. Deepgram утверждает, что это может сократить задержку ответа агента на 200–600 мс по сравнению с традиционным конвейером STT плюс VAD. Модель предоставляет параметры eot_threshold (0.5–0.9), eager_eot_threshold (0.3–0.9) и событие EagerEndOfTurn, позволяющее раньше запустить LLM.

Последняя возможность важнее самого показателя. Если можно начать генерацию по опережающему сигналу, TTFT LLM полностью исчезает из критического пути, когда прогноз оказывается верным.

AssemblyAI Universal-Streaming переворачивает привычную модель «частичные результаты, затем финальные», выдавая неизменяемые транскрипции. В собственном измерении 2025 года AssemblyAI сообщила о медианном времени выдачи слова 307 мс против 516 мс у Deepgram Nova-3. В документации также рекомендуется использовать неформатированные транскрипции для голосовых агентов, поскольку форматирование появляется позже и редко меняет поведение LLM.

Заявления о точности здесь оспариваются и опубликованы самими провайдерами. AssemblyAI сообщает, что Universal-3.5 Pro Realtime показывает WER 6,99% в открытом бенчмарке голосовых агентов Pipecat, опережая Google Chirp3 с 9,04%, ElevenLabs Scribe v2 с 9,76% и Deepgram Flux с 15,58%. Прежде чем считать эти результаты окончательными, проведите собственные тесты.

LiveKit также документирует упреждающую генерацию, при которой LLM запускается на частичной транскрипции. Оговорка существенна: если после получения финальной транскрипции ответ приходится генерировать заново, вы расходуете токены и ничего не экономите.

Уровень 3: время преобразования текста в речь до первого аудио

Именно здесь цифры провайдеров сильнее всего расходятся с пользовательским опытом.

ElevenLabs заявляет, что Flash v2.5 обеспечивает примерно 75 мс. Собственная документация тщательно оговаривает: 75 мс относится только ко времени инференса модели. На странице о задержке компания уточняет, что сетевой обмен туда-обратно обычно занимает 20–200 мс в зависимости от географии, а большинство аудиоплееров буферизуют данные перед воспроизведением; при этом буферизация длительностью 500 мс является распространённой. Также ElevenLabs указывает, что Eleven v3 не предназначена для работы в реальном времени, и рекомендует Flash v2.5, Flash v2 или Multilingual v2 для своей платформы Agents.

Cartesia заявляет задержку TTS менее 90 мс и задержку транскрипции 100 мс для Sonic-3.6 и Ink-2. В материале Marktechpost о выпуске Sonic-3.6 отмечается, что оба показателя заявлены для задержки самой модели, а не измерены для сквозного сетевого обмена. Ранее Cartesia заявляла 82 мс от сквозного запроса до первого аудио для Sonic 3.5. Sonic работает на моделях пространства состояний, а не на трансформерах, поэтому масштабируется линейно, а не квадратично относительно длины последовательности.

Что касается качества, то рейтинг голосов провайдеров Artificial Analysis основан на Elo по оценкам слушателей, не знающих источник; данные получены 30 августа 2026 года:

МодельEloЦена за 1 млн символов
Cartesia Sonic 3.61 288$49.00
SpeechifyAI Simba 3.21 243$10.00
Alibaba Qwen-Audio-3.0-TTS-Plus1 243$27.60
Inworld Realtime TTS-2 Flash (preview)1 228$10.40
BreezeBlue Breeze TTS 2 (open weights)1 220$34.00
ElevenLabs v3 Conversational1 215$50.00
Google Gemini 3.1 Flash TTS1 210$18.30
ElevenLabs Flash v2.51 083$50.00

Разница между Sonic 3.6 с показателем 1 288 и Flash v2.5 с показателем 1 083 — это цена качества низколатентного уровня, на котором фактически работает большинство агентов.

Уровень 4: время преобразования речи в речь до первого аудио

Модели преобразования речи в речь объединяют STT, LLM и TTS в один проход. Меньшее число обменов должно означать меньшую задержку.

LiveKit проявляет здесь осторожность, отмечая, что модели реального времени не гарантируют более высокую скорость в каждом случае, а хорошо настроенный конвейер может быть весьма конкурентоспособным.

Данные подтверждают эту осторожность. Согласно рейтингу моделей преобразования речи в речь Artificial Analysis, TTFA измерялось на Big Bench Audio; данные получены 30 августа 2026 года:

МодельTTFAРассуждения на основе речиУспешность выполнения задачИндекс S2S
Deepslate Opal0.44 с85%
Gemini 2.5 Flash Native Audio Dialog0.63 с69%
Grok Voice Think Fast 2.0 High0.70 с97%94.7%79.0%
Grok Voice Fast 1.00.78 с93%
Qwen3.5 Omni Flash Realtime0.79 с59%29.1%
OpenAI GPT-Realtime-1.50.81 с81%85.1%70.3%
OpenAI GPT Realtime Mini (Oct ’25)0.81 с64%79.6%56.8%
OpenAI GPT-Realtime-2.1 Mini Minimal0.85 с63%76.7%52.8%
Google Gemini 3.1 Flash Live Minimal0.96 с71%74.6%63.9%
OpenAI GPT-Realtime-2.1 Minimal0.97 с87%89.4%70.3%
Amazon Nova 2.0 Sonic (Mar 2026)1.14 с88%57.1%
OpenAI GPT-Realtime-2 (High)1.14 с97%89.8%73.6%
OpenAI GPT-Realtime-2.1 High1.21 с96%91.5%73.9%
Google Gemini 3.1 Flash Live High2.99 с97%71.8%71.5%
OpenAI GPT-Realtime-2.1 Mini High4.28 с75%

Grok Voice Think Fast 2.0 High — лидер этой таблицы: TTFA 0,70 с, 97% рассуждений на основе речи и 94,7% успешности выполнения задач.

Штраф за уровень рассуждений виден внутри отдельных семейств моделей. Gemini 3.1 Flash Live переходит от 0,96 с к 2,99 с при смене режима Minimal на High. OpenAI GPT-Realtime-2.1 — от 0,97 с к 1,21 с, получая взамен 2,1 процентного пункта успешности выполнения задач.

OpenAI выпустила gpt-realtime-2.1 и gpt-realtime-2.1-mini в начале июля 2026 года и заявила, что улучшенное кэширование сократило задержку p95 как минимум на 25% во всех голосовых моделях Realtime. Именно хвостовая задержка заставляет телефонного агента ощущаться сломанным, поэтому это более полезное заявление, чем сообщение об улучшении медианного показателя.

Разрыв в возможностях

Бенчмарк Daily показывает, почему большинство производственных агентов по-прежнему используют каскадные конвейеры. В тесте aiwf_medium_context GPT Realtime набрала 86,7% против 94,9% у GPT-4.1. По оценке Daily, Ultravox 0.7 стала первой моделью преобразования речи в речь, хорошо справляющейся с длинными многоходовыми разговорами; кроме того, она распространяется с открытыми весами.

Artificial Analysis также тестирует четыре «каскадные системы по умолчанию» от провайдеров, что даёт полезное представление о фактически поставляемых платформах: Deepgram Voice Agent (Nova-3 + GPT-4o Mini + Aura-2), ElevenLabs Agents (Scribe v2 Realtime + Gemini 2.5 Flash + Eleven Flash v2), Cartesia Line (Ink + Gemini 2.5 Flash + Sonic) и Inworld Realtime (Inworld STT 1 + Gemini 2.5 Flash + Inworld TTS 1.5 Mini).

Три из четырёх используют Gemini 2.5 Flash. Это показательный консенсус.

Эталонные бюджеты

Составлены на основе приведённых выше проверенных показателей компонентов. Это оценки для планирования, а не измерения работающей системы.

Агрессивный каскадный конвейер, размещённый в США, с совместным расположением компонентов:

ЭтапБюджет
Транспорт и медиаданные (WebRTC)50–150 мс
STT + конец хода (Flux при настройках по умолчанию)~260 мс
Первый фрагмент LLM (уровень менее 0,5 с)230–500 мс
Завершение предложения при скорости 250+ токенов/с~100 мс
Первое аудио TTS + сеть150–300 мс
Итого~790 мс–1,3 с

Это значение соответствует целевому показателю 800 мс или немного превышает его, что согласуется с формулировкой Квиндлы: 800 мс — жёсткая, но достижимая цель.

Преобразование речи в речь, одна модель:

ЭтапБюджет
Транспорт и медиаданные50–150 мс
TTFA модели (уровень минимальных рассуждений)700 мс–1,0 с
Итого~750 мс–1,15 с

Сопоставимый результат при меньшей наблюдаемости и, согласно бенчмарку Daily, измеримом разрыве в возможностях вызова инструментов и следования инструкциям.

Что с этим делать

  • Выбирайте метрику, которой ограничена ваша архитектура. Если ниже по цепочке расположена модель TTS, оптимизируйте TTFS, а не TTFT. Это означает совместную оптимизацию TTFT и числа токенов в секунду.
  • Сначала разместите компоненты рядом, а уже потом оптимизируйте модели. LiveKit оценивает совместное размещение агента и модели как решение с очень высоким эффектом, превосходящим влияние выбора модели. Если вы используете SIP, также держите транк географически близко.
  • Явно ограничивайте уровень рассуждений. Это главный отдельный рычаг в приведённых выше таблицах, причём на большинстве современных конечных точек он задаётся флагом конфигурации.
  • Закладывайте время на вызовы инструментов. Квиндла отмечает, что любой ход с вызовом инструмента примерно удваивает задержку LLM. LiveKit рекомендует ограничивать max_tool_steps, объединять внешние API-вызовы и воспроизводить звук размышления, чтобы тишина не оставалась единственной обратной связью для пользователя.
  • Сначала внедрите мониторинг, затем настраивайте. Agents SDK от LiveKit предоставляет значения e2e_latency, времени LLM до первого токена и времени TTS до первого байта для каждого хода. Pipecat предоставляет эквивалентные данные через enable_metrics и наблюдателей. Храните журналы отдельно и следите за регрессиями.
  • Измеряйте p95, а не только p50. Главным улучшением OpenAI в июле 2026 года стало снижение хвостовой задержки, поскольку именно на этом уровне голосовые агенты ломаются.
  • Следите за инфраструктурными ловушками. LiveKit документирует, что агенты с самостоятельным размещением на AWS-инстансах с переменной производительностью, таких как t3 или t4g, могут сталкиваться с серьёзными задержками и тайм-аутами определения хода даже при, на первый взгляд, низкой загрузке CPU.

Основные выводы

  • Самый быстрый независимо измеренный первый фрагмент в рабочей нагрузке с 10 тыс. токенов: gpt-oss-120b на Baseten — 0,23 с, по данным Artificial Analysis.
  • Пропускная способность и TTFT — разные характеристики: Cerebras достигает 1 697 токенов/с при TTFT 0,49 с, а Mercury 2 от Inception — 770 токенов/с при 3,07 с.
  • Заявления провайдеров о задержке, такие как 75 мс у ElevenLabs и менее 90 мс у Cartesia, означают только время инференса модели и не учитывают сеть.
  • Уровень рассуждений — главный рычаг TTFT: Gemini 3.1 Flash Live переходит от 0,96 с к 2,99 с при смене режима Minimal на High.
  • Один только TTFT не предсказывает, как агент будет ощущаться. Это делает время до первого предложения, поскольку для синтеза речи нужна законченная фраза.

Источники

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости