API инференса с минимальной задержкой для голосовых агентов и агентов реального времени: бенчмарк с приоритетом времени до первого токена (TTFT)
Время до первого токена (TTFT) — это метрика, которую команды используют для выбора API инференса для голосовых систем. Но это также метрика, которая вводит их в заблуждение. TTFT показывает момент начала генерации; модель преобразования текста в речь не может начать говорить, пока не получит целую фразу. Между этими двумя моментами и скрывается разница между агентом, который ощущается как собеседник, и агентом, которого постоянно перебивают. В этом материале рассматривается каждый уровень голосового стека, включая LLM, преобразование речи в текст, преобразование текста в речь и преобразование речи в речь.
Почему TTFT — правильная отправная точка, но не конечный ориентир
Голосовой агент — это бюджет задержки, внутри которого работает языковая модель. Каждый этап расходует миллисекунды, которые слышит пользователь.
Время до первого токена (TTFT) — это интервал между отправкой запроса на инференс и получением первого токена в ответ. Определение IBM описывает его как момент, когда система переходит из состояния простоя в состояние видимой активности.
Для чата TTFT почти исчерпывающе описывает ситуацию. Для голоса это лишь один элемент суммы.
Причина механическая. Модель преобразования текста в речь не может синтезировать половину слова. Ей нужна законченная фраза или предложение, прежде чем она начнёт создавать аудио. LiveKit называет соответствующую метрику временем до первого предложения (TTFS) и утверждает в своей публикации о развёртывании Gemma 4, что именно TTFS ощущают пользователи.
Таким образом, у вас есть два регулятора, а не один. TTFT определяет, когда начинается генерация. Число токенов в секунду определяет, насколько быстро завершается первое предложение. Провайдер, который выигрывает по одному показателю и проигрывает по другому, не будет ощущаться быстрым.
Бюджет задержки: сколько на самом деле стоит один голосовой ход
Обзор голосовых агентов LiveKit разбивает один ход на STT — примерно 100–200 мс, LLM — 300–500 мс при потоковой передаче, TTS — 100–200 мс и сеть — 50–150 мс поверх WebRTC. Практическая целевая сквозная задержка составляет, по оценке LiveKit, от 700 мс до 1,2 с.
Квиндла Хультман Крамер, соавтор Pipecat, рекомендовал ориентироваться на медианную задержку от голоса до голоса в 800 мс, при этом для прототипа допустима более высокая задержка — 1 500 мс. В его приблизительном расчёте эти показатели делятся на четыре части примерно по 200 мс: транспорт и обработка медиаданных, STT плюс определение конца фразы, инференс LLM и TTS.
Предыдущая работа Daily над самым быстрым голосовым ботом задаёт ориентир, основанный на человеческом поведении. Типичное время ответа человека в разговоре составляет около 500 мс. Паузы дольше 800 мс начинают ощущаться неестественными.
Февральский бенчмарк LLM для голосовых агентов Daily за 2026 год напрямую переводит это в требование к LLM. Для естественного разговора задержка от голоса до голоса должна быть менее 1 500 мс, что даёт примерно 700 мс бюджета TTFT для текстовой LLM внутри контура «транскрипция — LLM — голос».
Именно эти 700 мс — планка, с которой следует сравнивать каждого провайдера.
Как читать бенчмарк TTFT и не попасть в ловушку
Прежде чем перейти к таблицам, рассмотрим пять методологических фактов, которые меняют смысл цифр:
1. Форма рабочей нагрузки имеет решающее значение: Artificial Analysis в марте 2026 года изменила рабочую нагрузку по умолчанию. Теперь сайт сообщает данные для запросов с 10 тыс. входных токенов вместо 1 тыс. Более длинные запросы увеличивают и TTFT, и скорость вывода. LiveKit утверждает, что это ближе к реальности для голосовых систем, поскольку производственные агенты заранее загружают политики, персону, правила эскалации, извлечённые данные и схемы инструментов.
2. Расположение сервера уже заложено в результатах: Artificial Analysis проводит тесты с виртуальной машины в зоне Google Cloud us-central1-a. Сервис прямо указывает, что TTFT включает сетевую задержку и может давать провайдерам преимущество или, наоборот, ухудшать их результаты в зависимости от места обслуживания.
3. Токены рассуждений учитываются: в определении Artificial Analysis TTFT для рассуждающей модели — это первый токен рассуждения, а не первый токен ответа. Это отдельные столбцы.
4. Измеряйте со стороны получателя: Daily отмечает, что провайдеры моделей иногда указывают TTFT внутри своих стеков инференса. Daily измеряет интервал от отправки запроса до первого пригодного токена, полученного от API.
5. Запуски невоспроизводимы: Daily прямо говорит об этом: TTFT существенно меняется от одного запуска бенчмарка к другому, а провайдеры изменяют стеки инференса и иногда веса, не меняя названия моделей.
Уровень 1: время LLM до первого токена
Приведённые ниже данные взяты из рейтинга провайдеров API Artificial Analysis, получены 30 августа 2026 года. Столбец «первый фрагмент» — это TTFT. Рабочая нагрузка: 10 тыс. входных токенов, один запрос, медианное значение за 72 часа.
Минимальная измеренная задержка до первого фрагмента
| Провайдер | Модель | TTFT | Скорость вывода |
|---|---|---|---|
| Baseten | gpt-oss-120b (high) | 0.23 с | 266 токенов/с |
| Baseten | gpt-oss-120b (low) | 0.24 с | 271 токен/с |
| DeepInfra | Nemotron 3 Ultra | 0.28 с | 371 токен/с |
| Cohere | North Mini Code | 0.32 с | 104 токена/с |
| Cohere | Command A+ | 0.40 с | 239 токенов/с |
| Baseten | Inkling Small | 0.42 с | 337 токенов/с |
| Modular | Gemma 4 31B (NVFP4) | 0.44 с | 243 токена/с |
| Nebius | GLM-5.3-Flash | 0.46 с | 206 токенов/с |
| Fireworks | Nemotron 3.5 Lightning | 0.46 с | 501 токен/с |
| Together AI | Kimi K2.7 Code | 0.47 с | 245 токенов/с |
| Cerebras | gpt-oss-120b (high) | 0.49 с | 1 697 токенов/с |
Ловушка пропускной способности
Производители чипов оптимизируют другой показатель, не тот, который нужен голосовым агентам.
| Провайдер | Модель | TTFT | Скорость вывода |
|---|---|---|---|
| Cerebras | gpt-oss-120b (high) | 0.49 с | 1 697 токенов/с |
| Celeris | Celeris-1 | 0.62 с | 1 612 токенов/с |
| Cerebras | Gemma 4 31B | 0.53 с | 1 351 токен/с |
| Groq | gpt-oss-20b (high) | 0.82 с | 957 токенов/с |
| SambaNova | gpt-oss-120b (high) | 0.92 с | 706 токенов/с |
| Groq | gpt-oss-120b (low) | 0.69 с | 473 токена/с |
| Inception | Mercury 2 | 3.07 с | 770 токенов/с |
Mercury 2 — самый наглядный пример. Это языковая модель на основе диффузии, генерирующая 770 токенов в секунду. Первый фрагмент поступает через 3,07 с. Это в четыре раза больше всего бюджета LLM для естественного разговора.
Cerebras и Groq — другой случай. Их TTFT вполне достойный, а пропускная способность исключительна. Именно для TTFS такое сочетание хорошо, поскольку предложение завершается почти сразу после поступления первого токена.
Передовые и проприетарные конечные точки
| Провайдер | Модель | TTFT | Скорость вывода |
|---|---|---|---|
| Amazon Bedrock | GPT-5.6 Luna (non-reasoning) | 0.59 с | 181 токен/с |
| Amazon Bedrock | GPT-5.6 Terra (non-reasoning) | 0.72 с | 103 токена/с |
| OpenAI | GPT-5.6 Luna (non-reasoning) | 0.74 с | 113 токенов/с |
| Gemini 3.7 Flash (low), AI Studio | 0.84 с | 315 токенов/с | |
| Anthropic | Claude 4.5 Haiku (non-reasoning) | 0.84 с | 82 токена/с |
| Amazon Bedrock | Nova Micro | 0.86 с | 264 токена/с |
| Gemini 3.5 Flash (minimal), AI Studio | 0.90 с | 202 токена/с | |
| OpenAI | GPT-5.6 Sol (non-reasoning) | 1.06 с | 71 токен/с |
Обратите внимание на одну и ту же модель на разных хостах. GPT-5.6 Luna без рассуждений показывает 0,59 с на Amazon Bedrock и 0,74 с на собственном API OpenAI. Хостинг и маршрутизация важны не меньше, чем веса.
Выброс среди измерений, опубликованных провайдером
LiveKit публикует значения TTFT для собственного продукта инференса. Gemma 4 31B на LiveKit Inference показала 192 мс против 911 мс у Gemini 2.5 Flash, 966 мс у GPT-5.5, 1 006 мс у GPT-4.1 и 1 876 мс у той же Gemma 4 31B через OpenRouter.
LiveKit прозрачно описывает механизм, что делает утверждение более убедительным, чем большинство подобных заявлений. Компания запускает Gemma за SGLang со спекулятивным декодированием и намеренно не размещает слишком много моделей на каждом GPU, чтобы задержка в очереди оставалась низкой. По словам LiveKit, тёплый запрос начинает возвращать токены примерно через 100 мс. Компромисс — стоимость в размере 1,20 доллара за 1 млн выходных токенов.
В той же публикации приводятся значения TTFS для полных разговоров: 354 мс для Gemma 4 31B на LiveKit, 1 034 мс для Gemini 2.5 Flash, 1 088 мс для GPT-4.1, 1 267 мс для Gemini 3.0 Flash и 1 404 мс для GPT-5.5.
Приведены и показатели возможностей. В IFBench, независимо оценённом Artificial Analysis, Gemma 4 31B набирает 75,6% против 75,9% у GPT-5.5, 43% у GPT-4.1 и 39% у Gemini 2.5 Flash. В τ²-bench лидирует GPT-5.5 с результатом 93,9%, тогда как Gemma 4 31B набирает 76,9%.
Уровень 2: преобразование речи в текст и определение хода
Для голоса задержка STT — это не скорость транскрибации. Это время, которое проходит после того, как пользователь перестал говорить, прежде чем конвейер понимает, что пользователь закончил говорить.
Artificial Analysis измеряет два показателя в своём рейтинге потокового STT, причём отсчёт в обоих случаях начинается с момента окончания речи, обнаруженного SileroVAD: время до первой частичной транскрипции и время до финальной транскрипции. Индекс AA-WER Streaming основан примерно на 8 часах аудио с весами AA-AgentTalk 50%, VoxPopuli 25% и Earnings-22 25%.
Опубликованные провайдерами значения задержки:
| Модель | Заявление | Тип источника |
|---|---|---|
| Deepgram Flux | ~260 мс p50 для определения конца хода при настройках по умолчанию | Документация провайдера |
| Deepgram Nova-3 | Задержка потоковой передачи менее 300 мс | Документация провайдера |
| AssemblyAI Universal-Streaming | ~300 мс до выдачи неизменяемого слова | Провайдер |
| Cartesia Ink-2 | Задержка транскрипции 100 мс | Провайдер |
| Speechmatics Voice SDK | 0,451 ± 0,022 с от окончания речи до финальных результатов | Внутренний инструмент провайдера |
Deepgram Flux — наиболее интересный с архитектурной точки зрения вариант. Он встраивает определение конца хода в модель распознавания, а не добавляет VAD поверх неё. Deepgram утверждает, что это может сократить задержку ответа агента на 200–600 мс по сравнению с традиционным конвейером STT плюс VAD. Модель предоставляет параметры eot_threshold (0.5–0.9), eager_eot_threshold (0.3–0.9) и событие EagerEndOfTurn, позволяющее раньше запустить LLM.
Последняя возможность важнее самого показателя. Если можно начать генерацию по опережающему сигналу, TTFT LLM полностью исчезает из критического пути, когда прогноз оказывается верным.
AssemblyAI Universal-Streaming переворачивает привычную модель «частичные результаты, затем финальные», выдавая неизменяемые транскрипции. В собственном измерении 2025 года AssemblyAI сообщила о медианном времени выдачи слова 307 мс против 516 мс у Deepgram Nova-3. В документации также рекомендуется использовать неформатированные транскрипции для голосовых агентов, поскольку форматирование появляется позже и редко меняет поведение LLM.
Заявления о точности здесь оспариваются и опубликованы самими провайдерами. AssemblyAI сообщает, что Universal-3.5 Pro Realtime показывает WER 6,99% в открытом бенчмарке голосовых агентов Pipecat, опережая Google Chirp3 с 9,04%, ElevenLabs Scribe v2 с 9,76% и Deepgram Flux с 15,58%. Прежде чем считать эти результаты окончательными, проведите собственные тесты.
LiveKit также документирует упреждающую генерацию, при которой LLM запускается на частичной транскрипции. Оговорка существенна: если после получения финальной транскрипции ответ приходится генерировать заново, вы расходуете токены и ничего не экономите.
Уровень 3: время преобразования текста в речь до первого аудио
Именно здесь цифры провайдеров сильнее всего расходятся с пользовательским опытом.
ElevenLabs заявляет, что Flash v2.5 обеспечивает примерно 75 мс. Собственная документация тщательно оговаривает: 75 мс относится только ко времени инференса модели. На странице о задержке компания уточняет, что сетевой обмен туда-обратно обычно занимает 20–200 мс в зависимости от географии, а большинство аудиоплееров буферизуют данные перед воспроизведением; при этом буферизация длительностью 500 мс является распространённой. Также ElevenLabs указывает, что Eleven v3 не предназначена для работы в реальном времени, и рекомендует Flash v2.5, Flash v2 или Multilingual v2 для своей платформы Agents.
Cartesia заявляет задержку TTS менее 90 мс и задержку транскрипции 100 мс для Sonic-3.6 и Ink-2. В материале Marktechpost о выпуске Sonic-3.6 отмечается, что оба показателя заявлены для задержки самой модели, а не измерены для сквозного сетевого обмена. Ранее Cartesia заявляла 82 мс от сквозного запроса до первого аудио для Sonic 3.5. Sonic работает на моделях пространства состояний, а не на трансформерах, поэтому масштабируется линейно, а не квадратично относительно длины последовательности.
Что касается качества, то рейтинг голосов провайдеров Artificial Analysis основан на Elo по оценкам слушателей, не знающих источник; данные получены 30 августа 2026 года:
| Модель | Elo | Цена за 1 млн символов |
|---|---|---|
| Cartesia Sonic 3.6 | 1 288 | $49.00 |
| SpeechifyAI Simba 3.2 | 1 243 | $10.00 |
| Alibaba Qwen-Audio-3.0-TTS-Plus | 1 243 | $27.60 |
| Inworld Realtime TTS-2 Flash (preview) | 1 228 | $10.40 |
| BreezeBlue Breeze TTS 2 (open weights) | 1 220 | $34.00 |
| ElevenLabs v3 Conversational | 1 215 | $50.00 |
| Google Gemini 3.1 Flash TTS | 1 210 | $18.30 |
| ElevenLabs Flash v2.5 | 1 083 | $50.00 |
Разница между Sonic 3.6 с показателем 1 288 и Flash v2.5 с показателем 1 083 — это цена качества низколатентного уровня, на котором фактически работает большинство агентов.
Уровень 4: время преобразования речи в речь до первого аудио
Модели преобразования речи в речь объединяют STT, LLM и TTS в один проход. Меньшее число обменов должно означать меньшую задержку.
LiveKit проявляет здесь осторожность, отмечая, что модели реального времени не гарантируют более высокую скорость в каждом случае, а хорошо настроенный конвейер может быть весьма конкурентоспособным.
Данные подтверждают эту осторожность. Согласно рейтингу моделей преобразования речи в речь Artificial Analysis, TTFA измерялось на Big Bench Audio; данные получены 30 августа 2026 года:
| Модель | TTFA | Рассуждения на основе речи | Успешность выполнения задач | Индекс S2S |
|---|---|---|---|---|
| Deepslate Opal | 0.44 с | 85% | — | — |
| Gemini 2.5 Flash Native Audio Dialog | 0.63 с | 69% | — | — |
| Grok Voice Think Fast 2.0 High | 0.70 с | 97% | 94.7% | 79.0% |
| Grok Voice Fast 1.0 | 0.78 с | 93% | — | — |
| Qwen3.5 Omni Flash Realtime | 0.79 с | 59% | 29.1% | — |
| OpenAI GPT-Realtime-1.5 | 0.81 с | 81% | 85.1% | 70.3% |
| OpenAI GPT Realtime Mini (Oct ’25) | 0.81 с | 64% | 79.6% | 56.8% |
| OpenAI GPT-Realtime-2.1 Mini Minimal | 0.85 с | 63% | 76.7% | 52.8% |
| Google Gemini 3.1 Flash Live Minimal | 0.96 с | 71% | 74.6% | 63.9% |
| OpenAI GPT-Realtime-2.1 Minimal | 0.97 с | 87% | 89.4% | 70.3% |
| Amazon Nova 2.0 Sonic (Mar 2026) | 1.14 с | 88% | 57.1% | — |
| OpenAI GPT-Realtime-2 (High) | 1.14 с | 97% | 89.8% | 73.6% |
| OpenAI GPT-Realtime-2.1 High | 1.21 с | 96% | 91.5% | 73.9% |
| Google Gemini 3.1 Flash Live High | 2.99 с | 97% | 71.8% | 71.5% |
| OpenAI GPT-Realtime-2.1 Mini High | 4.28 с | 75% | — | — |
Grok Voice Think Fast 2.0 High — лидер этой таблицы: TTFA 0,70 с, 97% рассуждений на основе речи и 94,7% успешности выполнения задач.
Штраф за уровень рассуждений виден внутри отдельных семейств моделей. Gemini 3.1 Flash Live переходит от 0,96 с к 2,99 с при смене режима Minimal на High. OpenAI GPT-Realtime-2.1 — от 0,97 с к 1,21 с, получая взамен 2,1 процентного пункта успешности выполнения задач.
OpenAI выпустила gpt-realtime-2.1 и gpt-realtime-2.1-mini в начале июля 2026 года и заявила, что улучшенное кэширование сократило задержку p95 как минимум на 25% во всех голосовых моделях Realtime. Именно хвостовая задержка заставляет телефонного агента ощущаться сломанным, поэтому это более полезное заявление, чем сообщение об улучшении медианного показателя.
Разрыв в возможностях
Бенчмарк Daily показывает, почему большинство производственных агентов по-прежнему используют каскадные конвейеры. В тесте aiwf_medium_context GPT Realtime набрала 86,7% против 94,9% у GPT-4.1. По оценке Daily, Ultravox 0.7 стала первой моделью преобразования речи в речь, хорошо справляющейся с длинными многоходовыми разговорами; кроме того, она распространяется с открытыми весами.
Artificial Analysis также тестирует четыре «каскадные системы по умолчанию» от провайдеров, что даёт полезное представление о фактически поставляемых платформах: Deepgram Voice Agent (Nova-3 + GPT-4o Mini + Aura-2), ElevenLabs Agents (Scribe v2 Realtime + Gemini 2.5 Flash + Eleven Flash v2), Cartesia Line (Ink + Gemini 2.5 Flash + Sonic) и Inworld Realtime (Inworld STT 1 + Gemini 2.5 Flash + Inworld TTS 1.5 Mini).
Три из четырёх используют Gemini 2.5 Flash. Это показательный консенсус.
Эталонные бюджеты
Составлены на основе приведённых выше проверенных показателей компонентов. Это оценки для планирования, а не измерения работающей системы.
Агрессивный каскадный конвейер, размещённый в США, с совместным расположением компонентов:
| Этап | Бюджет |
|---|---|
| Транспорт и медиаданные (WebRTC) | 50–150 мс |
| STT + конец хода (Flux при настройках по умолчанию) | ~260 мс |
| Первый фрагмент LLM (уровень менее 0,5 с) | 230–500 мс |
| Завершение предложения при скорости 250+ токенов/с | ~100 мс |
| Первое аудио TTS + сеть | 150–300 мс |
| Итого | ~790 мс–1,3 с |
Это значение соответствует целевому показателю 800 мс или немного превышает его, что согласуется с формулировкой Квиндлы: 800 мс — жёсткая, но достижимая цель.
Преобразование речи в речь, одна модель:
| Этап | Бюджет |
|---|---|
| Транспорт и медиаданные | 50–150 мс |
| TTFA модели (уровень минимальных рассуждений) | 700 мс–1,0 с |
| Итого | ~750 мс–1,15 с |
Сопоставимый результат при меньшей наблюдаемости и, согласно бенчмарку Daily, измеримом разрыве в возможностях вызова инструментов и следования инструкциям.
Что с этим делать
- Выбирайте метрику, которой ограничена ваша архитектура. Если ниже по цепочке расположена модель TTS, оптимизируйте TTFS, а не TTFT. Это означает совместную оптимизацию TTFT и числа токенов в секунду.
- Сначала разместите компоненты рядом, а уже потом оптимизируйте модели. LiveKit оценивает совместное размещение агента и модели как решение с очень высоким эффектом, превосходящим влияние выбора модели. Если вы используете SIP, также держите транк географически близко.
- Явно ограничивайте уровень рассуждений. Это главный отдельный рычаг в приведённых выше таблицах, причём на большинстве современных конечных точек он задаётся флагом конфигурации.
- Закладывайте время на вызовы инструментов. Квиндла отмечает, что любой ход с вызовом инструмента примерно удваивает задержку LLM. LiveKit рекомендует ограничивать
max_tool_steps, объединять внешние API-вызовы и воспроизводить звук размышления, чтобы тишина не оставалась единственной обратной связью для пользователя. - Сначала внедрите мониторинг, затем настраивайте. Agents SDK от LiveKit предоставляет значения
e2e_latency, времени LLM до первого токена и времени TTS до первого байта для каждого хода. Pipecat предоставляет эквивалентные данные черезenable_metricsи наблюдателей. Храните журналы отдельно и следите за регрессиями. - Измеряйте p95, а не только p50. Главным улучшением OpenAI в июле 2026 года стало снижение хвостовой задержки, поскольку именно на этом уровне голосовые агенты ломаются.
- Следите за инфраструктурными ловушками. LiveKit документирует, что агенты с самостоятельным размещением на AWS-инстансах с переменной производительностью, таких как t3 или t4g, могут сталкиваться с серьёзными задержками и тайм-аутами определения хода даже при, на первый взгляд, низкой загрузке CPU.
Основные выводы
- Самый быстрый независимо измеренный первый фрагмент в рабочей нагрузке с 10 тыс. токенов: gpt-oss-120b на Baseten — 0,23 с, по данным Artificial Analysis.
- Пропускная способность и TTFT — разные характеристики: Cerebras достигает 1 697 токенов/с при TTFT 0,49 с, а Mercury 2 от Inception — 770 токенов/с при 3,07 с.
- Заявления провайдеров о задержке, такие как 75 мс у ElevenLabs и менее 90 мс у Cartesia, означают только время инференса модели и не учитывают сеть.
- Уровень рассуждений — главный рычаг TTFT: Gemini 3.1 Flash Live переходит от 0,96 с к 2,99 с при смене режима Minimal на High.
- Один только TTFT не предсказывает, как агент будет ощущаться. Это делает время до первого предложения, поскольку для синтеза речи нужна законченная фраза.
Источники
- Artificial Analysis: рейтинг провайдеров API LLM
- Artificial Analysis: методология измерения производительности
- Artificial Analysis: рейтинг преобразования речи в речь
- Artificial Analysis: рейтинг потокового преобразования речи в текст
- Artificial Analysis: рейтинг голосов провайдеров преобразования текста в речь
- LiveKit: как понять и улучшить задержку голосового агента
- LiveKit: оптимизированный по задержке инференс Gemma 4
- LiveKit: голосовые агенты
- Daily: сравнение LLM для задач голосовых агентов
- Daily: рекомендации по созданию голосового ИИ
- Deepgram: переход с Nova-3 на Flux
- Deepgram: измерение задержки STT
- AssemblyAI: представляем Universal-Streaming
- ElevenLabs: понимание задержки
- ElevenLabs: оптимизация задержки
- Cartesia: Sonic-3.6 и Ink-2
- OpenAI: руководство по Realtime и аудио
- Исходный код бенчмарка aiewf-eval
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.