ByteDance Seed представила SeedRealtime: нативную аудиовизуальную полнодуплексную LLM, которая смотрит, слушает и говорит в одной модели
Команда Seed компании ByteDance представила SeedRealtime — нативную аудиовизуальную полнодуплексную большую языковую модель (LLM). Модель объединяет аудио, видео и текст в единой архитектуре. Она взаимодействует в реальном времени через непрерывные мультимодальные потоки, а не по одному запросу за раз. Seed позиционирует её как шаг к омнимодальному взаимодействию и заявляет о трёх прорывах: совместном аудиовизуальном понимании, проактивном взаимодействии и естественном выборе времени для ведения диалога. Архитектура нацелена на устранение каскадной схемы: связанных модулей ASR, VLM и TTS, которые добавляют задержку и приводят к потере информации между этапами. Вместо этого SeedRealtime параллельно выполняет восприятие, понимание, принятие решений и формирование ответа внутри одной сквозной модели. Определение очередности реплик также перенесено внутрь модели, что заменяет внешний детектор голосовой активности, от которого по-прежнему зависят большинство систем реального времени.
Можно ли её развернуть?
Частично.
SeedRealtime уже работает внутри приложения Doubao, потребительского ассистента ByteDance. Для этой конкретной модели ByteDance не опубликовала технический отчёт, количество параметров, открытые веса или конечную точку Volcano Engine либо BytePlus. На данный момент сторонняя команда не может интегрировать её. Что можно применять уже сейчас — это идея: проверенная эталонная архитектура и поднятая планка для всех, кто создаёт продукты реального времени с голосом и камерой.
Интерактивное объяснение
Что нового в демонстрациях на самом деле
Seed опубликовала семь сценариев. Четыре из них имеют ключевое значение.
- Связывание личности между модальностями: На шумном групповом ужине модель сопоставляет имена с лицами по мере представления людей, а затем сохраняет связь каждого голоса с соответствующей личностью — прежде чем предложить план, она правильно определяет, кто из участников высказал противоречащие предпочтения относительно путешествия.
- Проактивная речь на основе сохранённой инструкции: В музее провинции Хэбэй пользователь просит напомнить ему, когда в кадре появится конкретная бронзовая подставка для ширмы. Камера продолжает панорамирование; модель наблюдает и сама начинает говорить, когда предмет появляется в кадре. Такое же поведение демонстрируется на статье о ResNet: модель отслеживает быстрое перелистывание страниц, замечает раздел «3.4 Реализация», самостоятельно останавливается и зачитывает значения скорости обучения, момента и затухания весов.
- Корректировка на основе визуального состояния, а не вопроса: Наблюдая за процессом приготовления эспрессо, модель прерывает пользователя, когда цельные зёрна попадают в портафильтр, затем анализирует цвет и объём крема и предлагает сократить время экстракции на 2–3 секунды.
- Подавление помех и память о происходившем за пределами экрана: В аэропорту Пекина Дасин посторонний разговор о рейсе не вызывает ответа. Когда пользователь действительно задаёт вопрос, модель отвечает на основе информации с табло вылетов, которая уже исчезла с экрана, и выходит в интернет, чтобы узнать расположение багажной карусели.
Основные выводы
- SeedRealtime — нативная аудиовизуальная полнодуплексная LLM: аудио, видео и текст объединены в одной сквозной архитектуре.
- Определение очередности реплик выполняется внутри модели; внешний VAD не решает, когда ей следует говорить.
- Согласно собственной оценке ByteDance с участием людей, проблемы с темпом речи сократились вдвое по сравнению с каскадными системами — при этом бенчмарк и показатели задержки не приведены.
- Модель уже работает в приложении Doubao, но технический отчёт, веса и объявленный API отсутствуют.
Ознакомьтесь с публикацией ByteDance Seed о запуске и страницей моделей Seed. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.