ByteDance Seed представила SeedRealtime: нативну аудіовізуальну повнодуплексну LLM, яка дивиться, слухає й говорить в одній моделі
Команда Seed компанії ByteDance представила SeedRealtime — нативну аудіовізуальну повнодуплексну велику мовну модель. Модель об’єднує аудіо, відео й текст в одній уніфікованій архітектурі. Вона взаємодіє в реальному часі через безперервні мультимодальні потоки, а не по одному повідомленню за раз. Seed позиціонує її як крок до омнімодальної взаємодії та заявляє про три прориви: спільне аудіовізуальне розуміння, проактивну взаємодію та природний таймінг розмови. Архітектурна мета — відмова від каскаду: послідовно з’єднаних модулів ASR, VLM і TTS, які додають затримку та втрачають інформацію між етапами. Натомість SeedRealtime паралельно виконує сприйняття, розуміння, ухвалення рішень і вираження в одній наскрізній моделі. Керування черговістю реплік також переноситься всередину моделі, замінюючи зовнішній детектор голосової активності, від якого досі залежать більшість стеків реального часу.
Чи придатна вона до розгортання?
Частково придатна.
SeedRealtime вже працює в застосунку Doubao, споживчому асистенті ByteDance. Для цієї конкретної моделі ByteDance не опублікувала технічного звіту, кількості параметрів, відкритих ваг або кінцевої точки Volcano Engine чи BytePlus. Як стороння команда, ви наразі не можете інтегрувати її. Те, що вже можна застосовувати, — це ідея: перевірена еталонна архітектура та підвищена планка для всіх, хто випускає продукти реального часу з голосом і камерою.
Інтерактивне пояснення
Що насправді нового в демонстраціях
Seed опублікувала сім сценаріїв. Чотири з них є ключовими.
- Прив’язка ідентичності між модальностями: Під час галасливої групової вечері модель зіставляє імена з обличчями, коли людей представляють, а потім зберігає відповідність кожного голосу його особі — визначаючи, який саме співрозмовник має суперечливі вподобання щодо подорожей, перш ніж запропонувати план.
- Проактивне мовлення на основі збереженої інструкції: У музеї Хебей користувач просить нагадати йому, коли в кадрі з’явиться певна бронзова підставка для ширми. Камера продовжує панорамувати; модель стежить за зображенням і без підказки починає говорити, коли предмет потрапляє в кадр. Та сама поведінка демонструється на статті про ResNet — модель відстежує швидке перегортання сторінок, помічає розділ «3.4 Implementation», самостійно зупиняється та зачитує швидкість навчання, момент і загасання ваг.
- Виправлення на основі візуального стану, а не запитання: Спостерігаючи за приготуванням еспресо, модель перериває процес, коли цілі зерна засипають у портафільтр, потім оцінює колір і об’єм крема та радить скоротити екстракцію на 2–3 секунди.
- Придушення перешкод і пам’ять про те, що зникло з екрана: У пекінському аеропорту Дасін стороння розмова про рейс не викликає відповіді. Коли користувач справді запитує, модель відповідає на основі інформації з табло вильотів, яка вже прокрутилася за межі екрана, і підключається до інтернету, щоб знайти місце видачі багажу.
Основні висновки
- SeedRealtime — нативна аудіовізуальна повнодуплексна велика мовна модель: аудіо, відео й текст в одній наскрізній архітектурі.
- Керування черговістю реплік відбувається всередині моделі; зовнішній VAD не визначає, коли їй говорити.
- За власними оцінками ByteDance на людях, проблеми з темпом мовлення скоротилися вдвічі порівняно з каскадними стеками — без бенчмарку та показників затримки.
- Модель уже працює в застосунку Doubao, але технічного звіту, ваг і оголошеного API немає.
Ознайомтеся з дописом про запуск ByteDance Seed і сторінкою моделей Seed. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML-сабреддіту зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно налагодити партнерство з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.