Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← Към новините

ByteDance Seed представя SeedRealtime: нативен аудио-визуален пълнодуплексен LLM, който гледа, слуша и говори в един модел

Екипът Seed на ByteDance представи SeedRealtime — нативен аудио-визуален пълнодуплексен LLM. Моделът обединява аудио, видео и текст в една унифицирана архитектура. Той взаимодейства в реално време чрез непрекъснати мултимодални потоци, вместо ход по ход. Seed го представя като стъпка към омнимодално взаимодействие и твърди, че е постигнал три пробива: съвместно аудио-визуално разбиране, проактивно взаимодействие и естествено синхронизиране на разговора. Архитектурната цел е каскадата: свързани модули ASR, VLM и TTS, които добавят латентност и губят информация между етапите. Вместо това SeedRealtime изпълнява възприемането, разбирането, вземането на решения и изразяването паралелно в един цялостен модел от край до край. Управлението на редуването в разговора също е интегрирано в модела, заменяйки външния детектор за гласова активност, на който все още разчитат повечето системи в реално време.

Готов ли е за внедряване?

Частично.

SeedRealtime вече работи в приложението Doubao, потребителския асистент на ByteDance. За този конкретен модел ByteDance не е публикувала технически доклад, брой параметри, отворени тегла или крайна точка в Volcano Engine или BytePlus. Като външен екип към момента не можете да го интегрирате. Това, което може да бъде внедрено още сега, е идеята: валидирана референтна архитектура и повишена летва за всеки, който разработва продукти за глас и камера в реално време.

Интерактивно обяснение

Какво всъщност е новото в демонстрациите

Seed публикува седем сценария. Четири са ключови.

  1. Свързване на идентичността между модалностите: На шумна групова вечеря моделът свързва имената с лицата, докато хората се представят, а след това запазва връзката между всеки глас и съответната идентичност — приписвайки противоречивите предпочитания за пътуване на правилния говорещ, преди да предложи план.
  2. Проактивно говорене въз основа на дадена инструкция: В музея на Хъбей потребител моли да бъде уведомен, когато се появи конкретна бронзова стойка за параван. Камерата продължава да се движи; моделът наблюдава и започва да говори без допълнителна подкана, когато експонатът попадне в кадър. Същото поведение се вижда и при статия за ResNet — моделът проследява бързото прелистване на страниците, забелязва раздела „3.4 Implementation“, сам спира на него и прочита на глас скоростта на обучение, момента и затихването на теглата.
  3. Корекция въз основа на визуалното състояние, а не на въпрос: Докато наблюдава процес на приготвяне на еспресо, моделът прекъсва, когато в ръкохватката на кафемашината бъдат поставени цели зърна, след което оценява цвета и обема на кремата и предлага скъсяване на екстракцията с 2 до 3 секунди.
  4. Потискане на смущенията и памет за случилото се извън кадъра: На пекинското летище Дасин несвързан разговор за полет не предизвиква отговор. Когато потребителят действително задава въпрос, моделът отговаря въз основа на информация от таблото за заминаващи полети, която вече е изчезнала от екрана, и се свързва с интернет, за да намери местоположението на лентата за получаване на багаж.

Основни изводи

  • SeedRealtime е нативен аудио-визуален пълнодуплексен LLM — аудио, видео и текст в една архитектура от край до край.
  • Управлението на редуването в разговора е интегрирано в модела; няма външен VAD, който да решава кога да се говори.
  • Според собствената човешка оценка на ByteDance проблемите с темпото са намалели наполовина спрямо каскадните системи — без бенчмарк и без данни за латентността.
  • Моделът работи в приложението Doubao, но няма технически доклад, тегла или обявен API.

Вижте публикацията за старта на ByteDance Seed и страницата с моделите Seed.Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML subreddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ представяне на продукт, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини