Gander на Tencent цели да поддържа разговора, докато работи във фонов режим
Основни моменти
- Gander на Tencent е проектиран да води разговори в реално време, докато обработва сложни задачи във фонов режим. Той обработва едновременно реч, изображения и текст, а потребителите могат да го прекъснат по всяко време.
- „Малък мозък“ управлява разговора секунда по секунда, докато сменяем „мозък“ изпълнява сложни агентски задачи. Разделението цели да запази бързината на отговорите, без планирането да бъде прекъсвано преждевременно.
- При тестове Gander прекъсваше потребителите по-рядко от конкурентните модели, но изоставаше по точност на задачите и показваше слабости при разбирането на видео и аудио. Екипът планира да публикува теглата на модела и тренировъчните данни. Вече съществува GitHub хранилище за кода.
Изследователският модел Gander на Tencent съчетава разговори в реално време с възможности за AI агенти. „Малък мозък“ управлява разговора, докато сменяем „мозък“ изпълнява сложни задачи. Потребителите могат да го прекъснат по всяко време, но тестовете показват компромис между времето на реакция в разговора и точността при задачите.
Екипът на Tencent, разработващ Hunyuan Speech, и изследователи от няколко университета представиха Gander — AI модел, проектиран да продължава разговора, докато изпълнява сложни задачи. Според техническия доклад той приема едновременно реч, изображения и текст.
Днешните гласови асистенти обикновено се редуват с потребителите, твърдят изследователите. В реалните разговори хората се прекъсват, дават бърза обратна връзка и слушат, докато говорят. Gander е проектиран да се справя с това взаимодействие, като непрекъснато обработва видео, реч и текст, дори докато говори. Потребителите могат да се намесят по всяко време, а моделът може да задава допълнителни въпроси или да дава актуална информация за напредъка, без да бъде подканян.

Gander поддържа разговора, докато неговият „мозък“ работи
Разговорът изисква бързи отговори, но търсенето на файлове или писането на код изискват време за планиране. Изследователите твърдят, че един модел трябва да балансира между бързина и способност за разсъждение, затова Gander разделя работата между две роли.
Вдъхновени от човешката анатомия, те ги наричат „малък мозък“ и „мозък“. Малкият мозък управлява разговора в реално време, докато мозъкът се заема с разсъжденията и сложните задачи във фонов режим.
Мозъкът може да бъде заменен с агентски системи като Codex или Claude Code, без да се налага повторно обучение на разговорния модел. При тестовете тази роля изпълняваше неуточнен модел от семейството GPT-5.6 на OpenAI. С подобряването на базовия модел цялата система се възползва от това.

Gander уцелва правилния момент, но изостава по точност на задачите
Gander разделя разговорите на едносекундни сегменти, за да може малкият мозък да решава кога да слуша, да говори или да спре, ако потребителят го прекъсне. Той взема тези решения без отделен модул за откриване на началото и края на речта, като използва приблизително последните две минути от разговора като памет.
Тъй като все още няма специализиран тест за модели като Gander, изследователите се обърнаха към утвърдени бенчмаркове. В доклада се посочва, че Gander е постигнал най-добри резултати по отношение на времето във Full-Duplex-Bench v3, който тества гласови асистенти в различни сценарии.
Gander започва да говори в правилния момент и в 100-те сценария и прекъсва потребителите в 8 процента от случаите. За сравнение, при GPT-Realtime този дял е 13,5 процента, а при най-слабия конкурент — близо 48 процента. Според доклада Gander използва сравнително малък модел, за да се конкурира с комерсиални системи, включително GPT-Realtime, Gemini Live и Grok.

Gander изостава леко по точност на задачите. Изследователите казват, че това се дължи отчасти на факта, че тестът оценява цялата система, така че грешките при разпознаването на реч и генерирането на изхода се отчитат срещу нея. Мозъкът се представя много по-добре, когато получава директно текст.
Разбирането на видео и аудио също страда: при един тест Gander се е представил по-зле от базовия си модел, което изследователите отдават на обучение, предпочитащо плавния разговор пред прецизното възприятие. Това включва задачи като броене на обекти и намирането им в изображение.
Tencent планира да публикува теглата и тренировъчните данни на Gander
Според доклада Gander е обучен с около 2,7 милиона примера. Някои от тях го учат да мълчи, когато има фонов шум или когато никой в групата не се обръща към него.
Изследователите казват, че работата все още е в начален етап. Как Gander да бъде разширен, остава открит въпрос, а няма и стандартен начин за оценяване на системи като него.
Екипът планира да публикува теглата и тренировъчните данни, след като завърши „процеса по публикуване с отворен код“. Вече съществува GitHub хранилище за кода, а демонстрации има на страницата на проекта.
Все повече компании разпределят агентската работа между модели
Gander следва юлското представяне от Tencent на Hy3 — езиков модел с отворен код, който според съобщенията е намалил изоставането спрямо конкурентите, особено при агентски задачи. Hy3 вече работи в WorkBuddy, Yuanbao и WeChat. Компанията също така преговаря да придобие мажоритарен дял в стартъпа за агенти Manus, след като Пекин блокира придобиването му от Meta. Компанията вижда сделката като подходяща за собствените си планове, включително агент, вграден във WeChat.
Други компании използват оркестратори, за да делегират задачи между модели. GPT-Live на OpenAI разделя разговора от разсъждението, като възлага търсенето в интернет и агентските задачи на фонов модел, докато чатът продължава. Fugu на Sakana AI е отделен езиков модел, който извиква други модели от разширяем набор. OpenAI също така тества проактивни агенти, които създават последващи задачи и се свързват с потребителите без подканване.
Обработването на прекъсвания и избягването на забавянията остават практически предизвикателства. Анализ на Anthropic установява, че опитните потребители прекъсват Claude Code при около 9 процента от работните стъпки, в сравнение с приблизително 5 процента при начинаещите. Според проучване екипите, разработващи разговорни гласови и чат агенти, особено често съобщават за проблеми със забавянето.
AI новини без сензация – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен AI бюлетин, нашия ексклузивен годишен доклад за водещите модели „AI Radar“, публикуван шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.