Gander від Tencent прагне підтримувати розмову, працюючи у фоновому режимі
Ключові моменти
- Gander від Tencent розроблено для ведення розмов у реальному часі під час виконання складних завдань у фоновому режимі. Модель одночасно обробляє мовлення, зображення й текст, а користувачі можуть перервати її будь-коли.
- «Мозочок» щосекунди керує розмовою, тоді як змінний «мозок» виконує складні агентні завдання. Такий поділ має забезпечити швидкі відповіді без передчасного припинення планування.
- Під час тестів Gander рідше переривав користувачів, ніж конкуруючі моделі, але поступався їм за точністю виконання завдань і продемонстрував слабкі результати в розумінні відео та аудіо. Команда планує опублікувати ваги моделі й навчальні дані. Репозиторій коду на GitHub уже існує.
Дослідницька модель Gander від Tencent поєднує розмови в реальному часі з можливостями ШІ-агента. «Мозочок» керує розмовою, тоді як змінний «мозок» виконує складні завдання. Користувачі можуть перервати модель будь-коли, але тести демонструють компроміс між своєчасністю розмови та точністю виконання завдань.
Команда Hunyuan Speech від Tencent і дослідники з кількох університетів представили Gander — модель ШІ, розроблену для підтримання розмови під час виконання складних завдань. Згідно з технічним звітом, вона одночасно отримує на вході мовлення, зображення й текст.
Сьогоднішні голосові асистенти здебільшого по черзі взаємодіють із користувачами, стверджують дослідники. У реальних розмовах люди перебивають одне одного, швидко реагують і слухають під час власної розмови. Gander розроблено для обробки такого обміну: модель безперервно опрацьовує відео, мовлення й текст, навіть коли сама говорить. Користувачі можуть втрутитися будь-коли, а модель — ставити додаткові запитання або повідомляти про перебіг роботи без відповідного запиту.

Gander підтримує розмову, поки його «мозок» працює
Для розмови потрібні швидкі відповіді, але пошук файлів або написання коду потребують часу на планування. Дослідники стверджують, що одна модель має балансувати між швидкістю та здатністю міркувати, тому Gander розподіляє роботу між двома ролями.
Запозичивши терміни з анатомії людини, вони називають їх «мозочком» і «мозком». Мозочок відповідає за розмову в реальному часі, а мозок у фоновому режимі виконує міркування та складні завдання.
Мозок можна замінити агентними системами на кшталт Codex або Claude Code без повторного навчання розмовної моделі. Під час тестів цю роль виконува́ла неуточнена модель із сімейства GPT-5.6 від OpenAI. У міру вдосконалення базової моделі користь отримує вся система.

Gander добре визначає час відповіді, але поступається в точності виконання завдань
Gander розбиває розмови на односекундні відрізки, щоб мозочок міг вирішувати, коли слухати, говорити або зупинитися, якщо користувач перебиває. Модель приймає ці рішення без окремого модуля для визначення початку й завершення мовлення, використовуючи як пам’ять приблизно останні дві хвилини розмови.
Оскільки спеціального тесту для моделей на кшталт Gander поки немає, дослідники звернулися до усталених бенчмарків. У звіті зазначено, що Gander продемонстрував найкращу своєчасність у Full-Duplex-Bench v3, який тестує голосових асистентів у різних сценаріях завдань.
Gander починає говорити в потрібний момент у всіх 100 сценаріях і перериває користувачів у 8% випадків. Для порівняння, цей показник становить 13,5% у GPT-Realtime і майже 48% у найслабшого конкурента. Згідно зі звітом, Gander використовує відносно невелику модель, конкуруючи з комерційними системами, зокрема GPT-Realtime, Gemini Live і Grok.

Gander трохи поступається за точністю виконання завдань. Дослідники пояснюють, що частково це пов’язано з оцінюванням усієї системи, через що помилки розпізнавання мовлення та формування відповідей зараховуються проти неї. Показники мозку значно кращі, коли він безпосередньо отримує текст.
Також страждає розуміння відео й аудіо: в одному з тестів Gander показав гірші результати, ніж його базова модель, що дослідники пояснюють навчанням, орієнтованим на плавність розмови, а не на точне сприйняття. Це стосується таких завдань, як підрахунок об’єктів і визначення їхнього розташування на зображенні.
Tencent планує опублікувати ваги Gander і навчальні дані
Згідно зі звітом, Gander навчали на приблизно 2,7 мільйона прикладів. Деякі з них навчають модель мовчати, коли є фоновий шум або ніхто в групі не звертається до неї.
Дослідники зазначають, що робота все ще перебуває на ранньому етапі. Як масштабувати Gander, залишається відкритим питанням, і стандартного способу оцінювання таких систем немає.
Команда планує опублікувати ваги й навчальні дані після завершення «процесу відкритого релізу». Репозиторій коду на GitHub уже існує, а демонстрації доступні на сторінці проєкту.
Дедалі більше компаній розподіляють роботу агентів між моделями
Gander з’явився після липневого випуску Tencent Hy3 — відкритої мовної моделі, яка, за повідомленнями, скоротила відставання від конкурентів, особливо в агентних завданнях. Hy3 уже працює у WorkBuddy, Yuanbao і WeChat. Компанія також веде переговори про придбання контрольної частки в стартапі агентів Manus після того, як Пекін заблокував придбання компанії Meta. Компанія вважає цю угоду сумісною зі своїми планами, зокрема щодо агента, вбудованого у WeChat.
Інші компанії використовують оркестратори для розподілу завдань між моделями. GPT-Live від OpenAI відокремлює розмову від міркування, передаючи вебпошук і агентні завдання фоновій моделі, поки чат триває. Fugu від Sakana AI — це окрема мовна модель, яка викликає інші моделі з розширюваного пулу. OpenAI також тестує проактивних агентів, які створюють подальші завдання та зв’язуються з користувачами без запиту.
Обробка переривань і запобігання затримкам залишаються практичними проблемами. Аналіз Anthropic показав, що досвідчені користувачі переривають Claude Code приблизно у 9% робочих кроків, тоді як новачки — приблизно у 5%. За даними опитування, команди, які створюють розмовних голосових і чат-агентів, особливо часто повідомляють про проблеми із затримкою.
Новини ШІ без ажіотажу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний піврічний звіт про передові технології «AI Radar», повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.