Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Gander от Tencent стремится продолжать разговор, работая в фоновом режиме

Tencent’s Gander aims to keep talking while it works in the background
Джонатан Кемпер
20 сен. 2026
GPT-Image-2 по запросу THE DECODER

Ключевые моменты

  • Gander от Tencent разработан для ведения разговоров в реальном времени одновременно с выполнением сложных задач в фоновом режиме. Он одновременно обрабатывает речь, изображения и текст, а пользователи могут прервать его в любой момент.
  • «Мозжечок» управляет разговором посекундно, а сменный «мозг» выполняет сложные агентские задачи. Такое разделение призвано обеспечить быстрые ответы, не сокращая время на планирование.
  • В тестах Gander реже перебивал пользователей, чем конкурирующие модели, но уступал им по точности выполнения задач и демонстрировал слабые результаты в понимании видео и аудио. Команда планирует выпустить веса модели и обучающие данные. Репозиторий кода на GitHub уже существует.

Исследовательская модель Gander от Tencent сочетает разговоры в реальном времени с возможностями ИИ-агента. «Мозжечок» ведёт разговор, а сменный «мозг» выполняет сложные задачи. Пользователи могут прервать модель в любой момент, однако тесты показывают компромисс между своевременностью диалога и точностью выполнения задач.

Команда Hunyuan Speech из Tencent и исследователи нескольких университетов представили Gander — модель ИИ, разработанную для поддержания разговора во время выполнения сложных задач. Согласно техническому отчёту, она одновременно получает на вход речь, изображения и текст.

Сегодняшние голосовые помощники в основном общаются с пользователями по очереди, утверждают исследователи. В реальных разговорах люди перебивают друг друга, быстро реагируют и слушают собеседника, одновременно говоря сами. Gander разработан для такой двусторонней коммуникации: он непрерывно обрабатывает видео, речь и текст, даже когда сам говорит. Пользователь может вмешаться в любой момент, а модель — задать уточняющие вопросы или сообщить о ходе выполнения задачи без соответствующего запроса.

Маскот Tencent в виде пингвина сидит перед монитором, окружённый пятью вариантами использования Gander. Среди них — вопросы о содержимом экрана, фоновая работа агента во время разговоров, обратная связь и перебивания, групповые разговоры с фон604овым шумом и проактивные уведомления о визуальном содержимом.
Gander разработан для ведения разговоров в реальном времени одновременно с выполнением фоновых задач, например исправлением ошибки или ожиданием появления определённого слайда. | Изображение: Tencent

Gander продолжает разговор, пока его «мозг» работает

Для разговора нужны быстрые ответы, но поиск файлов или написание кода требуют времени на планирование. Исследователи утверждают, что одной модели приходится балансировать между скоростью и способностью рассуждать, поэтому Gander разделяет работу между двумя компонентами.

По аналогии с человеческой анатомией они называют их «мозжечком» и «мозгом». Мозжечок отвечает за разговор в реальном времени, а мозг занимается рассуждениями и сложными задачами в фоновом режиме.

Мозг можно заменить агентскими системами, такими как Codex или Claude Code, без повторного обучения разговорной модели. В тестах эту роль выполняла не указанная в отчёте модель из семейства GPT-5.6 от OpenAI. По мере совершенствования базовой модели выигрывает вся система.

Диаграмма рабочего процесса показывает четыре этапа с названиями «Делегировать», «Продолжать разговор», «Изменить задачу» и «Предоставить результат». В верхней части отображаются фрагменты разговора, в середине — статус задачи, а ниже — шаги фонового агента. Устаревший запуск отбрасывается и помечается как "Отклонён."
Пока фоновый агент исправляет ошибку, пользователь может продолжать задавать вопросы и добавить к задаче совместимость с Python 3.12. | Изображение: Tencent

Gander хорошо выбирает момент ответа, но уступает в точности выполнения задач

Gander разбивает разговоры на односекундные отрезки, чтобы мозжечок мог решить, когда слушать, говорить или остановиться, если пользователь его перебивает. Он принимает эти решения без отдельного модуля для определения начала и окончания речи, используя в качестве памяти примерно последние две минуты разговора.

Поскольку специального теста для таких моделей, как Gander, пока нет, исследователи обратились к уже существующим бенчмаркам. В отчёте говорится, что Gander показал лучшие результаты по выбору времени ответа в Full-Duplex-Bench v3, который тестирует голосовых помощников в различных сценариях.

Gander начинает говорить в подходящий момент во всех 100 сценариях и перебивает пользователей в 8% случаев. Для сравнения, у GPT-Realtime этот показатель составляет 13,5%, а у наименее успешного конкурента — почти 48%. Согласно отчёту, Gander использует относительно небольшую модель, конкурируя с коммерческими системами, включая GPT-Realtime, Gemini Live и Grok.

Результаты Full-Duplex-Bench v3 для GPT-Realtime, Gemini Live 3.1 и 2.5, каскадного конвейера, Grok, Ultravox v0.7 и Gander. В таблице приведены показатели выбора инструментов, точности аргументов, качества ответов, Pass@1 и три метрики взаимодействия.
Gander перебивает пользователей реже любой другой протестированной системы, но по точности выполнения задач немного уступает наименее успешному конкуренту. | Изображение: Tencent

Gander немного уступает по точности выполнения задач. Исследователи объясняют это отчасти тем, что тест оценивает всю систему целиком, поэтому ошибки распознавания речи и генерации ответа снижают результат. Мозг показывает гораздо лучшие результаты, если напрямую получает текст.

Понимание видео и аудио также страдает: в одном из тестов Gander показал результат хуже базовой модели, что исследователи связывают с обучением, отдающим предпочтение плавности разговора, а не точности восприятия. Это касается таких задач, как подсчёт объектов и определение их местоположения на изображении.

Tencent планирует выпустить веса Gander и обучающие данные

Согласно отчёту, Gander обучался примерно на 2,7 млн примеров. Некоторые из них учат модель сохранять молчание при наличии фонового шума или когда никто в группе не обращается к ней.

Исследователи говорят, что работа всё ещё находится на ранней стадии. Вопрос о том, как масштабировать Gander, остаётся открытым, а стандартного способа оценки подобных систем пока нет.

Команда планирует опубликовать веса и обучающие данные после завершения «процесса выпуска в открытый доступ». Репозиторий кода на GitHub уже существует, а демонстрации доступны на странице проекта.

Всё больше компаний распределяют работу агентов между моделями

Gander появился после июльского выпуска Tencent — Hy3, открытой языковой модели, которая, по сообщениям, сократила отставание от конкурентов, особенно в агентских задачах. Hy3 уже работает в WorkBuddy, Yuanbao и WeChat. Компания также ведёт переговоры о приобретении крупнейшей доли в стартапе Manus после того, как Пекин заблокировал приобретение компании Meta. Tencent считает эту сделку соответствующей собственным планам, включая внедрение агента в WeChat.

Другие компании используют оркестраторы для распределения задач между моделями. GPT-Live от OpenAI отделяет разговор от рассуждений, передавая веб-поиск и агентские задачи фоновой модели, пока чат продолжается. Fugu компании Sakana AI — это отдельная языковая модель, которая вызывает другие модели из расширяемого пула. OpenAI также тестирует проактивных агентов, создающих последующие задачи и связывающихся с пользователями без запроса.

Обработка перебиваний и предотвращение задержек остаются практическими проблемами. Анализ Anthropic показал, что опытные пользователи перебивают Claude Code примерно в 9% рабочих шагов, тогда как новички — примерно в 5%. Согласно исследованию, команды, создающие разговорных голосовых и чат-агентов, особенно часто сообщают о проблемах с задержками.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, наш эксклюзивный ежегодный шесть раз в год отчёт о передовых технологиях «AI Radar», полный доступ к архиву и доступ к разделу комментариев.

Источник: Arxiv

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости