GitHub представляет Project HydraFusion: оркестрация нескольких моделей во время выполнения, создающая отдельный рабочий процесс для каждой задачи кодирования в Copilot CLI
GitHub выпустила Project HydraFusion — предварительную исследовательскую версию, которая перестаёт рассматривать выбор модели как разовую настройку. Вместо того чтобы направлять ваш запрос к одной модели, HydraFusion создаёт план выполнения для каждого запроса. Она может подготовить черновик с помощью одной модели, поручить второй модели проверить черновик или переключиться на более мощную модель, если первая попытка не проходит проверку качества. Модели предоставляются несколькими провайдерами. Разработчик один раз выбирает HydraFusion — так же, как любую другую модель.
Можно ли её развернуть? Да, но с ограничениями. HydraFusion доступна в качестве предварительной исследовательской версии пользователям всех тарифных планов GitHub Copilot, но только внутри GitHub Copilot CLI. Открытых весов и возможности самостоятельного хостинга нет. Выполните /update, затем /experimental on, после этого /model и выберите HydraFusion (Research Preview). Оплата взимается за каждый токен, использованный моделями, которые вызываются рабочим процессом, по стандартной ставке каждой модели.
Что на самом деле делает система
HydraFusion следует принципу автоматического выбора модели, который GitHub представила ранее в 2026 году для сопоставления задачи с наиболее подходящей моделью. HydraFusion делает ещё один шаг и рассматривает выбор рабочего процесса как задачу оптимизации.
Она анализирует сигналы возможностей в области рассуждений, генерации кода, отладки и использования инструментов. Затем выбирает наименее сложный рабочий процесс, который, как ожидается, позволит достичь требуемого уровня качества, выполняя дополнительные вызовы моделей только там, где они, вероятно, принесут пользу.
Три шаблона выполнения
Для каждого запроса HydraFusion в настоящее время выбирает один из трёх шаблонов:
- Single: Одна выбранная модель напрямую решает задачу.
- Cascade: Эффективная модель подготавливает решение. Затем проверка качества либо принимает его, либо передаёт задачу более мощной модели.
- Critique: Одна модель подготавливает черновик, независимый критик в режиме только для чтения из другого семейства моделей проверяет его, после чего модель, создавшая черновик, один раз вносит исправления. Проверка выполняется по тому же принципу, что и Rubber Duck.
Каждый шаблон по-разному сочетает качество и стоимость. Single сохраняет высокую скорость. Cascade оставляет возможность переключиться на более мощный вывод. Critique добавляет внешний взгляд в тех случаях, когда проверка эффективнее ещё одной попытки без посторонней помощи.
Инженерные средства защиты
GitHub построила среду выполнения вокруг пяти принципов работы, важных для задач на уровне репозитория:
- Полный учёт на каждом этапе, включая создание черновика, проверку, исправление, эскалацию, повторную попытку и резервный сценарий.
- Ограниченное выполнение с явными тайм-аутами и отменой для каждого этапа.
- Изолированная проверка, при которой критики работают в контекстах без инструментов и не могут изменять репозиторий.
- Безопасное применение: при отмене рабочего процесса или непрохождении проверки патч не применяется.
- Проверенная маршрутизация: перед началом выполнения проверяются привязки моделей, поведение резервного сценария и доступность.
Внутри среды выполнения для каждого этапа записываются роль, результат, стоимость, задержка и диагностические данные. Внешне разработчик видит один связный ответ и один набор изменений с учётом разрешений.
Результаты тестов
Команда GitHub оценила фиксированные политики HydraFusion на трёх бенчмарках агентного программирования, используя Claude Opus 5 и GPT-5.6 Sol в качестве базовых показателей. Все модели работали со средним уровнем рассуждений. Приведённые ниже значения указаны относительно Opus 5.
| Бенчмарк | Расчётная стоимость по сравнению с Opus 5 | Проверенное качество выполнения задач по сравнению с Opus 5 |
|---|---|---|
| TerminalBench 2.1 | на 67% ниже | +4,9 пункта |
| DeepSWE | на 36% ниже | −1,5 пункта |
| CheckpointBench | на 65% ниже | −0,1 пункта |
CheckpointBench — это внутренний многотуровый набор GitHub, составленный на основе реальных сессий Copilot и привязанный к неизменяемым общедоступным коммитам, благодаря чему запуски можно воспроизводить.
Ключевые выводы
- HydraFusion выбирает для каждого запроса рабочий процесс, а не только модель, используя модели нескольких провайдеров.
- Сегодня доступны три шаблона: Single, Cascade с проверкой качества и Critique с проверяющим из другого семейства моделей.
- Лучший результат: +4,9 пункта качества при на 67% меньшей расчётной стоимости на TerminalBench 2.1.
- На DeepSWE и CheckpointBench система немного уступает Opus 5, снижая стоимость на 36% и 65% соответственно.
- Уже доступна в Copilot CLI через
/experimental; оплата взимается по стандартной ставке каждой используемой модели.
Ознакомьтесь с анонсом в блоге GitHub и обсуждением GitHub Community №206492. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией более 150 тыс. участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.