GitHub представляє Project HydraFusion: оркестрація кількох моделей під час виконання, що створює окремий робочий процес для кожного завдання з кодування в Copilot CLI
GitHub випустив Project HydraFusion — дослідницьку попередню версію, яка перестає розглядати вибір моделі як одноразове налаштування. Замість того щоб спрямовувати ваш запит до однієї моделі, HydraFusion створює план виконання для кожного запиту. Вона може створити чернетку за допомогою однієї моделі, доручити другій моделі перевірити чернетку або передати запит потужнішій моделі, коли перша спроба не проходить перевірку якості. Моделі надходять від кількох постачальників. Розробник один раз обирає HydraFusion — так само, як він обрав би будь-яку іншу модель.
Чи можна її розгортати? Так, але з обмеженнями. HydraFusion доступна як дослідницька попередня версія для користувачів усіх планів GitHub Copilot і працює лише в GitHub Copilot CLI. Відкритих вагових коефіцієнтів немає, як і можливості самостійного хостингу. Виконайте /update, потім /experimental on, потім /model і виберіть HydraFusion (Research Preview). Оплата здійснюється за кожен токен, використаний моделями, які викликає робочий процес, за стандартною ставкою кожної моделі.
Що насправді робить система
HydraFusion використовує автоматичний вибір моделі, який GitHub представив раніше у 2026 році, щоб зіставляти завдання з найкраще підходящою моделлю. HydraFusion робить ще один крок і розглядає вибір робочого процесу як задачу оптимізації.
Вона аналізує сигнали можливостей для міркування, генерації коду, налагодження та використання інструментів. Потім обирає найменш складний робочий процес, який, за прогнозами, пройде планку якості, залучаючи додаткові виклики моделей лише там, де вони, ймовірно, допоможуть.
Три шаблони виконання
Для кожного запиту HydraFusion наразі обирає один із трьох шаблонів:
- Single: Одна вибрана модель безпосередньо розв’язує завдання.
- Cascade: Ефективна модель створює розв’язання. Потім перевірка якості або приймає його, або передає запит потужнішій моделі.
- Critique: Одна модель створює чернетку, незалежний критик із іншого сімейства моделей переглядає її, а модель, що створила чернетку, один раз вносить правки. Перевірка відбувається за тим самим принципом, що й Rubber Duck.
Кожен шаблон по-різному балансує якість і вартість. Single зберігає швидкість. Cascade залишає можливість перейти до потужнішого виведення. Critique додає зовнішню перспективу там, де перевірка ефективніша за ще одну спробу без сторонньої допомоги.
Інженерні запобіжники
GitHub побудував середовище виконання на основі п’яти операційних принципів, важливих для роботи на рівні репозиторію:
- Повний облік на кожному етапі, включно зі створенням чернетки, критикою, виправленням, ескалацією, повторною спробою та резервним переходом.
- Обмежене виконання з чіткими тайм-аутами та скасуванням для кожного етапу.
- Ізольована перевірка, під час якої критики працюють у контекстах без інструментів і не можуть змінювати репозиторій.
- Безпечне застосування: жоден патч не застосовується, якщо робочий процес скасовано або він не пройшов перевірку.
- Перевірена маршрутизація: перед початком виконання перевіряються прив’язки моделей, резервна поведінка та доступність.
Усередині середовище виконання реєструє роль, результат, вартість, затримку та діагностичні дані для кожного етапу. Зовні розробник бачить одну узгоджену відповідь і один набір змін із урахуванням дозволів.
Результати бенчмарків
Команда GitHub оцінила фіксовані політики HydraFusion на трьох бенчмарках агентного програмування, використовуючи Claude Opus 5 і GPT-5.6 Sol як базові показники. Усі моделі працювали із середнім рівнем міркування. Наведені нижче показники є відносними до Opus 5.
| Бенчмарк | Орієнтовна вартість порівняно з Opus 5 | Перевірена якість завдань порівняно з Opus 5 |
|---|---|---|
| TerminalBench 2.1 | на 67% нижча | +4,9 бала |
| DeepSWE | на 36% нижча | −1,5 бала |
| CheckpointBench | на 65% нижча | −0,1 бала |
CheckpointBench — це внутрішній багатотуровий набір GitHub, сформований на основі реальних сеансів Copilot і прив’язаний до незмінних публічних комітів, завдяки чому запуски можна відтворювати.
Ключові висновки
- HydraFusion обирає робочий процес для кожного запиту, а не лише модель, використовуючи моделі від кількох постачальників.
- Сьогодні доступні три шаблони: Single, Cascade із перевіркою якості та Critique із рецензентом з іншого сімейства моделей.
- Найкращий результат: +4,9 бала якості за орієнтовної вартості на 67% нижчої на TerminalBench 2.1.
- На DeepSWE і CheckpointBench вона дещо поступається Opus 5, водночас скорочуючи витрати на 36% і 65%.
- Уже доступна в Copilot CLI через
/experimental; оплата здійснюється за стандартною ставкою кожної базової моделі.
Ознайомтеся з анонсом у блозі GitHub та обговоренням у спільноті GitHub №206492. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту ML із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.