PrismML випустила Ternary Bonsai 2 27B: модель Apache 2.0 розміром 5,9 ГБ зберігає 98,2% продуктивності Qwen3.8 27B
PrismML випустила Ternary Bonsai 2 27B — версію Qwen3.8 27B із тернарними вагами. Мовна модель займає 5,93 ГБ проти 53,80 ГБ у FP16. PrismML повідомляє, що вона зберігає 98,2% середнього показника батьківської моделі у 20 бенчмарках. Модель приймає текст і зображення та підтримує контекст у 262 тисячі токенів. PrismML демонструє її роботу з агентами програмування Cline і використання комп’ютера на RTX 5090. Вона з’явилася через 2 місяці після першої Bonsai 27B, чия тернарна версія зберігала близько 95% показників.
Чи придатна вона для розгортання? Так. Ваги за ліцензією Apache 2.0 працюють вже сьогодні на ноутбуці з 16 ГБ пам’яті або на одному GPU з 24 ГБ. Вам потрібен форк llama.cpp від PrismML або її середовище виконання MLX.
Що таке Ternary Bonsai 2 27B?
Архітектура моделі Qwen3.8 27B залишилася без змін. Вона має 27,36 млрд параметрів. Це 24,35 млрд параметрів мовного ядра, 2,54 млрд параметрів ембедингів і головки LM та 0,47 млрд параметрів візуальної вежі. Ядро використовує гібридну увагу: близько 75% шарів працюють із лінійною увагою, а 25% — із повною увагою.
Тернарні ваги охоплюють ембединги, проєкції уваги, проєкції MLP і головку LM. Лише 26,2 млн параметрів, або 0,0976%, залишаються у вищій точності. Це рекурентний шлях стану та ваги нормалізації. У форматі GGUF візуальна вежа постачається окремо у вигляді файлу розміром 0,63 ГБ і завантажується лише для введення зображень.
Як працює тернарний формат?
Кожна вага набуває 1 із 3 значень: -1, 0 або +1. Кожна група зі 128 ваг використовує спільний масштаб FP16. Тернарне значення містить log2(3), або близько 1,585 біта. Додавання 16 бітів масштабу на кожні 128 ваг дає 1,71 біта на вагу. З урахуванням тензорів високої точності модель досягає 1,72 біта.
Реальним ядрам потрібне упаковане розташування, тому в технічному документі описано 2 способи пакування GGUF. PTQ1_0 щільно пакує трити, використовуючи 1,76 біта на вагу, і займає 5,93 ГБ. PQ2_0 зберігає кожен трит у 2-бітовому слоті та займає 7,25 ГБ, що спрощує розпакування.
Ваги також зберігаються в повернутому базисі. Перед призначенням тернарних значень PrismML застосовує поблокове перетворення Адамара з розміром блока 1 024. Середовище виконання застосовує відповідне перетворення до активацій перед кожним множенням. У технічному документі для цієї ідеї наведено посилання на SpinQuant. PrismML не публікує інформацію про те, як саме призначаються тернарні значення.
Як вона показує себе порівняно з Qwen3.8 27B?
PrismML оцінювала всі моделі в режимі міркування за допомогою EvalScope і vLLM на GPU H100.
| Можливість | Qwen3.6 27B | Qwen3.8 27B | Ternary Bonsai 2 27B | Збереження |
|---|---|---|---|---|
| Знання та міркування | 84.71 | 86.66 | 83.95 | 96.9% |
| Математика | 94.64 | 97.06 | 96.57 | 99.5% |
| Програмування | 82.57 | 82.17 | 81.58 | 99.3% |
| Агентні можливості та виклик інструментів | 80.05 | 79.74 | 77.57 | 97.3% |
| Дотримання інструкцій | 74.53 | 81.25 | 82.66 | 101.7% |
| Зір | 79.82 | 81.64 | 78.59 | 96.3% |
| Загалом (20) | 83.6 | 85.4 | 83.9 | 98.2% |
Порівняння зі звичайним квантуванням дає більш показовий результат. Збірка Qwen3.8 27B IQ2_XXS у середньому отримує 75,2 бала та займає 7,3 ГБ. В AIME26 вона набирає 78,6 бала, тоді як Bonsai 2 — 95,83. У LiveCodeBench v6 розрив становить 70,05 проти 90,07.
Де модель усе ще втрачає якість?
Показник 98,2% є середнім, а втрати розподілені нерівномірно. Для зору зберігається 96,3%, а для знань і міркувань — 96,9%.
У завданнях агентів із довгим горизонтом падіння ще більше. Bonsai 2 набирає 52,8 бала в Terminal-Bench 2.1 проти 69,7 у Qwen3.8 27B. У SWE-bench Verified вона набирає 60,8 проти 80,6. Це близько 75% збереження, і обидва показники не входять до середнього значення за 20 бенчмарками.
Інтенсивність міркування також має значення. За середньої інтенсивності модель у середньому набирає 79,3 бала проти 82,6 у базової моделі FP16. Низька інтенсивність не підтримується. Усі результати належать PrismML і не були незалежно відтворені.
Наскільки швидко вона працює на реальному обладнанні?
Показники наведено для декодування з розміром пакета 1 на спеціальних ядрах PrismML; вимірювання проведено 16 вересня 2026 року. RTX 5090 досягає 142,5 токена на секунду за 0,582 мВт·год на токен. RTX 4090 досягає 96,7 токена з PTQ1_0, а L4 потужністю 72 Вт — 32,1. На ноутбуках Apple M5 Max досягає 46,8, а M5 Pro — 27,7.
Жоден спосіб пакування не є найкращим у всіх випадках. PTQ1_0 працює швидше на картах покоління Ada та L4. PQ2_0 працює швидше на Blackwell, Hopper, Ampere і кремнії Apple, а також під час обробки промптів у всіх випадках.
Дослідницька команда PrismML також заявляє про на 40% вищу енергоефективність порівняно з моделлю 8B повної точності.
Як її запустити?
Файлам GGUF потрібен форк llama.cpp від PrismML. Стандартний llama.cpp відхиляє типи PTQ1_0 і PQ2_0. Репозиторій Bonsai-demo є рекомендованим способом запуску. Виконайте ./setup.sh, потім ./scripts/start_llama_server.sh, щоб використовувати чат, зір і інструменти за адресою localhost:8080.
Користувачі Mac можуть скористатися пакетом MLX, якому потрібен завантажувач, що входить до комплекту. Демонстрація WebGPU запускає модель у браузері.
Основні висновки
- Мовна модель займає 5,93 ГБ, що приблизно у 9,1 раза менше за базову модель FP16 розміром 53,80 ГБ.
- Середній показник у 20 бенчмарках становить 83,9 проти 85,4 у Qwen3.8 27B у FP16.
- 142,5 токена на секунду на RTX 5090 і 46,8 на M5 Max.
- У довготривалих агентних бенчмарках зберігається лише близько 75% показників моделей повної точності.
- Стандартний llama.cpp не може завантажити ці файли. Потрібен форк PrismML.
Ознайомтеся з технічним документом, вагами моделі, репозиторієм GitHub, документацією, демонстрацією WebGPU та оголошенням в X. Уся заслуга належить досліднику цього проєкту. Також не соромтеся стежити за нами в Twitter і не забудьте приєднатися до нашого сабреддиту ML із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.