Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

PrismML випустила Ternary Bonsai 2 27B: модель Apache 2.0 розміром 5,9 ГБ зберігає 98,2% продуктивності Qwen3.8 27B

PrismML випустила Ternary Bonsai 2 27B — версію Qwen3.8 27B із тернарними вагами. Мовна модель займає 5,93 ГБ проти 53,80 ГБ у FP16. PrismML повідомляє, що вона зберігає 98,2% середнього показника батьківської моделі у 20 бенчмарках. Модель приймає текст і зображення та підтримує контекст у 262 тисячі токенів. PrismML демонструє її роботу з агентами програмування Cline і використання комп’ютера на RTX 5090. Вона з’явилася через 2 місяці після першої Bonsai 27B, чия тернарна версія зберігала близько 95% показників.

Чи придатна вона для розгортання? Так. Ваги за ліцензією Apache 2.0 працюють вже сьогодні на ноутбуці з 16 ГБ пам’яті або на одному GPU з 24 ГБ. Вам потрібен форк llama.cpp від PrismML або її середовище виконання MLX.

Що таке Ternary Bonsai 2 27B?

Архітектура моделі Qwen3.8 27B залишилася без змін. Вона має 27,36 млрд параметрів. Це 24,35 млрд параметрів мовного ядра, 2,54 млрд параметрів ембедингів і головки LM та 0,47 млрд параметрів візуальної вежі. Ядро використовує гібридну увагу: близько 75% шарів працюють із лінійною увагою, а 25% — із повною увагою.

Тернарні ваги охоплюють ембединги, проєкції уваги, проєкції MLP і головку LM. Лише 26,2 млн параметрів, або 0,0976%, залишаються у вищій точності. Це рекурентний шлях стану та ваги нормалізації. У форматі GGUF візуальна вежа постачається окремо у вигляді файлу розміром 0,63 ГБ і завантажується лише для введення зображень.

Як працює тернарний формат?

Кожна вага набуває 1 із 3 значень: -1, 0 або +1. Кожна група зі 128 ваг використовує спільний масштаб FP16. Тернарне значення містить log2(3), або близько 1,585 біта. Додавання 16 бітів масштабу на кожні 128 ваг дає 1,71 біта на вагу. З урахуванням тензорів високої точності модель досягає 1,72 біта.

Реальним ядрам потрібне упаковане розташування, тому в технічному документі описано 2 способи пакування GGUF. PTQ1_0 щільно пакує трити, використовуючи 1,76 біта на вагу, і займає 5,93 ГБ. PQ2_0 зберігає кожен трит у 2-бітовому слоті та займає 7,25 ГБ, що спрощує розпакування.

Ваги також зберігаються в повернутому базисі. Перед призначенням тернарних значень PrismML застосовує поблокове перетворення Адамара з розміром блока 1 024. Середовище виконання застосовує відповідне перетворення до активацій перед кожним множенням. У технічному документі для цієї ідеї наведено посилання на SpinQuant. PrismML не публікує інформацію про те, як саме призначаються тернарні значення.

Як вона показує себе порівняно з Qwen3.8 27B?

PrismML оцінювала всі моделі в режимі міркування за допомогою EvalScope і vLLM на GPU H100.

МожливістьQwen3.6 27BQwen3.8 27BTernary Bonsai 2 27BЗбереження
Знання та міркування84.7186.6683.9596.9%
Математика94.6497.0696.5799.5%
Програмування82.5782.1781.5899.3%
Агентні можливості та виклик інструментів80.0579.7477.5797.3%
Дотримання інструкцій74.5381.2582.66101.7%
Зір79.8281.6478.5996.3%
Загалом (20)83.685.483.998.2%

Порівняння зі звичайним квантуванням дає більш показовий результат. Збірка Qwen3.8 27B IQ2_XXS у середньому отримує 75,2 бала та займає 7,3 ГБ. В AIME26 вона набирає 78,6 бала, тоді як Bonsai 2 — 95,83. У LiveCodeBench v6 розрив становить 70,05 проти 90,07.

Де модель усе ще втрачає якість?

Показник 98,2% є середнім, а втрати розподілені нерівномірно. Для зору зберігається 96,3%, а для знань і міркувань — 96,9%.

У завданнях агентів із довгим горизонтом падіння ще більше. Bonsai 2 набирає 52,8 бала в Terminal-Bench 2.1 проти 69,7 у Qwen3.8 27B. У SWE-bench Verified вона набирає 60,8 проти 80,6. Це близько 75% збереження, і обидва показники не входять до середнього значення за 20 бенчмарками.

Інтенсивність міркування також має значення. За середньої інтенсивності модель у середньому набирає 79,3 бала проти 82,6 у базової моделі FP16. Низька інтенсивність не підтримується. Усі результати належать PrismML і не були незалежно відтворені.

Наскільки швидко вона працює на реальному обладнанні?

Показники наведено для декодування з розміром пакета 1 на спеціальних ядрах PrismML; вимірювання проведено 16 вересня 2026 року. RTX 5090 досягає 142,5 токена на секунду за 0,582 мВт·год на токен. RTX 4090 досягає 96,7 токена з PTQ1_0, а L4 потужністю 72 Вт — 32,1. На ноутбуках Apple M5 Max досягає 46,8, а M5 Pro — 27,7.

Жоден спосіб пакування не є найкращим у всіх випадках. PTQ1_0 працює швидше на картах покоління Ada та L4. PQ2_0 працює швидше на Blackwell, Hopper, Ampere і кремнії Apple, а також під час обробки промптів у всіх випадках.

Дослідницька команда PrismML також заявляє про на 40% вищу енергоефективність порівняно з моделлю 8B повної точності.

Як її запустити?

Файлам GGUF потрібен форк llama.cpp від PrismML. Стандартний llama.cpp відхиляє типи PTQ1_0 і PQ2_0. Репозиторій Bonsai-demo є рекомендованим способом запуску. Виконайте ./setup.sh, потім ./scripts/start_llama_server.sh, щоб використовувати чат, зір і інструменти за адресою localhost:8080.

Користувачі Mac можуть скористатися пакетом MLX, якому потрібен завантажувач, що входить до комплекту. Демонстрація WebGPU запускає модель у браузері.

Основні висновки

  • Мовна модель займає 5,93 ГБ, що приблизно у 9,1 раза менше за базову модель FP16 розміром 53,80 ГБ.
  • Середній показник у 20 бенчмарках становить 83,9 проти 85,4 у Qwen3.8 27B у FP16.
  • 142,5 токена на секунду на RTX 5090 і 46,8 на M5 Max.
  • У довготривалих агентних бенчмарках зберігається лише близько 75% показників моделей повної точності.
  • Стандартний llama.cpp не може завантажити ці файли. Потрібен форк PrismML.

Ознайомтеся з технічним документом, вагами моделі, репозиторієм GitHub, документацією, демонстрацією WebGPU та оголошенням в X. Уся заслуга належить досліднику цього проєкту. Також не соромтеся стежити за нами в Twitter і не забудьте приєднатися до нашого сабреддиту ML із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини