Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

PrismML пусна Ternary Bonsai 2 27B: модел под Apache 2.0 с размер 5,9 GB, запазващ 98,2% от производителността на Qwen3.8 27B

PrismML пусна Ternary Bonsai 2 27B — версия с тернарни тегла на Qwen3.8 27B. Езиковият модел заема 5.93 GB спрямо 53.80 GB във FP16. PrismML съобщава, че той запазва 98.2% от средния резултат на базовия модел в 20 бенчмарка. Моделът приема текст и изображения и поддържа контекст от 262K токена. PrismML демонстрира работата му с кодиращи агенти Cline и задачи за използване на компютър на RTX 5090. Той се появява 2 месеца след първия Bonsai 27B, чиято версия с тернарни тегла запази около 95%.

Може ли да бъде внедрен? Да. Теглата с лиценз Apache 2.0 работят още днес на лаптоп с 16 GB или на един GPU с 24 GB. Необходим е fork-ът на llama.cpp на PrismML или неговата MLX среда за изпълнение.

Какво представлява Ternary Bonsai 2 27B?

Моделът запазва архитектурата на Qwen3.8 27B непроменена. Той има 27.36B параметъра. Те се разделят на 24.35B в езиковия гръбнак, 2.54B в embeddings и LM head и 0.47B във визуалната кула. Гръбнакът използва хибридно внимание — около 75% слоеве с линейно внимание и 25% слоеве с пълно внимание.

Тернарните тегла обхващат embeddings, проекциите на вниманието, MLP проекциите и LM head. Само 26.2M параметъра, или 0.0976%, остават с по-висока точност. Това са пътят на рекурентното състояние и теглата за нормализация. В GGUF визуалната кула се предоставя отделно като файл от 0.63 GB и се зарежда само при въвеждане на изображения.

Как работи тернарният формат?

Всяко тегло приема 1 от 3 стойности: -1, 0 или +1. Всяка група от 128 тегла споделя 1 FP16 мащабиращ коефициент. Тернарната стойност носи log2(3), или около 1.585 бита. Добавянето на 16 бита за мащабиращия коефициент на всеки 128 тегла дава 1.71 бита на тегло. Като се отчетат тензорите с висока точност, моделът достига 1.72.

Реалните ядра се нуждаят от пакетиран формат, затова бялата книга описва 2 GGUF формата за пакетиране. PTQ1_0 пакетира тритовете плътно при 1.76 бита на тегло и 5.93 GB. PQ2_0 съхранява всеки трит в 2-битов слот при 7.25 GB, което улеснява разпакетирането.

Теглата се съхраняват и в завъртяна базиса. PrismML прилага блоково преобразуване на Адамар с размер на блока 1,024 преди присвояването на тернарните стойности. Средата за изпълнение прилага съответното преобразувание към активациите преди всяко умножение. В бялата книга се цитира SpinQuant за тази идея. PrismML не публикува как присвоява тернарните стойности.

Как се представя спрямо Qwen3.8 27B?

PrismML оцени всички модели в режим на мислене с EvalScope и vLLM върху H100 GPU.

СпособностQwen3.6 27BQwen3.8 27BTernary Bonsai 2 27BЗапазване
Знания и разсъждение84.7186.6683.9596.9%
Математика94.6497.0696.5799.5%
Програмиране82.5782.1781.5899.3%
Агентни задачи и извикване на инструменти80.0579.7477.5797.3%
Следване на инструкции74.5381.2582.66101.7%
Визия79.8281.6478.5996.3%
Общо (20)83.685.483.998.2%

Сравнението с конвенционалното квантизиране е по-показателно. Версията IQ2_XXS на Qwen3.8 27B постига среден резултат 75.2 при 7.3 GB. В AIME26 тя получава 78.6, докато Bonsai 2 получава 95.83. В LiveCodeBench v6 разликата е 70.05 спрямо 90.07.

Къде все още губи качество?

Стойността от 98.2% е средна, а загубите са неравномерни. Визията запазва 96.3%, а знанията и разсъждението — 96.9%.

Работата на агентите с дълъг хоризонт отбелязва допълнителен спад. Bonsai 2 постига 52.8 в Terminal-Bench 2.1 спрямо 69.7 за Qwen3.8 27B. В SWE-bench Verified той получава 60.8 спрямо 80.6. Това е около 75% запазване, като и двата резултата не са включени в средната стойност за 20-те бенчмарка.

Интензивността на разсъждението също има значение. При средна интензивност моделът постига средно 79.3 спрямо 82.6 за базовия модел във FP16. Ниска интензивност не се поддържа. Всички резултати са на PrismML и не са независимо възпроизведени.

Колко бърз е на реален хардуер?

Данните са за декодиране с размер на пакета 1 с персонализираните ядра на PrismML, измерени на 16 септември 2026 г. RTX 5090 достига 142.5 токена в секунда при 0.582 mWh на токен. RTX 4090 достига 96.7 с PTQ1_0, а L4 със 72 W достига 32.1. При лаптопите на Apple M5 Max достига 46.8, а M5 Pro — 27.7.

Нито един от двата формата за пакетиране не е най-добър навсякъде. PTQ1_0 е по-бърз при картите от поколението Ada и L4. PQ2_0 е по-бърз при Blackwell, Hopper, Ampere и силиция на Apple, както и при обработката на промптове навсякъде.

Изследователският екип на PrismML също твърди, че енергийната ефективност е с 40% по-добра от тази на модел с 8B параметъра и пълна точност.

Как се стартира?

GGUF файловете се нуждаят от fork-а на llama.cpp на PrismML. Стандартният llama.cpp отхвърля типовете PTQ1_0 и PQ2_0. Репозиторито Bonsai-demo е поддържаният начин за стартиране. Изпълнете ./setup.sh, след което ./scripts/start_llama_server.sh за чат, визия и инструменти на localhost:8080.

Потребителите на Mac могат да използват MLX пакета, който се нуждае от включения в него loader. WebGPU демо стартира модела в браузър.

Основни изводи

  • Езиков модел от 5.93 GB, около 9.1 пъти по-малък от базовия модел във FP16 от 53.80 GB.
  • Среден резултат 83.9 в 20 бенчмарка спрямо 85.4 за Qwen3.8 27B във FP16.
  • 142.5 токена в секунда на RTX 5090 и 46.8 на M5 Max.
  • Бенчмарковете за агенти с дълъг хоризонт запазват само около 75% от резултатите при пълна точност.
  • Стандартният llama.cpp не може да зарежда тези файлове. Необходим е fork-ът на PrismML.

Вижте бялата книга, теглата на модела, GitHub репозиторито, документацията, WebGPU демото и съобщението в X. Цялата заслуга е на изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150k членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub репозитори OR страница в Hugging Face OR нов продукт OR уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини