Sakhanda Wire
NVDA $230.48 -2.94% MSFT $522.61 -1.35% GOOGL $348.29 -0.63% META $720.89 -0.06% AMZN $254.06 -2.25%
← Към новините

Запознайте се с аутсайдера Saluki 27B: 2-битов Qwen3.8-27B, който надминава оригинала при извикване на инструменти

Underdog, асистентът на устройството от Conway Research, пусна Saluki 27B под лиценза Apache 2.0. Underdog Saluki 27B е 2-битов GGUF на Qwen3.8-27B, който се побира в 7.89 GB. Пълният BF16 модел изисква 54 GB. Underdog е настроил компресията така, че да защити извикването на инструменти — умението, което превръща чат модел в агент. За разработчиците това означава агентен модел от клас 27B, който работи в стандартния llama.cpp.

Накратко

  • Размер: 27B плътни параметъра. 7.89 GB GGUF спрямо 54 GB за BF16.
  • Работи на: стандартния llama.cpp и приложенията, изградени върху него, с пълно прехвърляне към GPU. Опционален визуален добавъчен модул от 629 MB или 928 MB.
  • Производителност: средно запазване на 96% в 9 бенчмарка спрямо пълния Qwen3.8-27B.
  • Най-добро: Паралелни извиквания на инструменти — 42 спрямо 35 за пълния модел (120% запазване).
  • Най-слабо: AIME 2025 — 79.2 спрямо 96.7 (около 82% запазване).
  • Извод:
    • Най-добро: превъзхожда оригинала от 54 GB при извикването на инструменти във файл под 8 GB.
    • Най-слабо: състезателната математика и многостъпковото разсъждение спадат с 12 до 18 пункта.

Какво представлява Underdog Saluki 27B?

Saluki 27B е 2-битов GGUF със смесена точност на Qwen3.8-27B, създаден за локални агенти. Той съчетава 3 етапа на работа:

  • Базата е Qwen3.8-27B, плътен модел с 27B параметъра от екипа на Qwen. Той има 64 слоя, съчетава линейно внимание Gated DeltaNet с gated attention и поддържа 262 144 токена нативно.
  • Вторият слой е Qwen3.8-27B-GSQ-RCO-GGUF на ISTA-DASLab. GSQ обучава точни скаларни решетки с малка битова дълбочина за всеки тензор. RCO задава тип квантизация на всеки тензор при фиксиран бюджет за размера. Най-малкият файл на ISTA, IQ2_XS, е 8.4 GB при 2.50 бита на тегло.
  • Третият слой е собственият етап на Underdog. Той намалява файла до 7.89 GB и е насочен към извикването на инструменти. Файлът се нарича IQ2-mix и съдържа imatrix етикет. Underdog не е публикувал пълната рецепта за този етап.

Как се представя Saluki в бенчмарковете?

Underdog разделя резултатите си на 2 групи.

Първата група изпълнява и двата модела в една и съща тестова среда:

  • Underdog Bench: 120 задачи от BFCL v4, фиксирани преди тестването. Режимът на разсъждение е изключен, температурата е 0. Saluki получава 88 точки, пълният модел — 84, а Bonsai 2 на PrismML — 70.
  • Паралелни извиквания на инструменти: 100 паралелни задачи от BFCL v4 с официалния проверяващ инструмент. Saluki — 42, пълният модел — 35.
  • SWE-bench Verified: 50 проблема. Saluki решава 30, а пълният модел — 33.

Втората група сравнява Saluki с публично обявени резултати за пълноразмерни модели:

БенчмаркSaluki 27BQwen3.8-27B (публичен)
IFEval (свободен промпт)93.591.5
IFBench (свободен промпт)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025 (avg@4)79.296.7
AIME 2026 (avg@4)80.094.6

Как Saluki се сравнява с други компактни версии на Qwen3.8-27B?

ХарактеристикаUnderdog Saluki 27BQwen3.8-27B (BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B (PTQ1_0)
ОрганизацияUnderdog (Conway Research)Екипът на QwenISTA-DASLabPrismML
Параметри27B27B27B27.36B
Размер на файла7.89 GB54 GB8.4 GB5.95 GB
Битове на теглоНе е обявено (2-битов микс)162.501.75
КонтекстНе е обявен262 144 нативноНе е обявен262K
ЗрениеДобавъчен модул, 629 или 928 MBНативно0.9 GB mmprojОпционален 0.63 GB
Среда за изпълнениеСтандартен llama.cppTransformers, vLLM, SGLangСтандартен llama.cpp, Ollama, LM StudioФорк на llama.cpp на PrismML
Underdog Bench (от 120)8884Не е обявено70
Основен резултат на разработчика96% средно запазване, 9 бенчмаркаБазова стойност100.3% възстановяване при zero-shot98.2% от FP16, 14 бенчмарка
ЛицензApache 2.0Apache 2.0Apache 2.0Apache 2.0

Bonsai 2 е по-малък и отчита 98.2% запазване в 14 бенчмарка в режим на разсъждение. Той също така показва по-силни резултати по математика, включително 95.00 на AIME25. Въпреки това изисква форка на llama.cpp на PrismML, тъй като стандартният llama.cpp отхвърля неговите формати за пакетиране. Saluki работи със стандартния llama.cpp. Всеки разработчик използва собствена тестова среда, затова резултатите между различните разработчици не са пряко сравними.

Основни изводи

  • Saluki 27B побира Qwen3.8-27B в 7.89 GB спрямо първоначалните 54 GB.
  • Той превъзхожда пълния модел при извикването на инструменти: 88 спрямо 84.
  • Паралелните извиквания на инструменти се увеличават от 35 на 42.
  • Математиката и разсъждението понасят най-големия спад — до около 82–85%.
  • Работи със стандартния llama.cpp под лиценза Apache 2.0.

Разгледайте картата на модела в Hugging Face, страницата за представянето на Underdog и съобщението в X. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини