Sakhanda Wire
NVDA $230.48 -2.94% MSFT $522.61 -1.35% GOOGL $348.29 -0.63% META $720.89 -0.06% AMZN $254.06 -2.25%
← К новостям

Знакомьтесь: аутсайдер Saluki 27B — 2-битная версия Qwen3.8-27B, превосходящая оригинал в вызове инструментов

Underdog, ассистент, работающий на устройстве, от Conway Research выпустил Saluki 27B по лицензии Apache 2.0. Underdog Saluki 27B — это 2-битная модель GGUF на основе Qwen3.8-27B, занимающая 7,89 ГБ. Полная модель BF16 требует 54 ГБ. Underdog настроила сжатие таким образом, чтобы сохранить возможность вызова инструментов — навык, превращающий чат-модель в агента. Для разработчиков это означает агентскую модель класса 27B, работающую в стандартной версии llama.cpp.

Кратко

  • Размер: 27B плотных параметров. 7,89 ГБ в формате GGUF против 54 ГБ для BF16.
  • Работает на: стандартной llama.cpp и приложениях на её основе, с полной выгрузкой на GPU. Опциональное дополнение для поддержки зрения объёмом 629 или 928 МБ.
  • Производительность: среднее сохранение 96% результатов в 9 тестах по сравнению с полной Qwen3.8-27B.
  • Лучший результат: параллельные вызовы инструментов — 42 против 35 у полной модели (сохранение 120%).
  • Худший результат: AIME 2025 — 79,2 против 96,7 (примерно 82% сохранения).
  • Итог:
    • Лучшее: превосходит оригинальную модель объёмом 54 ГБ в вызове инструментов, занимая менее 8 ГБ.
    • Худшее: результаты в соревновательной математике и многошаговом рассуждении снижаются на 12–18 пунктов.

Что такое Underdog Saluki 27B?

Saluki 27B — это 2-битная модель GGUF со смешанной точностью на основе Qwen3.8-27B, созданная для локальных агентов. Она объединяет 3 этапа работы:

  • В основе лежит Qwen3.8-27B — плотная модель на 27B параметров от команды Qwen. Она содержит 64 слоя, сочетает линейное внимание Gated DeltaNet с управляемым вниманием и поддерживает 262 144 токена изначально.
  • Второй слой — это Qwen3.8-27B-GSQ-RCO-GGUF от ISTA-DASLab. GSQ обучает точные скалярные сетки с низкой разрядностью для каждого тензора. RCO назначает тип квантования каждому тензору в рамках фиксированного ограничения на размер. Самый компактный файл ISTA, IQ2_XS, занимает 8,4 ГБ при 2,50 бита на вес.
  • Третий слой — собственная обработка Underdog. Она уменьшила размер файла до 7,89 ГБ и оптимизировала его для вызова инструментов. Файл называется IQ2-mix и содержит тег imatrix. Underdog не опубликовала полный рецепт этой обработки.

Как Saluki показывает себя в тестах?

Underdog разделяет результаты на 2 группы.

В первой группе обе модели запускались в одном и том же тестовом окружении:

  • Underdog Bench: 120 задач из BFCL v4, зафиксированных до начала тестирования. Режим рассуждений отключён, температура — 0. Saluki набрала 88 баллов, полная модель — 84, а Bonsai 2 от PrismML — 70.
  • Параллельные вызовы инструментов: 100 параллельных задач BFCL v4 с официальной проверкой. Saluki — 42, полная модель — 35.
  • SWE-bench Verified: 50 задач. Saluki исправила 30, полная модель — 33.

Во второй группе Saluki сравнивается с опубликованными результатами полноразмерной модели:

ТестSaluki 27BQwen3.8-27B (опубликованные данные)
IFEval (prompt-loose)93.591.5
IFBench (prompt-loose)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025 (avg@4)79.296.7
AIME 2026 (avg@4)80.094.6

Как Saluki сравнивается с другими компактными сборками Qwen3.8-27B?

ХарактеристикаUnderdog Saluki 27BQwen3.8-27B (BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B (PTQ1_0)
ОрганизацияUnderdog (Conway Research)команда QwenISTA-DASLabPrismML
Параметры27B27B27B27.36B
Размер файла7,89 ГБ54 ГБ8,4 ГБ5,95 ГБ
Бит на весНе раскрыто (смесь 2-битных форматов)162.501.75
КонтекстНе раскрыто262 144 токена изначальноНе раскрыто262K
ЗрениеДополнение, 629 или 928 МБВстроенная поддержкаmmproj 0,9 ГБОпционально, 0,63 ГБ
Среда выполненияСтандартная llama.cppTransformers, vLLM, SGLangСтандартная llama.cpp, Ollama, LM StudioФорк llama.cpp от PrismML
Underdog Bench (из 120)8884Не раскрыто70
Заявленный производителем показательСреднее сохранение 96%, 9 тестовБазовый уровень100,3% восстановления в режиме zero-shot98,2% от FP16, 14 тестов
ЛицензияApache 2.0Apache 2.0Apache 2.0Apache 2.0

Bonsai 2 меньше по размеру и сообщает о сохранении 98,2% результатов в 14 тестах в режиме рассуждений. Она также показывает более высокие результаты в математике, включая 95,00 на AIME25. Однако для неё требуется форк llama.cpp от PrismML, поскольку стандартная llama.cpp отклоняет используемые форматы упаковки. Saluki работает в стандартной llama.cpp. Каждый производитель использует собственное тестовое окружение, поэтому результаты разных производителей нельзя напрямую сравнивать.

Ключевые выводы

  • Saluki 27B помещает Qwen3.8-27B в 7,89 ГБ вместо 54 ГБ.
  • Она превосходит полную модель в вызове инструментов: 88 против 84.
  • Количество параллельных вызовов инструментов увеличивается с 35 до 42.
  • Наибольшие потери наблюдаются в математике и рассуждении — показатели снижаются примерно до 82–85%.
  • Она работает в стандартной llama.cpp по лицензии Apache 2.0.

Ознакомьтесь с карточкой модели на Hugging Face, страницей запуска Underdog и объявлением в X. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости