BottleCap AI выпустила ThinkingCap-Qwen3.8-27B: на 37,2% меньше токенов рассуждений при снижении точности на 0,86 п.п.
BottleCap AI выпустила ThinkingCap-Qwen3.8-27B, вторую модель в серии ThinkingCap. Это дообученная версия модели Qwen3.8-27B команды Qwen с одной узкой целью: сократить трассировки рассуждений. В 12 бенчмарках она в среднем использует на 37,2% меньше токенов рассуждений. Средняя точность по макроусреднению снизилась с 86,65% до 85,79%, то есть на 0,86 п.п.
Готова к развёртыванию? Да. Она устанавливается вместо Qwen3.8-27B в vLLM или SGLang и доступна в сборках FP8, NVFP4, GGUF и MLX. Репозиторий ограничен, а для коммерческого использования за пределами лицензии для малого бизнеса требуется соглашение с BottleCap.
Какую проблему решает ThinkingCap?
Модели с рассуждением часто используют больше токенов рассуждений, чем требуется для вопроса. По мнению BottleCap, многие из этих дополнительных токенов не меняют итоговый ответ. Первый релиз серии применял эту идею к Qwen3.6-27B.
На этот раз цель была намеренно консервативной. BottleCap не пыталась добавить знания или изменить стиль ответов. Предполагалось сохранить без изменений способность к рассуждению, следование инструкциям и поведение в вопросах безопасности. Исследовательская команда также уделила больше внимания бенчмаркам по математике, рассуждению, работе с длинным контекстом и агентным задачам.
Результаты бенчмарков при уровне усилий xhigh
Все основные показатели получены при reasoning_effort=xhigh, используемом в шаблоне чата по умолчанию. Каждый бенчмарк стал короче: сокращение составляет от 10,7% до 65,5%.
Задачи на знания и мультиязычность сокращаются сильнее всего. MMMLU сокращается на 65,5% (с 1 656 до 571 токена), а MMLU-Pro — на 57,3%. GPQA-Diamond снижается с 12 772 до 7 267 токенов, то есть на 43,1%. IFBench использует на 46,4% меньше токенов рассуждений при почти неизменной точности (79,75% против 79,71%).
Извлечение информации из длинного контекста улучшается. Точность AA-LCR возрастает на 2,25 п.п. — с 81,75% до 84,00%, при сокращении числа токенов рассуждений на 38,6%. LiveCodeBench v6 повышается на 0,07 п.п., при этом рассуждения занимают на 20,3% меньше токенов.
Результаты агентных задач остаются близкими к базовой модели. τ²-bench теряет 1,01 п.п. при сокращении на 30,9%. Terminal-Bench 2.1 теряет 0,56 п.п., что значительно меньше его интервала ±4,26, при сокращении на 10,7%.
Самый дорогой компромисс наблюдается в AIME 2026. Точность снижается на 3,85 п.п. — с 98,13% до 94,27%, — при сокращении рассуждений на 30,2%.
Обратите внимание, что показатель 37,2% — это среднее значение 12 сокращений по отдельным бенчмаркам. Среднее число токенов рассуждений по совокупности снижается с 15 735 до 12 144.
BottleCap также сообщает о зависимости результатов от ограничения бюджета. При ограничении в 16 тыс. токенов на ответ ThinkingCap набирает больше баллов, чем базовая модель. Доля усечённых трассировок снижается с 0,51% до 0,34%, а зацикливания — с 0,06% до 0,05%.
Как модель взаимодействует с регулятором уровня усилий
Qwen3.8-27B поддерживает настройку уровня усилий при рассуждении, и сжатие сочетается с ней. Все приведённые ниже изменения сравниваются с базовой моделью при xhigh и усреднены по 11 бенчмаркам.
При среднем уровне базовая модель сокращает объём рассуждений на 52,1% при снижении точности на 9,16 п.п. ThinkingCap сокращает его на 60,2% при снижении на 9,90 п.п. При низком уровне показатели базовой модели составляют −55,4% и −9,71 п.п., а у ThinkingCap — −62,3% и −10,79 п.п. При отключённых рассуждениях ThinkingCap уступает базовой модели 5,7 п.п.
Команда BottleCap рекомендует xhigh для оптимального баланса между точностью и числом токенов. Она сообщает, что отдельные режимы рассуждений получат больше внимания в будущем релизе.
Как проводилась оценка
Обе модели запускались с использованием одного и того же тестового комплекса на одном NVIDIA H200 с vLLM 0.29.0. Параметры семплирования были идентичными: temperature 1.0, top_p 0.95, top_k 20, min_p 0.0. Точность по нескольким сидами представляет собой среднее значение с 95%-ным интервалом. Число сидов варьировалось от 32 для AIME 2026 до 1 для MMLU-Pro и MMMLU. Для MMMLU использовалась фиксированная выборка из 10 000 вопросов; остальные 11 бенчмарков запускались на полных наборах.
Спекулятивное декодирование MTP (3 черновых токена) показало отсутствие влияния на точность в AIME 2026. Принималось 53% черновых токенов — около 2,6 токена за шаг, что соответствовало базовой модели.
Развёртывание: сборки, обслуживание и лицензия
Контрольная точка bf16 содержит 28 млрд параметров и принимает изображения и текст. BottleCap публикует 5 квантованных сборок:
- FP8: 31 ГБ, для vLLM, Hopper и Blackwell.
- NVFP4 только для весов: 21 ГБ, для vLLM, Hopper (ядро Marlin) и Blackwell.
- NVFP4 W4A4 (AWQ): 23 ГБ, только для Blackwell.
- GGUF: от 16 до 55 ГБ, для llama.cpp, LM Studio и Ollama.
- MLX 4-bit DWQ: 21 ГБ, для компьютеров Mac на Apple Silicon с 32 ГБ памяти.
Для обслуживания используется конфигурация базовой модели: --reasoning-parser qwen3 вместе с парсером вызовов инструментов qwen3_xml в vLLM. Рассуждения возвращаются в отдельном поле.
Лицензия — PolyForm Small Business 1.0.0 плюс разрешение BottleCap на личное использование. Материалы исходной модели Qwen по-прежнему распространяются по лицензии Apache-2.0. Hugging Face пока не указывает ни одного провайдера, размещающего модель для инференса.
Основные выводы
- В среднем на 37,2% меньше токенов рассуждений в 12 бенчмарках.
- Макроточность снижается на 0,86 п.п. — с 86,65% до 85,79%.
- Точность AA-LCR на длинном контексте возрастает на 2,25 п.п.; в AIME 2026 снижается на 3,85 п.п.
- Устанавливается вместо Qwen3.8-27B: те же параметры семплирования, те же флаги vLLM или SGLang.
- Веса доступны по ограниченной лицензии PolyForm Small Business; для коммерческого использования требуется лицензия.
Ознакомьтесь с техническим блогом и весами модели. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? Теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.