BottleCap AI випустила ThinkingCap-Qwen3.8-27B: на 37,2% менше токенів міркування ціною зниження точності на 0,86 в.п.
BottleCap AI випустила ThinkingCap-Qwen3.8-27B, другу модель у серії ThinkingCap. Це донавчена версія Qwen3.8-27B команди Qwen з однією вузькою метою: скоротити ланцюжки міркувань. На 12 бенчмарках вона в середньому використовує на 37,2% менше токенів міркування. Середня макроточність знижується з 86,65% до 85,79%, тобто на 0,86 в. п.
Придатна для розгортання? Так. Вона безпосередньо замінює Qwen3.8-27B у vLLM або SGLang і має збірки FP8, NVFP4, GGUF та MLX. Репозиторій доступний за запитом, а для комерційного використання за межами ліцензії для малого бізнесу потрібна угода з BottleCap.
Яку проблему вирішує ThinkingCap?
Моделі міркування часто використовують більше токенів міркування, ніж потрібно для запитання. Позиція BottleCap полягає в тому, що багато з цих додаткових токенів не змінюють остаточну відповідь. Перша модель серії застосувала цю ідею до Qwen3.6-27B.
Цього разу мета була свідомо консервативною. BottleCap не намагалася додати знання чи змінити стиль відповідей. Передбачалося, що здатність до міркування, виконання інструкцій і поведінка щодо безпеки залишаться без змін. Дослідницька команда також приділила більше уваги бенчмаркам математики, міркування, довгого контексту та агентних систем.
Результати бенчмарків за рівня зусиль xhigh
Усі основні показники використовують reasoning_effort=xhigh, значення за замовчуванням у шаблоні чату. На кожному бенчмарку міркування стають коротшими, а скорочення варіюються від 10,7% до 65,5%.
Найбільше скорочення спостерігається в завданнях на знання та багатомовність. MMMLU скорочується на 65,5% (з 1 656 до 571 токена), а MMLU-Pro — на 57,3%. GPQA-Diamond знижується з 12 772 до 7 267 токенів, тобто на 43,1%. IFBench використовує на 46,4% менше міркувань, тоді як точність майже не змінюється (з 79,75% до 79,71%).
Показники пошуку в довгому контексті покращуються. Точність AA-LCR зростає на 2,25 в. п. — з 81,75% до 84,00%, — при цьому токенів міркування використовується на 38,6% менше. LiveCodeBench v6 зростає на 0,07 в. п., водночас міркування скорочується на 20,3%.
Агентні результати залишаються близькими до базової моделі. τ²-bench втрачає 1,01 в. п. за скорочення на 30,9%. Terminal-Bench 2.1 втрачає 0,56 в. п., що значно менше за його інтервал ±4,26, при скороченні на 10,7%.
Найбільший компроміс спостерігається на AIME 2026. Точність знижується на 3,85 в. п. — з 98,13% до 94,27%, — за умови на 30,2% меншого обсягу міркувань.
Зверніть увагу, що показник 37,2% є середнім значенням скорочень на 12 окремих бенчмарках. Середня кількість токенів міркування по всіх бенчмарках знижується з 15 735 до 12 144.
BottleCap також наводить криву залежності від бюджету. За обмеження в 16 тис. токенів на відповідь ThinkingCap набирає більше балів, ніж базова модель. Частка обрізаних ланцюжків знижується з 0,51% до 0,34%, а зациклення — з 0,06% до 0,05%.
Як вона взаємодіє з регулятором рівня зусиль
Qwen3.8-27B має налаштування рівня зусиль для міркування, і стиснення накладається на його дію. Усі наведені нижче зміни порівнюються з базовою моделлю на рівні xhigh і усереднюються за 11 бенчмарками.
На середньому рівні базова модель скорочує обсяг міркувань на 52,1% за падіння на 9,16 в. п. ThinkingCap скорочує його на 60,2% за падіння на 9,90 в. п. На низькому рівні ці показники становлять -55,4% і -9,71 в. п. для базової моделі проти -62,3% і -10,79 в. п. для ThinkingCap. Коли міркування вимкнено, ThinkingCap поступається базовій моделі на 5,7 в. п.
Команда BottleCap рекомендує xhigh для найкращого балансу між точністю та кількістю токенів. Вона зазначає, що в майбутньому випуску окремим режимам міркування буде приділено увагу.
Як проводилося оцінювання
Обидві моделі працювали через один і той самий тестовий стенд на одному NVIDIA H200 із vLLM 0.29.0. Параметри семплювання були ідентичними: temperature 1.0, top_p 0.95, top_k 20, min_p 0.0. Точність за кількома початковими значеннями є середнім із 95-відсотковим інтервалом. Кількість початкових значень становить від 32 для AIME 2026 до 1 для MMLU-Pro та MMMLU. Для MMMLU використовується фіксована вибірка з 10 000 запитань; решта 11 бенчмарків запускаються на повних наборах.
Спекулятивне декодування MTP (3 чернеткові токени) показало нейтральність щодо точності на AIME 2026. Було прийнято 53% чернеткових токенів — приблизно 2,6 токена за крок, що відповідає базовій моделі.
Розгортання: збірки, обслуговування та ліцензія
Контрольна точка bf16 має 28 млрд параметрів і приймає зображення та текст. BottleCap публікує 5 квантизованих збірок:
- FP8: 31 ГБ, vLLM, Hopper і Blackwell.
- NVFP4 лише для ваг: 21 ГБ, vLLM, Hopper (ядро Marlin) і Blackwell.
- NVFP4 W4A4 (AWQ): 23 ГБ, лише Blackwell.
- GGUF: від 16 до 55 ГБ, для llama.cpp, LM Studio та Ollama.
- MLX 4-bit DWQ: 21 ГБ, для Mac на Apple Silicon із 32 ГБ.
Обслуговування використовує рецепт базової моделі: --reasoning-parser qwen3 із парсером викликів інструментів qwen3_xml у vLLM. Міркування повертається в окремому полі.
Ліцензія — PolyForm Small Business 1.0.0 у поєднанні з дозволом BottleCap на особисте використання. Матеріали оригінальної Qwen залишаються під ліцензією Apache-2.0. Hugging Face наразі не вказує жодного провайдера, який би розміщував цю модель для виконання.
Головні висновки
- У середньому на 37,2% менше токенів міркування на 12 бенчмарках.
- Макроточність знижується на 0,86 в. п. — з 86,65% до 85,79%.
- Точність AA-LCR у довгому контексті зростає на 2,25 в. п.; на AIME 2026 знижується на 3,85 в. п.
- Безпосередня заміна Qwen3.8-27B: те саме семплювання, ті самі параметри vLLM або SGLang.
- Ваги доступні за запитом під ліцензією PolyForm Small Business; для комерційного використання потрібна ліцензія.
Ознайомтеся з технічним блогом і вагами моделі. Уся заслуга належить досліднику цього проєкту. Також не вагайтеся підписатися на нас у Twitter і не забудьте приєднатися до нашого сабреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.