BottleCap AI пусна ThinkingCap-Qwen3.8-27B: с 37,2% по-малко токени за разсъждение при цена от 0,86 пр.п. в точността
BottleCap AI пусна ThinkingCap-Qwen3.8-27B, втория модел от серията ThinkingCap. Това е фино дообучена версия на Qwen3.8-27B на екипа на Qwen с една тясно дефинирана цел: по-кратки следи от разсъждение. В 12 бенчмарка той използва средно с 37,2% по-малко токени за мислене. Средната макроточност се променя от 86,65% на 85,79% — спад от 0,86 процентни пункта.
Готов за внедряване? Да. Може директно да замени Qwen3.8-27B във vLLM или SGLang, като са налични версии за FP8, NVFP4, GGUF и MLX. Хранилището е с ограничен достъп, а комерсиалната употреба извън лиценза за малък бизнес изисква споразумение с BottleCap.
Към какъв проблем е насочен ThinkingCap?
Моделите за разсъждение често използват повече токени за мислене, отколкото са необходими за даден въпрос. Позицията на BottleCap е, че много от тези допълнителни токени не променят крайния отговор. Първото издание от серията приложи тази идея към Qwen3.6-27B.
Този път целта беше умишлено консервативна. BottleCap не се опита да добави знания или да промени стила на отговорите. Предвиждаше се способността за разсъждение, следването на инструкции и поведението по отношение на безопасността да останат непроменени. Изследователският екип също насочи по-голямо внимание към бенчмаркове за математика, разсъждение, дълъг контекст и агентни задачи.
Резултати от бенчмарковете при ниво xhigh
Всички основни показатели използват reasoning_effort=xhigh, което е зададеното по подразбиране в шаблона за чат. Всеки бенчмарк става по-кратък, като съкращенията варират от 10,7% до 65,5%.
Задачите за знания и многоезичност се съкращават най-много. MMMLU спада с 65,5% (от 1656 на 571 токена), а MMLU-Pro — с 57,3%. GPQA-Diamond намалява от 12 772 на 7267 токена, което е съкращение от 43,1%. IFBench използва с 46,4% по-малко мислене, като точността почти не се променя (от 79,75% на 79,71%).
Извличането от дълъг контекст се подобрява. Точността в AA-LCR се повишава с 2,25 процентни пункта — от 81,75% на 84,00% — при 38,6% по-малко токени за мислене. LiveCodeBench v6 се покачва с 0,07 процентни пункта, докато мисленето намалява с 20,3%.
Агентните резултати остават близки до тези на базовия модел. τ²-bench губи 1,01 процентни пункта при съкращение от 30,9%. Terminal-Bench 2.1 губи 0,56 процентни пункта, което е в рамките на интервала му от ±4,26, при съкращение от 10,7%.
Най-скъпият компромис е AIME 2026. Точността спада с 3,85 процентни пункта — от 98,13% на 94,27% — при 30,2% по-малко мислене.
Моля, обърнете внимание, че стойността от 37,2% е средната стойност на съкращенията за всеки от 12-те бенчмарка. Обединената средна стойност на токените за мислене спада от 15 735 на 12 144.
BottleCap също отчита крива на бюджетиране. При ограничение от 16K токена на отговор ThinkingCap постига по-висок резултат от базовия модел. Дяловете на прекъснатите следи спадат от 0,51% на 0,34%, а на циклите — от 0,06% на 0,05%.
Как взаимодейства с регулатора на усилието
Qwen3.8-27B предлага настройка за усилието при разсъждение, а компресията се наслагва върху нея. Всички стойности по-долу са сравнени с базовия модел при xhigh и са осреднени за 11 бенчмарка.
При medium базовият модел съкращава мисленето с 52,1% при спад от 9,16 процентни пункта. ThinkingCap го съкращава с 60,2% при спад от 9,90 процентни пункта. При low стойностите са съответно -55,4% и -9,71 процентни пункта за базовия модел срещу -62,3% и -10,79 процентни пункта за ThinkingCap. При изключено мислене ThinkingCap изостава от базовия модел с 5,7 процентни пункта.
Екипът на BottleCap препоръчва xhigh за най-добрия баланс между точност и брой токени. От компанията казват, че в бъдещо издание ще бъде обърнато внимание на отделните режими на мислене.
Как е проведена оценката
И двата модела са тествани с един и същ набор от инструменти на един NVIDIA H200 с vLLM 0.29.0. Параметрите за семплиране са идентични: temperature 1.0, top_p 0.95, top_k 20, min_p 0.0. Точността при множество начални стойности е средната стойност с 95% интервал. Броят на началните стойности варира от 32 при AIME 2026 до 1 при MMLU-Pro и MMMLU. MMMLU използва фиксирана извадка от 10 000 въпроса; останалите 11 бенчмарка използват пълните набори.
Спекулативното декодиране с MTP (3 чернови токена) беше измерено като неутрално по отношение на точността при AIME 2026. То прие 53% от генерираните чернови токени — около 2,6 токена на стъпка — което съответства на базовия модел.
Внедряване: версии, обслужване и лиценз
Контролната точка bf16 има 28B параметъра и приема изображения и текст. BottleCap публикува 5 квантизирани версии:
- FP8: 31 GB, за vLLM, Hopper и Blackwell.
- NVFP4 само за теглата: 21 GB, за vLLM, Hopper (ядро Marlin) и Blackwell.
- NVFP4 W4A4 (AWQ): 23 GB, само за Blackwell.
- GGUF: 16 до 55 GB, за llama.cpp, LM Studio и Ollama.
- MLX 4-bit DWQ: 21 GB, за Mac компютри с Apple Silicon и 32 GB.
Обслужването използва рецептата на базовия модел: --reasoning-parser qwen3 с парсера за извикване на инструменти qwen3_xml във vLLM. Мисленето се връща в отделно поле за разсъждение.
Лицензът е PolyForm Small Business 1.0.0 плюс разрешение от BottleCap за лична употреба. Материалите на Qwen остават под лиценз Apache-2.0. Hugging Face все още не посочва доставчик на хостинг за инференция, който да предлага модела.
Основни изводи
- Средно с 37,2% по-малко токени за мислене в 12 бенчмарка.
- Макроточността спада с 0,86 процентни пункта — от 86,65% на 85,79%.
- Точността в AA-LCR за дълъг контекст се повишава с 2,25 процентни пункта; тази в AIME 2026 спада с 3,85 процентни пункта.
- Директна замяна на Qwen3.8-27B: същото семплиране, същите флагове за vLLM или SGLang.
- Теглата са с ограничен достъп и са под PolyForm Small Business; за комерсиална употреба е необходим лиценз.
Разгледайте техническия блог и теглата на модела. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и там.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и др.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.