Sakhanda Wire
NVDA $213.05 +2.19% MSFT $491.71 +0.90% GOOGL $346.96 -0.32% META $570.05 +1.97% AMZN $261.06 -0.39%
← Към новините

IBM представи Granite 4.2: вградени разсъждения и агентно обучение с подсилване за отворени корпоративни модели

IBM пусна Granite 4.2 — семейство отворени езикови модели с разсъждение във варианти с 3B, 8B и 30B параметъра. За разлика от по-ранните версии на Granite, които бяха асистенти, следващи инструкции, Granite 4.2 е изграден около явно разсъждение. Всеки модел може да генерира верига от мисли, преди да отговори, а всеки модел предлага превключвател за мислещ / немислещ режим, както и режим с малко усилие, който използва кратък бюджет за разсъждение при лесни въпроси. Моделите са плътни трансформъри само с декодер, предварително обучени от нулата върху приблизително 15 трилиона токена, а след това дообучени чрез многоетапна верига за обучение с подсилване. При 8B и 30B тази верига включва блок за агентно обучение с подсилване, в който моделът се учи да редактира код, да управлява терминал и да извършва уеб търсения в реални среди тип „пясъчник“. И трите модела се разпространяват под Apache 2.0. IBM пусна и два модела Granite Speech 5.0 Turbo CTC със 470M параметъра заедно с LLM моделите.

Може ли да бъде внедрен?

Да, и трите езикови модела Granite 4.2 се разпространяват под Apache 2.0, така че изтеглянето, дообучаването и комерсиалното използване в производствена среда не са ограничени от лиценз.

  • Кои компании: Версията 3B е подходяща за самостоятелни разработчици и стартъпи, работещи на лаптоп чрез Ollama или LM Studio, особено с публикуваните GGUF квантизации до Q4_K_M. Версията 8B е подходяща за екипи от средния пазар с един съвременен графичен процесор. Версията 30B е насочена към предприятия с капацитет от клас A100/H100 или към обслужване във FP8/NVFP4 чрез vLLM. Регулираните организации получават и допълнителното предимство на локалното хостване на теглата.
  • Индустрии: Разработка на софтуер и инструменти за разработчици, финансови услуги, здравеопазване, телекомуникации, публичен сектор и контактни центрове — именно там намират приложение новите модели за реч.
  • Приложения: Агенти за софтуерно инженерство, автоматизация на терминали и DevOps, агенти за задълбочени проучвания и търсене, RAG за дълги документи, структурирано извикване на инструменти и транскрипция с голям обем.

Архитектура

Granite 4.2 е плътен трансформър само с декодер, а не хибриден модел или модел тип MoE. Основните компоненти са Grouped Query Attention с 8 KV глави, RoPE с θ = 10,000,000, SwiGLU MLP, RMSNorm (ε = 1e-5), необвързани входни/изходни ембединг слоеве и прецизност bfloat16.

Версията 3B използва 40 слоя с размер на ембедингите 2560. Версията 8B използва 40 слоя с размер 4096. Версията 30B достига 64 слоя с MLP скрит размер 32,768. Публикуваната архитектурна таблица посочва дължина на последователността от 131 072 токена (128K), докато петфазовото предварително обучение включва фаза за дълъг контекст, достигаща 512K токена. Предварителното обучение обхваща приблизително 15 трилиона токена от нулата.

Истинската история е в обучаващия конвейер

Наблюдаваното дообучаване използва около 7,2 милиона извадки — приблизително 100B токена, от които около 65B са обучаеми. Съотношението е 31,6% агентни и 68,4% неагентни данни, като софтуерното инженерство представлява 69% от агентния дял. Траекториите са генерирани в среди, включително OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex и Goose. Контролът на качеството използва GPT-OSS-120B и Gemma 4 като оценяващи модели, както и дедупликация чрез SHA-256 върху полетата tools и messages.

Дообучаването след предварителното обучение представлява многоетапна верига за обучение с подсилване в множество среди, а не еднократен процес. Всеки етап е отделно асинхронно изпълнение на GRPO, което започва от предишната контролна точка, с базова линия leave-one-out вместо мрежа за стойност и съкратено семплиране на важността за ограничаване на отклонението извън политиката. Редът е RLVR, след това подобрители на уменията, SWE, Terminal, Search и накрая RLHF.

Агентният блок за обучение с подсилване се изпълнява само за 8B и 30B. Версията 3B преминава само през фундаментално обучение с подсилване и подравняване. Именно този избор обяснява по-голямата част от разликата във възможностите между размерите. Обучението е проведено с NeMo-RL и NeMo-Gym върху клъстер NVIDIA GB200 NVL72, хостван от CoreWeave.

Важни са и два поддържащи компонента: 1 трилион токена синтетичен код от конвейера CodeAlchemy на IBM и слой за спекулативно декодиране за по-бързо обслужване.

Отчетени резултати

Резултатите на IBM според размера (3B / 8B / 30B):

Бенчмарк3B8B30B
SWE-Bench VerifiedNA47.6757.00
Terminal-Bench 2.1NA20.5629.24
τ³-bench50.9966.3468.05
BFCL (v4)52.4150.2961.39
AIME2578.3386.6789.17
GPQA54.8064.1466.41
MMLU-Pro67.8474.0477.60
RULER 128K55.3071.4181.38

Реч: 470M параметъра, без LLM основа

Моделите Turbo CTC имат 470 милиона параметъра и изцяло премахват LLM основата, като използват класификация на временни връзки за преобразуване на аудио в текст. IBM отчита пропускателна способност RTFx от близо 12 600 на един H200 спрямо приблизително 6000 при настоящите лидери по скорост в класацията Open ASR. Вече е достъпна демонстрация с WebGPU.

Основни изводи

  • Granite 4.2 предлага плътни модели за разсъждение с 3B/8B/30B параметъра под Apache 2.0.
  • В шаблона за чат е наличен превключвател за мислещ / режим с малко усилие / немислещ режим.
  • Агентното обучение с подсилване (SWE, Terminal, Search) се прилага само за 8B и 30B.
  • Моделът 30B постига 57.00 в SWE-Bench Verified и 29.24 в Terminal-Bench 2.1.
  • Granite Speech 5.0 Turbo CTC има 470M параметъра и няма LLM основа.

Разгледайте  блога на IBM Research, техническия материал и GitHub хранилището. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини