Sakhanda Wire
NVDA $213.05 +2.19% MSFT $491.71 +0.90% GOOGL $346.96 -0.32% META $570.05 +1.97% AMZN $261.06 -0.39%
← До новин

IBM випустила Granite 4.2: нативне міркування та агентне навчання з підкріпленням для відкритих корпоративних моделей

IBM випустила Granite 4.2 — сімейство відкритих мовних моделей із міркуваннями у варіантах із 3B, 8B і 30B параметрів. На відміну від попередніх релізів Granite, які були асистентами, що виконують інструкції, Granite 4.2 побудована на явному міркуванні. Кожна модель може генерувати ланцюжок міркувань перед відповіддю, а також має перемикач режимів міркування / без міркування та режим низьких зусиль, який витрачає невеликий бюджет міркувань на прості запитання. Моделі є щільними трансформерами лише з декодером, попередньо навченими з нуля приблизно на 15 трильйонах токенів, а потім донавченими через багатоступеневий ланцюжок навчання з підкріпленням. Для моделей 8B і 30B цей ланцюжок містить блок агентного RL, у межах якого модель навчається редагувати код, керувати терміналом і виконувати вебпошук у реальних ізольованих середовищах. Усі три моделі випускаються за ліцензією Apache 2.0. Разом із LLM IBM також випустила дві моделі Granite Speech 5.0 Turbo CTC із 470M параметрів.

Чи придатна вона для розгортання?

Так. Усі три мовні моделі Granite 4.2 випускаються за ліцензією Apache 2.0, тому завантаження, донавчання та комерційне використання у виробництві не мають ліцензійних обмежень.

  • Які компанії: Модель 3B підходить окремим розробникам і стартапам, які працюють на ноутбуці через Ollama або LM Studio, особливо з доступними GGUF-квантами аж до Q4_K_M. Модель 8B підходить командам середнього бізнесу, які використовують один сучасний GPU. Модель 30B орієнтована на підприємства з потужностями рівня A100/H100 або на обслуговування у форматах FP8/NVFP4 через vLLM. Регульовані організації отримують додаткову перевагу у вигляді ваг моделі для локального розгортання.
  • Галузі: розробка програмного забезпечення та інструментів для розробників, фінансові послуги, охорона здоров’я, телекомунікації, державний сектор і контакт-центри — саме для останніх призначені нові мовні моделі.
  • Застосування: агенти для розробки програмного забезпечення, автоматизація роботи з терміналом і DevOps, агенти для глибоких досліджень і пошуку, RAG для довгих документів, структуровані виклики інструментів і транскрибування великих обсягів даних.

Архітектура

Granite 4.2 — це щільний трансформер лише з декодером, а не гібридна архітектура чи MoE. Основні компоненти: Grouped Query Attention із 8 KV-головами, RoPE з θ = 10,000,000, MLP-блоки SwiGLU, RMSNorm (ε = 1e-5), непов’язані вхідні та вихідні вкладення, а також точність bfloat16.

Модель 3B використовує 40 шарів із розміром вкладення 2560. Модель 8B має 40 шарів із розміром 4096. Модель 30B має 64 шари та прихований розмір MLP 32,768. В опублікованій таблиці архітектури зазначено довжину послідовності 131 072 токени (128K), тоді як п’ятифазний цикл попереднього навчання містить фазу роботи з довгим контекстом, що розширюється до 512K токенів. Попереднє навчання виконувалося з нуля приблизно на 15 трильйонах токенів.

Справжня історія — у конвеєрі навчання

Кероване донавчання використовує близько 7,2 мільйона зразків, приблизно 100B токенів, із яких ~65B є навчальними. Суміш складається з 31,6% агентних і 68,4% неагентних даних, а розробка програмного забезпечення становить 69% агентної частини. Траєкторії генерувалися в таких середовищах, як OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex і Goose. Контроль якості здійснювався за допомогою GPT-OSS-120B і Gemma 4 як оцінювачів, а також дедуплікації SHA-256 для полів tools і messages.

Післянавчання — це багатоступеневий ланцюжок RL у кількох середовищах, а не один етап. Кожен етап є окремим асинхронним запуском GRPO, який починається з попередньої контрольної точки, із базовою лінією leave-one-out замість мережі значень і усіченим вибірковим семплюванням важливості для обмеження позаполітичного зсуву. Порядок такий: RLVR, потім підсилювачі навичок, SWE, Terminal, Search, а потім RLHF.

Блок агентного RL працює лише для моделей 8B і 30B. Модель 3B проходить лише фундаментальне RL і вирівнювання. Саме це проєктне рішення пояснює більшість розриву в можливостях між різними розмірами моделей. Навчання виконувалося на NeMo-RL і NeMo-Gym у кластері NVIDIA GB200 NVL72, розміщеному компанією CoreWeave.

Важливими є ще дві складові: 1 трильйон токенів синтетичного коду, створеного конвеєром IBM CodeAlchemy, і шар спекулятивного декодування для швидшого обслуговування.

Заявлені результати

Показники IBM за розміром (3B / 8B / 30B):

Бенчмарк3B8B30B
SWE-Bench VerifiedNA47.6757.00
Terminal-Bench 2.1NA20.5629.24
τ³-bench50.9966.3468.05
BFCL (v4)52.4150.2961.39
AIME2578.3386.6789.17
GPQA54.8064.1466.41
MMLU-Pro67.8474.0477.60
RULER 128K55.3071.4181.38

Мовлення: 470M параметрів, без базової LLM

Моделі Turbo CTC мають 470 мільйонів параметрів і повністю відмовляються від базової LLM, використовуючи класифікацію часових зв’язків для перетворення аудіо на текст. IBM повідомляє про пропускну здатність RTFx на рівні близько 12 600 на одному H200 проти приблизно 6 000 у нинішніх лідерів за швидкістю на рейтингу Open ASR. Демонстрація WebGPU вже доступна.

Основні висновки

  • Granite 4.2 пропонує щільні моделі міркування 3B/8B/30B за ліцензією Apache 2.0.
  • У шаблоні чату доступний перемикач режимів міркування / низьких зусиль / без міркування.
  • Агентне RL (SWE, Terminal, Search) застосовується лише для моделей 8B і 30B.
  • Модель 30B набирає 57.00 у SWE-Bench Verified і 29.24 у Terminal-Bench 2.1.
  • Granite Speech 5.0 Turbo CTC має 470M параметрів і не використовує базову LLM.

Ознайомтеся з  блогом IBM Research, технічним описом і репозиторієм GitHub. Також стежте за нами у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини