Sakhanda Wire
NVDA $213.05 +2.19% MSFT $491.71 +0.90% GOOGL $346.96 -0.32% META $570.05 +1.97% AMZN $261.06 -0.39%
← К новостям

IBM выпустила Granite 4.2: нативное рассуждение и агентное обучение с подкреплением для открытых корпоративных моделей

IBM выпустила Granite 4.2 — семейство открытых языковых моделей с рассуждением в версиях на 3B, 8B и 30B параметров. В отличие от предыдущих выпусков Granite, которые представляли собой ассистентов, следующих инструкциям, Granite 4.2 построена вокруг явного рассуждения. Каждая модель может выдавать цепочку рассуждений перед ответом, а также поддерживает переключатель режима мышления / без мышления и режим низкой сложности, в котором на простые вопросы выделяется небольшой бюджет рассуждений. Модели представляют собой плотные трансформеры только с декодером, предварительно обученные с нуля примерно на 15 триллионах токенов, а затем дообученные посредством многоэтапной цепочки обучения с подкреплением. Для моделей 8B и 30B эта цепочка включает блок агентного обучения с подкреплением, в рамках которого модель учится редактировать код, работать с терминалом и выполнять веб-поиск в реальных изолированных средах. Все три модели распространяются по лицензии Apache 2.0. Вместе с LLM IBM также выпустила две модели Granite Speech 5.0 Turbo CTC на 470 млн параметров.

Можно ли развернуть модели?

Да. Все три языковые модели Granite 4.2 распространяются по лицензии Apache 2.0, поэтому загрузка, дообучение и коммерческое использование в продуктивной среде не ограничены лицензионными условиями.

  • Какие компании: Модель 3B подходит индивидуальным разработчикам и стартапам, работающим на ноутбуке через Ollama или LM Studio, особенно с выпущенными квантованными версиями GGUF вплоть до Q4_K_M. Модель 8B подходит командам среднего бизнеса, использующим один современный GPU. Модель 30B ориентирована на предприятия с мощностями уровня A100/H100 либо на обслуживание в форматах FP8/NVFP4 через vLLM. Регулируемые организации получают дополнительное преимущество в виде возможности локального размещения весов.
  • Отрасли: разработка программного обеспечения и инструменты для разработчиков, финансовые услуги, здравоохранение, телекоммуникации, государственный сектор и контакт-центры — именно для последних предназначены новые речевые модели.
  • Применения: агенты для разработки программного обеспечения, автоматизация работы с терминалом и DevOps, агенты для глубокого исследования и поиска, RAG по длинным документам, структурированные вызовы инструментов и высокопроизводительная транскрипция.

Архитектура

Granite 4.2 — это плотный трансформер только с декодером, а не гибридная архитектура или архитектура MoE. Ключевые компоненты: Grouped Query Attention с 8 KV-головами, RoPE с θ = 10 000 000, MLP-блоки SwiGLU, RMSNorm (ε = 1e-5), несвязанные входные и выходные эмбеддинги и точность bfloat16.

Модель 3B использует 40 слоёв с размерностью эмбеддингов 2560. Модель 8B использует 40 слоёв с размерностью 4096. Модель 30B включает 64 слоя с размером скрытого слоя MLP 32 768. В опубликованной таблице архитектуры указана длина последовательности 131 072 токена (128K), тогда как пятифазный процесс предварительного обучения включает этап работы с длинным контекстом до 512K токенов. Предварительное обучение с нуля проводилось примерно на 15 триллионах токенов.

Главное — это сам процесс обучения

Обучение с учителем использует около 7,2 млн образцов, примерно 100 млрд токенов, из которых около 65 млрд являются обучаемыми. Смесь состоит из 31,6% агентных и 68,4% неагентных данных, при этом на разработку программного обеспечения приходится 69% агентной части. Траектории генерировались с использованием таких инструментов, как OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex и Goose. Контроль качества осуществлялся с помощью GPT-OSS-120B и Gemma 4 в качестве оценщиков, а также дедупликации SHA-256 по полям tools и messages.

Дообучение представляет собой многоэтапную цепочку обучения с подкреплением в нескольких средах, а не один проход. Каждый этап — это отдельный асинхронный запуск GRPO, начинающийся с предыдущей контрольной точки, с базовой линией leave-one-out вместо сети значений и усечённой выборкой по важности для ограничения смещения при обучении не по текущей политике. Порядок следующий: RLVR, затем усилители навыков, SWE, Terminal, Search и RLHF.

Блок агентного обучения с подкреплением запускается только для моделей 8B и 30B. Модель 3B проходит только фундаментальное обучение с подкреплением и выравнивание. Именно это решение в значительной степени объясняет разрыв в возможностях между моделями разных размеров. Обучение проводилось с использованием NeMo-RL и NeMo-Gym на кластере NVIDIA GB200 NVL72, размещённом компанией CoreWeave.

Важны ещё два вспомогательных компонента: 1 трлн токенов синтетического кода, созданного конвейером IBM CodeAlchemy, и слой спекулятивного декодирования для ускорения обслуживания.

Заявленные результаты

Показатели IBM по размерам (3B / 8B / 30B):

Бенчмарк3B8B30B
SWE-Bench VerifiedNA47.6757.00
Terminal-Bench 2.1NA20.5629.24
τ³-bench50.9966.3468.05
BFCL (v4)52.4150.2961.39
AIME2578.3386.6789.17
GPQA54.8064.1466.41
MMLU-Pro67.8474.0477.60
RULER 128K55.3071.4181.38

Речь: 470 млн параметров, без основы в виде LLM

Модели Turbo CTC содержат 470 млн параметров и полностью отказываются от основы в виде LLM, используя коннекционистскую временную классификацию для преобразования аудио в текст. IBM сообщает о пропускной способности RTFx около 12 600 на одном H200 против примерно 6 000 у текущих лидеров по скорости в рейтинге Open ASR. Доступна демоверсия WebGPU.

Ключевые выводы

  • Granite 4.2 включает плотные модели с рассуждением на 3B/8B/30B, распространяемые по лицензии Apache 2.0.
  • Переключатель режимов мышления / низкой сложности / без мышления доступен в шаблоне чата.
  • Агентное обучение с подкреплением (SWE, Terminal, Search) проводится только для моделей 8B и 30B.
  • Модель 30B набирает 57.00 в SWE-Bench Verified и 29.24 в Terminal-Bench 2.1.
  • Granite Speech 5.0 Turbo CTC содержит 470 млн параметров и не использует основу в виде LLM.

Ознакомьтесь с блогом IBM Research, техническим описанием и репозиторием на GitHub. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости