Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Z.ai випустила GLM-5.3-Flash: нативно мультимодальну MoE-модель 320B-A18B із контекстом на 1 млн токенів

Z.ai випустила GLM-5.3-Flash — першу нативно мультимодальну модель у серії GLM-5 і найдешевшу потужну модель для програмування, яку випустила лабораторія. Це модель типу суміші експертів із 320 млрд загальних параметрів і 18 млрд активних параметрів на токен, контекстним вікном на 1 048 576 токенів, а також підтримкою введення зображень і відео — випущена за ліцензією MIT, а ваги доступні на Hugging Face. Згідно зі звітами Z.ai, вона перевершує GLM-5.2 у тестах і реальних робочих навантаженнях приблизно за одну десяту вартості, водночас відстаючи менш ніж на пів бала від Claude Opus 4.8 у внутрішньому тесті програмування. Перший тиждень модель анонімно працювала під назвою «Ox Alpha» на OpenCode і OpenRouter, повністю обслуговуючись на китайських чипах штучного інтелекту вітчизняного виробництва.

Чи придатна вона до розгортання?

Так, за двома напрямами. Ваги вже доступні на Hugging Face за ліцензією MIT, а розміщений API вже має тарифи та працює.

  • Які компанії реально можуть розгорнути модель самостійно? Не всі. Стандартний контрольний файл FP8 займає приблизно 306 ГіБ ваг до врахування KV-кешу, а поточний шлях через vLLM підтримує лише NVIDIA Hopper і новіші архітектури. Це робить самостійне розгортання доступним для середніх і великих організацій, які мають щонайменше один вузол із 8 GPU (або стійку GB200 у конфігурації TP4), а також для AI-стартапів, що орендують обчислювальні потужності GPU. Усі, хто не відповідає цим вимогам, використовують модель через API — і саме економіка, а не апаратне забезпечення, є тут головною історією.
  • Галузі з негайною практичною користю: розроблення програмного забезпечення та devtools, автоматизація IT/BPO, операції з документами у фінансових послугах і страхуванні, корпоративна BI-аналітика та бек-офісна інтелектуальна робота, електронна комерція й будь-які команди, що створюють інтерфейси у великих обсягах.
  • Застосування: агенти програмування на рівні репозиторію, агенти для роботи з терміналом і браузером/комп’ютером, аналіз журналів і контрактів обсягом у мільйон токенів, перевірка регресій UI за скриншотами, а також робота з електронними таблицями, презентаціями й інформаційними панелями, для якої інакше знадобився б конвеєр OCR-to-text.

Саме архітектура забезпечує ефективність

GLM-5.3-Flash розпочинається з базової моделі, навченої на новому мультимодальному корпусі обсягом 30 трлн токенів. Варто знати про три зміни:

  • Гібридна увага: уперше в серії GLM Z.ai поєднала лінійну та розріджену увагу. Згідно з рецептом vLLM, мовна модель із 45 шарами чергує шари лінійної уваги KDA зі шарами розрідженої уваги MLA без позиційних кодувань NoPE, спрямовує кожен токен через 8 із 288 експертів і постачається з нативними вагами FP8 та одним чернетковим шаром MTP. Лінійна увага обробляє локальні залежності, а розріджена увага знаходить глобально релевантний контекст.
  • IndexPool: за контексту в мільйон токенів саме пошук стає вузьким місцем. IndexPool стискає групи ключових векторів індексатора за допомогою зваженого об’єднання, щоб зменшити затримку та використання пам’яті. Z.ai повідомляє про приблизно втричі менші обчислення уваги та у 4,4 раза менший KV-кеш порівняно з GLM-5.3.
  • mHC: модель використовує гіперз’єднання з обмеженнями на многовиді (Manifold-Constrained Hyper-Connections) для підвищення ефективності масштабування. Порівняно з GLM-4.5, за подібної загальної кількості параметрів GLM-5.3-Flash приблизно вдвічі зменшує як кількість активованих параметрів, так і кількість шарів.

Результати тестів

Більшість наведених у таблиці нижче показників повідомлені Z.ai, а набори інструментів відрізняються залежно від тесту — у виносках до картки моделі зазначено температуру, обмеження контексту та моделі-судді для кожного тесту, тож порівняння різних моделей слід сприймати як залежні від налаштувань.

ТестGLM-5.3-FlashОрієнтир
Terminal-Bench 2.184.3Opus 4.8: 85.0 · GPT-5.6 Terra: 87.4
DeepSWE v1.163.4GLM-5.2: 46.2
AutomationBench48.8GLM-5.2: 26.2
HLE55.3
OfficeQA Pro62.4випереджає Opus 4.8
Z.ai Code Bench v1.0 (макс.)29.0Opus 4.8: 29.5

Незалежно від цього, Artificial Analysis оцінює її в 57 балів за індексом інтелекту, із показником 48,7 вихідного токена/с і 1,52 с TTFT в API Z.ai — це високий рівень інтелекту за кожен долар, але модель повільна й багатослівна. Слабке місце — робота із зображеннями: вона поступається Gemini 3.7 Flash у BabyVision і MVbench.

Історія обслуговування — найменш висвітлена частина

Z.ai заявляє, що весь попередній перегляд Ox Alpha працював на китайських чипах штучного інтелекту вітчизняного виробництва, використовуючи власний рушій на базі SGLang, який розділяє кодування, попереднє заповнення та декодування, і повідомляє про трикратне покращення наскрізного обслуговування на десятках тисяч прискорювачів.

Ціни та доступ

Стандартні тарифи API становлять $0,15/млн вхідних токенів, $0,03/млн кешованих вхідних токенів, $0,50/млн вихідних токенів. Z.ai повідомляє про показник 57 за індексом інтелекту Artificial Analysis v4.1.1 за $0,045 за завдання на тарифі зі знижкою. Модель доступна для всіх рівнів GLM Coding Plan — Lite ($18/міс.), Pro ($80), Max ($168) — із втричі більшою доступною квотою, ніж у GLM-5.3, а її мультимодальні можливості доступні в ZCode через Browser Use і Computer Use. Локальне обслуговування підтримують SGLang, vLLM, TokenSpeed і KTransformers.

Ключові висновки

  • Нативно мультимодальна MoE-модель 320B-A18B, контекст на 1 млн токенів, ваги з ліцензією MIT на Hugging Face.
  • Гібридна увага KDA — лінійна + NoPE MLA — розріджена: приблизно втричі менші обчислення уваги, у 4,4 раза менший KV-кеш.
  • 84,3 у Terminal-Bench 2.1 і 63,4 у DeepSWE v1.1 — майже на рівні Opus 4.8 і значно вище за GLM-5.2.
  • $0,15/$0,50 за мільйон токенів; утричі більша квота GLM-5.3 для кожного рівня GLM Coding Plan.
  • Для самостійного розгортання потрібно приблизно 306 ГіБ ваг FP8 на Hopper або новішій архітектурі; усі інші використовують API.

Перегляньте ваги моделі і блог. Також можете стежити за нами у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини