Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Z.ai пусна GLM-5.3-Flash: нативно мултимодален MoE 320B-A18B с контекст от 1 млн. токена

Z.ai пусна GLM-5.3-Flash — първия изначално мултимодален модел в серията GLM-5 и най-евтиния способен модел за програмиране, който лабораторията е пускала досега. Това е модел от типа mixture-of-experts с 320 млрд. общи параметъра и 18 млрд. активни параметъра на токен, контекстен прозорец от 1 048 576 токена и входни изображения и видео — пуснат под MIT лиценз, като теглата са достъпни в Hugging Face. Според докладите на Z.ai той превъзхожда GLM-5.2 в бенчмаркове и реални работни натоварвания при приблизително една десета от цената, като изостава с по-малко от половин точка от Claude Opus 4.8 във вътрешния бенчмарк за програмиране. През първата си седмица моделът работеше анонимно като „Ox Alpha“ в OpenCode и OpenRouter, като беше обслужван изцяло от произведени в Китай AI чипове.

Може ли да бъде внедрен?

Да, по два начина. Теглата вече са налични в Hugging Face под MIT лиценз, а хостван API вече има определени цени и работи.

  • Кои компании реалистично могат да го хостват самостоятелно? Не всички. Чекпойнтът по подразбиране във FP8 е приблизително 306 GiB тегла преди KV кеша, а текущият път през vLLM поддържа само NVIDIA Hopper и по-нови архитектури. Това прави самостоятелното хостване достъпно за средни и големи организации с поне един 8-GPU сървърен възел (или GB200 шаси при TP4), както и за стартиращи компании, разработващи AI продукти, които наемат GPU капацитет. Всички останали го използват като API — и тук историята е свързана с икономиката, а не с хардуера.
  • Индустрии с непосредствено приложение: софтуер и инструменти за разработчици, IT/BPO автоматизация, операции с документи във финансовите услуги и застраховането, корпоративен BI и работа със знания в бекофиса, електронна търговия и всеки екип, който разработва UI в голям обем.
  • Приложения: агенти за програмиране на ниво хранилище, агенти за терминал и браузър/компютър, анализ на логове и договори с милиони токени, проверка на UI регресии чрез екранни снимки и работа с електронни таблици, презентации и табла, която иначе би изисквала OCR-към-текст процес.

Архитектурата е източникът на ефективността

GLM-5.3-Flash започва от новообучен базов модел, изграден върху мултимодален корпус от 30 трилиона токена. Струва си да се знаят три промени:

  • Хибридно внимание: За първи път в серията GLM Z.ai комбинира линейно и разредено внимание. Според рецептата за vLLM езиковият модел с 45 слоя редува слоеве с линейно внимание KDA със слоеве с разредено внимание MLA без NoPE, насочва всеки токен през 8 от 288 експерта и използва изначални FP8 тегла плюс един MTP слой за чернова. Линейното внимание обработва локалните зависимости, а разреденото внимание извлича глобално релевантния контекст.
  • IndexPool: При контекст от милион токена самото извличане се превръща в тясно място. IndexPool компресира групи от ключови вектори на индексатора чрез претеглено обединяване, за да ограничи латентността и използваната памет. Z.ai съобщава за около 3 пъти по-малко изчисления за внимание и 4,4 пъти по-малък KV кеш в сравнение с GLM-5.3.
  • mHC: Моделът използва Manifold-Constrained Hyper-Connections за подобряване на ефективността при мащабиране. Спрямо GLM-4.5, при сходен общ брой параметри, GLM-5.3-Flash приблизително намалява наполовина както активираните параметри, така и броя на слоевете.

Бенчмаркове

Повечето числа, споменати в таблицата по-долу, са предоставени от Z.ai, а използваните тестови среди се различават според теста — бележките под линия в картата на модела посочват температурата, ограниченията на контекста и съдийските модели за всеки бенчмарк, затова приемайте сравненията между моделите като зависими от настройките.

БенчмаркGLM-5.3-FlashРеференция
Terminal-Bench 2.184.3Opus 4.8: 85.0 · GPT-5.6 Terra: 87.4
DeepSWE v1.163.4GLM-5.2: 46.2
AutomationBench48.8GLM-5.2: 26.2
HLE55.3
OfficeQA Pro62.4пред Opus 4.8
Z.ai Code Bench v1.0 (макс.)29.0Opus 4.8: 29.5

Независимо от това, Artificial Analysis му дава 57 точки в Intelligence Index, с 48,7 изходни токена/сек и 1,52 сек. TTFT в API на Z.ai — висока интелигентност спрямо цената, но бавен и многословен. Визията е слабата страна: моделът изостава от Gemini 3.7 Flash в BabyVision и MVbench.

Историята с обслужването е недостатъчно отразената част

Z.ai посочва, че целият преглед на Ox Alpha е работил върху произведени в Китай AI чипове, използвайки персонализиран енджин, базиран на SGLang, който разделя кодирането, предварителното попълване и декодирането, и отчита 3-кратно подобрение на обслужването от край до край при десетки хиляди ускорители.

Цени и достъп

Стандартните цени за API са $0,15/M вход, $0,03/M кеширан вход, $0,50/M изход. Z.ai отчита резултат от 57 в Artificial Analysis Intelligence Index v4.1.1 при $0,045 на задача в намаления тарифен план. Моделът е достъпен за всички нива на GLM Coding Plan — Lite ($18/мес.), Pro ($80), Max ($168) — с 3 пъти по-голяма използваема квота спрямо GLM-5.3, а мултимодалните му възможности са налични в ZCode чрез Browser Use и Computer Use. Локалното обслужване се поддържа от SGLang, vLLM, TokenSpeed и KTransformers.

Основни изводи

  • Изначално мултимодален MoE модел 320B-A18B, контекст от 1 млн. токена, MIT-лицензирани тегла в Hugging Face.
  • Хибридно внимание KDA linear + NoPE sparse MLA: около 3 пъти по-малко изчисления за внимание, 4,4 пъти по-малък KV кеш.
  • 84,3 в Terminal-Bench 2.1 и 63,4 в DeepSWE v1.1 — близо до Opus 4.8 и значително пред GLM-5.2.
  • $0,15/$0,50 на M токена; 3 пъти по-голяма квота спрямо GLM-5.3 за всяко ниво на GLM Coding Plan.
  • Самостоятелното хостване изисква около 306 GiB FP8 тегла върху Hopper или по-нова архитектура; всички останали използват API.

Разгледайте теглата на модела и блога. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини