Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Доступный флагманский ИИ Xiaomi возглавил открытые модели, а Anthropic заявляет, что Claude помог ему добиться этого

Xiaomi's affordable flagship AI leads the open models, and Anthropic says Claude helped get it there
Maximilian Schreiner
22 сент. 2026
Xiaomi

Ключевые моменты

  • Новая модель Xiaomi MiMo-V2.6-Pro возглавляет текущие рейтинги открытых ИИ-моделей и при этом стоит значительно дешевле конкурентов.
  • Xiaomi добилась скачка производительности благодаря расширенному обучению с подкреплением, а компания открыто опубликовала свои инструменты и обучающие задания.
  • В то же время Anthropic обвиняет Xiaomi в неправомерном извлечении данных через модель Claude для обучения собственной линейки моделей.

Xiaomi выпустила линейку MiMo-V2.6, и флагманская модель возглавляет рейтинг открыто доступных моделей, при этом стоимость одной задачи составляет лишь малую долю от цены конкурентов. Такой прирост стал результатом масштабного расширения обучения с подкреплением, хотя компанию также обвиняют в заимствовании данных у Claude от Anthropic.

По данным Xiaomi, старшая из двух новых моделей, MiMo-V2.6-Pro, набирает 46 баллов в Intelligence Index аналитической компании Artificial Analysis. Это делает её самой сильной открыто доступной ИИ-моделью на данный момент — впереди таких конкурентов, как Kimi K3 и Qwen. Но самое впечатляющее — цена: $0,435 за миллион входных токенов и $0,87 за миллион выходных токенов.

Согласно расчётам Artificial Analysis, одна тестовая задача стоит всего около $0,13 — лишь малую долю того, что взимают модели сопоставимой мощности. Это помещает модель на так называемую границу Парето по уровню интеллекта и стоимости.

Image: Artificial Analysis
Изображение: Artificial Analysis

Pro — это модель со смесью экспертов, содержащая 1,02 триллиона параметров, из которых при каждом запросе активируются только 42 миллиарда. Вместе с ней представлена меньшая и более эффективная MiMo-V2.6-Flash.

Прирост обеспечило обучение с подкреплением

Xiaomi связывает скачок производительности с существенно расширенным обучением с подкреплением (RL), то есть обучением методом проб, обратной связи и вознаграждения. Компания масштабировала этот этап по трём направлениям: больше данных на каждый шаг обучения, более разнообразные среды выполнения задач и больше вычислительных ресурсов для оценки решений.

По словам Xiaomi, процесс занял менее шести дней и стоил около $2,62 млн для Pro и $0,85 млн для Flash. В тесте программирования DeepSWE результат Pro вырос с 58,4 до 72,6, а Flash — с 48,8 до 65,7.

Чтобы сохранить стабильность обучения в таком масштабе, Xiaomi зафиксировала внутренний механизм распределения модели и добавила несколько уровней защиты от «взлома системы вознаграждений» — уловок, с помощью которых модель получает вознаграждение, фактически не решая задачу.

Около 7 000 задач с автоматическими оценщиками

Вместе с моделями Xiaomi выпускает особенно быструю версию под названием Pro-UltraSpeed, обеспечивающую скорость генерации до 20 раз выше. Но особенно примечательно то, что компания открывает свой набор инструментов для RL, включая технический отчёт, полный фреймворк обучения, меньшую модель для дальнейшего обучения и около 7 000 готовых обучающих задач с автоматическими оценщиками для разработки программного обеспечения, кибербезопасности, офисной работы и веб-дизайна, а также примерно 1 000 задач для сочинения музыки.

Задачи происходят из разных источников. Часть кода взята из реальных запросов пользователей и pull request’ов сотрудников на GitHub, тогда как другие описания задач сгенерированы языковой моделью. Киберзадачи основаны на OSS-Fuzz — наборе из десятков тысяч реальных уязвимостей программного обеспечения, — а офисные среды воссозданы синтетически.

Показательно открытая — и попавшая под прицел Anthropic

Эта демонстрация открытости резко контрастирует с обвинениями, которые Anthropic выдвинула всего двумя неделями ранее. В своём отчёте о киберугрозах Anthropic рассмотрела случаи злоупотребления Claude, выявленные в период с декабря 2025 года по август 2026 года, и назвала семь китайских лабораторий, связанных с кампаниями против модели: Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax и SenseTime.

Всего, как утверждается, эти лаборатории сгенерировали около 190 миллионов обменов сообщениями, чтобы извлечь возможности Claude для обучения собственных моделей. Anthropic называет эту технику незаконной дистилляцией.

Xiaomi упоминается по имени. В деле с обозначением GTG-16008 Anthropic отследила более 400 000 обменов за 20 дней в марте и апреле 2026 года: Xiaomi передавала пользовательские разговоры и сеансы программирования из собственных моделей MiMo через OpenClaw и OpenCode в Claude, стремясь обогатить обучающие данные для будущих моделей. В отчёте почти нет сведений о том, откуда поступили исходные обучающие и эталонные данные для внутренней дистилляции моделей-учителей.

Иными словами, в отчёте утверждается, что Xiaomi записывала разговоры пользователей со своими моделями MiMo, а затем передавала их в Claude для извлечения обучающих данных — тех самых данных, которые теперь вывели её на вершину рейтингов открытых моделей.

Новости ИИ без хайпа — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: MiMo

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости