Доступный флагманский ИИ Xiaomi возглавил открытые модели, а Anthropic заявляет, что Claude помог ему добиться этого
Ключевые моменты
- Новая модель Xiaomi MiMo-V2.6-Pro возглавляет текущие рейтинги открытых ИИ-моделей и при этом стоит значительно дешевле конкурентов.
- Xiaomi добилась скачка производительности благодаря расширенному обучению с подкреплением, а компания открыто опубликовала свои инструменты и обучающие задания.
- В то же время Anthropic обвиняет Xiaomi в неправомерном извлечении данных через модель Claude для обучения собственной линейки моделей.
Xiaomi выпустила линейку MiMo-V2.6, и флагманская модель возглавляет рейтинг открыто доступных моделей, при этом стоимость одной задачи составляет лишь малую долю от цены конкурентов. Такой прирост стал результатом масштабного расширения обучения с подкреплением, хотя компанию также обвиняют в заимствовании данных у Claude от Anthropic.
По данным Xiaomi, старшая из двух новых моделей, MiMo-V2.6-Pro, набирает 46 баллов в Intelligence Index аналитической компании Artificial Analysis. Это делает её самой сильной открыто доступной ИИ-моделью на данный момент — впереди таких конкурентов, как Kimi K3 и Qwen. Но самое впечатляющее — цена: $0,435 за миллион входных токенов и $0,87 за миллион выходных токенов.
Согласно расчётам Artificial Analysis, одна тестовая задача стоит всего около $0,13 — лишь малую долю того, что взимают модели сопоставимой мощности. Это помещает модель на так называемую границу Парето по уровню интеллекта и стоимости.

Pro — это модель со смесью экспертов, содержащая 1,02 триллиона параметров, из которых при каждом запросе активируются только 42 миллиарда. Вместе с ней представлена меньшая и более эффективная MiMo-V2.6-Flash.
Прирост обеспечило обучение с подкреплением
Xiaomi связывает скачок производительности с существенно расширенным обучением с подкреплением (RL), то есть обучением методом проб, обратной связи и вознаграждения. Компания масштабировала этот этап по трём направлениям: больше данных на каждый шаг обучения, более разнообразные среды выполнения задач и больше вычислительных ресурсов для оценки решений.
По словам Xiaomi, процесс занял менее шести дней и стоил около $2,62 млн для Pro и $0,85 млн для Flash. В тесте программирования DeepSWE результат Pro вырос с 58,4 до 72,6, а Flash — с 48,8 до 65,7.
Чтобы сохранить стабильность обучения в таком масштабе, Xiaomi зафиксировала внутренний механизм распределения модели и добавила несколько уровней защиты от «взлома системы вознаграждений» — уловок, с помощью которых модель получает вознаграждение, фактически не решая задачу.
Около 7 000 задач с автоматическими оценщиками
Вместе с моделями Xiaomi выпускает особенно быструю версию под названием Pro-UltraSpeed, обеспечивающую скорость генерации до 20 раз выше. Но особенно примечательно то, что компания открывает свой набор инструментов для RL, включая технический отчёт, полный фреймворк обучения, меньшую модель для дальнейшего обучения и около 7 000 готовых обучающих задач с автоматическими оценщиками для разработки программного обеспечения, кибербезопасности, офисной работы и веб-дизайна, а также примерно 1 000 задач для сочинения музыки.
Задачи происходят из разных источников. Часть кода взята из реальных запросов пользователей и pull request’ов сотрудников на GitHub, тогда как другие описания задач сгенерированы языковой моделью. Киберзадачи основаны на OSS-Fuzz — наборе из десятков тысяч реальных уязвимостей программного обеспечения, — а офисные среды воссозданы синтетически.
Показательно открытая — и попавшая под прицел Anthropic
Эта демонстрация открытости резко контрастирует с обвинениями, которые Anthropic выдвинула всего двумя неделями ранее. В своём отчёте о киберугрозах Anthropic рассмотрела случаи злоупотребления Claude, выявленные в период с декабря 2025 года по август 2026 года, и назвала семь китайских лабораторий, связанных с кампаниями против модели: Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax и SenseTime.
Всего, как утверждается, эти лаборатории сгенерировали около 190 миллионов обменов сообщениями, чтобы извлечь возможности Claude для обучения собственных моделей. Anthropic называет эту технику незаконной дистилляцией.
Xiaomi упоминается по имени. В деле с обозначением GTG-16008 Anthropic отследила более 400 000 обменов за 20 дней в марте и апреле 2026 года: Xiaomi передавала пользовательские разговоры и сеансы программирования из собственных моделей MiMo через OpenClaw и OpenCode в Claude, стремясь обогатить обучающие данные для будущих моделей. В отчёте почти нет сведений о том, откуда поступили исходные обучающие и эталонные данные для внутренней дистилляции моделей-учителей.
Иными словами, в отчёте утверждается, что Xiaomi записывала разговоры пользователей со своими моделями MiMo, а затем передавала их в Claude для извлечения обучающих данных — тех самых данных, которые теперь вывели её на вершину рейтингов открытых моделей.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.