Доступний флагманський ШІ Xiaomi очолив відкриті моделі, а Anthropic заявляє, що Claude допоміг йому цього досягти
Ключові моменти
- Нова модель Xiaomi MiMo-V2.6-Pro очолює поточні рейтинги відкритих моделей ШІ, коштуючи значно дешевше за конкурентів.
- Xiaomi досягла такого стрибка продуктивності завдяки розширеному навчанню з підкріпленням, а компанія відкрито випустила свої інструменти та навчальні завдання.
- Водночас Anthropic звинувачує Xiaomi в неналежному вилученні даних через модель Claude для навчання власної лінійки моделей.
Xiaomi випустила лінійку MiMo-V2.6, і флагманська модель очолює рейтинг загальнодоступних моделей, коштуючи за виконання завдання лише частину ціни конкурентів. Таких результатів вдалося досягти завдяки масштабному розширенню навчання з підкріпленням, хоча компанію також звинувачують у запозиченні напрацювань Anthropic Claude.
За даними Xiaomi, більша з двох нових моделей, MiMo-V2.6-Pro, набирає 46 балів за індексом інтелекту аналітичної компанії Artificial Analysis. Це робить її найпотужнішою загальнодоступною моделлю ШІ на цей момент — попереду таких конкурентів, як Kimi K3 і Qwen. Найцікавіше — ціна: $0,435 за мільйон вхідних токенів і $0,87 за мільйон вихідних токенів.
За підрахунками Artificial Analysis, одне тестове завдання коштує лише близько $0,13 — це частка вартості, яку стягують моделі зі схожими можливостями. Таким чином, модель опинилася на так званому фронті Парето за показниками інтелекту та вартості.

Pro — це модель суміші експертів із 1,02 трильйона параметрів, з яких для кожного запиту активними є лише 42 мільярди. Поруч із нею розташована менша й ефективніша MiMo-V2.6-Flash.
Результати зросли завдяки навчанню з підкріпленням
Xiaomi пояснює стрибок продуктивності значним розширенням навчання з підкріпленням (RL), тобто навчанням методом спроб, отримання зворотного зв’язку та винагороди. Компанія масштабувала цей етап за трьома напрямами: збільшила обсяг даних на кожен крок навчання, урізноманітнила середовища виконання завдань і надала більше обчислювальних ресурсів для оцінювання рішень.
За словами Xiaomi, процес тривав менш як шість днів і коштував близько $2,62 млн для Pro та $0,85 млн для Flash. У тесті програмування DeepSWE результат Pro зріс із 58,4 до 72,6 бала, а Flash — із 48,8 до 65,7.
Щоб зберегти стабільність навчання в такому масштабі, Xiaomi заморозила внутрішній механізм розподілу моделі та додала кілька рівнів захисту від «злому системи винагород», тобто прийомів, за допомогою яких модель обходить систему винагород, фактично не розв’язуючи завдання.
Близько 7 000 завдань з автоматичними оцінювачами
Разом із моделями Xiaomi випускає особливо швидку версію під назвою Pro-UltraSpeed, яка забезпечує до 20 разів вищу швидкість генерації. Найбільше вирізняється те, що компанія відкриває свій набір інструментів для RL, зокрема технічний звіт, повний навчальний фреймворк, меншу модель для подальшого навчання і близько 7 000 готових навчальних завдань з автоматичними оцінювачами для розробки програмного забезпечення, кібербезпеки, офісної роботи та вебдизайну, а також приблизно 1 000 завдань для створення музики.
Завдання походять із різних джерел. Частина коду взята з реальних запитів користувачів і pull request у GitHub, створених працівниками, тоді як інші описи завдань генерує мовна модель. Кіберзавдання спираються на OSS-Fuzz — колекцію з десятків тисяч реальних вразливостей програмного забезпечення, а офісні середовища відтворені синтетично.
Показова відкритість і приціл Anthropic
Така демонстрація відкритості різко контрастує зі звинуваченнями, які Anthropic висунула лише два тижні тому. У своєму звіті про аналіз загроз Anthropic розглянула випадки зловживання Claude, виявлені в період із грудня 2025 року до серпня 2026 року, і назвала сім китайських лабораторій, пов’язаних із кампаніями проти моделі: Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax і SenseTime.
Загалом, як стверджується, лабораторії згенерували близько 190 мільйонів обмінів повідомленнями, щоб вилучити можливості Claude для навчання власних моделей — методику, яку Anthropic називає незаконною дистиляцією.
Xiaomi згадується поіменно. У справі з позначкою GTG-16008 Anthropic відстежила понад 400 000 обмінів повідомленнями протягом 20 днів у березні та квітні 2026 року. За її даними, Xiaomi передавала розмови користувачів і сеанси програмування зі своїх моделей MiMo через OpenClaw і OpenCode до Claude, прагнучи збагатити навчальні дані для майбутніх моделей. У звіті майже немає документальних підтверджень того, звідки походили попередні навчальні дані та дані вчителя для внутрішньої дистиляції моделей-учителів.
Іншими словами, у звіті стверджується, що Xiaomi записувала розмови користувачів зі своїми моделями MiMo, а потім передавала їх Claude для вилучення навчальних даних — тих самих даних, які тепер вивели її на вершину рейтингу відкритих моделей.
Новини ШІ без галасу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ та наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, мати повний доступ до архіву й доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.