Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Достъпният флагмански ИИ на Xiaomi оглави отворените модели, а Anthropic твърди, че Claude е помогнал за това

Достъпният флагмански AI модел на Xiaomi води при отворените модели, а Anthropic твърди, че Claude му е помогнал да стигне дотам
Максимилиан Шрайер
22 септември 2026 г.
Xiaomi

Основни акценти

  • Новият модел MiMo-V2.6-Pro на Xiaomi оглавява актуалните класации на отворените AI модели, като струва значително по-малко от конкурентите.
  • Xiaomi постигна скока в производителността чрез разширено обучение с подсилване, а компанията публикува инструментите и задачите за обучение с отворен достъп.
  • Междувременно Anthropic обвинява Xiaomi, че неправомерно извлича данни чрез модела Claude, за да обучава собствената си линия модели.

Xiaomi пусна своята линия MiMo-V2.6, а флагманският модел оглавява класациите сред свободно достъпните модели, като струва само малка част от цената на конкурентите за задача. Подобренията са резултат от мащабно разширен етап на обучение с подсилване, макар че компанията е обвинявана и че е заимствала от Claude на Anthropic.

Според Xiaomi по-големият от двата нови модела, MiMo-V2.6-Pro, получава 46 точки в Intelligence Index на аналитичната фирма Artificial Analysis. Това го прави най-силния свободно достъпен AI модел в момента, пред конкуренти като Kimi K3 и Qwen. Най-впечатляваща е цената: 0,435 долара за милион входни токени и 0,87 долара за милион изходни токени.

Според изчисленията на Artificial Analysis една тестова задача струва само около 0,13 долара — малка част от цената, която моделите със сходни възможности обикновено таксуват. Така моделът попада на т.нар. граница на Парето по отношение на интелигентност и цена.

Изображение: Artificial Analysis
Изображение: Artificial Analysis

Pro е модел от типа „смес от експерти“ с 1,02 трилиона параметъра, от които само 42 милиарда са активни при всяка заявка. Наред с него се предлага по-малкият и по-ефективен MiMo-V2.6-Flash.

Подобренията са резултат от обучение с подсилване

Xiaomi отдава скока в производителността на значително разширеното обучение с подсилване (RL), тоест обучение чрез проби, обратна връзка и награди. Компанията е разширила този етап по три направления: повече данни за всяка стъпка на обучение, по-разнообразни среди със задачи и повече изчислителни ресурси за оценяване на решенията.

Обучението е продължило по-малко от шест дни, посочва Xiaomi, и е струвало около 2,62 милиона долара за Pro и 0,85 милиона долара за Flash. При теста за програмиране DeepSWE резултатът на Pro се е повишил от 58,4 на 72,6, докато този на Flash е нараснал от 48,8 на 65,7.

За да поддържа обучението стабилно при този мащаб, Xiaomi е замразила вътрешния механизъм за разпределение на модела и е добавила няколко нива на защита срещу „хакване на наградата“ — триковете, чрез които моделът манипулира наградите, без действително да решава задачата.

Около 7000 задачи с автоматични оценители

Заедно с моделите Xiaomi пуска особено бърз вариант, наречен Pro-UltraSpeed, с до 20 пъти по-висока скорост на генериране. Най-впечатляващото е, че компанията предоставя с отворен достъп своя набор от инструменти за RL, включително техническия доклад, пълната рамка за обучение, по-малък модел за допълнително обучение и около 7000 готови задачи за обучение с автоматични оценители за разработка на софтуер, киберсигурност, офис работа и уеб дизайн, както и приблизително 1000 задачи за композиране на музика.

Задачите идват от различни източници. Част от кода е взет от реални заявки за промени в GitHub, направени от служители, и от потребителски заявки, докато други описания на задачи са генерирани от езиков модел. Киберзадачите се основават на OSS-Fuzz — колекция от десетки хиляди реални уязвимости в софтуера, а офис средите са пресъздадени синтетично.

Демонстративно отворен — и в полезрението на Anthropic

Тази демонстрация на откритост рязко контрастира с обвиненията, които Anthropic отправи само преди две седмици. В своя доклад за разузнаването на заплахи Anthropic е проучила случаи на злоупотреба с Claude, установени между декември 2025 г. и август 2026 г., и е назовала седем китайски лаборатории, свързани с кампании срещу модела: Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax и SenseTime.

Твърди се, че общо лабораториите са генерирали около 190 милиона обмена, за да извлекат способностите на Claude с цел обучение на собствените си модели — техника, която Anthropic нарича незаконна дестилация.

Xiaomi е посочена поименно. По случай с обозначение GTG-16008 Anthropic е проследила повече от 400 000 обмена в рамките на 20 дни през март и април 2026 г., при които Xiaomi е прекарала потребителски разговори и сесии за програмиране от собствените си модели MiMo през OpenClaw и OpenCode към Claude, с цел обогатяване на данните за обучение на бъдещи модели. Докладът почти не предоставя информация откъде са дошли по-ранните данни за обучение и данните от учителя за вътрешната дестилация на учителските модели.

Казано по друг начин, в доклада се твърди, че Xiaomi е записвала потребителски разговори с моделите си MiMo, а след това ги е подавала към Claude, за да извлича данни за обучение — същите данни, които сега са издигнали модела до върха на класациите за отворени модели.

AI новини без сензацията – подбрани от хора

Абонирайте се за THE DECODER, за да получавате четене без реклами, седмичен AI бюлетин, ексклузивния ни обзор на водещите разработки „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.

Източник: MiMo

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини