Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Liquid AI открыла исходный код Pipette: воспроизводимый набор тестов, одновременно измеряющий модели на устройстве, квантование, среду выполнения и аппаратное обеспечение

В карточках моделей качество указывается для серверных условий и вычислений с полной точностью. Эти показатели редко предсказывают, как та же модель будет работать на телефоне. На этой неделе Liquid AI представила Pipette. Это платформа с открытым исходным кодом для тестирования базовых моделей на периферийных устройствах, созданная в партнерстве с Artificial Analysis в качестве независимого валидатора методологии. Pipette рассматривает поведение на устройстве как свойство развернутой системы, а не модели в изоляции. Единицей измерения является полная конфигурация: модель + квантование + среда выполнения + устройство. Набор данных на момент запуска охватывает пять показателей производительности на устройстве для более чем 1 000 конфигураций вида «модель × квантование × среда выполнения × устройство × контекст», включая более 30 моделей, сборки llama.cpp для macOS, iOS, Windows и Android, а также длину контекста от 256 до 8 192 токенов. Первые проверенные результаты получены на MacBook Pro с M5 Max, iPhone 17 Pro и Galaxy S26 Ultra. Практическое утверждение можно проверить: две модели объемом 350M при одинаковом квантовании на одном и том же телефоне сохраняют 78,4% и 33,8% пропускной способности декодирования при 4 096 токенах.

Готово ли это к развертыванию?

Да, Pipette распространяется как инфраструктура под лицензией Apache 2.0 (pipette-mgmt, pipette-clients, pipette-scores), включает общедоступный набор результатов, размещенную панель мониторинга, а также нативные приложения для тестирования на iOS и Android. Лист ожидания отсутствует. Публикация результатов, представленных сообществом, пока находится в бета-режиме.

  • Какие компании: Любая команда, развертывающая модель на оборудовании, которым она не владеет. Индивидуальные разработчики и стартапы на ранних стадиях могут пользоваться панелью мониторинга и приложениями без собственной инфраструктуры. Команды продуктовых компаний среднего размера могут запускать клиенты на внутреннем парке устройств. Крупные производители оригинального оборудования, поставщики чипов и предприятия могут развернуть весь конвейер за собственным межсетевым экраном.
  • Отрасли: Производители потребительской электроники и смартфонов, автомобильная промышленность, промышленность и робототехника, медицинские устройства, финансовые услуги, оборонная отрасль — везде, где задержка, конфиденциальность или подключение к сети требуют выполнения вывода на устройстве.
  • Применения: Выбор модели и квантования до утверждения спринта; проверка закупаемых SoC и оборудования; регрессионное тестирование при обновлении среды выполнения, ОС или драйвера; планирование емкости с учетом длины контекста; независимая проверка заявлений поставщиков о производительности.

Что выпустила Liquid AI

Liquid AI представила Pipette в партнерстве с Artificial Analysis — независимым валидатором, который проверил и подтвердил методологию. Предпосылка проста и полезна: поведение на устройстве является свойством развернутой системы, а не модели в изоляции.

Набор данных на момент запуска охватывает пять показателей производительности на устройстве для более чем 1 000 конфигураций вида «модель × квантование × среда выполнения × устройство × контекст». Он включает более 30 моделей, несколько форматов квантования, сборки llama.cpp для macOS, iOS, Windows и Android, а также длину контекста от 256 до 8 192 токенов. Первые опубликованные результаты получены на MacBook Pro с M5 Max, iPhone 17 Pro и Galaxy S26 Ultra; результаты для AMD Ryzen AI Max+ 395 и Radeon 8060S будут представлены позднее.

В Pipette единицей измерения является конфигурация развертывания: модель + квантование + среда выполнения + устройство. Затем бенчмарк определяет метрику и форму токенов, выдавая результат по задержке, пропускной способности или памяти. Качество отдельно отслеживается на наборах IFBench, GPQA Diamond и MATH-500. В настоящее время эти показатели качества получены в ходе оценочных запусков llama.cpp на эталонных системах с NVIDIA H100 80GB, а затем сопоставляются с запусками на устройствах, использующими ту же модель и квантование — показатель качества, отображаемый рядом с пропускной способностью телефона, не был получен на телефоне.

Почему контекст развертывания меняет ответ

Четыре опубликованных сравнения показывают, насколько конфигурация может повлиять на решение:

  • Масштабирование контекста может различаться при одинаковом количестве параметров. При Q4_K_M на Galaxy S26 Ultra модель Granite-4.0-H-350M сохраняет 78,4% пропускной способности декодирования при увеличении входного контекста с 256 до 4 096 токенов, тогда как Granite-4.0-350M сохраняет лишь 33,8%.
  • Разреженная активация повышает скорость, но не уменьшает потребление памяти. При входном контексте в 2 048 токенов на том же телефоне LFM2.5-8B-A1B декодирует в 2,4 раза быстрее, чем Qwen3.5-4B, и в 2,6 раза быстрее, чем Ministral-3-3B-Instruct-2512. На каждый токен она активирует 1,5B из 8,5B параметров, однако пиковое потребление памяти все равно достигает 5,29 GiB, поскольку веса всех экспертов занимают память.
  • Скорость и качество не всегда сочетаются. На iPhone 17 Pro при Q4_K_M MiniCPM5-1B выполняет задачу с 2 048 входными и 256 выходными токенами за 3,47 секунды против 4,12 секунды у LFM2.5-1.2B-Instruct, что означает сокращение времени выполнения на 15,8%. На тех же артефактах LFM получает на 9,0 балла больше на MATH-500.
  • Почти идентичные профили системы могут скрывать противоположные результаты на уровне задач. При Q4_K_M и входном контексте в 2 048 токенов на M5 Max Granite-4.1-8B и Ministral-3-8B-Instruct-2512 различаются на 2,4% по пропускной способности декодирования и на 1,2% по пиковому объему оперативной памяти. Granite опережает по IFBench на 7,3 балла, а Ministral — по GPQA Diamond на 14,0 балла.

Как формируются измерения

Производительные запуски выполняются в соответствии с опубликованной методологией: фиксированные формы токенов, жадное декодирование, отбрасываемый прогрев, пять измеряемых повторов и проверка готовности. Перед каждым измеряемым повтором выполняется проверка условий температуры и нагрузки, специфичная для платформы; не прошедшие проверку запуски не публикуются. Оценки используют отдельный протокол с детерминированным оцениванием, не зависящим от модели, а pipette-scores не получает информацию о происхождении генерации. Для каждой отправки фиксируются версия бенчмарка, форма токенов, артефакт модели, квантование, версия и настройки среды выполнения, а также аппаратное обеспечение и ОС устройства.

Интерактивное объяснение

Основные выводы

  • Pipette тестирует конфигурации, а не модели: модель + квантование + среда выполнения + устройство.
  • Стек Apache 2.0, более 1 000 конфигураций, более 30 моделей и три проверенных устройства на момент запуска.
  • Оценки качества выполняются на эталонных системах с H100 и сопоставляются с производительностью на устройстве, а не измеряются на самом устройстве.
  • Модели с одинаковым количеством параметров могут различаться по сохранению производительности при масштабировании контекста: 78,4% против 33,8%.

Ознакомьтесь с техническими подробностями и таблицей лидеров. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тыс. участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости