Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Liquid AI відкрила код Pipette: відтворюваний набір тестів, що одночасно вимірює моделі на пристрої, квантування, середовище виконання та апаратне забезпечення

У картках моделей якість зазначається в умовах серверного класу та повної точності. Ці показники рідко передбачають, як та сама модель поводитиметься на телефоні. Цього тижня Liquid AI випустила Pipette. Це платформа з відкритим кодом для бенчмаркінгу базових моделей на периферійних пристроях, створена у партнерстві з Artificial Analysis, яка виступила незалежним валідатором методології. Pipette розглядає поведінку на пристрої як властивість розгорнутої системи, а не моделі окремо. Її одиницею вимірювання є повна конфігурація: модель + квантизація + середовище виконання + пристрій. Набір даних на момент запуску охоплює п’ять метрик продуктивності на пристрої для понад 1 000 конфігурацій модель × квантизація × середовище виконання × пристрій × контекст, включаючи понад 30 моделей, збірки llama.cpp для macOS, iOS, Windows та Android і довжини контексту від 256 до 8 192 токенів. Початкові перевірені результати отримано на MacBook Pro з M5 Max, iPhone 17 Pro та Galaxy S26 Ultra. Практичне твердження можна перевірити: дві моделі на 350 млн параметрів за однакової квантизації на тому самому телефоні зберігають 78,4% та 33,8% пропускної здатності декодування за 4 096 токенів.

Чи придатна вона для розгортання?

Так, Pipette постачається як інфраструктура за ліцензією Apache 2.0 (pipette-mgmt, pipette-clients, pipette-scores), загальнодоступний набір результатів, розміщену панель моніторингу, а також нативні застосунки для бенчмаркінгу на iOS та Android. Жодних списків очікування немає. Публікація результатів, надісланих спільнотою, усе ще перебуває на стадії бета-тестування.

  • Які компанії: будь-яка команда, яка постачає модель на обладнання, що їй не належить. Окремі розробники та стартапи на ранніх стадіях можуть користуватися панеллю й застосунками без інфраструктури. Продуктові команди середнього бізнесу можуть запускати клієнти на внутрішньому парку пристроїв. Великі виробники оригінального обладнання, постачальники чипів і підприємства можуть працювати з усім конвеєром за власним мережевим екраном.
  • Галузі: виробники споживчої електроніки та смартфонів, автомобільна промисловість, промисловість і робототехніка, медичні пристрої, фінансові послуги, оборона — будь-де, де затримка, конфіденційність або підключення змушують виконувати інференс на пристрої.
  • Застосування: вибір моделі та квантизації до початку спринту; перевірка закупівлі SoC і обладнання; регресійне тестування під час оновлення середовища виконання, ОС або драйвера; планування місткості з урахуванням довжини контексту; незалежна перевірка заяв постачальників щодо продуктивності.

Що випустила Liquid AI

Liquid AI випустила Pipette у партнерстві з Artificial Analysis — незалежним валідатором, який перевірив і підтвердив методологію. Передумова є вузькою, але корисною: поведінка на пристрої є властивістю розгорнутої системи, а не моделі окремо.

Набір даних на момент запуску охоплює п’ять метрик продуктивності на пристрої для понад 1 000 конфігурацій модель × квантизація × середовище виконання × пристрій × контекст. Він охоплює понад 30 моделей, кілька форматів квантизації, збірки llama.cpp для macOS, iOS, Windows та Android і довжини контексту від 256 до 8 192 токенів. Початкові опубліковані результати отримано на MacBook Pro з M5 Max, iPhone 17 Pro та Galaxy S26 Ultra; результати для AMD Ryzen AI Max+ 395 і Radeon 8060S буде опубліковано незабаром.

У Pipette одиницею вимірювання є конфігурація розгортання: модель + квантизація + середовище виконання + пристрій. Потім бенчмарк визначає метрику та форму токенів, формуючи результат щодо затримки, пропускної здатності або пам’яті. Якість відстежується окремо на IFBench, GPQA Diamond та MATH-500. Наразі ці показники якості отримано під час оцінювання в llama.cpp на еталонних системах NVIDIA H100 80GB, а потім зіставлено з результатами на пристроях, де використовуються та сама модель і квантизація — показник якості, наведений поруч із пропускною здатністю телефону, не було отримано на телефоні.

Чому контекст розгортання змінює відповідь

Чотири опубліковані порівняння демонструють, наскільки конфігурація може змінити рішення:

  • Масштабування контексту може відрізнятися за однакової кількості параметрів. За Q4_K_M на Galaxy S26 Ultra модель Granite-4.0-H-350M зберігає 78,4% пропускної здатності декодування під час переходу від 256 до 4 096 вхідних токенів, тоді як Granite-4.0-350M зберігає лише 33,8%.
  • Розріджена активація забезпечує швидкість, але не економію пам’яті. За 2 048 вхідних токенів на тому самому телефоні LFM2.5-8B-A1B декодує у 2,4 раза швидше за Qwen3.5-4B і в 2,6 раза швидше за Ministral-3-3B-Instruct-2512. Вона активує 1,5 млрд із 8,5 млрд параметрів на кожен токен, проте пікове споживання пам’яті все одно становить 5,29 ГіБ, оскільки ваги всіх експертів займають пам’ять.
  • Швидкість і якість не завжди поєднуються. На iPhone 17 Pro за Q4_K_M модель MiniCPM5-1B виконує робоче навантаження 2 048 вхідних / 256 вихідних токенів за 3,47 секунди проти 4,12 секунди для LFM2.5-1.2B-Instruct, що означає скорочення загального часу на 15,8%. На тих самих артефактах LFM набирає на 9,0 бала більше на MATH-500.
  • Майже ідентичні профілі системи можуть приховувати протилежні результати на рівні завдань. За Q4_K_M і 2 048 вхідних токенів на M5 Max Granite-4.1-8B та Ministral-3-8B-Instruct-2512 відрізняються на 2,4% за пропускною здатністю декодування та на 1,2% за піковим обсягом оперативної пам’яті. Granite випереджає IFBench на 7,3 бала, а Ministral — GPQA Diamond на 14,0 бала.

Як отримують вимірювання

Вимірювання продуктивності проводяться відповідно до опублікованої методології: фіксовані форми токенів, жадібне декодування, відкинутий прогрів, п’ять вимірюваних повторів і перевірка готовності. Перед кожним вимірюваним повтором перевірка з урахуванням платформи підтверджує теплові умови та рівень навантаження; невдалі запуски не публікуються. Оцінювання використовує окремий протокол із детермінованим оцінюванням без урахування моделі, а pipette-scores не бачить походження генерації. Кожен результат містить версію бенчмарку, форму токенів, артефакт моделі, квантизацію, версію та налаштування середовища виконання, а також апаратне забезпечення пристрою й ОС.

Інтерактивне пояснення

Основні висновки

  • Pipette тестує конфігурації, а не моделі: модель + квантизація + середовище виконання + пристрій.
  • Стек Apache 2.0, понад 1 000 конфігурацій, понад 30 моделей і три перевірені пристрої на момент запуску.
  • Оцінювання якості виконується на еталонних H100 і зіставляється з продуктивністю на пристроях, а не вимірюється на самих пристроях.
  • Однакова кількість параметрів може давати різницю від 78,4% до 33,8% у збереженні показників під час масштабування контексту.

Ознайомтеся з технічними деталями та таблицею лідерів. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини