Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Liquid AI пуска с отворен код Pipette: възпроизводим пакет за сравнителни тестове, който измерва едновременно моделите на устройството, квантизацията, средата за изпълнение и хардуера

Картите на моделите отчитат качеството при условия със сървърен клас хардуер и пълна точност. Тези числа рядко предсказват как същият модел се държи на телефон. Тази седмица Liquid AI представи Pipette. Това е платформа с отворен код за бенчмаркинг на фундаментални модели върху периферийни устройства, създадена в партньорство с Artificial Analysis като независим валидатор на методологията. Pipette разглежда поведението на устройството като свойство на внедрената система, а не на модела сам по себе си. Нейната единица за измерване е пълна конфигурация: модел + квантизация + среда за изпълнение + устройство. Наборът от данни при старта обхваща пет показателя за производителност на устройството в повече от 1000 конфигурации модел × квантизация × среда за изпълнение × устройство × контекст, включващи над 30 модела, компилации на llama.cpp за macOS, iOS, Windows и Android и дължини на контекста от 256 до 8192 токена. Първоначалните проверени резултати са получени от MacBook Pro с M5 Max, iPhone 17 Pro и Galaxy S26 Ultra. Практическото твърдение може да бъде проверено: два модела с 350 млн. параметъра при една и съща квантизация на един и същ телефон запазват съответно 78,4% и 33,8% от пропускателната способност при декодиране при 4096 токена.

Готова ли е за внедряване?

Да, Pipette се предоставя като инфраструктура с лиценз Apache 2.0 (pipette-mgmt, pipette-clients, pipette-scores), публичен набор от резултати, хоствано табло и собствени бенчмарк приложения за iOS и Android. Няма списък с чакащи. Публикуването на резултати, изпратени от общността, все още е в бета версия.

  • Кои компании: Всеки екип, който внедрява модел върху хардуер, който не притежава. Самостоятелни разработчици и стартъпи в начален етап могат да използват таблото и приложенията без инфраструктура. Продуктовите екипи от средния пазар могат да изпълняват клиентите върху вътрешен парк от устройства. Големи производители на оригинално оборудване, производители на чипове и предприятия могат да управляват целия процес зад собствената си защитна стена.
  • Индустрии: Производители на потребителска електроника и смартфони, автомобилна индустрия, промишленост и роботика, медицински устройства, финансови услуги, отбраната — навсякъде, където латентността, поверителността или свързаността налагат извеждането на инференса върху устройството.
  • Приложения: Избор на модел и квантизация преди започването на спринт; валидиране на доставката на SoC и хардуер; регресионно тестване при актуализация на среда за изпълнение, операционна система или драйвер; планиране на капацитета спрямо дължината на контекста; независимо потвърждение на твърденията на доставчиците за производителност.

Какво представи Liquid AI

Liquid AI представи Pipette в партньорство с Artificial Analysis, независим валидатор, който прегледа и потвърди методологията. Основната идея е ясна и полезна: поведението на устройството е свойство на внедрената система, а не на модела сам по себе си.

Наборът от данни при старта обхваща пет показателя за производителност на устройството в повече от 1000 конфигурации модел × квантизация × среда за изпълнение × устройство × контекст. Той включва над 30 модела, множество формати за квантизация, компилации на llama.cpp за macOS, iOS, Windows и Android и дължини на контекста от 256 до 8192 токена. Първоначално публикуваните резултати са получени от MacBook Pro с M5 Max, iPhone 17 Pro и Galaxy S26 Ultra, като резултатите за AMD Ryzen AI Max+ 395 и Radeon 8060S са отбелязани като предстоящи.

В Pipette единицата за измерване е конфигурация за внедряване: модел + квантизация + среда за изпълнение + устройство. След това бенчмаркът определя показателя и формата на токените, като генерира резултат за латентност, пропускателна способност или памет. Качеството се проследява отделно в IFBench, GPQA Diamond и MATH-500. Тези оценки за качеството понастоящем идват от оценъчни изпълнения на llama.cpp върху референтни системи с NVIDIA H100 80GB, след което се съпоставят с изпълненията на устройството, използващи същия модел и квантизация — оценката за качество, показана до пропускателната способност на телефона, не е получена на телефона.

Защо контекстът на внедряването променя отговора

Четири публикувани сравнения показват доколко една конфигурация може да промени дадено решение:

  • Мащабирането спрямо контекста може да се разминава при идентичен брой параметри. При Q4_K_M на Galaxy S26 Ultra Granite-4.0-H-350M запазва 78,4% от пропускателната си способност при декодиране при преминаване от 256 към 4096 входни токена, докато Granite-4.0-350M запазва само 33,8%.
  • Разредената активация осигурява скорост, но не и по-малко памет. При 2048 входни токена на същия телефон LFM2.5-8B-A1B декодира 2,4 пъти по-бързо от Qwen3.5-4B и 2,6 пъти по-бързо от Ministral-3-3B-Instruct-2512. На токен се активират 1,5 млрд. от общо 8,5 млрд. параметъра, но пиковото потребление все пак достига 5,29 GiB, тъй като теглата на всички експерти заемат памет.
  • Скоростта и качеството не се намират на едно и също място. На iPhone 17 Pro при Q4_K_M MiniCPM5-1B завършва работно натоварване с 2048 входни и 256 изходни токена за 3,47 секунди в сравнение с 4,12 секунди за LFM2.5-1.2B-Instruct, което е 15,8% намаление на изминалото време. При същите артефакти LFM постига с 9,0 точки по-висок резултат на MATH-500.
  • Почти идентичните профили на системата могат да прикриват обрати на ниво задача. При Q4_K_M и 2048 входни токена на M5 Max Granite-4.1-8B и Ministral-3-8B-Instruct-2512 се различават с 2,4% по пропускателна способност при декодиране и с 1,2% по пикова оперативна памет. Granite води IFBench със 7,3 точки, а Ministral води GPQA Diamond с 14,0 точки.

Как се получават измерванията

Изпълненията за производителност следват публикувана методология: фиксирани форми на токените, алчно декодиране, отхвърлен тест за загряване, пет измерени повторения и проверка за готовност. Преди всяко измервано повторение специфична за платформата проверка потвърждава термичните условия и натоварването; неуспешните изпълнения не се публикуват. Оценките използват отделен протокол с детерминистично оценяване, независимо от модела, а pipette-scores не получава информация за произхода на генерирането. Всяко изпращане записва версията на бенчмарка, формата на токените, артефакта на модела, квантизацията, версията и настройките на средата за изпълнение, както и хардуера и операционната система на устройството.

Интерактивно обяснение

Основни изводи

  • Pipette бенчмаркира конфигурации, а не модели: модел + квантизация + среда за изпълнение + устройство.
  • Стек с лиценз Apache 2.0, над 1000 конфигурации, над 30 модела и три проверени устройства при старта.
  • Оценките за качество се изпълняват върху референтни системи с H100 и се съпоставят с производителността на устройството, а не се измерват на самото устройство.
  • Идентичният брой параметри може да доведе до разлика от 78,4% спрямо 33,8% при запазването на производителността при мащабиране на контекста.

Разгледайте техническите подробности и класацията. Също така можете да ни следвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини