Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

H Company представя NeoMME: семейство от еднобашови мултимодални енкодери с 260 млн. и 800 млн. параметра, които премахват визуалната кула и каузалния декодер

Повечето визуални системи за извличане на документи, използвани днес в продукционна среда, са наследени решения. ColPali и моделите, които го последваха, вземат генеративен визуално-езиков модел и го преизползват като енкодер. В резултат все още се използват отделно предварително обучена визуална кула и каузален декодер, който никога не генерира токен. Това са допълнителни параметри и изчислителни разходи за задача, която се нуждае единствено от представяния.

H Company представи NeoMME — семейство от двупосочни енкодери с 260M и 800M параметъра, които премахват и двата компонента. Един Transformer обработва многоезични текстови токени и необработени RGB изображения, разделени на пачове 32×32, през едни и същи слоеве, като е обучен от случайна инициализация. Финото настройване за извличане, NeoMME-Retriever, достига 0.523 nDCG@10 в ViDoRe v3 при 260M параметъра.

Може ли да се внедри? Да. Всеки чекпойнт се разпространява под лиценза Apache 2.0 с поддръжка от първия ден в Hugging Face Transformers. Моделът с 260M параметъра индексира 51.3 страници в секунда на един NVIDIA L40S и кодира заявка за 78.3 ms на хост, използващ само CPU.

Една кула, две модалности

Текстът постъпва чрез факторизирано вграждане в стил ALBERT: справочна таблица с размерност 256, проектирана до ширината на модела. Изображенията се разделят на неприпокриващи се пачове 32×32 и се проектират чрез 2-слоен MLP, обучен от нулата. Няма модул за сливане на пачове и няма кула SigLIP2.

И двата модела поддържат контекст от 16 384 токена, достатъчен за две стандартни 3 840×2 160 4K UHD изображения след разделянето им на пачове. Повечето слоеве използват симетрично внимание с плъзгащ се прозорец; всеки шести слой и последният слой използват глобално внимание. Архитектурата използва внимание с групирани заявки, нормализация на заявките и ключовете, гейтирано внимание, двумерни ротационни позиционни вграждания и MLP със squared-ReLU. Точният брой параметри е съответно 262 937 906 и 793 715 032.

Токенизаторът е BPE без ограничение по отношение на интервалите, с речник от 131 072 записа, обучен от нулата. В 14-те целеви езика на FLORES-200 devtest той генерира с 44.4% по-малко токени от ModernBERT.

Обучен като дифузионен денойзър с маскиране

Предварителното обучение представлява дискретна маскирана дифузия върху текст, по избор обусловена от видими пачове на изображенията. При сегментите само с текст процентът на корупция се избира равномерно между 0 и 1. При мултимодалните сегменти се избира между 0.30 и 1, което премахва прекия път, основан само на езика, и принуждава модела да разчита страницата.

Аблационна сонда за между-модалността потвърждава, че това работи. При 90% маскиране видимите пачове на страницата повишават точността за маскираните токени с 38.4 пункта при модела с 260M параметъра и с 40.5 пункта при модела с 800M параметъра. При всяко изпълнение се обработват около 524 милиарда пакетирани входни токена, от които приблизително 290 милиарда са само текстови, съответно на 16 и 32 ускорителя H100.

Резултати от извличането

NeoMME-Retriever добавя две съвместно обучени глави върху споделения гръбнак: плътна глава със средно пулсиране и ширини Matryoshka, както и глава за късно взаимодействие, която проектира всеки токен и пач до 128 измерения. Едно предно подаване връща и двете.

Във ViDoRe v3 моделът с 260M параметъра постига 0.523 nDCG@10, а моделът с 800M — 0.556. Резултатът на модела с 260M параметъра е в рамките на 0.002 от ColQwen2.5-v0.2 с 3.75B параметъра и е с 26.1 пункта над най-добрия друг модел с под 300M параметъра. Моделът с 800M параметъра изостава с 0.9 пункта от сходния по размер Vultron Retriever Flash. Във ViDoRe v1 и v2 моделите достигат съответно 0.860/0.522 и 0.874/0.559 nDCG@5.

Извличането на текст е по-слабо. В BEIR-15 късното взаимодействие достига 0.4881 и 0.5126 спрямо 0.5722 за LateOn с 149M параметъра. Авторите отдават това отчасти на мащаба на надзора: NeoMME е видял приблизително 430K текстови примера със заявки спрямо около 660M контрастивни примера за mLateOn.

Съхранение и пропускателна способност

Индексите за късно взаимодействие са скъпи. Страница с размер 2048×2048 генерира 4 162 вектора, или около 1.5 MB на документ от ViDoRe v3 във формат float32. Два метода намаляват този размер. Йерархичното пулсиране на токени с коефициент 10, с int8 заявки и документи, дава 39.0 kB на страница — 39.4-кратно намаление при запазване на 99.16% от базовия nDCG@10. Коефициент на пулсиране 8 с int8 заявки и двоични документи дава 6.0 kB — 255.5-кратно намаление при запазване на 95.19%.

Индексирането е бързо предвид броя на векторите. При съпоставим вход 2048×2048 на един L40S NeoMME-260M кодира 51.3 страници в секунда спрямо 26.0 за ColModernVBERT — разлика от 1.97 пъти.

Интерактивно обяснение

Основни изводи

  • Един двупосочен Transformer обработва текст и необработени пачове от изображения, без визуална кула и без декодер.
  • NeoMME-Retriever-260M постига 0.523 nDCG@10 във ViDoRe v3, надминавайки всеки оценен модел под 800M параметъра.
  • Той се изравнява с ColQwen2.5 с 3.75B параметъра във ViDoRe v3, като е 14.4 пъти по-малък.
  • Пулсирането на токени плюс асиметричното квантуване намаляват индекса от приблизително 1.5 MB до 6 kB на страница.
  • Извличането само на текст и преносът към естествени изображения със замразени параметри остават ясни слаби места.

Разгледайте научната статия, колекцията от модели и демото. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово представяне, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини