Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Linkup Research випустила SPARSEUP: відкриту розріджену модель вбудовувань зі 149 млн параметрів

Дослідницька команда Linkup випускає SPARSEUP — модель розріджених вкладень із відкритим кодом, навчену на даних. Модель працює на основі ModernBERT зі 149 млн параметрів і поширюється за ліцензією Apache 2.0. Команда Linkup повідомляє про середній показник nDCG@10 на рівні 56,4 на BEIR-13. Вона називає цю модель найсильнішим загальнодоступним розрідженим енкодером на основі словника з відомих їй моделей із менш ніж 150 млн параметрів.

Чи придатна вона для розгортання? Так. Ваги доступні на Hugging Face за ліцензією Apache 2.0. Модель завантажується через Transformers або Sentence Transformers із параметром trust_remote_code=True.

Чому розріджена модель і чому саме зараз

Більшість відкритих моделей пошуку є щільними: 1 вектор на текст. Натомість розріджені моделі виводять ваги для словника. Кожен вимір відповідає реальному токену, тому вектори можна зберігати в інвертованих індексах, а люди можуть їх читати. Вони також зазвичай добре знаходять рідкісні слова.

Поштовхом став реліз DenseOn і LateOn від LightOn. LightOn опублікувала відкриті дані, рецепт навчання, щільну модель і модель із пізньою взаємодією. SPARSEUP заповнює відсутню розріджену позицію. Вона використовує те саме сімейство базових моделей і дані для донавчання, тож усі 3 стилі пошуку можна порівнювати безпосередньо.

Як створено SPARSEUP

Навчання починається з LateOn-unsupervised. Ця контрольна точка не мала голови MLM, тому команда повторно додала оригінальну голову ModernBERT. Для донавчання використано суміш даних для донавчання від LightOn лише з контрастивним навчанням. Для кожного запиту відбирається 7 складних негативних прикладів із пулу з 50, а також використовуються негативні приклади в межах пакета. Дистиляції за допомогою перехресного енкодера немає, а навчання вміщується на одному H100.

Звичайна SPLADE на цій базовій моделі створювала величезні набори, переповнені стоп-словами. Linkup виправила це за допомогою 3 змін:

  • Зсув логітів: Енкодер обчислює log(1 + ReLU(x - 15)). Логіти MLM у ModernBERT були надто високими, через що логарифм насичувався, а набори ставали щільними вже під час ініціалізації.
  • Top-k для кожної позиції: Кожен вхідний токен зберігає лише свої 12 найсильніших вимірів словника перед об’єднанням методом max pooling. Це обмежує розширення для кожного токена, а не загальний розмір вектора.
  • Зведення регістру: BPE на рівні байтів зберігає heat, Heat, Ġheat і ĠHeat як окремі ідентифікатори. SPARSEUP зводить їх до 1 ідентифікатора й зберігає найбільшу вагу. Кількість вихідних вимірів зменшується приблизно з 50 тис. до приблизно 34 тис.

Для запитів і документів використовуються префікси [Q] і [D], а оцінювання виконується як скалярний добуток. Максимальна довжина під час оцінювання становить 128 токенів для запитів і 512 для документів.

Результати тестування

Порівняно з іншими розрідженими енкодерами на BEIR-13 (nDCG@10, без MS MARCO), згідно з карткою моделі:

МодельСереднє BEIR-13
SPARSEUP56,4
opensearch-neural-sparse-encoding-doc-v3-gte54,6
opensearch-neural-sparse-encoding-v152,44
ModernBERT-VT52,4
splade-v351,7
granite-embedding-30m-sparse50,6
LACONIC-1B (1 млрд параметрів, інший клас розміру)58,7

Контрольоване порівняння виглядає менш вражаюче. За однакових базової моделі й даних LateOn набирає 58,9, DenseOn — 57,9, а SPARSEUP — 56,4. SPARSEUP використовує приблизний пошук Seismic, тоді як LightOn повідомляє про точний пошук. SPARSEUP перемагає в ArguAna і Touché та випереджає DenseOn у HotpotQA. Вона поступається на більш семантичних наборах, причому найбільший розрив спостерігається у FiQA. DBPedia — ще одна слабка сторона.

На очищеному від забруднення BEIR розрив із DenseOn скорочується до 0,17 бала. Linkup попереджає, що очищені від забруднення NQ і MS MARCO містять лише 21 і 46 запитів відповідно, тому ці результати є нестабільними.

Швидкість і розрідженість

На MS MARCO SPARSEUP у середньому має 47 ненульових термів на запит і 190 на документ. Для SPLADE-v3 ці показники становлять 25 і 170. Використовуючи інвертований індекс Seismic, модель досягає понад 97% повноти порівняно з точним пошуком приблизно за 380 мікросекунд на запит в однопотоковому режимі. Linkup зазначає, що збільшення розміру вектора могло б додати від 1 до 2 балів BEIR, але команда вирішила зберегти розрідженість.

Основні висновки

  • SPARSEUP — перша відкрита модель Linkup Research: розріджений енкодер зі 149 млн параметрів за ліцензією Apache 2.0.
  • Вона набирає 56,4 nDCG@10 на BEIR-13 — найкращий результат серед загальнодоступних розріджених енкодерів із менш ніж 150 млн параметрів, за даними Linkup.
  • Її визначають 3 виправлення: зсув логітів на 15, розширення top-12 для кожного токена та зведення регістру.
  • За однакових даних вона поступається DenseOn на 1,52 бала, а LateOn — на 2,5 бала на BEIR-13.
  • На MS MARCO вона досягає понад 97% повноти приблизно за 380 мкс на запит із Seismic.

Перегляньте ваги моделі та технічні деталі. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини