Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Keenable AI відкриває код NEEDLE: бенчмарку для пошуку в реальному часі, який щогодини заново формує набір запитів

Як порівняти API вебпошуку, якщо об’єкт тестування може прочитати ключ відповідей? Пошуковий агент має інструмент fetch. Якщо еталонні мітки містяться в загальнодоступному наборі даних, агент може завантажити їх під час оцінювання й повністю пропустити пошук. Подібна проблема виникає, коли відповіді вже закодовані в параметричній пам’яті моделі: правильна відповідь більше не демонструє, що вебпошук спрацював. Відповіддю Keenable є NEEDLE — актуальний бенчмарк із відкритим кодом, який формує свій набір запитів заново зі свіжих загальнодоступних джерел, а не фіксує один набір. Новинні запити генеруються щогодини з RSS-стрічок і Google Trends; запити у сферах фінансів, наукових досліджень, права та рідкісних сутностей генеруються щодня на основі SEC XBRL, arXiv, Europe PMC, CourtListener і загальнодоступних журналів роботи агентів. П’ятнадцять пошукових API працюють з одним і тим самим текстом запиту за єдиним протоколом, а кожен результат оцінюється порівняно з ultimate — об’єднаним еталонним рушієм, який позначає все, що вдалося знайти всій галузі.

Чи можна це відтворити?

Так, як open-source інструментарій для оцінювання, а не як продукт. needle — це Python CLI, який встановлюється за допомогою uv sync і керується двома підкомандами для кожного бенчмарку: generate та run. Для оцінювання потрібен ключ OpenRouter і по одному API-ключу для кожного тестованого рушія; запуск можливий на ноутбуці або в CI. Він дає змогу відтворювати всі потоки запитів, що використовуються, на додаток до оцінок якості ранжування.

Що вимірює NEEDLE

NEEDLE розшифровується як News, Everyday, Expert, Deep-tail і Legal Evaluation. Кожен напрям моделює різний намір агента. News перетворює найновіший матеріал приблизно зі 124 відібраних RSS-стрічок і Google Trends на ключовий запит. Finance запитує реєстрові факти з Wikidata і GLEIF, а також показники 10-Q за один квартал із SEC XBRL. Scholar перетворює одну статтю на чотири стилі запитів: заголовок зі зниженою точністю, деталь, доступну лише в повному тексті, підказку природною мовою та обережний опис у стилі «вертиться на кінчику язика». Deep-tail відбирає запити з рідкісними словами з опублікованих наборів траєкторій агентів, зокрема DeepResearchGym, OpenResearcher і LRAT. Legal отримує нещодавні судові рішення CourtListener із 14 федеральних судів і розділи eCFR.

Оцінювання розділене за тим самим принципом. Новини та deep-tail не мають єдиного правильного результату, тому LLM-суддя оцінює кожен результат від 0 до 4, а інструментарій розраховує nDCG@5 зі штрафом за дублікати URL. Finance використовує показник answer-recall@5: чи потрапляє факт до агента в одному з п’яти найкращих фрагментів. Scholar і legal — це завдання на пошук відомого об’єкта, які оцінюються за збігом ідентифікатора.

Найцікавіше — верхня межа

Кожен рушій отримує однаковий текст запиту. Засіб запуску надсилає по одному виклику за раз, тому перцентилі затримки можна порівнювати, а жоден рушій не отримує паралельного навантаження. Оцінювання відбувається на основі власного ранжування, заголовків і фрагментів рушія. Сторінки ніколи не завантажуються, а результати не ранжуються повторно. Для всіх обсяг доказів обмежено 2 000 символами, і суддя не бачить назви рушія.

Цікавішим показником є ultimate ceiling. Для кожного запиту NEEDLE об’єднує результати, повернуті всіма рушіями, у синтетичний еталонний рушій, а потім упорядковує цей об’єднаний набір за релевантністю. Так створюється емпірична верхня межа, заснована на тому, що вдалося знайти всій галузі.

Отже, відставання від ultimate є верхньою межею якості агентного пошуку в його нинішньому стані. Великий розрив означає, що кращі результати існували, але жоден рушій не зміг добре їх виявити або ранжувати. Низький показник ultimate означає дещо інше: навіть після об’єднання результатів усіх постачальників бенчмарк знайшов небагато переконливих доказів. Іншими словами, NEEDLE може відрізнити проблему ранжування від проблеми пошуку, спільної для всього ринку.

Справжній стан галузі

Наведені нижче показники — опубліковані середні значення за 7 днів для періоду, що завершився 2026-08-28.

Фінанси майже вирішені: Exa — 0.910, Keenable — 0.872, Perplexity — 0.871, Google — 0.847, за показника ultimate 0.965. У Scholar розрив більший: від 0.774 у Keenable до 0.310 у Tavily за верхньої межі 0.869, оскільки на запити із заголовками можна відповісти за метаданими, а на запити щодо змісту — ні. Deep-tail є найскладнішим напрямом і найближчим до реального трафіку агентів: Exa лідирує з показником 0.557 від ultimate, Keenable іде далі з 0.470, а Bing має 0.199. Розрив між отриманою та досяжною якістю збільшується в міру того, як запити наближаються до того, як агенти здійснюють пошук на практиці.

Затримка тут також є важливим показником, оскільки агенти виконують десятки пошукових викликів за одне завдання. За той самий період: Keenable-realtime — 193 мс p50 / 284 мс p95, Exa — 1 876 / 2 955, Bing — 2 767 / 9 381.

Ключові висновки

  • NEEDLE генерує запити щогодини для новин і щодня для інших чотирьох напрямів, тож фіксованого набору для перенавчання немає.
  • П’ять напрямів, 15 пошукових API, один протокол: однаковий текст запиту, однакове обмеження доказів у 2 000 символів, один запит за раз.
  • Кожен рейтинг розглядається порівняно з ultimate — об’єднаним еталонним рушієм, який позначає верхню межу, досягнуту всією галуззю.
  • У запитах щодо рідкісних сутностей із реальних журналів роботи агентів найкращий рушій досягає 0.557 цієї верхньої межі; у фінансових запитах більшість рушіїв перебуває в діапазоні від 0.77 до 0.91.
  • Код поширюється за ліцензією MIT, запуски виконуються в загальнодоступних GitHub Actions, а артефакти кожного запуску публікуються в наборі даних Hugging Face.

Перегляньте актуальну інформаційну панель, репозиторій GitHub, технічний матеріал і архівні артефакти. Уся подяка належить дослідникам цього проєкту.

Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини