Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Keenable AI открывает исходный код NEEDLE: бенчмарка для поиска в реальном времени, который каждый час заново формирует набор запросов

Как тестировать API веб-поиска, если тестируемая система может прочитать ключ ответов? Поисковый агент располагает инструментом загрузки. Если эталонные метки находятся в общедоступном наборе данных, агент может скачать их в ходе оценки и полностью пропустить этап поиска. Аналогичная проблема возникает, когда ответы уже закодированы в параметрической памяти модели: правильный ответ больше не доказывает, что веб-поиск действительно сработал. Ответ Keenable — это NEEDLE, открытый бенчмарк в реальном времени, который формирует набор запросов заново на основе свежих общедоступных источников, а не фиксирует один неизменный набор. Новостные запросы генерируются каждый час из RSS-лент и Google Trends; запросы для финансов, научных публикаций, права и редких сущностей генерируются ежедневно на основе SEC XBRL, arXiv, Europe PMC, CourtListener и общедоступных журналов работы агентов. Пятнадцать поисковых API работают с одним и тем же текстом запроса по единому протоколу, а каждый результат сравнивается с ultimate — объединённым эталонным движком, который отмечает, что удалось найти всей отрасли.

Воспроизводим ли он?

Да, как инструмент оценки с открытым исходным кодом, а не как продукт. needle — это Python CLI, устанавливаемый с помощью uv sync и управляемый двумя подкомандами для каждого бенчмарка: generate и run. Для его работы необходим ключ OpenRouter для выставления оценок и отдельный API-ключ для каждого тестируемого движка; запускать его можно на ноутбуке или в CI. Он позволяет воссоздавать все используемые потоки запросов, а также оценки качества ранжирования.

Что измеряет NEEDLE

NEEDLE расшифровывается как News, Everyday, Expert, Deep-tail и Legal Evaluation — оценка новостей, повседневных, экспертных, узкоспециализированных и юридических запросов. Каждый вертикальный раздел моделирует отдельное намерение агента. Новости преобразуют самый свежий материал примерно из 124 отобранных RSS-лент и Google Trends в запрос по ключевым словам. Финансовый раздел запрашивает факты из реестров Wikidata и GLEIF, а также показатели за один квартал из форм 10-Q в SEC XBRL. Научный раздел преобразует одну статью в четыре стиля запросов: ухудшенное название, деталь, доступную только в полном тексте, подсказку на естественном языке и осторожное описание в духе «вертится на кончике языка». Deep-tail выбирает запросы с редкими словами из общедоступных наборов траекторий агентов, включая DeepResearchGym, OpenResearcher и LRAT. Юридический раздел извлекает недавние решения CourtListener по 14 федеральным судам и разделы eCFR.

Оценка разделена по тому же принципу. Для новостей и deep-tail нет единственного правильного результата, поэтому LLM-судья оценивает каждый результат от 0 до 4, а инструмент сообщает показатель nDCG@5 со штрафом за дублирующиеся URL. Финансовый раздел использует показатель answer-recall@5: попадает ли нужный факт к агенту в один из пяти лучших фрагментов. Научные и юридические задачи относятся к задачам поиска известного объекта и оцениваются по совпадению идентификаторов.

Самое интересное — верхняя граница

Каждый движок получает один и тот же текст запроса. Средство запуска отправляет по одному вызову за раз, поэтому процентили задержки можно сравнивать, а ни один движок не получает параллельную нагрузку. Оценивание проводится на основе собственного ранжирования, заголовков и фрагментов движка. Страницы никогда не загружаются, а результаты никогда не ранжируются повторно. Для всех доказательства ограничиваются 2 000 символами, и судья не видит название движка.

Более интересным показателем является ultimate ceiling — предельный уровень. Для каждого запроса NEEDLE объединяет результаты, возвращённые всеми движками, в синтетический эталонный движок, а затем сортирует полученный набор по релевантности. Так создаётся эмпирическая верхняя граница, основанная на том, что удалось найти всей отрасли.

Таким образом, разрыв с ultimate представляет собой верхнюю границу качества агентского поиска на сегодняшний день. Большой разрыв означает, что лучшие результаты существовали, но ни одному движку не удалось хорошо их обнаружить или ранжировать. Низкий показатель ultimate означает другое: даже после объединения результатов всех поставщиков бенчмарк обнаружил мало убедительных свидетельств. Иными словами, NEEDLE способен отличить проблему ранжирования от проблемы поиска, общей для всего рынка.

На каком уровне на самом деле находится отрасль

Приведённые ниже значения — опубликированные средние за 7 дней для периода, завершившегося 2026-08-28.

Финансовый поиск близок к решённой задаче: Exa — 0.910, Keenable — 0.872, Perplexity — 0.871, Google — 0.847 при показателе ultimate 0.965. В научном поиске разброс больше: от 0.774 у Keenable до 0.310 у Tavily при верхней границе 0.869, поскольку на вопросы по названию можно ответить на основе метаданных, а на вопросы по содержанию статьи — нет. Deep-tail — самая сложная категория и наиболее близкая к реальному трафику агентов: Exa лидирует с показателем 0.557 от ultimate, за ним следует Keenable с 0.470, а Bing получает 0.199. Разрыв между достигнутым и потенциально достижимым качеством увеличивается по мере приближения запросов к тому, как агенты действительно ищут информацию.

Задержка также является важным показателем, поскольку агенты выполняют десятки поисковых запросов за одну задачу. За тот же период: Keenable-realtime — 193 мс p50 / 284 мс p95, Exa — 1 876 / 2 955, Bing — 2 767 / 9 381.

Основные выводы

  • NEEDLE генерирует запросы для новостей каждый час, а для остальных четырёх вертикальных разделов — ежедневно, поэтому фиксированного набора, под который можно переобучиться, не существует.
  • Пять вертикальных разделов, 15 поисковых API, один протокол: одинаковый текст запроса, одинаковое ограничение доказательств в 2 000 символов и один запрос за раз.
  • Каждый рейтинг сравнивается с ultimate — объединённым эталонным движком, показывающим верхнюю границу, которой достигла вся отрасль.
  • В запросах о редких сущностях из реальных журналов работы агентов лучший движок достигает 0.557 этой верхней границы; в финансовой категории большинство движков получают от 0.77 до 0.91.
  • Код распространяется по лицензии MIT, запуски выполняются в общедоступных GitHub Actions, а артефакты каждого запуска публикуются в наборе данных Hugging Face.

Посмотрите панель мониторинга в реальном времени, репозиторий GitHub, техническое описание и архивные артефакты. Вся заслуга принадлежит исследователям этого проекта.

Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости