Keenable AI пуска с отворен код NEEDLE: бенчмарк за търсене в реално време, който изгражда наново набора си от заявки всеки час
Как се оценява API за уеб търсене, когато тестваната система може да прочете ключа с отговорите? Един агент за търсене разполага с инструмент за извличане. Ако златните етикети се намират в публичен набор от данни, агентът може да ги изтегли по време на оценяването и изцяло да прескочи извличането. Подобен проблем възниква, когато отговорите вече са кодирани в параметричната памет на модела: правилният отговор вече не доказва, че уеб търсенето е проработило. Отговорът на Keenable е NEEDLE — актуален бенчмарк с отворен код, който изгражда наново набора си от заявки от свежи публични източници, вместо да замразява един-единствен набор. Новинарските заявки се генерират отново на всеки час от RSS емисии и Google Trends; заявките за финанси, научна литература, право и редки обекти се генерират ежедневно от SEC XBRL, arXiv, Europe PMC, CourtListener и публични логове на агенти. Петнадесет API за търсене работят с един и същ текст на заявката по един протокол, а всеки резултат се сравнява с ultimate — обединен оракулен двигател, който отбелязва какво е успяла да открие цялата област.
Възпроизводимо ли е?
Да, като харнес за оценяване с отворен код, а не като продукт. needle е Python CLI, инсталиран с uv sync и управляван чрез две подкоманди за всеки бенчмарк — generate и run. Необходим е OpenRouter ключ за оценяването и по един API ключ за всеки тестван двигател; системата работи на лаптоп или в CI. Тя позволява възстановяването на всички използвани потоци от заявки в допълнение към оценките на качеството на класирането.
Какво измерва NEEDLE
NEEDLE означава News, Everyday, Expert, Deep-tail и Legal Evaluation. Всяка вертикала моделира различно намерение на агента. News превръща най-новия елемент от около 124 подбрани RSS емисии и Google Trends в заявка по ключова дума. Finance търси регистрационни факти от Wikidata и GLEIF, както и данни от един отчет за тримесечие 10-Q от SEC XBRL. Scholar превръща една научна статия в четири типа заявки: заглавие с влошено качество, детайл, наличен само в пълния текст, подсказка на естествен език и предпазливо описание на нещо, което е на върха на езика. Deep-tail избира заявки с редки думи от публични публикации на траектории на агенти, включително DeepResearchGym, OpenResearcher и LRAT. Legal извлича скорошни решения от CourtListener от 14 федерални съдилища и раздели от eCFR.
Оценяването следва същото разделение. Новините и deep-tail нямат един-единствен правилен резултат, затова LLM оценител поставя оценка от 0 до 4 за всеки резултат, а харнесът отчита nDCG@5 с наказание за дублирани URL адреси. Finance отчита answer-recall@5: достига ли фактът до агента в рамките на откъс от топ 5. Scholar и legal са задачи за намиране на известен елемент, оценявани чрез съвпадение на идентификатори.
Горната граница е интересната част
Всеки двигател получава един и същ текст на заявката. Рънърът изпраща по едно извикване наведнъж, така че процентилите на латентността са сравними и нито един двигател не поема паралелно натоварване. Оценяването се извършва върху собственото класиране, заглавията и откъсите на двигателя. Страниците никога не се извличат и резултатите никога не се класират повторно. Доказателствата са ограничени до 2 000 знака за всички, а оценителят не вижда името на двигателя.
По-интересното число е ultimate ceiling. За всяка заявка NEEDLE обединява резултатите, върнати от всички двигатели, в синтетичен оракулен двигател, след което подрежда комбинирания набор по релевантност. Така се създава емпирична горна граница, основана на това, което цялата област е успяла да извлече.
Следователно разликата спрямо ultimate е горна граница на качеството на агентното търсене към днешна дата. Голяма разлика означава, че са съществували по-добри резултати, но никой двигател не е успял да ги покаже или класира добре. Нисък резултат на ultimate означава нещо различно: дори след обединяването на всички доставчици бенчмаркът е открил малко надеждни доказателства. С други думи, NEEDLE може да различи проблем с класирането от проблем с извличането, споделян от целия пазар.
Къде всъщност се намира областта
Числата по-долу са публикувани 7-дневни средни стойности за периода, приключващ на 2026-08-28.
Finance е близо до решаването: Exa 0.910, Keenable 0.872, Perplexity 0.871, Google 0.847 при ultimate от 0.965. Scholar показва по-голямо разсейване — от Keenable 0.774 до Tavily 0.310 при горна граница 0.869, тъй като на заявките по заглавие може да се отговори чрез метаданни, а на заявките по съдържание — не. Deep-tail е най-трудната категория и е най-близо до реалния трафик от агенти: Exa води с 0.557 от ultimate, Keenable следва с 0.470, а Bing е на 0.199. Разликата между доставеното и постижимото качество се увеличава с приближаването на заявките до начина, по който агентите действително търсят.
Латентността е друг важен показател тук, тъй като агентите извикват търсене десетки пъти за всяка задача. Същият период: Keenable-realtime 193 ms p50 / 284 ms p95, Exa 1 876 / 2 955, Bing 2 767 / 9 381.
Основни изводи
- NEEDLE генерира отново заявките на всеки час за новините и ежедневно за останалите четири вертикали, така че няма фиксиран набор, към който да се пригоди системата.
- Пет вертикали, 15 API за търсене, един протокол: един и същ текст на заявката, един и същ лимит от 2 000 знака за доказателствата, една заявка наведнъж.
- Всяка класация се отчита спрямо ultimate — обединен оракулен двигател, който обозначава горната граница, достигната от цялата област.
- При заявки за редки обекти от реални логове на агенти водещият двигател достига 0.557 от тази горна граница; при Finance повечето двигатели се групират между 0.77 и 0.91.
- Кодът е с лиценз MIT, изпълненията се извършват в публични GitHub Actions, а артефактите от всяко изпълнение се публикуват в набор от данни на Hugging Face.
Разгледайте таблото на живо, GitHub хранилището, техническия материал и архивираните артефакти. Заслугата е изцяло на изследователите на този проект.
Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.