Sakhanda Wire
NVDA $219.74 -2.34% MSFT $481.63 +0.27% GOOGL $344.20 +0.06% META $543.67 -4.45% AMZN $259.45 -0.71%
← К новостям

Новый бенчмарк ранжирует поисковые API для ИИ-агентов по качеству, стоимости и скорости

Новый бенчмарк оценивает поисковые API для ИИ-агентов по качеству, стоимости и скорости
Matthias Bastian
18 авг. 2026
Nano Banana Pro по запросу THE DECODER

Artificial Analysis выпустила «Search Index» — бенчмарк, который оценивает, насколько хорошо провайдеры поисковых API работают с ИИ-агентами с точки зрения качества, стоимости и скорости.

В первоначальный список вошли Parallel, Exa, Firecrawl, You.com, Tavily, Keenable и Brave. Каждый из них тестируется с одной и той же моделью (GPT-5.6 Luna) в стандартизированной конфигурации агента. Меняется только поисковый провайдер. Агент работает на базе Stirrup — фреймворка с открытым исходным кодом от Artificial Analysis — и получает 25 запусков на каждую задачу для поиска и загрузки веб-страниц.

Индекс объединяет три равновесных бенчмарка. DeepSearchQA содержит 900 исследовательских вопросов, каждый из которых требует нескольких поисковых запросов. Подмножество BrowseComp проверяет 200 труднодоступных фактов, для поиска которых нужна многоэтапная работа с веб-страницами. AA-Omniscience охватывает 600 вопросов в шести областях знаний. Базовый вариант без инструментов, в котором модель отвечает самостоятельно, служит точкой сравнения.

Без доступа к поиску модель набирает всего 33 балла. При использовании поиска результаты варьируются от 65 до 75 баллов. Parallel, Exa и Firecrawl лидируют с результатами 75, 74 и 73 балла соответственно. | Изображение: Artificial Analysis

Более высокое качество поиска также снижает общие расходы. Модель использует меньше токенов, когда сразу получает хорошие результаты. При использовании Parallel Search (advanced) расход токенов снижается более чем на 40 процентов по сравнению с Basic. Стоимость поиска для одной задачи возрастает, но общая стоимость оказывается ниже ($0.084 против $0.11).

Высокая скорость обработки отдельного запроса не всегда означает более быстрый результат в целом. Parallel Search (turbo) показывает самое короткое время ответа на запрос (0.51 секунды против 1.03 секунды у Basic), но из-за более низкого качества (67 против 73) агенту приходится выполнять больше итераций. В итоге общее время на задачу оказывается примерно одинаковым.

По данным Artificial Analysis, Parallel, Firecrawl и Parallel (turbo) обеспечивают лучшее сочетание стоимости и производительности. Другие провайдеры могут подать заявку на участие в бенчмарке. Полная методология опубликована в открытом доступе.

Новости об ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный аналитический отчет о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.

Источник: через X

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости