Sakhanda Wire
NVDA $219.74 -2.34% MSFT $481.63 +0.27% GOOGL $344.20 +0.06% META $543.67 -4.45% AMZN $259.45 -0.71%
← До новин

Новий бенчмарк ранжує пошукові API для ШІ-агентів за якістю, вартістю та швидкістю

Новий бенчмарк оцінює пошукові API для ШІ-агентів за якістю, вартістю та швидкістю
Matthias Bastian
18 серпня 2026 року
Nano Banana Pro за запитом THE DECODER

Artificial Analysis випустила «Search Index» — бенчмарк, який вимірює, наскільки добре постачальники пошукових API працюють для ШІ-агентів за показниками якості, вартості та швидкості.

До початкового переліку увійшли Parallel, Exa, Firecrawl, You.com, Tavily, Keenable і Brave. Кожен із них тестують на одній і тій самій моделі (GPT-5.6 Luna) у стандартизованому налаштуванні агента. Змінюється лише постачальник пошуку. Агент працює на базі Stirrup — фреймворку з відкритим кодом від Artificial Analysis — і отримує 25 запусків на кожне завдання для пошуку та завантаження вебсторінок.

Індекс поєднує три бенчмарки з однаковою вагою. DeepSearchQA містить 900 дослідницьких запитань, кожне з яких потребує кількох пошукових запитів. Підмножина BrowseComp перевіряє 200 складних для пошуку фактів, які потребують багатокрокового перегляду вебсторінок. AA-Omniscience охоплює 600 запитань у шести галузях знань. Базовий варіант без інструментів, у якому модель відповідає самостійно, є точкою порівняння.

Без доступу до пошуку модель набирає лише 33 бали. З пошуком результати становлять від 65 до 75 балів. Parallel, Exa і Firecrawl лідирують із результатами 75, 74 і 73 відповідно. | Зображення: Artificial Analysis

Вища якість пошуку також знижує загальні витрати. Модель використовує менше токенів, коли одразу отримує хороші результати. У разі використання Parallel Search (advanced) кількість використаних токенів зменшується більш ніж на 40 відсотків порівняно з базовою версією. Вартість пошуку на одне завдання зростає, але загальна вартість знижується ($0.084 проти $0.11).

Сира швидкість окремого запиту не завжди означає швидший результат загалом. Parallel Search (turbo) має найкоротший час відповіді на запит (0.51 секунди проти 1.03 секунди для Basic), але його нижча якість (67 проти 73) змушує агента виконувати більше проходів. Загальний час на завдання зрештою приблизно однаковий.

За словами Artificial Analysis, Parallel, Firecrawl і Parallel (turbo) забезпечують найкраще поєднання вартості та продуктивності. Інші постачальники можуть подати заявку на участь у бенчмарку. Повна методологія доступна публічно.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерело: через X

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини