Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Exa стартира Agent Ultra: API за задълбочено проучване с рояк от подагенти, създаден за изчерпателно съставяне на списъци

Exa пусна Agent Ultra, най-високото ниво на усилие в нейния Exa Agent API. То е създадено за изследвания, които трябва да се извършват до изчерпване: съставяне на големи списъци, обогатяване на данни за обекти и въпроси, които изискват хиляди източници. Екипът на Exa съобщава, че Ultra превъзхожда Opus 5.5, GPT-6 Astra и Perplexity Agent, всеки при максимално ниво на усилие, в 4 изследователски бенчмарка.

Може ли да бъде внедрен? Да, като хостван API. Agent Ultra е достъпен днес в Exa API чрез задаване на effort: "ultra". Той не е с отворени тегла и не може да бъде хостван самостоятелно.

Какво представлява Exa Agent Ultra?

Exa Agent разделя дадена задача на подзадачи и възлага на подагенти да изследват няколко области едновременно. Той насочва най-модерните модели към стъпките, които се нуждаят от тях, а по-бързи модели — там, където те са достатъчни. Ultra е режимът, който използва най-много изчислителни ресурси. Според документацията за Agent Ultra той работи по-дълго от всяко друго ниво на усилие, за да предостави най-пълните резултати.

Изпълненията на Ultra обикновено завършват сложни задачи за около 30 минути. Много трудните задачи могат да отнемат до 3 часа.

Резултати от бенчмарковете

Всички стойности по-долу са от публикацията на Exa при представянето. Конкурентите са работили при максималната си настройка за усилие.

Бенчмарк (метрика)Agent UltraOpus 5.5GPT-6 AstraPerplexity Agent
WANDR (soft recall)81.4%72.3%26.0%40.1%
DeepSearchQA (F1)93.9%77.6%85.3%89.7%
WideSearch (F1 на ниво ред)58.9%51.6%54.7%56.0%
Company Find-All (среден брой преминали проверката обекти на задача)2,45114611398

Exa свързва всеки резултат с твърдение за разходите:

  • WANDR: +12.6% спрямо Opus 5.5 при наполовина по-ниска цена на задача.
  • DeepSearchQA: +4.7% спрямо Perplexity при 46% по-ниска цена на задача от GPT-6 Astra.
  • WideSearch: +5.2% спрямо Perplexity при най-ниската цена на задача от 4-те системи.
  • Company Find-All: +1579% спрямо Opus 5.5 при най-ниската цена за намерен обект.

Тези увеличения са относителни, а не процентни пунктове. При WANDR абсолютната разлика спрямо Opus 5.5 е 9.1 пункта.

Как да разбираме тези числа

WANDR е бенчмаркът на Perplexity за 500 широки и задълбочени задачи за събиране на данни, с отворен набор от инструменти за оценяване. Оценяващата система на Exa споделя логиката за оценяване от оригиналната система. Тя заменя инструмента за съдържание с Exa, променя логиката за пренос и използва gpt-6-luna като оценяващ модел. Когато даден доставчик е публикувал резултат от тази система, Exa посочва тази стойност. В останалите случаи Exa е провела бенчмарка самостоятелно.

DeepSearchQA е многостъпков бенчмарк на Google DeepMind за търсене с 900 подсказки. WideSearch проверява широкото събиране на информация. Exa е оценила до 200 задачи за WANDR и DeepSearchQA и по 100 за WideSearch и Company Find-All. Броят на оценените задачи варира според доставчика. Всички резултати са докладвани от доставчиците и все още не са независимо възпроизведени.

Къде се вписва Agent Ultra

Exa посочва 3 целеви групи потребители:

  • Доставчици на модели: съставяне на тренировъчни данни, например всяка статия и хранилище, реализиращи дадена техника. Проверка на критерии като „публикувани тегла, а не само API“.
  • Финансови услуги: създаване на пазарни карти за комплексна проверка, провеждане на KYC проучвания във финансови отчети и съдебни регистри и наблюдение на сигнали от портфейли.
  • Екипи за излизане на пазара: създаване на списъци с акаунти и обогатяване на редове с полета, изискващи преценка, като всеки от тях е подкрепен от цитиран URL адрес.

Ultra може също да разширява съществуващ списък. Предайте редовете, с които вече разполагате, и те ще бъдат изключени от новите резултати.

API, ценообразуване и контроли

Ultra използва стандартната крайна точка за изпълнение на Agent. Заявката поддържа outputSchema, input.data и поточно предаване.

Копирай кодаКопираноИзползвай друг браузър
from exa_py import Exa

exa = Exa()
run = exa.agent.runs.create(
    query="Find all companies building browser automation tools in the United States.",
    effort="ultra",
)
run = exa.agent.runs.poll_until_finished(run.id, timeout_ms=3 * 60 * 60 * 1000)
print(run.stop_reason)
  • Ценообразуване: таксуването се извършва според използването при стандартните тарифи за използване на Agent, до стандартен максимум от 20 долара на изпълнение. Изпълненията, които завършват по-рано, струват по-малко.
  • Бюджет: maxCostDollars приема стойности от 1 до 100 долара. maxDurationSeconds приема стойности от 300 до 10 800 секунди.
  • Спиране: заявка за спиране прекратява изпълнението по-рано, запазва резултатите му и таксува използването до този момент.
  • Изтичане на времето: помощните функции за анкети в SDK изтичат след 1 час по подразбиране, затова задайте по-дълъг период или предавайте поточно събитията.
  • Съвместимост с OpenAI: в /responses задайте reasoning.effort: "ultra" с поточно предаване или фонов режим.

Можете да го изпробвате в Exa API Playground.

Сравнение

Основни изводи

  • Agent Ultra е режимът с най-високо ниво на усилие в Exa Agent и вече е достъпен чрез API.
  • Той координира паралелни подагенти и комбинира най-модерни и по-бързи модели.
  • Exa съобщава за най-високи резултати при WANDR, DeepSearchQA, WideSearch и Company Find-All.
  • Изпълненията струват до 20 долара по подразбиране, като сумата може да се настройва от 1 до 100 долара.
  • Типичните изпълнения отнемат около 30 минути, с максимална продължителност от 3 часа.

Разгледайте техническите подробности. Цялата заслуга е за изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини