Exa запускает Agent Ultra: API для глубоких исследований с роем субагентов, созданное для исчерпывающего составления списков
Exa выпустила Agent Ultra — самый высокий уровень усилий в её API Exa Agent. Он предназначен для исследований, которые должны выполняться до полного исчерпания возможностей: создания больших списков, обогащения данных о сущностях и ответов на вопросы, требующие анализа тысяч источников. Команда Exa сообщает, что Ultra превосходит Opus 5.5, GPT-6 Astra и Perplexity Agent, каждый из которых работал на максимальном уровне усилий, в 4 исследовательских бенчмарках.
Можно ли его развернуть? Да, в виде размещённого API. Agent Ultra уже доступен в API Exa — для его включения нужно указать effort: "ultra". Это не модель с открытыми весами, и самостоятельно разместить её нельзя.
Что такое Exa Agent Ultra?
Exa Agent разделяет задачу на подзадачи и назначает субагентов для одновременного исследования нескольких областей. Он направляет передовые модели на этапы, где они необходимы, а более быстрые модели — туда, где их возможностей достаточно. Ultra — это режим, который использует больше всего вычислительных ресурсов. Согласно документации Agent Ultra, он работает дольше любого другого режима усилий, чтобы возвращать наиболее полные результаты.
Запуски Ultra обычно выполняют сложные задачи примерно за 30 минут. Очень сложные задачи могут занимать до 3 часов.
Результаты бенчмарков
Все приведённые ниже показатели взяты из публикации Exa о запуске. Конкурирующие системы работали с максимальными настройками усилий.
| Бенчмарк (метрика) | Agent Ultra | Opus 5.5 | GPT-6 Astra | Perplexity Agent |
|---|---|---|---|---|
| WANDR (мягкая полнота) | 81.4% | 72.3% | 26.0% | 40.1% |
| DeepSearchQA (F1) | 93.9% | 77.6% | 85.3% | 89.7% |
| WideSearch (F1 на уровне строк) | 58.9% | 51.6% | 54.7% | 56.0% |
| Company Find-All (среднее число прошедших проверку сущностей на задачу) | 2,451 | 146 | 113 | 98 |
Exa сопровождает каждый результат заявлением о стоимости:
- WANDR: на 12,6% выше, чем у Opus 5.5, при вдвое меньшей стоимости одной задачи.
- DeepSearchQA: на 4,7% выше, чем у Perplexity, при стоимости одной задачи на 46% ниже, чем у GPT-6 Astra.
- WideSearch: на 5,2% выше, чем у Perplexity, при самой низкой стоимости одной задачи среди 4 систем.
- Company Find-All: на 1579% выше, чем у Opus 5.5, при самой низкой стоимости одной найденной сущности.
Эти показатели отражают относительный прирост, а не процентные пункты. В WANDR абсолютный разрыв с Opus 5.5 составляет 9,1 пункта.
Как понимать эти цифры
WANDR — это бенчмарк Perplexity, включающий 500 широких и углублённых задач по сбору данных, с открытым инструментарием. Грейдер Exa использует ту же логику оценки, что и исходная система. Он заменяет инструмент работы с контентом на Exa, изменяет логику передачи данных и использует gpt-6-luna в качестве оценщика. Если поставщик уже публиковал результат в этом инструментарии, Exa сообщает этот показатель. В остальных случаях Exa самостоятельно запускала бенчмарк.
DeepSearchQA — это многоэтапный бенчмарк поиска Google DeepMind, содержащий 900 запросов. WideSearch проверяет широкий сбор информации. Exa оценила до 200 задач для WANDR и DeepSearchQA и по 100 задач для WideSearch и Company Find-All. Количество оценённых задач различается у разных поставщиков. Все результаты представлены самими поставщиками и пока не были независимо воспроизведены.
Место Agent Ultra
Exa выделяет 3 целевые группы пользователей:
- Поставщики моделей: сбор обучающих данных, например всех статей и репозиториев, реализующих определённый метод. Проверка таких критериев, как «опубликованные веса, а не только API».
- Финансовые компании: создание рыночных карт для комплексной проверки, проведение исследований KYC по документам и судебным материалам, а также мониторинг сигналов портфеля.
- Команды выхода на рынок: создание списков компаний и обогащение строк оценочными полями, каждое из которых подтверждается указанным URL.
Ultra также может расширить существующий список. Передайте уже имеющиеся строки, и они будут исключены из новых результатов.
API, стоимость и элементы управления
Ultra использует стандартную конечную точку запуска Agent. Запрос поддерживает outputSchema, input.data и потоковую передачу.
from exa_py import Exa
exa = Exa()
run = exa.agent.runs.create(
query="Find all companies building browser automation tools in the United States.",
effort="ultra",
)
run = exa.agent.runs.poll_until_finished(run.id, timeout_ms=3 * 60 * 60 * 1000)
print(run.stop_reason)- Стоимость: рассчитывается по стандартным тарифам использования Agent, по умолчанию — до 20 долларов за запуск. Запуски, завершившиеся раньше, стоят дешевле.
- Бюджет:
maxCostDollarsпринимает значения от 1 до 100 долларов.maxDurationSecondsпринимает значения от 300 до 10 800 секунд. - Остановка: вызов остановки досрочно завершает запуск, сохраняет его результаты и списывает стоимость использования на этот момент.
- Тайм-ауты: вспомогательные функции опроса SDK по умолчанию завершаются по тайм-ауту через 1 час, поэтому задайте более длительный тайм-аут или передавайте события в потоковом режиме.
- Совместимость с OpenAI: в разделе /responses укажите
reasoning.effort: "ultra"в потоковом режиме или в фоновом режиме.
Протестировать систему можно в песочнице Exa API.
Сравнение
Главные выводы
- Agent Ultra — это режим Agent с максимальным уровнем усилий, уже доступный через API.
- Он координирует параллельных субагентов и сочетает передовые и более быстрые модели.
- Exa сообщает о лучших результатах на WANDR, DeepSearchQA, WideSearch и Company Find-All.
- По умолчанию запуски стоят до 20 долларов; сумму можно изменить в диапазоне от 1 до 100 долларов.
- Обычные запуски занимают около 30 минут, максимальная продолжительность составляет 3 часа.
Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подпишитесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией 150k+ и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.