Sakhanda Wire
NVDA $219.74 -2.34% MSFT $481.63 +0.27% GOOGL $344.20 +0.06% META $543.67 -4.45% AMZN $259.45 -0.71%
← К новостям

Сколько памяти на самом деле нужно вашему агенту?

Сколько памяти на самом деле нужно вашему агенту?
Для предприятий Статья
Опубликовано 18 августа 2026 года
В нашем предыдущем посте мы сравнили ALTK-Evolve с ACE и показали, что то, как вы предоставляете агенту его самостоятельно дистиллированные рекомендации — несколько извлечённых для каждой задачи или весь набор, внедрённый целиком, — определяет и точность, и стоимость. В этой публикации мы возвращаемся к предшествующему вопросу: сколько ему следует предоставить?

Оснастить агента агентной памятью кажется простым: извлечь уроки из его прошлой работы, вернуть их в контекст — и чем больше опыта, тем выше должна быть производительность. Но так бывает не всегда. Когда мы расширили оценивание до восьми моделей — от плотной модели на 30 млрд параметров до передовых проприетарных систем, — особенно выделился один вывод:

Агентная память — не функция, которую можно просто включить. Это дозировка, которую нужно подобрать под модель.

Кратко

  • ALTK-Evolve позволяет агенту учиться на собственных прошлых траекториях: извлекать универсальные рекомендации и возвращать их во время инференса без обновления весов и аннотации человеком.

  • Подходящая дозировка различается в зависимости от уровня модели: сильным моделям, у которых есть запас для улучшения, нужен полный набор рекомендаций; более слабые модели лучше работают с компактным ядром и извлечением рекомендаций для каждой задачи; у насыщенных моделей измеримого прироста нет.

  • Отобранное извлечение может быть одновременно самым точным и самым дешёвым вариантом: gpt-oss-120b повысила долю выполненных задач на +16,1 п. п. при увеличении числа токенов всего на +5%, а кэширование промптов делает даже полный набор рекомендаций доступным по стоимости в продакшене.


Главный вывод: дозировка зависит от возможностей модели

Не каждая модель получает пользу от одинакового объёма памяти. Среди восьми моделей, охватывающих весь спектр возможностей, мы наблюдали три повторяющихся закономерности:

  • Сильные модели с запасом для улучшения хотят полный набор рекомендаций — каждую рекомендацию, включая уроки о редких крайних случаях. У них достаточно возможностей, чтобы усвоить и применить всё это. DeepSeek-V3.2 (671B MoE) повысила показатель выполнения задач на +9,5 процентного пункта, получив полный набор рекомендаций, добытых самостоятельно.

  • Большие или более слабые модели захлёбываются в большом наборе рекомендаций. Для них лучше всего работает компактное, высоконадежное ядро плюс несколько рекомендаций, релевантных задаче и извлечённых для каждой задачи. gpt-oss-120b (117B MoE) получила прирост +16,1 п. п. при таком избирательном подходе, тогда как полный набор рекомендаций дал меньший прирост и потребовал примерно на 50% больше токенов.

  • Уже насыщенные модели не показывают измеримого прироста. Мы называем это насыщенной закономерностью — это описание наблюдаемого явления, а не доказанной причины. Возможно, модель уже была близка к своему пределу на этих задачах, рекомендации не затрагивали оставшиеся ошибки или модель не смогла эффективно применить указания. В наших запусках GLM-5 (745B MoE) относилась к этой категории.

То, к какой закономерности относится модель, определяется не только количеством параметров. Запас до уровня бенчмарка, размер контекстного окна, архитектура, качество рекомендаций и распределение задач, по-видимому, влияют на результат, а разделение этих факторов остаётся предметом текущих исследований. Практический вывод в любом случае один: подходящая дозировка памяти зависит от модели, и её можно откалибровать.


Обучение происходит вокруг модели, а не внутри неё

Здесь «память» не означает воспроизведение прошлого диалога. Речь идёт о наборе рекомендаций — стратегиях, которые сработали, ошибках, которых следует избегать, и крайних случаях, — извлечённых из собственных прошлых траекторий агента. Цикл прост:

  1. Агент выполняет задачи и создаёт траектории.

  2. ALTK-Evolve извлекает поведенческие рекомендации как из успешных, так и из неудачных запусков.

  3. Эти рекомендации объединяются в пригодный для повторного использования набор.

  4. Во время инференса агент получает либо полный набор рекомендаций, либо релевантную задаче выборку.

Веса модели не обновляются. Цикл обучения изменяет доступные агенту указания, а не саму модель — именно поэтому его дёшево внедрять и переносить между всеми восемью протестированными моделями.


Результаты для всего спектра моделей

Мы проводили оценивание на AppWorld — 585 многошаговых задачах (168 из test_normal + 417 из test_challenge) в 9 симулированных приложениях (календари, обмен сообщениями, платежи и т. д.). Задачи оцениваются двумя способами: полностью ли агент выполняет каждую задачу (TGC — Task Goal Completion, выполнение цели задачи) и проходят ли все варианты сценария (SGC — Scenario Goal Completion, выполнение цели сценария; это более строгий критерий по принципу «всё или ничего»). Полные определения приведены в приложении.

Три сравниваемые конфигурации

Поскольку самая запутанная часть любого исследования памяти — это вопрос что именно находится в контекстном окне, мы заранее определяем конфигурации.

Обе конфигурации с памятью используют один и тот же набор рекомендаций, добытый один раз (посредством описанного выше цикла) только из обучающей выборки AppWorld. Между ними меняется лишь способ доставки этого набора: полный набор рекомендаций внедряет его целиком на каждом шаге, тогда как отобранное извлечение предоставляет выбранное подмножество — при этом способ создания рекомендаций не меняется, и данные из тестовой выборки никогда не используются для его формирования.

Конфигурация Что находится в контексте агента
Базовая Без памяти — агент в исходном виде.
Полный набор рекомендаций Каждая добытая рекомендация, внедряемая на каждом шаге ReAct.
Отобранное извлечение Фиксированное, высоконадежное ядро из тех же рекомендаций плюс несколько релевантных задаче рекомендаций, извлекаемых для каждой задачи (фиксированная часть + переменная часть).

Количество рекомендаций, добываемых моделью, зависит от её собственных возможностей, поэтому мы описываем конфигурации через стратегию — «полный набор рекомендаций» и «отобранное извлечение», — а не через абсолютное количество, которое нельзя сопоставлять между моделями.

Три закономерности в одном представлении

Репрезентативные модели из исследования восьми моделей, измеренные по выполнению задач (TGC) на test_normal:

image

Рисунок 1. Репрезентативные модели для трёх наблюдаемых закономерностей. Столбцы показывают TGC на AppWorld test_normal для базовой конфигурации и лучшей конфигурации с памятью; ось X начинается с 40%, чтобы различия были заметнее. Один показатель TGC недооценивает больший прирост SGC — см. столбцы SGC в таблице ниже.

На рисунке показан TGC для удобства чтения; в таблице добавлен более строгий показатель SGC, прирост которого часто оказывается больше:

Модель Закономерность Базовый TGC / SGC Лучший TGC / SGC с памятью Лучшая конфигурация Δ TGC Δ SGC
gpt-oss-120b (117B MoE) Слабая / избирательная 39.9 / 21.4 56.0 / 37.5 отобранное извлечение +16.1 +16.1
DeepSeek-V3.2 (671B MoE) Сильная, с запасом 79.8 / 64.3 89.3 / 80.4 полный набор рекомендаций +9.5 +16.1
Claude Opus 4.6 Сильная, с запасом 90.5 / 87.5 94.6 / 94.6 полный набор рекомендаций +4.1 +7.1
GPT-5.5 Сильная, близкая к пределу 92.3 / 82.1 95.2 / 89.3 полный набор рекомендаций +2.9 +7.2
GLM-5 (745B MoE) Насыщенная 87.5 / 80.4 87.5 / 80.4 полный набор рекомендаций 0.0 0.0

Если посмотреть на столбец SGC, то более строгий показатель обычно меняется сильнее, чем TGC: SGC DeepSeek увеличивается на +16,1 п. п. против прироста TGC на +9,5 п. п., поскольку хорошие рекомендации особенно помогают агенту пройти все варианты сценария, а не только средний случай. И этот эффект не исчезает на верхнем уровне диапазона: GPT-5.5 и Opus, обе близкие к пределу по TGC, всё ещё получают прирост +7,2 и +7,1 п. п. SGC соответственно. Память продолжает приносить пользу, пока у модели остаётся ошибка, на которую можно воздействовать.


Самая дешёвая стратегия памяти может быть и лучшей

Практическая проблема заключается в том, что внедрение полного набора рекомендаций увеличивает объём входных данных на каждом шаге ReAct, поскольку рекомендации повторно отправляются в каждом ходе. Вот что мы наблюдали:

Модель Конфигурация Токенов на задачу (базовая) Токенов на задачу (+ память) Накладные расходы
DeepSeek-V3.2 полный набор рекомендаций 148K 263K +78%
gpt-oss-120b полный набор рекомендаций 110K 166K +51%
gpt-oss-120b отобранное извлечение 110K 116K +5%

Таблица 1. Среднее использование токенов на задачу, накопленное на всех шагах агента, в сравнении с базовой конфигурацией без памяти.

Два вывода:

  1. Отобранное извлечение удерживает стоимость близкой к базовой. Для более слабых моделей, где выборка выигрывает по точности, она также выигрывает по стоимости — лучшее из двух миров (+16,1 п. п. TGC всего при +5% токенов для gpt-oss-120b). Более высокая производительность здесь не требует больших затрат на инференс.

  2. Память не раздувает цикл рассуждений. DeepSeek выполняет примерно столько же шагов ReAct с памятью, сколько и без неё (в среднем ≈18–19), поэтому дополнительные расходы связаны с увеличением числа входных токенов, а не с удлинением траекторий.

В продакшене настоящим рычагом эффективности является кэширование промптов: статическая часть набора рекомендаций одинакова на всех шагах и может кэшироваться, что значительно снижает фактическую стоимость. Поэтому стоит инвестировать в проектирование промптов с учётом кэширования — сохранять общий префикс набора рекомендаций неизменным, чтобы он оставался доступным для кэша. Мы также предполагаем, что размер контекстного окна играет роль: модели с большими окнами могут эффективнее усваивать полный набор рекомендаций, тогда как модели с меньшим контекстом больше выигрывают от извлечения, сохраняющего компактный объём внедряемого содержимого. Мы ещё не проводили контролируемых экспериментов, изолирующих этот фактор.


Память нужно калибровать, а не просто накапливать

Урок заключается не в том, чтобы давать агенту всё, чему он научился. Нужно давать ему столько опыта, сколько он действительно способен использовать.

  • Для слабых моделей это означает компактное ядро плюс несколько уроков, специфичных для задачи, — что заодно является самым дешёвым вариантом.

  • Для сильных моделей с запасом для улучшения это означает сохранение полного набора рекомендаций, доступного по стоимости в продакшене благодаря кэшированию промптов.

  • Для насыщенных моделей это означает не тратить дополнительный контекст, пока их оставшиеся типы ошибок не будут лучше изучены.

Прирост реален для всех моделей — он достигается автоматически, без утечек данных и без аннотации человеком, — но только если дозировка соответствует модели.


Что дальше

Это отправная точка, а не финиш:

  • Обучаемый селектор. Сейчас наше извлечение ранжирует рекомендации по косинусному сходству, однако мы показали, что оно не идеально предсказывает, какие рекомендации помогут конкретной задаче. Естественный следующий шаг — селектор, обученный на сигнале результата.

  • Память для очень слабых моделей. Ниже минимального порога возможностей самодистилляция не получает достаточного сигнала. Память, дистиллированная учителем для очень слабых моделей, — отдельная задача, которую мы исследуем.

  • За пределами AppWorld. Эти результаты подтверждены на AppWorld — строгом многошаговом бенчмарке, но лишь одном. Работа с более широкими бенчмарками агентов и реальными развёртываниями продолжается.

  • Изоляция влияния контекстного окна. Как отмечалось выше, мы хотим провести контролируемые эксперименты, отделяющие размер контекстного окна от общих возможностей модели.

Попробуйте библиотеку ALTK-Evolve — она включает использованный здесь конвейер извлечения, консолидации и поиска — или ознакомьтесь с полным техническим отчётом, где подробно описаны метод и абляционные эксперименты.


Приложение: понимание метрик

Задачи AppWorld оцениваются по двум метрикам, обе представлены в процентах (чем выше, тем лучше):

  • TGC — Task Goal Completion, выполнение цели задачи. Доля отдельных задач, которые агент выполняет полностью и корректно. Это основной показатель — «справился ли он с задачей».

  • SGC — Scenario Goal Completion, выполнение цели сценария. Более строгая метрика по принципу «всё или ничего». Каждый сценарий объединяет несколько вариантов одной и той же задачи (одинаковый запрос с разными данными, формулировками или крайними условиями). Сценарий считается пройденным по SGC только в том случае, если агент успешно выполняет каждый вариант. Эта метрика измеряет надёжность: агент, который решает задачу чаще всего, но терпит неудачу на одном варианте, получает баллы по TGC, но не по SGC.

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в поле ввода текста, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости