Сколько памяти на самом деле нужно вашему агенту?
Оснастить агента агентной памятью кажется простым: извлечь уроки из его прошлой работы, вернуть их в контекст — и чем больше опыта, тем выше должна быть производительность. Но так бывает не всегда. Когда мы расширили оценивание до восьми моделей — от плотной модели на 30 млрд параметров до передовых проприетарных систем, — особенно выделился один вывод:
Агентная память — не функция, которую можно просто включить. Это дозировка, которую нужно подобрать под модель.
Кратко
ALTK-Evolve позволяет агенту учиться на собственных прошлых траекториях: извлекать универсальные рекомендации и возвращать их во время инференса без обновления весов и аннотации человеком.
Подходящая дозировка различается в зависимости от уровня модели: сильным моделям, у которых есть запас для улучшения, нужен полный набор рекомендаций; более слабые модели лучше работают с компактным ядром и извлечением рекомендаций для каждой задачи; у насыщенных моделей измеримого прироста нет.
Отобранное извлечение может быть одновременно самым точным и самым дешёвым вариантом: gpt-oss-120b повысила долю выполненных задач на +16,1 п. п. при увеличении числа токенов всего на +5%, а кэширование промптов делает даже полный набор рекомендаций доступным по стоимости в продакшене.
Главный вывод: дозировка зависит от возможностей модели
Не каждая модель получает пользу от одинакового объёма памяти. Среди восьми моделей, охватывающих весь спектр возможностей, мы наблюдали три повторяющихся закономерности:
Сильные модели с запасом для улучшения хотят полный набор рекомендаций — каждую рекомендацию, включая уроки о редких крайних случаях. У них достаточно возможностей, чтобы усвоить и применить всё это. DeepSeek-V3.2 (671B MoE) повысила показатель выполнения задач на +9,5 процентного пункта, получив полный набор рекомендаций, добытых самостоятельно.
Большие или более слабые модели захлёбываются в большом наборе рекомендаций. Для них лучше всего работает компактное, высоконадежное ядро плюс несколько рекомендаций, релевантных задаче и извлечённых для каждой задачи. gpt-oss-120b (117B MoE) получила прирост +16,1 п. п. при таком избирательном подходе, тогда как полный набор рекомендаций дал меньший прирост и потребовал примерно на 50% больше токенов.
Уже насыщенные модели не показывают измеримого прироста. Мы называем это насыщенной закономерностью — это описание наблюдаемого явления, а не доказанной причины. Возможно, модель уже была близка к своему пределу на этих задачах, рекомендации не затрагивали оставшиеся ошибки или модель не смогла эффективно применить указания. В наших запусках GLM-5 (745B MoE) относилась к этой категории.
То, к какой закономерности относится модель, определяется не только количеством параметров. Запас до уровня бенчмарка, размер контекстного окна, архитектура, качество рекомендаций и распределение задач, по-видимому, влияют на результат, а разделение этих факторов остаётся предметом текущих исследований. Практический вывод в любом случае один: подходящая дозировка памяти зависит от модели, и её можно откалибровать.
Обучение происходит вокруг модели, а не внутри неё
Здесь «память» не означает воспроизведение прошлого диалога. Речь идёт о наборе рекомендаций — стратегиях, которые сработали, ошибках, которых следует избегать, и крайних случаях, — извлечённых из собственных прошлых траекторий агента. Цикл прост:
Агент выполняет задачи и создаёт траектории.
ALTK-Evolve извлекает поведенческие рекомендации как из успешных, так и из неудачных запусков.
Эти рекомендации объединяются в пригодный для повторного использования набор.
Во время инференса агент получает либо полный набор рекомендаций, либо релевантную задаче выборку.
Веса модели не обновляются. Цикл обучения изменяет доступные агенту указания, а не саму модель — именно поэтому его дёшево внедрять и переносить между всеми восемью протестированными моделями.
Результаты для всего спектра моделей
Мы проводили оценивание на AppWorld — 585 многошаговых задачах (168 из test_normal + 417 из test_challenge) в 9 симулированных приложениях (календари, обмен сообщениями, платежи и т. д.). Задачи оцениваются двумя способами: полностью ли агент выполняет каждую задачу (TGC — Task Goal Completion, выполнение цели задачи) и проходят ли все варианты сценария (SGC — Scenario Goal Completion, выполнение цели сценария; это более строгий критерий по принципу «всё или ничего»). Полные определения приведены в приложении.
Три сравниваемые конфигурации
Поскольку самая запутанная часть любого исследования памяти — это вопрос что именно находится в контекстном окне, мы заранее определяем конфигурации.
Обе конфигурации с памятью используют один и тот же набор рекомендаций, добытый один раз (посредством описанного выше цикла) только из обучающей выборки AppWorld. Между ними меняется лишь способ доставки этого набора: полный набор рекомендаций внедряет его целиком на каждом шаге, тогда как отобранное извлечение предоставляет выбранное подмножество — при этом способ создания рекомендаций не меняется, и данные из тестовой выборки никогда не используются для его формирования.
| Конфигурация | Что находится в контексте агента |
|---|---|
| Базовая | Без памяти — агент в исходном виде. |
| Полный набор рекомендаций | Каждая добытая рекомендация, внедряемая на каждом шаге ReAct. |
| Отобранное извлечение | Фиксированное, высоконадежное ядро из тех же рекомендаций плюс несколько релевантных задаче рекомендаций, извлекаемых для каждой задачи (фиксированная часть + переменная часть). |
Количество рекомендаций, добываемых моделью, зависит от её собственных возможностей, поэтому мы описываем конфигурации через стратегию — «полный набор рекомендаций» и «отобранное извлечение», — а не через абсолютное количество, которое нельзя сопоставлять между моделями.
Три закономерности в одном представлении
Репрезентативные модели из исследования восьми моделей, измеренные по выполнению задач (TGC) на test_normal:
Рисунок 1. Репрезентативные модели для трёх наблюдаемых закономерностей. Столбцы показывают TGC на AppWorld test_normal для базовой конфигурации и лучшей конфигурации с памятью; ось X начинается с 40%, чтобы различия были заметнее. Один показатель TGC недооценивает больший прирост SGC — см. столбцы SGC в таблице ниже.
На рисунке показан TGC для удобства чтения; в таблице добавлен более строгий показатель SGC, прирост которого часто оказывается больше:
| Модель | Закономерность | Базовый TGC / SGC | Лучший TGC / SGC с памятью | Лучшая конфигурация | Δ TGC | Δ SGC |
|---|---|---|---|---|---|---|
| gpt-oss-120b (117B MoE) | Слабая / избирательная | 39.9 / 21.4 | 56.0 / 37.5 | отобранное извлечение | +16.1 | +16.1 |
| DeepSeek-V3.2 (671B MoE) | Сильная, с запасом | 79.8 / 64.3 | 89.3 / 80.4 | полный набор рекомендаций | +9.5 | +16.1 |
| Claude Opus 4.6 | Сильная, с запасом | 90.5 / 87.5 | 94.6 / 94.6 | полный набор рекомендаций | +4.1 | +7.1 |
| GPT-5.5 | Сильная, близкая к пределу | 92.3 / 82.1 | 95.2 / 89.3 | полный набор рекомендаций | +2.9 | +7.2 |
| GLM-5 (745B MoE) | Насыщенная | 87.5 / 80.4 | 87.5 / 80.4 | полный набор рекомендаций | 0.0 | 0.0 |
Если посмотреть на столбец SGC, то более строгий показатель обычно меняется сильнее, чем TGC: SGC DeepSeek увеличивается на +16,1 п. п. против прироста TGC на +9,5 п. п., поскольку хорошие рекомендации особенно помогают агенту пройти все варианты сценария, а не только средний случай. И этот эффект не исчезает на верхнем уровне диапазона: GPT-5.5 и Opus, обе близкие к пределу по TGC, всё ещё получают прирост +7,2 и +7,1 п. п. SGC соответственно. Память продолжает приносить пользу, пока у модели остаётся ошибка, на которую можно воздействовать.
Самая дешёвая стратегия памяти может быть и лучшей
Практическая проблема заключается в том, что внедрение полного набора рекомендаций увеличивает объём входных данных на каждом шаге ReAct, поскольку рекомендации повторно отправляются в каждом ходе. Вот что мы наблюдали:
| Модель | Конфигурация | Токенов на задачу (базовая) | Токенов на задачу (+ память) | Накладные расходы |
|---|---|---|---|---|
| DeepSeek-V3.2 | полный набор рекомендаций | 148K | 263K | +78% |
| gpt-oss-120b | полный набор рекомендаций | 110K | 166K | +51% |
| gpt-oss-120b | отобранное извлечение | 110K | 116K | +5% |
Таблица 1. Среднее использование токенов на задачу, накопленное на всех шагах агента, в сравнении с базовой конфигурацией без памяти.
Два вывода:
Отобранное извлечение удерживает стоимость близкой к базовой. Для более слабых моделей, где выборка выигрывает по точности, она также выигрывает по стоимости — лучшее из двух миров (+16,1 п. п. TGC всего при +5% токенов для gpt-oss-120b). Более высокая производительность здесь не требует больших затрат на инференс.
Память не раздувает цикл рассуждений. DeepSeek выполняет примерно столько же шагов ReAct с памятью, сколько и без неё (в среднем ≈18–19), поэтому дополнительные расходы связаны с увеличением числа входных токенов, а не с удлинением траекторий.
В продакшене настоящим рычагом эффективности является кэширование промптов: статическая часть набора рекомендаций одинакова на всех шагах и может кэшироваться, что значительно снижает фактическую стоимость. Поэтому стоит инвестировать в проектирование промптов с учётом кэширования — сохранять общий префикс набора рекомендаций неизменным, чтобы он оставался доступным для кэша. Мы также предполагаем, что размер контекстного окна играет роль: модели с большими окнами могут эффективнее усваивать полный набор рекомендаций, тогда как модели с меньшим контекстом больше выигрывают от извлечения, сохраняющего компактный объём внедряемого содержимого. Мы ещё не проводили контролируемых экспериментов, изолирующих этот фактор.
Память нужно калибровать, а не просто накапливать
Урок заключается не в том, чтобы давать агенту всё, чему он научился. Нужно давать ему столько опыта, сколько он действительно способен использовать.
Для слабых моделей это означает компактное ядро плюс несколько уроков, специфичных для задачи, — что заодно является самым дешёвым вариантом.
Для сильных моделей с запасом для улучшения это означает сохранение полного набора рекомендаций, доступного по стоимости в продакшене благодаря кэшированию промптов.
Для насыщенных моделей это означает не тратить дополнительный контекст, пока их оставшиеся типы ошибок не будут лучше изучены.
Прирост реален для всех моделей — он достигается автоматически, без утечек данных и без аннотации человеком, — но только если дозировка соответствует модели.
Что дальше
Это отправная точка, а не финиш:
Обучаемый селектор. Сейчас наше извлечение ранжирует рекомендации по косинусному сходству, однако мы показали, что оно не идеально предсказывает, какие рекомендации помогут конкретной задаче. Естественный следующий шаг — селектор, обученный на сигнале результата.
Память для очень слабых моделей. Ниже минимального порога возможностей самодистилляция не получает достаточного сигнала. Память, дистиллированная учителем для очень слабых моделей, — отдельная задача, которую мы исследуем.
За пределами AppWorld. Эти результаты подтверждены на AppWorld — строгом многошаговом бенчмарке, но лишь одном. Работа с более широкими бенчмарками агентов и реальными развёртываниями продолжается.
Изоляция влияния контекстного окна. Как отмечалось выше, мы хотим провести контролируемые эксперименты, отделяющие размер контекстного окна от общих возможностей модели.
Попробуйте библиотеку ALTK-Evolve — она включает использованный здесь конвейер извлечения, консолидации и поиска — или ознакомьтесь с полным техническим отчётом, где подробно описаны метод и абляционные эксперименты.
Приложение: понимание метрик
Задачи AppWorld оцениваются по двум метрикам, обе представлены в процентах (чем выше, тем лучше):
TGC — Task Goal Completion, выполнение цели задачи. Доля отдельных задач, которые агент выполняет полностью и корректно. Это основной показатель — «справился ли он с задачей».
SGC — Scenario Goal Completion, выполнение цели сценария. Более строгая метрика по принципу «всё или ничего». Каждый сценарий объединяет несколько вариантов одной и той же задачи (одинаковый запрос с разными данными, формулировками или крайними условиями). Сценарий считается пройденным по SGC только в том случае, если агент успешно выполняет каждый вариант. Эта метрика измеряет надёжность: агент, который решает задачу чаще всего, но терпит неудачу на одном варианте, получает баллы по TGC, но не по SGC.
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.


