Способность искусственного интеллекта удерживать информацию на протяжении длительного времени остается одной из ключевых проблем в разработке. Каждый раз, когда ассистент для написания кода теряет ход отладки или агент анализа данных повторно обрабатывает уже изученный контекст, это приводит к задержкам, увеличению стоимости вычислений и негибкости рабочих процессов. Традиционные решения, такие как расширение контекстного окна или использование дополнительных модулей Retrieval-Augmented Generation (RAG — генерация с расширенным поиском, метод, при котором ИИ обращается к внешней базе знаний), становятся всё более дорогостоящими и не всегда гарантируют надёжность.
Содержание
Преодоление вызовов долгосрочной памяти
В ответ на эти вызовы исследователи из Mind Lab и нескольких университетов предложили новую эффективную технику под названием delta-mem. Она позволяет сжимать историческую информацию модели в динамически обновляемую матрицу, не изменяя при этом саму базовую модель. Этот модуль добавляет всего 0,12% параметров к основной модели, в то время как один из ведущих альтернативных методов требует до 76,40% параметров, при этом delta-mem демонстрирует превосходные результаты в задачах, требующих большой объём памяти.
Delta-mem позволяет моделям непрерывно накапливать и использовать исторические данные, снижая зависимость от огромных контекстных окон или сложных внешних поисковых модулей для обеспечения поведенческой непрерывности.
По словам Цзинди Лэя, соавтора исследования, современные системы рассматривают память исключительно как проблему управления контекстом. Существующие подходы либо расширяют контекстное окно, либо извлекают больше документов через RAG. Эти методы полезны и остаются важными, но они становятся всё более дорогими и ненадёжными, когда агентам необходимо работать с длительными, многошаговыми взаимодействиями. К тому же, они не функционируют подобно человеческой памяти, скорее напоминая поиск документов.
В корпоративной среде узким местом является не только доступ модели к истории, но и её способность эффективно, непрерывно и с низкой задержкой повторно использовать эту историю. Стандартные механизмы внимания требуют квадратичных вычислительных затрат по мере увеличения длины последовательности. Более того, расширение контекстного окна не гарантирует, что модель будет эффективно вспоминать информацию. Модели часто страдают от деградации контекста или его искажения, когда они перегружены большим (и часто противоречивым) объёмом информации, даже если теоретически они поддерживают миллион токенов.
Исследователи выступают за использование передовых механизмов памяти, которые могут компактно представлять историческую информацию и динамически поддерживать её в процессе взаимодействия. Существующие решения сопряжены со значительными компромиссами и, как правило, делятся на три парадигмы:
- Текстовая память: хранит историю в виде текста, вводимого в контекст — ограничена размерами окна и подвержена потере информации при сжатии.
- Внешний канал (RAG): кодирует и извлекает данные из внешних модулей — добавляет задержки, сложности интеграции и потенциальное рассогласование с базовой моделью.
- Параметрическая: кодирует память в веса модели через адаптеры — статична после обучения, не может адаптироваться к новой информации во время интерактивных взаимодействий.
Принцип работы delta-mem
Для достижения компактной и динамически обновляемой памяти delta-mem сжимает прошлые взаимодействия агента в «онлайн-состояние ассоциативной памяти» (OSAM). Это состояние поддерживается в виде матрицы фиксированного размера, которая сохраняет историческую информацию, в то время как базовая языковая модель остаётся неизменной.
Для корпоративных рабочих процессов это напрямую означает устранение операционных затруднений. Цзинди Лэй отметил, что, например, постоянный помощник по кодированию «может нуждаться в запоминании проектных соглашений, недавних шагов отладки, пользовательских предпочтений или промежуточных решений в рамках рабочего процесса». Аналогично, агент анализа данных может «нуждаться в поддержании состояния задачи, предположений и предыдущих наблюдений при итеративном выполнении нескольких вызовов инструментов».
Вместо многократного извлечения и повторного ввода всей релевантной истории для этих задач, матрица delta-mem обеспечивает низкозатратный способ переноса полезных состояний взаимодействия внутри прямых вычислений модели.
Во время генерации система не извлекает необработанные текстовые сегменты для добавления в запрос. Вместо этого текущее скрытое состояние базовой большой языковой модели (LLM) проецируется в матрицу для извлечения старой памяти. Эта операция извлекает контекстно-релевантные ассоциативные сигналы памяти из delta-mem. Затем эти сигналы преобразуются в числовые корректировки, которые применяются к вычислениям модели. Это направляет рассуждения модели во время инференса, не изменяя её внутренние параметры.
После каждого взаимодействия delta-mem обновляет онлайн-состояние, используя «обучение по дельта-правилу». Когда поступает новая информация, предыдущее состояние делает предсказание относительно результирующих значений внимания. Затем оно сравнивает это предсказание с фактическим значением и корректирует матрицу памяти на основе расхождения.
Этот механизм обновления основан на «управляемом дельта-правиле». По сути, модуль памяти имеет различные регуляторы, которые контролируют, сколько предыдущей памяти сохраняется и сколько новой памяти применяется. Такая коррекция ошибок с контролируемым забыванием позволяет матрице развиваться со временем, удерживая стабильные исторические ассоциации и не отклоняясь от краткосрочных шумов.
Исследователи изучили три стратегии определения того, когда и как обновляется матрица:
- Запись состояния токенов: фиксирует детальные изменения, но уязвима для краткосрочных шумов.
- Запись состояния последовательности: усредняет токены внутри сегмента сообщения, сглаживая обновления за счёт потери некоторых локализованных деталей.
- Запись мульти-состояния: декомпозирует память на подсостояния для различных типов информации, таких как факты или ход выполнения задачи.
Delta-mem в действии
Разработчики протестировали delta-mem на трёх базовых моделях LLM: Qwen3-8B, Qwen3-4B-Instruct и SmolLM3-3B. Фреймворк был настроен с компактной матрицей размером 8×8. Система прошла проверку на общих бенчмарках, включая HotpotQA, GPQA-Diamond и IFEval. Она также была оценена в задачах, требующих большой объём памяти, таких как LoCoMo (тестирование долгосрочной разговорной памяти) и Memory Agent Bench (оценка удержания, извлечения, избирательного забывания и обучения во время тестирования на протяжении длительных взаимодействий).
Фреймворк сравнивался с репрезентативными моделями из трёх существующих парадигм памяти: базовые методы текстовой памяти (например, BM25 RAG, LLMLingua-2 и MemoryBank), параметрические системы (Context2LoRA и MemGen) и подход внешнего канала MLP Memory.
По данным исследователей, delta-mem превзошла все базовые решения. На базовой модели Qwen3-4B-Instruct вариант записи состояния токенов достиг среднего балла 51,66%, легко превзойдя замороженную ванильную базовую модель с 46,79% и самый сильный базовый вариант, Context2LoRA, с 44,90%. В задаче Memory Agent Bench, требующей большой объём памяти, средний балл вырос с 29,54% до 38,85%. Производительность в конкретной подзадаче обучения во время тестирования почти удвоилась с 26,14% до 50,50%.
Однако наиболее убедительные выводы касаются операционной эффективности системы. Исследователи протестировали фреймворк в условиях отсутствия контекста, когда исторический текст был полностью удалён. Даже без явного текстового воспроизведения delta-mem успешно восстанавливала контекстно-релевантные данные в многошаговых задачах. Исследователи утверждают, что модель запоминает прошлые взаимодействия, не требуя поглощения огромных объёмов токенов из запроса.
Фреймворк также добавляет всего 4,87 миллиона обучаемых параметров, что составляет лишь 0,12% от базовой модели Qwen3-4B-Instruct. Для сравнения, базовый MLP Memory требовал 3 миллиарда параметров, масштабируясь до 76,40% от размера базовой модели, при этом показывая худшие результаты. Когда длина запроса увеличивалась до 32 000 токенов во время тестов инференса, фреймворк поддерживал практически тот же объём памяти GPU, что и стандартная, немодифицированная модель. Он обходит серьёзное разрастание памяти, которое затрагивает другие передовые системы памяти, такие как MemGen и MLP Memory.
Различные стратегии обновления оказались полезными в зависимости от базовой мощности модели. Стратегия записи состояния последовательности была наиболее эффективной для более мощных базовых моделей, таких как Qwen3-8B. Эти более способные модели используют запись на уровне сегментов для сглаживания обновлений и смягчения шумов на уровне токенов. И наоборот, стратегия записи мульти-состояния обеспечила огромный скачок производительности для меньших базовых моделей, таких как SmolLM3-3B. Для этих моделей с более низкой мощностью разделение памяти на несколько состояний оказалось критически важным для минимизации информационных помех.
Внедрение delta-mem в корпоративный стек
Исследователи опубликовали код delta-mem на GitHub, а веса своих обученных адаптеров на Hugging Face. Для инженерных команд ИИ, стремящихся интегрировать этот фреймворк в существующий стек инференса, процесс требует минимальных вычислительных ресурсов.
Цзинди Лэй пояснил, что на практике инженерная команда начала бы с существующей базовой модели, настроенной на инструкции, прикрепила бы адаптерные модули Delta-Mem к выбранным слоям внимания, обучила бы только параметры адаптера на данных, релевантных домену, с многошаговыми или длинными контекстами, а затем запустила бы инференс с онлайн-обновлением состояния памяти во время взаимодействия. Что особенно важно, командам не требуется огромный корпус для предварительного обучения. Данные для обучения должны лишь отражать целевое поведение памяти, такое как многошаговые диалоги, трассировки агентов или рабочие процессы домена, где более ранняя информация должна влиять на более поздние решения.
Компромиссы и гибридный подход
Хотя сжатие истории взаимодействия в математическую матрицу фиксированного размера создаёт огромную эффективность, оно сопряжено с определёнными компромиссами. Delta-mem не является безвозвратной заменой для явных текстовых логов или извлечения документов. Поскольку различные части информации конкурируют внутри одного ограниченного состояния, существует риск смешивания памяти.
Лэй подчеркнул, что Delta-Mem полезна, когда системе требуется быстрое, онлайн, непрерывно обновляемое поведенческое состояние. RAG лучше подходит, когда системе требуется точное фактическое воспроизведение, цитирование, соблюдение требований, возможность аудита или доступ к большой внешней базе знаний. Запоминание стиля работы пользователя или многошаговой траектории рассуждений идеально подходит для delta-mem, в то время как извлечение юридического договора или медицинских рекомендаций должно оставаться в векторной базе данных.
Это означает, что наиболее реалистичная корпоративная архитектура в будущем — это гибридный подход. Delta-mem действует как лёгкая внутренняя рабочая память, уменьшая необходимость извлекать или воспроизводить всё постоянно, в то время как RAG служит явным слоем памяти большой ёмкости.
Забегая вперёд, Лэй не считает, что векторные базы данных устареют. Вместо этого он ожидает, что корпоративные стеки ИИ станут более многослойными. Мы, вероятно, увидим краткосрочную рабочую память внутри модели, долгосрочную явную память в системах извлечения и слои политик или аудита, которые будут решать, что следует хранить, извлекать, забывать или показывать пользователю.