Структурная память вместо растущего лога: как AI-агент научился выигрывать в Slay the Spire 2
Исследователи заменили накапливающийся контекст пятью изолированными слоями памяти — и получили шестикратный рост побед при 66–90-кратном снижении затрат на токены.

Содержание · 6
Исследователи протестировали нового AI-агента на одной из самых сложных карточных игр — Slay the Spire 2 — и добились результатов, которые не удавались ни одной из ведущих языковых моделей. Секрет не в более мощной модели, а в принципиально иной архитектуре памяти: вместо постоянно растущего журнала событий агент каждый раз собирает контекст заново из пяти чётко разделённых слоёв. Это позволило не только выигрывать чаще, но и тратить на порядки меньше вычислительных ресурсов.
Почему именно Slay the Spire 2 — и почему это сложно
Выбор тестовой площадки неслучаен. Slay the Spire 2 — это рогалик с построением колоды, где одно прохождение включает сотни решений: выбор карт, тактика боёв, маршрут по карте, покупки в магазине. Все правила игры можно полностью описать текстом, случайность высокая, а партии долгие — идеальные условия, чтобы архитектурные различия между агентами проявились максимально чётко.
Статистика разработчиков говорит сама за себя: живые игроки побеждают на минимальной сложности A0 лишь в 16% случаев. Передовые языковые модели, протестированные в рамках оценки AGI-Eval, не выиграли ни одной из пяти конфигураций. Это не академическая задача с известным ответом — это открытая среда с реальной неопределённостью.
Пять слоёв вместо бесконечного лога
Стандартные LLM-агенты — такие как ReAct или Reflexion — работают по простой схеме: каждое новое наблюдение, вызов инструмента и авторефлексия дописываются в конец промпта. Контекст растёт с каждым шагом, пока не переполнит окно или не размоет внимание модели. Именно это явление исследователи называют «context rot» — деградация качества решений по мере накопления лога.
Агент AgenticSTS устроен иначе. Перед каждым решением промпт собирается заново из пяти изолированных слоёв:
- L1 — фиксированные инструкции протокола
- L2 — схема текущего состояния игры и доступные действия
- L3 — релевантные правила игры, извлекаемые по запросу
- L4 — краткие итоги предыдущих партий
- L5 — библиотека тактических навыков для повторяющихся ситуаций
Всё, что агент хочет «запомнить», должно быть явно записано в один из этих слоёв. Это держит размер промпта постоянным вне зависимости от длины партии. Дополнительный бонус: поскольку каждый слой адресуется отдельно, исследователи могут точно определить, какой именно компонент даёт прирост результата.
Библиотека навыков удваивает процент побед
Для основного сравнения команда провела пять конфигураций по 10 партий каждая на минимальной сложности A0. Без каких-либо слоёв памяти агент выигрывает 3 из 10 партий. После включения слоя L5 — библиотеки тактических правил для типовых ситуаций — результат вырастает до 6 из 10. Причём неважно, написаны ли навыки вручную или сгенерированы по шаблонам: эффект одинаковый.
Авторы честно признают ограничение: при выборке в 10 партий удвоение результата статистически может оказаться шумом. Эпизодическая память прошлых партий (L4) на уровне A0 не даёт заметного преимущества — она начинает работать только в режиме, когда агент после каждой победы переходит на следующий уровень сложности. С активной межпартийной памятью агент достигает уровней A6–A8, без неё — застревает на A2–A4.
Отдельный эксперимент проверил переносимость знаний между моделями. Исследователи заморозили стек памяти, накопленный Gemini 3.1 Pro, и передали его двум другим моделям без изменений. Qwen 3.6-27B показал рост среднего счёта на 84,5%, тогда как Deepseek V4-Pro потерял 18,1%. Ни одна из моделей не выиграла партии — память оказалась привязана к модели, которая её создала.
Разрыв в токенах: в 66–90 раз
Ещё показательнее сравнение с двумя публично доступными агентами для Slay the Spire 2 — STS2MCP и CharTyr, — которые работают по классической схеме с растущим транскриптом. Все три агента использовали Gemini 3.1 Pro для стратегических решений. Ни один из конкурентов не выиграл ни одной из 5 партий.
Цифры по токенам говорят о системной проблеме: на каждое очко счёта конкуренты отправляют в языковую модель в 66–90 раз больше токенов, чем AgenticSTS. В STS2MCP один вызов модели ближе к концу партии достигал ~527 000 токенов — потому что вся история игры пересылается заново с каждым решением. AgenticSTS удерживает размер пользовательского текста на уровне ~5 000 токенов вне зависимости от длины партии.
Временные потери тоже существенны: конкурирующие агенты тратят в 4 раза больше времени на достижение того же уровня. По данным провайдера, 96% этих потерь приходится на латентность самой языковой модели — то есть на ожидание ответа, а не на работу управляющего кода.
Авторы оговариваются: это не чистый ablation-тест. STS2MCP и CharTyr отличаются от AgenticSTS также маршрутизацией и пакетной обработкой решений, поэтому разрыв отражает текущее состояние публичных решений, а не изолированный эффект архитектуры памяти.
Что ещё не проверено — и почему это важно
Команда сама указывает на ограничения. Ключевой тест — сравнение растущего контекста и структурированной памяти внутри одной кодовой базы с одинаковой системой оценки — так и не был проведён. Основные метрики основаны на 50 партиях, и пока протестирован только один персонаж (Silent) на одной версии игры. Работает ли подход для других персонажей и патчей — открытый вопрос.
Тем не менее команда публикует 298 полных игровых записей, замороженные снимки памяти и скрипты оценки на Hugging Face, чтобы другие группы могли тестировать альтернативные архитектуры памяти в той же среде.
Контекст: «context rot» — активная область исследований
AgenticSTS — не единственный проект, атакующий проблему деградирующего контекста. Anthropic использует инструменты Memory Tool и Context Editing, которые автоматически удаляют устаревшие результаты вызовов инструментов и сохраняют важную информацию во внешних файлах. В собственных тестах компании это сократило расход токенов при 100-раундовом веб-поиске на 84%. Китайский фреймворк GAM разделяет архивирование и извлечение между двумя специализированными агентами. Open-source фреймворк Mastra сжимает разговоры в краткие текстовые заметки, хранящиеся за пределами контекстного окна.
Для белорусских разработчиков, строящих AI-агентов под задачи автоматизации или аналитики, эта работа даёт конкретный инженерный ориентир: архитектура памяти влияет на стоимость и качество агента сильнее, чем выбор базовой модели. В условиях, когда API-затраты на токены напрямую влияют на юнит-экономику продукта, разница в 66–90 раз — это уже не академический результат, а операционный.
Свежие новости
Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Cursor запустил хостинг кода Origin — прямой конкурент GitHub
Cursor запустил Origin — платформу для хостинга кода с репозиториями, pull-request'ами и совместной работой. Старт совпал с шестичасовым глобальным сбоем GitHub.

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура
Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Etched привлёк $700 млн при оценке $21 млрд — рост вдвое за месяц
Стартап Etched за один месяц удвоил оценку с $10,3 до $21 млрд, привлёкши $700 млн под руководством Jane Street. Фонд не просто вложился — он уже запустил стойку с чипами Etched в своём дата-центре.