Awesome-AI-Memory
【中文 | [English](README_en.md)】

👋 简介
大语言模型(LLM)已迅速发展为强大的通用推理与生成引擎。然而,尽管其能力不断提升,LLM 仍然受到一个根本性限制的约束:上下文窗口(Context Window)长度有限。这一限制决定了模型在单次推理过程中能够直接访问的信息范围,使其在本质上仅具备短期记忆能力,难以支持长期对话、个性化交互、持续学习以及复杂的多阶段任务。
为突破上下文窗口的固有限制,面向大模型的记忆与记忆系统(AI Memory & Memory Systems for LLMs)逐渐成为一个重要且活跃的研究与工程方向。通过为模型引入参数之外的外部、可持久化且可控的记忆结构,记忆系统使大模型能够在生成过程中存储、检索、压缩和管理历史信息,从而在有限上下文中持续利用长期经验,实现跨会话的一致性与连续推理能力。
Awesome-AI-Memory 是一个围绕 AI 大模型记忆与记忆系统构建的资源汇编仓库,系统性地收集相关的研究论文、框架工具与实践经验。该仓库致力于梳理并呈现大模型记忆领域快速发展的研究脉络,连接自然语言处理、信息检索、智能体系统与认知科学等多个研究方向。
🎯 仓库目标
本仓库的目标是构建一个集中、持续演进的知识库,为研究者与工程实践者提供参考,助力构建能够长期记忆、持续推理并随时间不断适应的智能系统。
📏 项目范围
本仓库聚焦 Agent Memory 与语言模型内部记忆机制。记忆必须是论文的核心研究问题,并有明确的语言模型或多模态语言模型研究对象。
- 收录:智能体的长期、情节、语义、共享及经验形成的流程记忆;语言模型中的存储、保持、寻址、召回与遗忘;直接针对这些机制的评测、安全研究及综述。
- 流程技能:须具体研究从执行经验形成持久记录、跨任务复用及验证/维护的过程。静态技能包、提示词优化或通用自演化不因出现 skill/memory 关键词而收录。
- 排除:纯视觉或低层机器人状态、硬件/KV 缓存效率、泛化的 RAG/长上下文/工具路由,以及仅声称能迁移到 LLM 的相邻工作。高层语言智能体的具身/多模态记忆仍可收录。
- 证据不足先待复核:核实记忆使用者、内容、存取机制、核心贡献与验证依据;准确说明阅读范围,不将摘要核验称为全文核验。
详见 论文筛选规则与发布检查。
🔔 近期热点研究与新闻
- 2026-10-11 - 🎉 更新 53 篇论文,其中综述 1 篇,方法类与框架类论文 40 篇,数据集和评估基准类论文 10 篇,模型和系统类论文 2 篇
- 2026-10-06 - 🎉 更新 67 篇论文,其中方法类与框架类论文 43 篇,数据集和评估基准类论文 15 篇,模型和系统类论文 9 篇
- 2026-10-03 - 🎉 更新 69 篇论文,其中综述 1 篇,方法类与框架类论文 51 篇,数据集和评估基准类论文 11 篇,模型和系统类论文 6 篇
- 2026-09-29 - 🎉 更新 67 篇论文,其中综述 1 篇,方法类与框架类论文 37 篇,数据集和评估基准类论文 17 篇,模型和系统类论文 12 篇
- 2026-09-26 - 🎉 更新 17 篇论文,其中方法类与框架类论文 12 篇,数据集和评估基准类论文 2 篇,模型和系统类论文 3 篇
- 2026-09-23 - 🎉 更新 34 篇论文,其中方法类与框架类论文 19 篇,数据集和评估基准类论文 7 篇,模型和系统类论文 8 篇
- 2026-09-20 - 🎉 更新 11 篇论文,其中方法类与框架类论文 8 篇,数据集和评估基准类论文 2 篇,模型和系统类论文 1 篇
- 2026-09-15 - 🎉 更新 222 篇论文,其中综述 3 篇,方法类与框架类论文 153 篇,数据集和评估基准类论文 32 篇,模型和系统类论文 34 篇
- 2026-07-06 - 🎉 更新25篇论文,数据集和评估基准类5篇,方法类与框架类23篇
- 2026-06-21 - 🎉 更新27篇论文,模型和系统类9篇,数据集和评估基准类5篇,方法类与框架类13篇
- 2026-06-14 - 🎉 更新24篇论文,综述类2篇,模型和系统类4篇,数据集和评估基准类2篇,方法类与框架类16篇
- 2026-06-06 - 🎉 更新45篇论文,综述类1篇,模型和系统类6篇,数据集和评估基准类12篇,方法类与框架类26篇
- 2026-05-10 - 🎉 更新16篇论文,系统&模型类3篇,Benchmark类1篇,方法类12篇;并新增1个开源系统项目
- 2026-05-06 - 🎉 更新16篇论文,系统&模型类2篇,Benchmark类2篇,方法类12篇
- 2026-04-27 - 🎉 更新15篇论文,综述类2篇,系统与模型类3篇,方法类10篇
- 2026-04-17 - 🎉 更新46篇论文,综述类1篇,系统与模型类5篇,Benchmark类3篇,方法类37篇
- 2026-04-07 - 🎉 更新16篇论文,方法类15篇,Benchmark类1篇
- 2026-03-15 - 🎉 更新14篇论文,方法类14篇
- 2026-03-08 - 🎉 更新15篇论文,综述类3篇, 系统&模型类2篇,Benchmark类5篇,方法类5篇。
- 2026-03-02 - 🎉 新增一个代码agent到仓库中
- 2026-02-27 - 🎉 更新20篇论文,综述类1篇, 系统&模型类2篇,Benchmark类2篇,方法类15篇。
- 2026-02-26 - 🎉 更新14篇论文,方法类14篇
- 2026-02-14 - 🎉 更新15篇论文,综述类1篇,方法类12篇,benchmark类1篇,系统与模型类1篇
- 2026-02-09 - 🎉 更新15篇论文
- 2026-02-01 - 🎉 更新16篇论文,方法类9篇,benchmark类4篇,系统与模型类3篇
- 2025-12-24 – 🎉 发布仓库-V(1.0)
- 2025-12-10 – 🎉 仓库初始化
🗺️ 目录表
🧠 核心概念
-
大模型记忆: LLM的记忆机制融合了隐性知识(通过训练过程内化于模型参数中)与显式存储(运行时可检索的外部存储),这种双重架构使模型突破token处理的局限,具备类似人类"记忆过往、认知当下、预见未来"的认知能力。
-
记忆系统:为大语言模型实现记忆功能的完整技术架构,包含四大核心组件:
- 记忆存储层:向量数据库(如 Chroma、Weaviate)、图数据库或混合存储方案
- 记忆处理层:嵌入模型、摘要生成器与记忆分割器
- 记忆检索层:多阶段检索器、重排序模块与上下文注入器
- 记忆控制层:记忆优先级管理器、遗忘控制器与一致性协调器
-
记忆操作:通过记忆系统工具调用执行的原子级记忆操作:
- 写入:将对话内容转换为向量进行存储,通常结合摘要生成以减少噪声信息
- 检索:根据当前上下文生成查询语句以获取Top-K相关记忆
- 更新:通过向量相似度找到相关记忆并进行替换或增强
- 删除:基于用户指令或自动策略(如隐私数据过期)删除特定记忆
- 压缩:将多个相关记忆合并为摘要以释放存储空间
-
记忆管理:在记忆系统内实施记忆管控的方法论,包含以下机制:
- 记忆生命周期:从创建、活跃使用、冷启动访问到归档/删除的全周期管理
- 冲突解决:矛盾信息仲裁机制(如时间戳优先级、来源可信度加权)
- 资源预算:为不同用户/任务分配内存配额以防止资源滥用
- 安全治理:自动检测和去标识化个人身份信息(PII)
-
记忆分类:记忆系统特有的多维度分类体系:
- 按访问频率:工作记忆(当前任务)、常用记忆(个人偏好)、归档记忆(历史记录)
- 按结构化程度:结构化记忆(数据库记录)、半结构化记忆(对话摘要)、非结构化记忆(原始对话文本)
- 按共享范围:个人记忆(单用户)、团队记忆(协作空间)、公共记忆(共享知识库)
- 按时效属性:永久记忆(核心事实)、临时记忆(对话上下文)、时效性记忆(如"用户今天心情不好")
-
记忆机制:驱动记忆系统功能的核心技术组件:
- 检索增强生成(RAG):通过从知识库中检索相关信息来增强生成能力
- 记忆反思循环:模型定期"回顾"对话历史以生成高层次摘要
- 记忆路由:根据查询类型(个人记忆/公共知识库)自动选择检索源
-
显式记忆:以原始文本形式存储在模型外部的记忆,通过融合混合索引策略的向量数据库实现:
- 稠密向量索引:处理语义相似性查询
- 稀疏关键词索引:处理精确匹配查询
- 多向量索引:将长文档切分为多个部分,每个部分独立索引
-
参数化记忆:存储于语言模型固定权重中的知识与能力,具有以下特征:
- 作为模型的核心长期语义记忆载体
- 无需外部检索或显式上下文支持即可激活
- 提供零样本推理、通用响应与语言生成的基础能力
-
长期记忆:设计用于持久存储的关键信息,通常通过外部知识库实现,包含以下功能:
- 自动摘要生成:将多轮对话提炼为结构化记忆
- 上下文绑定:记录记忆上下文以防止错误泛化
- 多模态存储:同时保存文本、图像、音频等多种模态记忆
-
短期记忆:受限于注意力机制的大语言模型上下文窗口中的活跃信息,包含以下关键技术:
- KV缓存管理:复用键值缓存以减少冗余计算
- 上下文压缩:使用摘要替代详细历史(如:"前5轮对话讨论了项目预算")
- 滑动窗口注意力机制:仅关注最近N个token,同时保留特殊标记
- 记忆摘要注入:将长期记忆摘要动态插入短期上下文
-
情景记忆:记录特定用户交互历史的记忆类型,是个性化AI的基础:
- 用户身份识别:跨会话识别同一用户
- 交互轨迹记录:保存用户决策路径与反馈
- 情绪状态追踪:记录用户情绪变化规律
- 偏好演化建模:捕捉用户兴趣长期变化
-
记忆遗忘:大模型中刻意设计的遗忘机制,包含以下技术实现:
- 选择性遗忘(机器遗忘):移除训练数据中特定信息的影响,例如通过遗忘层覆盖特定知识
- 隐私保护遗忘:自动识别并删除个人身份信息(PII),或设置自动过期策略
- 记忆衰减:根据使用频率自动降低低频访问记忆的优先级
- 冲突驱动遗忘:当新证据与旧记忆冲突时,策略性更新或淘汰旧记忆
-
记忆检索:从海量记忆库中精确定位相关信息的复杂过程:
- 语义预过滤:通过向量相似度匹配获取Top-100候选结果
- 上下文重排序:根据当前查询上下文重新排序结果
- 时间过滤:优先选择最新相关数据
-
记忆压缩:在资源受限条件下最大化记忆效用的技术体系:
- 内容级压缩:提取核心信息并舍弃冗余细节
- 表征级压缩:向量量化(如乘积量化编码)、维度约简
- 组织级压缩:聚类相似记忆、构建分层记忆结构
- 知识蒸馏:将外部记忆中的关键模式迁移至参数化记忆
📚 论文列表
以下论文按发表日期排列:
综述
时间
论文与摘要
标签
链接
2026-10-06
Towards In-Parameter Memory Augmentation for Large Language Models
• 综述参数内记忆增强:将预训练后获得的事实、偏好、文档或经验编码为可用于推理的参数对象。
• 按嵌入、注意力、FFN 或混合位置,以及部署前后获得记忆两个正交轴整理方法与边界。
• 提出干扰、安全、上下文协同和自我改进方向;这是方法综述,不提供统一新模型的实测优势。
2026-09-30
The Evolution of Attention in Large Language Models: Mechanisms, Trade-offs, and Emerging Trends
• 将注意力演化视为模型内部上下文记忆的表示、更新、访问、读取与整合问题。
• 梳理 59 个发布记录与 11 个开放端点,比较显式缓存、循环状态、稀疏访问及跨层复用。
• 提出多维有状态记忆路由假设;属于机制综述与架构归纳,不是统一受控性能实验。
2026-09-25
Machine Unlearning for Large Language Models: Foundations, Advances, and Agentic Extensions
• 综述模型参数及智能体外部状态中的遗忘。
• 使用五层系统框架和六类证据维度比较移除主张及恢复测试。
• 指出仅评测模型不足以证明记忆、工具和后续更新中的影响已移除。
2026-09-08
Graph-Based Personalized Memory for LLM Agents: Representation, Evolution, Retrieval, and Evaluation
• 综述长期个性化智能体的图记忆。
• 围绕表示、演化、检索和评测组织研究。
• 比较设计选择,并梳理可靠性与可控性挑战。
2026-07-28
Memory for Large Language Models
• 从模型架构视角综述大语言模型记忆。
• 按表示形式、更新动态及持久性组织记忆机制。
• 综合分析写入、路由、固化、效率权衡及评测方向。
2026-07-20
The Chronos Vulnerability: A Taxonomy of Temporal Persistence and Memory-Based Deception in Agentic AI
• 分类梳理有状态智能体中的时间持久攻击。
• 分析记忆注入、延迟欺骗及工作流级威胁模型。
• 综合轨迹监控、形式验证及可信记忆等防御方向。
2026-06-25
Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents




[](https://arxiv.org/pdf/2606.26627v1)
• 本文从数据中心视角综述 LLM Agent 的隐私问题,关注智能体查询、存储、记忆、交换并据此行动的数据,而不只是按攻击类型分类。
• 论文围绕数据库、文档集合、API、跨会话记忆、中间工作流状态和多智能体通信组织风险,指出敏感信息可能在最终回答生成前就通过多种路径泄露。
• 该综述强调 Agent 隐私需要覆盖记忆写入、检索、委托、日志和工具调用的全生命周期控制,因此持久状态与数据治理是安全部署的核心问题。
2026-06-23
Are We Ready For An Agent-Native Memory System?




[](https://arxiv.org/pdf/2606.24775v1)
• 本文从数据管理视角研究 Agent Memory,指出面向 LLM Agent 的记忆不应只被视作检索增强组件,而应作为支持持久化存储、检索、更新、整合与生命周期治理的系统来评估。
• 论文将 Agent 原生记忆系统拆解为四个模块:表示与存储、提取、检索与路由、维护,并在这一框架下评估了 12 个代表性记忆系统和 2 个基线,覆盖 5 类基准工作负载与 11 个数据集。
• 实验表明不存在一种在所有场景下都占优的记忆架构,效果高度依赖记忆结构与工作负载瓶颈的匹配;细粒度消融进一步量化了表示保真度、检索精度、更新正确性和长程稳定性等因素,成本分析也显示局部维护通常比全局重组更高效。
2026-06-10
Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application




[](https://arxiv.org/pdf/2606.12191)
• 本文系统梳理了LLM代理环境的全生命周期框架,覆盖建模、合成、评估与应用四个核心环节。
• 提出了符号与神经两类环境合成范式,并从结构属性与能力维度分析了环境设计的演化路径。
• 强调代理与环境的协同演化机制(记忆、工作流、轨迹与探索),并指出未来将走向环境即服务与多代理生态。
2026-06-09
Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Evaluation




[](https://arxiv.org/pdf/2606.10749)
• 本文从生命周期视角系统刻画LLM代理的安全风险,并统一建模信息流、授权委托与持久状态三类关键交互。
• 通过综述247篇研究,归纳攻击面、防御机制与评估体系,揭示当前安全方法整体仍偏脆弱且不完整。
• 强调需要构建可信边界清晰、权限控制原则化、且贴近真实环境的长期状态安全评估框架。
2026-06-04
Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads




• 将 Agent Memory 定位为长程有状态工作负载,而不只是检索增强模块。
• 提出系统导向分类法和阶段感知 profiling 工具,用于拆解构建、检索和生成成本。
• 分析十个代表性系统,并总结面向规模化部署、新鲜度与延迟权衡的系统建议。
2026-05-23
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory




• 提出 MemEye,一个以视觉为中心的基准测试,用于评估多模态 Agent 的长期记忆能力,避免文本主导的"捷径"问题。
• 设计了二维评估矩阵(X轴:场景/区域/实例/像素粒度;Y轴:原子检索/关系关联/演化合成推理深度)。
• 引入三阶段验证闸门,确保问题无法通过文本上下文、简短字幕或超出 VLM 能力的方式被解决。
2026-06-01
EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning




• 提出 EverMemOS,一个三阶段记忆生命周期(情景记忆形成 → 语义整合 → 重构式回忆),将碎片化对话组织为结构化、可演化的记忆单元(MemCell/MemScene)。
• 引入 MemCell 作为原子记忆单元,包含 Episode + Atomic Facts + Foresight + Metadata;MemScene 用于场景级整合,支持长期用户画像演化。
• 设计重构式检索范式,包含 MemScene 引导检索、前瞻有效性过滤和充分性验证,实现长期推理中"必要且充分"的上下文获取。
2026-05-19
An Agent-Oriented Pluggable Experience-RAG Skill for Experience-Driven Retrieval Strategy Orchestration




• 识别了流水线式检索的三个工程问题:策略逻辑不可复用、路由决策不可观测、工作流耦合导致不可演进。
• 提出 Experience-RAG Skill,包含六个模块(统一接口、场景分析、经验记忆、策略路由、检索器池、结果打包),将检索策略选择封装为可插拔的 Agent skill。
• 规则路由(0.8924)优于学习路由(0.8778/0.8627),经验记忆记录 (scene_features, score_vector, best_margin) 为未来升级到学习路由奠定基础。
2026-04-17
Human Cognition in Machines: A Unified Perspective of World Models





• 从认知架构视角统一梳理世界模型中的记忆、感知、语言、推理、想象、动机与元认知等能力。
• 提出面向科学发现的 Epistemic World Models 类别,并给出跨视频、具身与认知世界模型的分类和未来方向。
2026-04-17
Agentic Frameworks for Reasoning Tasks: An Empirical Study





• 对 22 种常用 Agentic 框架在 BBH、GSM8K 与 ARC 上进行统一评测,比较准确率、耗时、成本与跨基准一致性。
• 结果表明性能差异主要来自编排质量,尤其是记忆控制、上下文增长和失败重试机制会显著影响效率与成本。
2026-04-09
Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering


• 从“外化”视角综述 LLM Agent 的记忆、技能、协议与 harness 工程。
• 指出记忆外化跨时间状态,技能外化程序能力,协议外化交互结构,harness 负责统一协调这些模块。
• 梳理了从模型参数到上下文再到外部基础设施的演进路径,并讨论其中的关键权衡与开放问题。
2026-03-05
Beyond the Context Window: A Cost-Performance Analysis of Fact-Based Memory vs. Long-Context LLMs for Persistent Agents


• 解决业界关于长上下文模型与外部记忆系统在构建持久化代理时的效能与成本优劣之争。
• 在三大主流记忆基准上,从准确率与累计 API 推理成本双重维度,系统交叉评测长上下文与事实型外部记忆方案。
• 长上下文在事实召回上具有优势,但成本随轮次递增;在 100k 上下文长度下,记忆系统在约 10 轮交互后即可实现成本反超,为实际工程选型提供了量化依据。
2026-03-02
Modular Memory is the Key to Continual Learning Agents


• 传统基础模型在持续学习时依赖权重更新,极易导致灾难性遗忘,难以实现大规模经验积累。
• 提出一种结合上下文学习与权重内学习的模块化记忆架构路线图。
• 该架构利用上下文学习实现快速适应,通过权重更新实现能力固化,为构建真正意义上的终身学习智能体提供了理论指引。
2026-03-02
Emerging Human-like Strategies for Semantic Memory Foraging in Large Language Models


• 旨在探究大语言模型内部在处理海量语义记忆时,是否具备类似人类的高效策略性访问机制。
• 借助机械可解释性技术分析语义流畅性任务,严密剖析模型内部收敛性与发散性的记忆搜索模式。
• 证实 LLM 不同层级中存在类人的策略性记忆搜寻行为,为认知对齐研究及强化人机协作奠定了可解释性基础。
2026-02-26
Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions



• 本论文探讨了个性化LLM驱动代理的基础、评估和未来方向,对个性化 LLM 驱动代理的基础、评估及未来方向进行了能力导向的系统性综述。
• 论文围绕用户画像建模、记忆、规划和行动执行这四个相互依赖的核心组件构建了分类法。
• 本文综合分析了用户信号的表示、传播与利用方式,并探讨了从通用辅助到专业领域的应用场景及设计权衡。
2026-01-14
Rethinking Memory Mechanisms of Foundation Agents in the Second Half: A Survey



[](https://arxiv.org/pdf/2602.06052)
• 从存储介质、认知机制和服务主体三个维度构建了统一的分类框架,系统化地定义了基础智能体记忆的分类学。
• 深入剖析了记忆在单智能体与多智能体系统中的动态操作机制,并归纳了提示词学习、参数微调和强化学习三种主流的学习策略。
• 全面梳理了现有的评价指标与基准测试体系,并结合多领域应用现状,提出了提升记忆效率、安全性及多模态能力的未来研究方向。
2025-12-15
Memory in the Age of AI Agents: A Survey



[](https://arxiv.org/pdf/2512.13564)
• 提供了一个全面且最新的智能体记忆全景图,明确将其与 LLM 记忆、RAG 和上下文工程等相关概念区分开来。
• 引入了一个统一的分类体系,通过三个视角审视记忆:形式(Token 级、参数化、潜在)、功能(事实性、经验性、工作)和动态(形成、演变、检索)。
• 探讨了新兴的研究前沿,如面向自动化的记忆设计、强化学习集成和可信度,同时汇编了具有代表性的基准和框架。
2025-09-18
A Survey of Machine Unlearning
[](https://dl.acm.org/doi/full/10.1145/3749987)
• 深入探讨了机器遗忘的概念和背景,强调了其在现代机器学习中的重要性。
• 机器遗忘旨在使学习算法能够有效地消除特定数据的影响,而无需进行完整的模型重新训练。
• 论文分析了机器遗忘的必要性、挑战和设计要求,回顾了当前的研究进展,并强调了该领域在算法有效性、公平性和隐私保护方面的复杂性和多样性。
2025-09-02
A Survey on the Memory Mechanism of Large Language Model based Agents
[](https://dl.acm.org/doi/pdf/10.1145/3748302)
• 探讨了基于 LLM 的智能体的记忆机制,强调了记忆在智能体自我进化和复杂交互中的关键作用。
• 系统总结和分类了现有的记忆模块设计和评估方法,并分析了它们在不同应用场景中的作用和局限性。
• 此类智能体能够改善决策制定和任务执行。
2025-05-31
A Survey of Machine Unlearning in Large Language Models: Methods, Challenges and Future Directions

[](https://arxiv.org/pdf/2503.01854v2)
• 论文调查了大语言模型(LLM)中的机器遗忘,旨在有效消除不良数据(如敏感或非法信息)的影响,无需完全重新训练,同时保留整体模型效用。
• 它定义了 LLM 遗忘的目标和范式,并建立了一个全面的分类体系。
• 论文回顾了现有方法,评估了它们的优势和局限性,并讨论了未来的研究机会。
2025-05-27
Rethinking Memory in AI Taxonomy, Operations, Topics, and Future Directions
[](https://arxiv.org/pdf/2505.00675)
• 探索了人工智能(AI)中关于记忆的多维研究,特别关注大语言模型(LLM)中的记忆操作和管理。
• 对各种类型的记忆表示和操作(包括整合、更新、索引、遗忘、检索和压缩)进行了分类,并系统分析了记忆在 AI 中的重要性及其实现方式。
• 通过广泛的文献回顾,论文确定了四个关键研究主题:长期记忆、参数化记忆、长上下文记忆和多源记忆整合。
2025-04-24
Cognitive Memory in Large Language Models
[](https://arxiv.org/pdf/2504.02441)
• 对大语言模型(LLM)中的记忆机制进行了全面考察,特别关注不同类型的记忆及其在模型中的作用。
• 虽然 LLM 在信息检索和交互总结方面表现出色,但其长期记忆仍然不稳定。
• 将记忆集成到 AI 系统中对于提供上下文丰富的响应、减少幻觉、提高数据处理效率以及实现 AI 系统的自我进化至关重要。
2025-04-23
From Human Memory to AI Memory A Survey on Memory Mechanisms in the Era of LLMs
[](https://arxiv.org/pdf/2504.15965)
• 探讨了人类记忆与基于 LLM 的人工智能(AI)系统的记忆机制之间的关系。
• 主要贡献包括系统定义了 LLM 驱动的 AI 系统中的记忆,及其与人类记忆的概念联系。
• 论文提出了一个基于对象、形式和时间的三维记忆分类体系,并总结了当前个人记忆和系统记忆研究中的关键开放问题。
2025-04-02
Digital Forgetting in Large Language Models: A Survey of Unlearning Methods
[](https://arxiv.org/pdf/2404.02062)
• 论文探讨了大语言模型(LLM)中的数字遗忘及相应的遗忘方法,重点是解决与隐私、版权和社会伦理相关的问题。
• 它分析了不同类型的模型架构和训练过程,以及数字遗忘的实际方法,包括数据重新训练、机器遗忘和提示工程。
• 通过引入“遗忘保证”的概念,论文强调了精确遗忘和近似遗忘的有效机制。
2025-01-12
Human-inspired Perspectives: A Survey on AI Long-term Memory
[](https://arxiv.org/pdf/2411.00489)
• 本文系统地考察了人类长期记忆机制与 AI 长期记忆之间的相互作用,并提出了一种自适应长期记忆认知架构(SALM)。
• 它介绍了人类记忆的结构,包括感官记忆、工作记忆以及不同类型的长期记忆(情景记忆、语义记忆和程序记忆)。
• 论文分析了 AI 长期记忆的分类——参数化记忆和非参数化记忆——及其存储和检索机制。
方法类与框架类论文
时间
论文与摘要
标签
链接
2026-10-08
What to Admit and How to Present: Governing Persistent Memory in LLM Agents
• 将哪些记忆进入工作上下文与如何呈现它们分离,研究准入和呈现对安全性的独立作用。
• 整条记忆或类型化单元经属性裁定与确定性策略筛选,比较匹配准入预算和固定呈现的条件。
• 外部基准失败率下降 6.7、8.8 个百分点,但个性化失败增加,预注册条件未全部满足;安全收益具有任务依赖性。
2026-10-08
Gated Memory: Admission-Controlled Memory Formation for Conversational AI
• Gated Memory 在事实提取之前设置准入边界,保留原话中的临时性、条件和隐私语境。
• 通过准入与条件化补全两阶段生成带来源、类别、适用范围及时空信息的原子事实,禁止凭空新增实体。
• 固定检索和生成条件下,LoCoMo-10 的裁判准确率相对提高 2.6%;样本情绪密度特殊,外推需谨慎。
2026-10-08
REMORY: Learning Residual Memory for Context Compaction
• REMORY 在文本摘要后补充有界软记忆 token,保存后续决策可能需要的残差信息。
• 记忆网络同时读取历史和摘要,学习使冻结 LLM 的续写逼近完整历史条件下的行为。
• SummHay 用 5.2% 输入位置接近完整上下文联合分数,并减少代理重复工具输出;结果限于所测模型和任务。
2026-10-08
From Retrieval to Reconstruction: Constructing Evolvable Cognitive Memory for Long-Term Dialogue
• CogMem 用人物、事件、概念、主张和事实分离来源归属与客观记录。
• 增量构建有出处的记忆图,巩固事实并协调有时间范围的矛盾主张,通过锚定、遍历、交集和证据落地重建上下文。
• LoCoMo 和 LongMemEval 上多跳、时间与更新任务表现较强,消融支持各组件互补;摘要无统一效应量。
2026-10-08
Beyond Sequences: Distilling Structured Decision Memory for LLM Recommendation
• MARI 将用户以往决策中的目标、约束和权衡存为可解释的结构化决策记忆。
• 离线从异质行为和用户内容蒸馏记录,在线检索相关记忆增强 LLM 决策,分离构建和推理成本。
• 下一物品预测和困难选择任务优于所测基线;依据是离线推断的决策理由,不等同于已知用户真实动机。
2026-10-08
Memory Type Varies: Empowering LLM Agents for Long-Term Memory with Diverse Strategies
• MemoType 通过区分记忆类型和查询类型,避免多类语料共用一种检索策略。
• TriMEM 提供类型标注,学习路由器选择对应记忆和检索方案,并分析统一策略的精度上界。
• 三个数据集上最高 Recall@1 改善 16.18%;类型划分和路由质量仍限定该方法的适用条件。
2026-10-08
DeltaReplay: Task-Relative Memory Reuse for Mobile GUI Agents
• DeltaReplay 将轨迹记忆的可用性定义为相对当前任务的逐步关系,而非整条轨迹是否匹配。
• 保存页面和动作转移图,把动作拆成通用操作与任务参数,再决定照用、替换参数或交还基础代理。
• AndroidWorld 和 SPA-Bench 成功率最高分别提高 10.3、25.0 个百分点;主要验证部分匹配轨迹复用。
2026-10-08
MemTrial: Learning When to Trust Memory in LLM Portfolio Agents
• MemTrial 按经验对同日决策的边际改变赋予记忆信用,减少市场共同波动造成的错误归因。
• 用八种经验组合估计 Banzhaf 值,跨日期和相似经验做层级贝叶斯汇聚,并经未见日期验证后才采信。
• 五种设置的平均效用比最强经验学习代理高 21.2%;无效时保守锚定仍可能亏损,不能解释为投资收益保证。
2026-10-08
DPPM: Dual-Path Parametric Memory for Personalized Language Models
• DPPM 将参数记忆中的早期证据保持和顺序偏好更新分为互补路径。
• Evidence 路径汇聚历史表征,Delta 路径递归更新联想状态,融合生成与用户历史对应的 LoRA 适配器。
• 多骨干实验中 PersonaMem-v2 为 54.22%、PrefEval 为 86.79%;证据针对所测个性化任务。
2026-10-08
Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks
• Memento 3 把可修订环境假设存为自然语言规则簿,使语义记忆成为显式世界模型。
• 将规则编译成可执行代码,预测误差驱动修订;只有模型忠实性检查和逐格转移回放通过才接受更新。
• ARC-AGI-3 的 25 个公开游戏全部通关,Pong 仅测试三局;公开游戏和有限案例不足以证明通用自我改进。
2026-10-08
Event-Centric Memory with Query-Aware Graph Augmentation for Long-Term Conversational Agents
• QGMem 用事件中心的原子记忆和动态轨迹保存个人经历、状态变迁及当前状态。
• 混合召回与查询重排激活紧凑工作记忆,再构造局部图并编码为图 token 供 LLM 结合文本使用。
• 六个基准报告检索、多跳证据组合和冲突解决改善;摘要仅给定性汇总,未提供统一幅度。
2026-10-08
Look Back, Think Ahead: Visual Memory on Demand for Efficient Multimodal Reasoning
• ViMoD 在紧凑视觉上下文之外保留可恢复细节,支持推理阶段变化时按需回看。
• 粗粒度组与原始细粒度 token 建立链接,路由器根据解码历史选择、保留或替换活跃细节组。
• 20% 视觉 token 预算下在八个推理基准胜过所测基线,平均归一化分数高 39%;实验主体为 Qwen3-VL-4B。
2026-10-08
Use and Disuse: Intent-Structured Experience Consolidation for Memory and Learning in LLM Agents
• Hippocam 按嵌套意图组织正在进行的工作,将已完成任务逐步巩固为持久经验。
• 递归压缩较早历史但保留原始交互,按需逐层恢复;被重新使用的经验与新经验共同巩固、补充和更新。
• 提出无需参数更新的记忆与学习架构;所读摘要未提供定量实验,效果不应视为已充分验证。
2026-10-07
Relevance Is Not Sufficiency: What Actually Closes the Evidence Gap in Long-Term Memory QA
• BFR 将召回目标从单条相关性改为能共同回答问题的充分证据集合。
• 固定平面记忆库下,按问题信息需求选择初始子集,再通过更深文本搜索、实体和会话视角补齐未见记录。
• LongMemEval-S 裁判准确率从 72.4% 提升至 82.2%,Turn Hit 为 91.4%;结论依赖固定存储和既定预算比较。
2026-10-07
COOL: Curiosity-Driven Object Ownership Learning for Personalized Robotic Assistance
• COOL 从长期人物—物体交互记忆推断所有权,支持带归属条件的机器人服务。
• 两个语言代理共享位置与事件记录,一个检索证据推断归属,另一个按信息价值和陈旧程度探索并刷新记忆。
• 离线、消融及真实机器人实验支持方法;不确定归属可标记共享或未知,效果受感知和跨时间身份关联影响。
2026-10-07
Learning Situation-Conditioned Thinking Policies for Long-Term LLM Agents
• 将历史推理经验转为情境条件的思考记忆,预测当前应激活何种思考而不不断扩充显式上下文。
• 跨独立情节分析临时经验,发现长程规律并巩固为新知识,由轻量策略调用、LLM 完成具体推理。
• 报告 DeepSeek 推理 F1 从 0.789 提升至 0.868;部分受控指标达 1.000,不能外推为开放任务完美表现。
2026-10-07
SkillForge: Co-Evolving Skills and Agents via Dynamic Skill Lifecycles
• SkillForge 将技能视为可过时的流程记忆,以试用、激活、稳定和退役管理其生命周期。
• 基础模型回放先剔除低适应度技能,随后在 RL 中持续验证、稳定、变异和退役,与策略共同演化。
• 多个交互基准成功率相对最强基线最高改善 7.8%,并提供 5,000 余条生命周期记录;证据主要在训练期技能库中取得。
2026-10-07
HGP:An on-device personalized agent memory via hybrid graph storage
• HGP 为异质长期记录建立混合图记忆,保留情节、语义和流程的类型与关系差异。
• 轻量分类器路由不同记忆图,以工作记忆状态轨迹表示当前约束,并增量更新用户档案。
• 两个基准中,PAL-Set 的 S-score 为 35.58,比最强基线高近 7 点;设备端通用性未由摘要充分展开。
2026-10-07
ExperienceIndex: Artifact-Grounded Memory
• ExperienceIndex 把以前任务发现的文档贡献和文档间关系保存为面向材料的持久经验。
• 单文档与文档对两类记录来自推理轨迹,经验检索帮助新任务找到完整相关材料,并可从强模型传给弱模型。
• 答案质量最高提高 11.0 点、在线费用最高下降 50.5%;跨任务转移在相同材料语料上验证。
2026-10-07
VideoEvolve: Co-Evolving Memory and Retrieval for Long Video Understanding
• VideoEvolve 联合改进记什么和如何召回,避免固定视频记忆与动态问题检索不匹配。
• 从低帧率概览出发,记忆与检索 Evolver 交替强化学习;瓶颈和能力反馈决定补充证据与训练方向。
• 多个长视频基准显示有效,正文明确语言/多模态模型承担记忆写入和检索;摘要未给统一效应量。
2026-10-07
EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory
• EngramEdit 把条件记忆作为独立可编辑知识接口,更新事实时保持 Transformer 骨干固定。
• 计算跨表达一致的目标记忆表征,联合修改共享 n-gram 嵌入,并对频繁复用项施加更强保护。
• 实验报告近乎完美编辑成功及多跳收益,同时大体保留无关知识;结论依赖所测条件记忆架构。
2026-10-07
Never Look Back: Understanding Persistence in 3D Object Memory from Egocentric Videos
• Ledger 保持离开视野的物体位置、历史和文字细节,使助手可回答事先未知的空间问题。
• 按稳定停留位置组织带时间观察,多次证据才确认移动;语言模型读取保存的文本记录,无需重新观看原始视频。
• HD-EPIC 准确率从 29.7% 提升至 42.6%;跨场景串接仍暴露构建和召回失败,离线记录实验不等于实时部署。
2026-10-07
MemoWM: How World Models Change What Agents Need to Remember
• MemoWM 按世界模型能够重建的内容分配经验记忆,只保留具有额外任务价值的信息。
• 以重建误差对后续任务的影响权衡存储成本,用共享预测补回省略内容,并计入模型参数成本。
• 五个基准平均准确率 42.42%,比最强基线高 2.62 个百分点,经验存储比 MIRIX 少 53.9%;总成本仍取决于模型容量与经验量。
2026-10-06
AgentMemGate: Addressing Speculation Contamination in Conversational Assistant Memory
• AgentMemGate 针对把未决计划写成既成事实的推测污染,控制用户档案记忆的写入边界。
• 将语句分为推测、完成事件、纠正及其他,推测须满足条件后才提升为记忆,并支持删除。
• 困难留出集污染率为 3.4%–5.7%,任务准确率提高 9–13 个百分点;档案字段匹配仍是主要瓶颈。
2026-10-06
Decide Before You Look: Learning Which Retrieved Memories Deserve Pixels
• PixelTriage 在记忆检索后决定哪些图像值得传入原始像素,而非一律用图片或文字代理。
• 小模型依据对话、笔记和缩略图预测像素的边际回答价值,以冻结 27B 模型的有无像素对照生成监督。
• 三个基准用 11%–23% 视觉 token 且无显著准确率损失,DMV 快 2.9 倍;该结果依赖所测回答模型和预算。
2026-10-06
DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks
• DAEDALUS 无需预设任务或 oracle,从自生成练习构建可复用流程记忆。
• 探索者生成任务,求解者从失败提炼启发式,只有反复成功验证后才接受并巩固到测试时记忆库。
• 三个交互基准平均成功率最高提高 15.9 点、pass^5 最高为 2.2 倍;启发式可跨模型迁移,仍依赖探索预算与环境反馈。
2026-10-06
Test-Time Agent Evolution for Long-Horizon Legal Reasoning
• 将部署时的案例经验召回、适配与巩固作为持续记忆演化,支持长程法律推理。
• 记忆更新配合按程序与行为规则校验的角色协作,在不更新模型参数的条件下复用先前经验。
• 五个基础模型在 J1-EVAL 和 LegalWorld 持续改善,消融显示记忆与协作互补;基准收益不等于现实法律决策可靠性保证。
2026-10-06
DeltaTTT: Layerwise Optimization for Nonlinear Recurrent Memory
• DeltaTTT 针对非线性记忆单遍优化困难,说明串行状态依赖并不自动优于固定基点并行更新。
• 把两层记忆网络的联合内循环优化改为逐层局部预测目标和状态依赖 delta 更新,同时支持分块并行。
• DeltaNet 与 LaCT 骨干上的语言建模和检索优于循环基线;因果解释仍来自探索性优化实验。
2026-10-06
MINDSET: Energy-based Schema Evolution for Long Conversational Agent Memory
• MINDSET 将记忆视为受约束的版本化状态管理,保留不可变情节及当前和历史图式。
• 最小能量转移在强化、覆盖、分裂与创建间选择,平衡冲突、历史损伤和碎片化,并用滞后避免过早重写。
• 850 个问题上报告较强回答和检索指标;MemoryAgentBench 差距较小,跨模型检查另使用 700 问题样本。
2026-10-06
When Forgetting is not Catastrophic: On the Mechanics of Spurious Forgetting
• 将表面遗忘拆成共享方向导致的可逆访问丢失与个别事实的真实侵蚀。
• 最小联想记忆解释动态,并用合成 Transformer 的公共偏移扣除和预训练模型更新方向移除做干预。
• 去除共享方向可恢复旧事实,表明召回崩塌不必然等于存储消失;长期事实特异变化仍可能造成真实遗忘。
2026-10-06
Whose Memory Is It? Scope-Aware Commit Rules for Long-Term LLM Memory
• CASK 用话语归属约束持久写入,防止假设、分支或他人信念变成共享事实。
• 识别模型内部的归属信号,但保存稳定关系而非易变坐标;临时内容仅在原范围可用。
• 受控长对话冲突与工具轨迹显示改善准入并减少后续污染;稳定关系的有效性由所测表征和场景支持。
2026-10-06
Visual Memory Attacks Can Persist Through The KV Cache
• P-VMI 研究视觉恶意输入移除后,其影响是否仍通过后续 token 的缓存记忆保留。
• 优化图像使攻击在注意力屏蔽后持续,以缓存交换定位状态来源,并测试保留摘要 KV 的上下文压缩。
• Qwen3-VL-8B-Instruct 最强配置攻击成功率约 90%,且能跨更长对话持续;效果依赖指定攻击和移除条件。
2026-10-06
Frozen Models, Evolving Expertise: Model-Agnostic Learning from Deployment Experience for Multimodal Medical AI
• 通过外部技能、可信知识记忆和多模态案例库,使冻结模型从部署经历持续积累经验。
• 保存先前案例与可信来源支持的事实和视觉实例,更新只有改善新案例且不损害早期案例才保留。
• 六个基准、四个基础模型报告最高 34.2% 医疗任务改善,并展示迁移;这些基准结果不等于临床部署验证。
2026-10-05
When to Remember, When to Abstain: Category-Conditioned Retention for Reliable Agent Memory
• 按语义类别决定记忆保留置信阈值,避免把弱来源支持的价值观和信念写成事实。
• 在 100 个合成角色、4,715 条候选断言中比较统一阈值与类别条件阈值,联合测量可靠性和覆盖率。
• 更严格的价值观阈值将无支持保留从 6.2% 降至 4.0%;证据限于合成冷启动和重复留出实验。
2026-10-05
AMBER: Training Long-Horizon Web Agents through Append-Only Memory
• AMBER 用只追加的自由文本记忆防止长期执行中的事实和纠错反馈在覆写时丢失。
• 语言智能体联合学习推理、动作和记忆写入,以结果奖励端到端训练,无需大量定制监督数据。
• WebArena Lite 平均成功率比覆写记忆高 4.09 个百分点,五次运行解题覆盖高 4.8 个百分点;结果针对该交互基准。
2026-10-05
Lineage-Aware Memory Governance: A Derivation-Gated Framework for Privacy-Preserving Column-Level Access Control in Enterprise AI Agents
• Analytical Memory Unit 为缓存结果附上列级派生血缘,防止内容合法却派生自无权访问列的记忆被复用。
• 只有请求者获得全部来源列授权才召回结果,并检测同名指标的计算冲突。
• 六组实验消除所测泄漏并保留约 81.5%–82.6% 复用;保证依赖完整血缘,真实 LLM SQL 演示仅九次往返。
2026-10-05
Understanding and Mitigating Inference-Time Overreliance Using Agentic Memory
• MEMTRIM 研究即使记忆正确且检索恰当,局部证据重叠仍会引起推理过度依赖。
• 写入时建立记忆证据索引,读取时移除重复或冲突部分,同时保留有用的记忆独有信息,无需重训。
• 跨模型和嵌入式、结构化记忆实验显示减轻过度依赖并保留有用收益;摘要未给统一效应量。
2026-10-05
MemCo: Memory-Centric Collaboration for Generalizing LLM Agents to Unseen Environments
• MemCo 通过互补局部与全局记忆,把环境细节和可迁移流程分开保存。
• 从局部执行轨迹归纳全局工作流,并按当前状态和决策阶段路由记忆,避免盲目移植其他环境细节。
• 交互决策基准显示任务成功率提高、重复探索减少;结论来自所测未见环境,摘要未报告统一增幅。
2026-10-05
PACMI: Provenance-Aware Cascading Memory Invalidation for Long-Term LLM Agents
• 同时保留历史证据并撤销过期记忆的当前有效性,防止错误沿依赖记录传播。
• 以带类型依赖的来源图和四状态有效性格管理记忆,级联更新并检查陈旧前提。
• 100 个案例、300 个查询上最终准确率最高;去掉传播后错误由 3 增至 11,但该成对差异未达显著。
2026-10-05
Off-Policy Merging Beats On-Policy Self-Distillation for Continual Learning
• 研究新任务更新如何干扰已有能力,并用早期检查点学习的参数增量保护知识保持。
• 在捐赠检查点学习更新,再缩放合并到后训练模型;分布差距大时屏蔽敏感方向。
• 多个持续学习设置优于直接 SFT 和在线自蒸馏的旧/新任务折中,结论依赖所测检查点与任务。
2026-10-05
The Optimization Landscape of Learning Compacted Context Models
• 分析以少量 KV 向量保留完整上下文行为时产生的脆弱、平坦优化空间。
• 刻画穿过冻结模型的压缩目标,并以简化 Perceiver 架构学习连续上下文压缩。
• 在金融、法律、文学与代码选择题中匹配完整 Perceiver 并改善压缩效用;证据限于所测任务。
2026-10-05
ReMem: Streaming Video Understanding With Long Context Retention
• 针对视频流增长时历史信息逐步丢失,联合压缩记忆与按查询读取的视觉记忆。
• Streaming Context Memory 持续压缩历史,Retrieved Vision Memory 选择相关证据补充 VLM 输入。
• 无需训练的适配在多项流式及长视频基准上取得领先结果;摘要未给出具体绝对分数。
2026-10-05
Capability-Driven Self-Evolution of Agent Memory
• 按具体记忆能力维度演化写入与检索程序,避免总分掩盖局部退化。
• 依赖感知选择优化目标,利用历史诊断与成对差异轨迹整合不同程序的互补收益。
• PrisMem 在 BEAM-1M 和 LongMemEval-M 比最强所测基线高 10.54 与 7.83 个百分点。
2026-10-05
MarvisNav: Making Memory Visible on Route Choices for Zero-Shot Object Navigation
• 将已探索进度绑定到可见路线候选,使 VLM 在同一空间表示中读取目标相关性与探索记忆。
• 维护拓扑图,将节点及超越二元访问标记的局部探索状态投影到第一视角。
• HM3D 达到 81.2% 成功率和 42.5% SPL,并有真实机器人验证;无需导航策略训练。
2026-10-05
Test-Time Adaptation of Reasoning Strategies with Bayesian Nonparametric Memory
• 把从解题和自反思中得到的行为策略保存为可动态重组的跨领域经验记忆。
• 用分层 Dirichlet 过程混合模型聚类策略,按后验预测检索,并在线更新统计量、增加新簇与重分配策略。
• AIME’25、Omni-MATH 和 PhysReason 上优于所测记忆模块,包含冷启动设置;摘要未给出统一增益。
2026-10-05
VideoTapestry: Query-Adaptive Memory Refinement for Multi-Agent Long-Video Understanding
• 用全局叙事、事件结构与局部关系三层记忆保存长视频证据,并按问题进行细化。
• 各层专门智能体重新观察相关片段,将新证据合并回分层记忆后作答,无需训练。
• 四个基准相对直接 GPT-5.5 推理提高 7.0–17.2 个百分点;结果针对所测长视频问答设置。
2026-10-05
Balancing Memory Pathways: Analyzing and Improving Memory Utilization in Hybrid LMs
• 揭示混合语言模型偏重注意力记忆、未充分使用循环状态的信息保持路径。
• 辅助损失限制注意力读取早期上下文,同时允许循环状态贯穿全序列,训练两条记忆路径协作。
• 多个模型及问答、智能体任务均获改善,长上下文与信息聚合任务收益更明显。
2026-10-05
MemPilot: Orchestrating On-Demand Multimodal Memory Curation for LLM Agents
• 在查询时按需整理原始多模态历史,避免预先压缩丢失后续需要的细节。
• 强化学习控制器在已有记忆检索和委派 LLM/VLM 整理之间选择,并联合分配证据量、模型与视觉访问。
• 五个多模态记忆基准显示较好的性能、成本与延迟折中;收益随优化偏好而变化。
2026-10-05
Recursive Video In-Context Learning for Agentic Robot
• 将示范视频保存为可逐层访问的事件记忆,按规划和执行阶段召回不同粒度的操作证据。
• 按抓取、释放等子事件构建关键帧、阶段、时刻和短片层级,通过只读工具按需展开当前子目标。
• 每任务一个示范使 LIBERO-PRO 成功率从 92.6% 到 96.5%、LIBERO-Plus 从 86.7% 到 95.8%;无需训练。
2026-10-04
ProactiveVLA: Augmenting Embodied Memory through Proactive Environment Exploration
• ProactiveVLA 用主动环境探索扩充持久交互知识,使后续任务不只复用重复练习所得经验。
• 代理自拟物体可供性与状态变化目标,验证执行结果,再把任务和探索经验巩固进指导规划的记忆。
• 同预算 LIBERO-Pro 和 RoboCasa365 实验优于基线;Goal-T 单次 VLA 原语条件下为 48% 对 19%,不代表全部真实环境。
2026-10-04
MemTrace: State-Consistent Memory for Long-Horizon Coding Agents
• 同时保存执行历史与仓库状态来源,避免上下文刷新后恢复已失效的证据。
• 不可变轨迹按文件、符号和测试锚定为依赖图,紧凑锚点重建任务状态,读取前检查当前有效性。
• 同骨干和执行框架下,DeepSWE、SWE-EVO、SWE-Milestone 分别提高 21.2、4.4 和 17.8 点。
2026-10-04
Enhancing Long-Video VLM Embeddings with Query-Aware Streaming Latent Reasoning
• 用持久潜在 think token 累积跨片段证据,在固定输出大小下保持长视频信息。
• 按时间顺序流式读取有界帧集,结合逐步对比监督与最终表示自蒸馏;支持查询相关或独立索引。
• 2B 和 8B 模型 HourVideo Hit@1 分别从 54.2 到 70.7、57.4 到 72.8;迁移只验证于所测骨干。
2026-10-04
PreAct-Nav: Agentic Reasoning Before Action for Urban Navigation
• 保存中程子目标与相关执行经验,减少长路线决策对瞬时观察的依赖。
• VLM 在动作条件世界预测下评估路线,执行后用真实观察纠正假设并延续或改写记忆中的子目标。
• 作者报告动作选择改善,长路线和多转弯路线收益更明显;摘要未给出绝对成功率。
2026-10-04
EVISKILL: Grounding Skill Evolution in Replayable Evidence
• 将执行观察保存为可重放证据卡,使持久流程修改能够追溯其支持情境。
• 用针对性重执行校验技能编辑,跨轮保留证据及暂获支持的修改,经过全局验证才纳入最终技能。
• 三个交互基准和六个骨干实验支持该流程;摘要未给出统一效果数值。
2026-10-04
ReMAP: Restoring the Perceptual Cycle with Reasoning-Time Latent Visual Memory
• 联合静态全局与动态局部潜在视觉记忆,补回长推理中逐渐减弱的视觉依据。
• 全局记忆保存场景关系,局部记忆按当前推理状态重编码区域,由强化学习策略决定何时读取。
• MuirBench 与 MIMIC 比先前最强结果高 8.38 和 14.84 点;匹配问题上视觉 token 减少 51.0–76.8%。
2026-10-04
Memadapter: Counterfactual Adaptation Against Memory-induced Sycophancy
• 研究正确记忆也可能诱发迎合的问题,将记忆影响控制与简单过滤区分开。
• 反事实推断识别风险,结合当前任务反思调整每条记忆的推理权重,再以证据支撑回答。
• 三个基准上持续改善记忆可靠性;摘要未提供统一幅度,不能推断所有迎合行为均被消除。
2026-10-04
AECG: Asymmetric Experience Consolidation and Governance In Multi-Agent Systems
• 治理流程经验的过时、弱证据与协调范围错用,避免污染经验反复进入推理。
• 保存协调范围,按置信度和多尺度可靠性检测退化,以风险排序复核,修改技能经成对重放后才恢复使用。
• 三个框架、四个基准中 11/12 设置最优;去掉范围保持最多下降 16.89 点,结论限于所测任务。
2026-10-04
Learning without Overwriting: A Theory of Self-Distillation and Supervised Fine-Tuning in Continual Reasoning
• 从推理路径结构分析自蒸馏与监督微调为何具有不同的旧知识覆盖行为。
• 将推理建模为图搜索,推导提示诱导稀疏更新的保持效应与路径密集更新的遗忘风险。
• 在理论假设下给出优化保证,并指出预训练多样性的作用;属于理论分析,不能当作通用实证保证。
2026-10-04
StateWise: Diagnosing and Repairing Persistent Operational State Before Agent Actions
• 在行动前定位并修复已失效的持久运行记录,防止旧环境或旧需求成为错误前提。
• 反事实重规划定位关键记录,再以只读事实核验、意图澄清和类型化证据写入带修复来源的更正。
• 150 个可执行案例中正确率为 93.3%,基线为 38.7%,所测场景未出现不安全行动。
2026-10-04
Task Vector Descent: Learning from Non-IID Batches
• 研究连续同分布数据更新如何导致旧知识退化,以及新任务位移应保留多少。
• 对每段训练产生的任务向量及优化器状态同步缩放,比较完整更新与部分整合。
• 跨预训练和后训练设置,中间缩放系数常改善持续模型表现;匹配学习率比较说明收益不能完全由学习率解释。
2026-10-04
TeleTune: Evolving Agent Skills From Offline Telemetry
• 从缺少目标、不可重放且任务交错的遥测日志中形成可复用文本流程技能。
• 根据动作预测错误提出技能库修改,仅保留提升留出预测的改动,并按工作流为新任务检索示例。
• WorkArena 与 Online-Mind2Web 成功率达 77.1% 和 80.6%;离线验证比在线执行少用 5–75 倍 token。
2026-10-04
Have I Scene This Before? Spatially Grounded Conversational Memory for Complex Queries in Egocentric Assistants
• 将用户陈述绑定到持久三维对象,联合保存空间证据与可更新的会话事实。
• 对象中心记忆结合重建与分割,并用 Ego-SpaCR 的 620 段视频和 3,100 个查询评测跨场景召回。
• 取得所测方法最高总体问答准确率并降低输入 token;去掉三维证据显著损害表现。
2026-10-03
Principles that Guide, Actions that Inform: Agent Evolution via Knowledge Abstraction
• SAGA 把具体执行经验分层抽象成情节、流程和有适用条件的原则记忆。
• 保留执行证据链接,召回原则后结合当前任务实例化,通过纠错和动作重采样形成持续更新闭环。
• ScienceWorld 和 ALFWorld 上性能改善,消融支持情境实例化与动作调节的重要性;摘要未给统一量化增幅。
2026-10-03
What to Preserve in Recursive Computation: A Local Predictive Sufficiency Principle
• 以局部预测充分性约束递归压缩,减少历史状态经过多次变换后的信息丢失。
• 在 CCM 记忆宿主上构造预测检验,仅在保留约束受损时投影优化器更新;主文另含其他递归领域。
• DailyDialog 和多会话聊天中相对对应压缩宿主改善,较大记忆深度收益更明显;并非所有领域都证明同等效果。
2026-10-03
RETRACE: From Entangled Repair Histories to Reusable Experience for CI Repair
• 从夹杂失败、回滚和无关改动的 PR 历史中恢复问题级修复经验。
• 结合最终有效改动的逆向视角和提交演化的正向视角,由 CI 证据对齐,保存为三层抽象并供新失败检索。
• 565 个 PR 的基准上,MiniMax-M2.5 Pass@1 从 19.6% 到 31.9%,DeepSeek 从 23.3% 到 32.8%。
2026-10-03
A Tropical Geometry View of Forgetting: A Per-Unit Projector for Knowledge-Preserving Fine-Tuning
• 用 ReLU 单元自身激活的旧 token 定义知识保护子空间,减少全层共享保护约束的浪费。
• 由热带几何推导逐单元投影与保护预算关系,并比较门控感知和随机、忽略符号的 token 集合。
• OPT-1.3B 在六种匹配预算下遗忘更少;OPT-6.7B 保持相当且学习更多,剪枝修复分析另揭示局限。
2026-10-02
A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns
• 研究早先声明的安全约束在长交互中被遗忘并导致违规执行的问题。
• 结合历史语义约束恢复与执行前确定性审计,并分析条件违规风险的累积。
• GPT-5.5 设置下基线出现 11.5% 违规,防护实验中未观察到违规;理论结论依赖风险序列假设。
2026-10-02
Decoupling Memory from Context: Structured Memory for Token-Efficient Test-Time Continual Learning
• 将跨查询形成的策略保存为图记忆,避免经验随共享上下文无限追加。
• 持续积累、细化并关联策略,每次查询仅取相关子图,在有界检索下维持稳定的读取规模。
• 作者报告下游性能具有竞争力,记忆构建 token 比基线少约 81–85%;摘要未给出统一性能增益。
2026-10-02
When History Fails to Become Experience: Action Calibration in Language Agents
• 评测智能体是否真正把历史动作与结果关联为可用经验,而非只利用更多上下文。
• 打乱动作及观察对应关系,并用结果标注与学习式校准器重新评估、选择性记录行动经验。
• 乱序仅造成较小退化;显式结果关联减少动作重复并提高成功率,结论限定于任务内历史使用。
2026-10-02
Skill2Real: Agentic Skill Learning for Zero-Shot Sim-to-Real Robot Manipulation
• 从模拟执行经验形成局部操作与高层组合两级可执行技能,并跨环境冻结复用。
• 提议、验证、治理循环诊断执行结果并批准记忆更新;高层学习时冻结低层技能,再整体迁移到真实机器人。
• LIBERO-Pro Long 成功率从 2.0% 到 56.3%,四项真实任务平均完成率 78.75%;迁移无需技能更新。
2026-10-02
Interpreting at Write Time: A Policy Ablation for Multi-Goal Agent Memory
• 分析记忆写入时的目标选择如何决定压缩历史中被保留的信息。
• 固定读取步骤,比较无目标摘要、合并全部目标摘要以及分目标独立摘要。
• 分目标摘要在相关性、完整性和准确性上更优;收益取决于未来查询与写入目标是否匹配。
2026-10-02
When to Compile a Computer-Use Agent? Measuring Payback and Making Compilation Decisions for Token Efficiency
• 研究何时应将执行经验编译成可复用程序,并把失败编译和界面变化纳入生命周期成本。
• 记录成功与失败编译费用,根据任务到达历史和复用收益决定编译,在累计预算内控制执行。
• 成功编译的估计回本次数为 2–16 次;回放到达序列的模拟相对 ReAct 节省 17.3% token。
2026-10-02
SlimKV: Joint Token-Feature KV Cache Compression with Reconstruction-Free Beacon Attention
• 把长历史写入低秩 beacon 记忆,在 token 和特征两个维度压缩并保持可召回内容。
• 低秩感知训练结合逐层秩分配,并利用位置编码不对称性直接在潜在空间读取。
• 4–8 倍压缩保留超过 96% 原模型 LongBench 分数,16–32 倍压缩领先所测基线;包含证据位置召回检验。
2026-10-02
Sentry: Learning to Recover from LLM Agent Failures at Test Time
• 将执行失败后的有效修复保存为条件化经验,避免把整套经验持续灌入上下文。
• 仅在检测到匹配失败时检索外部手册,独立验证恢复成功后才写入新经验。
• 跨基准平均优于最强运行时干预基线 37%,经验可迁移到留出任务;完整手册暴露反而降低表现。
2026-10-02
KV$^2$: A Self-Refining KV Cache
• 研究不依赖未来查询的上下文内容保留,通过选择性重构决定哪些 KV 记忆应保留。
• 先用轻量评分选取信息性 token,再仅重处理该子集,估计最终淘汰分数。
• RULER 16K 在 2% KV 预算下比次优基线高逾 40 个百分点;结果针对所测压缩预算和任务。
2026-10-02
A Step Towards Forgetting: Optimiser History and the Loss of Answer Mass
• 将旧知识遗忘分解为答案内部混淆和答案集合外的概率流失,分析优化器历史的作用。
• 按梯度年龄拆解 Adam 更新,并在匹配初始更新范数的条件下重置动量检验知识保持。
• 旧梯度主要推动答案概率流失;重置历史降低后续旧任务损失,但即时效果依赖模型状态。
2026-10-02
SEER: Self-Evolving Event Reasoning and Retrieval for Time Series Forecasting
• 把预测误差转化为后续可复用的检索经验与因果规则,而非只追加新闻。
• 分别维护查询扩展、事件筛选的反思记录和因果知识库;更新严格限定于当时已知证据。
• 六个波动时间序列基准上优于所测预测和语言模型基线;改进针对事件驱动预测场景。
2026-10-01
SEDIMA: Cross-Run Hierarchical Insight Memory for Evolutionary Search Agents
• 把搜索轨迹提炼为跨问题复用的持久自然语言洞见,减少重复探索失败路径。
• 按语义相似性组织分层洞见记忆,以注意力加权簇中心检索后续变异所需经验。
• 固定 100 个候选预算下,AlgoTune 与 ALE-Bench LITE 最终表现平均提高 5.5% 和 6.6%。
2026-10-01
Mitigating Private Data Leakage in LLMs with Whiteout
• 通过定向覆写减少模型重现已记忆的个人敏感信息,避免大范围知识删除。
• 构建有针对性的混淆样本,检验不同模型上的效用保持与黑盒、白盒适应性攻击。
• 作者报告优于所测遗忘方法且效用影响较小;摘要未给出统一泄漏率,不能视为隐私绝对保证。
2026-10-01
APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
• 将会话历史组织为主题摘要、个人事实、轮次证据和原始消息四层记忆。
• 控制器按查询需要逐层展开,证据合成器整合事实、排列事件并标记矛盾。
• LongMemEval 上仅访问约 8% 会话即可取得较强表现;摘要未列出绝对准确率。
2026-10-01
Harnessing LLMs as Agents: What Does It Cost?
• 建立智能体记忆通信、访问方式和中间状态复用的资源理论。
• 以 LAM 抽象推导上下文与持久记忆容量、随机或顺序寻址及重计算次数之间的界,并分析验证可靠性。
• GPT-6 Astra 受控实验检验通信和可靠性预测;理论结论依赖固定语义模型与资源计费假设。
2026-10-01
How To Train Your World Model: Fine-tuning vs RAG for LM-based World Modeling
• 研究语言世界模型如何检索并复用探索得到的状态转移经验。
• 在五类环境中比较微调和经验检索,以反事实干预诊断召回错误,并结合参数动力学与主动维护的记忆库。
• 微调在 20 个设置中有 15 个获得更高奖励;混合系统进一步改善表现,但不同方式的数据效率不同。
2026-10-01
Fisher-Guided Submodular Data Selection for Continual Pre-Training of Large Language Models
• 把持续预训练数据选择视为知识遗忘控制,分析已承诺参数方向受扰动的机制。
• 将样本梯度分成高 Fisher 锚定方向和低 Fisher 可学习方向,以次模目标进行流式筛选。
• 医学适应实验中 10 亿筛选 token 在适应与遗忘指标上超过 100 亿 token 回放;证据范围限于所测模型和领域。
2026-10-01
Role-aware Heuristic Episodic Attention for Conversational LLMs
• 为全局指令与情节交互赋予不同保留策略,减少长对话中的注意力稀释和漂移。
• REA 保留指令前缀与用户输入,压缩模型回复,再按启发式选择原文、压缩表示或省略。
• Long-MT-Bench+ 分数从 6.32 升至 7.36,延迟改善 2.91 倍;评测含三个骨干及中英角色扮演。
2026-10-01
Madeleine: Learning Involuntary Recall for Conversational Memory from Simulated Lives
• 学习当前话语与不相似但相关生活记忆的联想召回。
• Madeleine 从模拟人生生成线索配对,在冻结相似度之上训练查询编码器的联想残差,在线不调用 LLM。
• 接入 HyperMem 得分 66.6,单独使用接近原 HyperMem 且上下文约为其 1/21;结果依赖官方 LoCoMo-Plus 协议。
2026-10-01
FlashBack: Knowing When to Remember in Streaming Vision-Language Models
• 研究历史视频记忆何时应被读取,避免不必要历史干扰实时感知。
• FlashBack 先判断历史证据需求,再用独立 Recall 轨迹及查询局部 Side-KV 融合长短期证据,不改持久 Native 状态。
• 在 OVO-Bench 和 StreamingBench 的多项记忆任务改善,实时能力大致保留;无需额外训练。
2026-10-01
Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models
• 研究输出不可见的私有关联能否在少量再训练后恢复。
• ReGap 由模型生成候选并以似然筛选,再训练 LoRA,不提供秘密答案或私有辅助数据。
• 六模型提升 6–21 个百分点;已暴露关联恢复率 42% 到 63%,未暴露对照无增益,表明潜在记忆残留。
2026-10-01
Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States
• 将历史组织为当前世界估计和未完成需求的显式信念状态,研究持续更新与失效恢复。
• PoS 检查状态一致性及任务进展,识别无进展陷阱后按陷阱与需求类型恢复。
• 四个执行和诊断基准上取得所测最佳总体表现;消融支持一致性验证与恢复,未证明开放世界可靠性。
2026-10-01
Managing Context and Communication in Distributed Agentic UAV Swarms
• 将运行知识写为原子笔记,区分核心、本地和伙伴专属共享记忆。
• 按事件驱动推理维护状态,以接收者相关的语义新颖度和时效选择 gossip 传播。
• 模拟搜救全部运行完成,泛洪仅 70–85%;推理 token 约减半,证据限于十机仿真。
2026-10-01
Not All Experience Belongs in the Weights: Component Routing for Self-Improving GUI Agents
• 拆分定位器、流程、状态事实和教训,比较经验进入参数或上下文记忆的适合度。
• 同一经验池受控分流,以重复性和状态条件性预测去向,并检验写入参数后外部笔记读取变化。
• 在留出骨干 24/24 单元预测去向,平均比较优单一路径高 3.5 分;证据覆盖两环境三种子。
2026-10-01
SIEVE: Selective attention-value Suppression for Vision-Language Models Unlearning
• 对同一人的敏感与允许信息实施选择性遗忘,而非整体移除身份知识。
• SIEVE 抑制待忘信息的注意力值,并结合冻结保留模型匹配与序列目标。
• 跨模型、多模态实验报告隐私删除与保留权衡改善;有效性限于测试的信息和访问方式。
2026-10-01
Typological Alignment of Stack-Based Language Models on Mildly Context-Sensitive Artificial Languages
• 研究堆栈工作记忆限制与语言顺序偏好及跨序列依赖泛化的关系。
• 在多种人工语言中比较堆栈语言模型对层次与跨序列依赖的学习。
• 模型普遍难学跨序列依赖,但有限工作记忆反而改善泛化;证据为人工语言模拟,非自然语言普遍定律。
2026-10-01
Causal Memory Policy: Making Memory Utility Identifiable by Intervening on Retrieval
• 指出从未被召回的记忆无法仅靠存储级操作估计效用,影响保留决策。
• CMP 预留上下文槽按已知概率抽样记忆,并用逆倾向加权估计召回介导的因果效用。
• 必要记忆识别 AUC 从 0.54 升到 0.66,但已识别效用仍不能预测未见查询的保留价值。
2026-10-01
AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents
• 学习何时压缩探索历史、保存哪些工作状态以及如何从摘要继续。
• AutoCompact 先用纠正后的轨迹监督,再联合强化学习编码与压缩行为。
• SWE-bench Verified 和 SWE-PolyBench Verified 分别提升 9.2、5.0 个百分点;256K 不溢出窗口仍有收益。
2026-09-30
Action Conditioned Bisimulation For GUI Agent Memory
• 用动作结果而非页面视觉相似度决定何时合并 GUI 经验状态。
• 在经验预测状态图上,仅当共享动作的结果与后继块一致时按可供性标签合并。
• 闭环实验提高成功率,等探索绕行、旧合并规则及无动作条件版本无同样收益;证据限于 MiniWoB++。
2026-09-30
MEMO: Multi-Level Entity-Aware Memory for Streaming Video Understanding
• 按实体、场景语义和空间结构组织流式视频记忆,避免粗粒度压缩丢失细节。
• 轻量全局与实体表示作索引,高分辨率证据另存,查询时选择性回读。
• 在 StreamingBench 和 OVO-Bench 改善多个骨干;方案免训练,但需保存可回读视觉内容。
2026-09-30
RefCon: Iterative Refinement and Contrastive Memory Extraction for Context-Evolving Agent
• 从有噪交互轨迹抽取可复用记忆,研究无金标准时的推理计算扩展。
• RefCon 联合顺序自修订与并行自对比,多轨迹提高记忆质量。
• AppWorld 与 BFCL-V3 上 ACE、ReMe 相对提高 21.6%、16.6%;多样性变体在 ReasoningBank 提高 35.5%,收益与 token 成本相关。
2026-09-30
Beyond the Remembered World: Predictive 4D Belief for Persistent Navigation in Evolving Worlds
• 从带时间戳的物体历史维护位置持久性、迁移与未知位置的概率记忆。
• EvolvingNav 随时间传播信念,用可见性校准的正负观察更新,避免重复计入证据。
• EvoWorld-Bench 含 54 场景与 803,680 任务,仿真及实机改善搜索;收益在可学习时间模式下最明显。
2026-09-30
Faithful Dual-constrained Erasure for Robust LLM Safety Alignment
• 分析危险知识被表面抑制而非删除后,良性再训练使其复现的机制。
• FDCU 用 Fisher 约束保护一般知识,并以双掩码阻止异常启用抑制参数,引导目标表示擦除。
• 报告对再训练攻击更稳健且一般效用损失较小;为所测知识擦除与输出控制任务,非删除的形式保证。
2026-09-30
Forking: Sudden Overfitting Under Replay
• 分析数据重放下 n-gram 记忆分支对训练续写过度编码造成的突然过拟合。
• 通过受控模型研究重复更新、低频上下文及表拥挤程度如何改变已见与未见续写概率。
• 在基础训练及短预算重复 SFT、类 RL 设置复现损失分叉;更长训练或拥挤表能抑制,非所有重放必然失效。
2026-09-30
LatentHarness: Learning Latent Actions for Memory and Reasoning via Counterfactual Policy Distillation
• 将输入证据和中间推理状态保存在快权重记忆中,联合学习召回与继续计算的选择。
• 内部策略选择 THINK、RECALL 或 EXIT;单步反事实分支按输出 token 收益蒸馏策略与记忆保留。
• 六基准中一般及长上下文推理相对提升 2.8% 和 10.0%;相对最强长上下文基线推理快 5.9 倍。
2026-09-30
Persistent Context Graphs for Efficient Memory Compaction in LLM Agents
• 将历史注意力重要度与消息依赖保存为持久上下文图,供新请求选择记忆。
• ReCAP 联合已存重要度、当前相关性及依赖遍历保留消息和支撑上下文,选择阶段不额外调用模型。
• 估计压缩及冷恢复延迟下降约 95%;SWE-Together 历史量约减半且质量相当,延迟为估计指标。
2026-09-30
MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories
• 将视频写为实体落地的第一人称文本情节,并研究增长记忆中的证据遗漏和检索竞争。
• MemLife 使用时间索引智能读取器;MemOpt 以强化学习优化写入忠实性、信息量和可检索性。
• 四个长期基准比最强免训练基线高 4.6–12.0%,写入优化再高 2.7–5.0%;查询时不访问原视频。
2026-09-30
ZoneClaw: Mitigating Persistent Memory Attacks by Establishing Memory-Zoning in OpenClaw-Style Computer-Use Agents
• 把持久保存外部声明与赋予行动权限分开,阻断跨任务记忆注入。
• ZoneClaw 设置分层信任区域和不对称权限进程,只有经可信区域交叉校验的内容才能晋升。
• 攻击成功从 372/480 降至 6/480,458/480 次保留效用;防御感知攻击覆盖有限场景。
2026-09-30
LabBook: Harnessing Experimental History for Efficient LLM-Driven Discovery
• 以可更新实验笔记指导完整实验日志的选择性读取和新程序生成。
• 每轮由同一智能体结合笔记与检索证据,同时输出下一程序和修订后的 LabBook。
• 49 个 Frontier-CS 问题上改善质量成本折中,并在另九任务有竞争力;结论相对所测演化基线。
2026-09-29
Eternal Sunshine of the Spotless Mind: Systematically Erasing LLM's Memories
• 研究删除请求后关联消息仍泄漏目标信息的问题,提出 DeLLM 记忆删除框架。
• 动态组装查询上下文,并维护消息来源图,沿依赖关系确定需要一并删除的内容。
• 实验报告较高删除率且保留效用;简单关键词或消息匹配不足,摘要未给出统一删除率。
2026-09-29
MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization
• 把用户历史偏好和约束压缩为固定数量软记忆向量,按读取后的任务行为优化。
• 联合组相对结果奖励与置信度门控的在策略蒸馏;文本记忆教师只重评分学生轨迹,推理时移除。
• PersonaMem 两种长度上取得所测最高准确率,并迁移到 PrefEval 和 LongMemEval;消融显示主要收益来自奖励项。
2026-09-29
Triadic Linear Attention: Three-Dimensional Recurrent States for Long-Context Sequence Modeling
• 将历史键值写入三阶张量记忆,以额外键轴扩大可寻址状态。
• 通过键、第二键和值的三元外积写入,用双查询收缩读取;兼容遗忘门、Delta 更新和分块并行训练。
• 报告长上下文语言建模与召回优于其他扩容方案;摘要未给出统一量化增益。
2026-09-29
Long-Term Memory-Guided Enhancement for Target Perception in Audio-Language Models
• 保存干净参考录音的类别隐状态,作为目标声音的长期表征记忆来抵抗声音干扰。
• 利用类别记忆重构输入音频 token,再与原 token 插值后送入冻结语言骨干;语音恢复另加可学习门控。
• 20 类诊断中分类增益为 29.53–46.15 个百分点;加门控的 Qwen2-Audio 词错率由 23.07% 降至 14.77%,证据为受控目标感知。
2026-09-29
MemEvo: Automatic Discovery of Streaming Video Memory Mechanisms
• 把持续视频观测的有界记忆设计转为可执行程序搜索,研究保留、巩固和召回机制。
• 领域语言显式规定表示、准入、保留、合并和预算;LLM 根据实验反馈提案,确定性流水线检验因果与容量约束。
• 在 StreamingBench 与 OVO-Bench 报告效果及效率改善;发现阶段依赖候选执行评估,运行时无需训练。
2026-09-29
Simple Agentic Memory for Generalist Robot Policies
• 按任务指令建立实体关系、进度和顺序状态,补足高层子目标中依赖历史的参数。
• SimpleARM 用感知与事件工具在线写入,结构化查询按需召回,再用当前视野重新定位实体;模型参数冻结。
• RoboMME 成功率 67.17% 对最强非 oracle 基线 44.51%;只验证回合内状态,使用基准专属解析规则,尚无真实机器人结果。
2026-09-29
EGSD: Event-Grounded Self-Distillation for Streaming Video Understanding
<img src="https://img.shields.io/badge/arXiv-Paper-%23D2691E?logo=arxiv" al