外部记忆与模型编辑
外部记忆与模型编辑
上下文窗口不是长期记忆。上下文是当前请求携带的输入,外部记忆需要负责写入、索引、读取、更新、权限和遗忘;参数中的知识则需要通过训练或编辑改变。本页讨论这些研究路线,产品级 RAG 基础见 RAG 基础,Agent 记忆架构见 Agent 架构与多智能体。
三种记忆位置
| 记忆位置 | 更新方式 | 优势 | 主要问题 |
|---|---|---|---|
| 上下文窗口 | 每次请求注入 | 简单、可见、易删除 | 长度和成本有限 |
| 外部存储 | 运行时读写 | 可更新、可审计、可分权限 | 检索和一致性复杂 |
| 模型参数 | 训练或编辑 | 读取快、无需每次检索 | 更新风险高、难回滚 |
长期记忆系统还要区分事实、用户偏好、任务状态、历史轨迹和原始证据。把所有内容都写进一个向量库,会导致过期事实、未经同意的个人信息和低质量推断长期存在。
检索式语言模型
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks 将外部检索结果作为生成模型的条件输入。它把知识更新从参数训练转移到文档库、索引和检索器。
Improving Language Models by Retrieving from Trillions of Tokens 的 RETRO 路线把大规模检索直接纳入语言模型生成过程。模型可以从外部语料中读取相似片段,而不必把全部知识压进参数。
检索式模型的关键问题是:
- 检索器是否能召回真正相关的证据;
- 生成器是否忠实使用证据;
- 文档更新后缓存和索引是否同步;
- 证据是否包含权限边界和来源信息;
- 训练集与评测集是否存在检索污染。
Memorizing Transformers 与测试时记忆
Memorizing Transformers 研究在推理或训练过程中从更大的记忆库中检索历史 token。它说明,模型可以把部分记忆机制从固定参数迁移到可寻址的外部存储。
Infini-attention 通过压缩注意力状态和线性注意力记忆,探索在有限内存中处理无限长度输入。它关注的是同一模型内部短期局部注意力与长期压缩记忆的组合。
Titans: Learning to Memorize at Test Time 进一步研究测试时学习和记忆模块,让模型在处理序列时更新记忆参数或状态。测试时记忆的风险是:写入什么、何时遗忘、如何防止错误和隐私扩散,都变成运行时控制问题。
记忆系统的四个操作
一个可审计的记忆系统至少要定义:
- 写入:什么内容值得长期保存,是否需要用户确认;
- 读取:什么条件触发检索,检索结果如何排序;
- 更新:新事实与旧事实冲突时如何合并、覆盖或保留版本;
- 遗忘:用户删除、权限撤销或事实过期后如何清理所有副本。
记忆的质量不等于召回率最大。更重要的是相关性、时效性、来源可追溯、权限正确和错误可恢复。
模型编辑:直接修改参数中的事实
模型编辑希望在不完整重训的情况下改变模型中的某个事实、行为或知识集合。它通常需要同时满足:
- 编辑成功:目标问题的答案发生预期变化;
- 泛化:同一事实的不同表达也发生变化;
- 局部性:无关事实不被意外改变;
- 持久性:更新不会很快被后续推理冲掉;
- 可组合性:多次编辑不会相互破坏;
- 可回滚性:错误编辑可以恢复原状态。
ROME、MEMIT、MEND 与 WISE
ROME 将事实关联定位为模型中的局部参数更新问题,研究通过修改特定权重来改变单个事实。
MEMIT 将这一思路扩展到批量事实编辑,希望一次处理大量知识更新。
MEND 学习一个编辑器,根据目标样本预测应该如何修改模型参数,而不是为每次编辑单独求解优化问题。
WISE 研究模型知识编辑中的权重空间与编辑稳定性,关注如何减少多次编辑造成的冲突和遗忘。
这些方法的共同难点是评测。只问一个触发句是不够的,应同时测试:
| 维度 | 示例问题 |
|---|---|
| 目标成功 | 新问题是否得到新事实? |
| 语义泛化 | 改写、别名和多语言表达是否更新? |
| 局部性 | 相邻但不同事实是否保持? |
| 持久性 | 继续训练或长对话后是否仍有效? |
| 组合性 | 多个编辑是否互相干扰? |
| 回滚 | 是否可以精确恢复旧版本? |
参数编辑与 RAG 的分工
| 需求 | 更适合的方案 | 原因 |
|---|---|---|
| 频繁更新的业务事实 | RAG / 外部数据库 | 更新和审计成本低 |
| 用户临时偏好 | 会话或用户记忆 | 不应改动公共模型 |
| 大规模领域知识 | 训练、RAG 或混合方案 | 参数编辑逐条更新不经济 |
| 少量行为修正 | 模型编辑或后训练 | 需要评估副作用 |
| 需要删除敏感知识 | 数据清理、隔离和遗忘流程 | 单点编辑不等于彻底删除 |
给 AI 产品经理的结论
“让模型记住”必须先说明记忆落在哪里、谁能读取、多久有效、如何纠错和如何删除。RAG 解决的是外部证据访问,Agent memory 解决的是任务和用户状态,模型编辑解决的是参数关联修改;三者不能因为都叫 memory 就合并成一个能力指标。
来源说明
本文为原创整理,引用日期:2026-09-04。产品级记忆基础参见 RAG 基础 与 Agent 架构与多智能体。主要来源包括 RETRO、Memorizing Transformers、Infini-attention、Titans、ROME、MEMIT、MEND 与 WISE。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用