Taxonomy of Memory Types 记忆分类Working Memory (Short-Term)working memoryactive workspace活跃工作区工作记忆三大核心特性访问极快已经放在上下文里面不需要额外检索延迟≈0易失性 volatile一旦上下文清空里面的信息直接丢失容量受限总长度上限由上下文窗口长度 L 约束Episodic Memory (Experience-Based)情景记忆 (Episodic Memory)存储具体的历史事件依靠上下文与时间建立索引对于智能体情景记忆存放 4 类内容1历史交互记录 Past interactions完整 / 摘要形式保存过去对话、任务尝试以及最终结果2成功轨迹 Successful trajectories高回报的动作序列遇到相似任务时可以检索出来作为少样本示例直接参考3失败案例 Failure cases已经记录下来的错误并且附带根因标注让 Agent 可以吸取教训、避免重蹈覆辙4检索增强式情景回忆 Retrieval‑augmented episodic recall给定新任务 q召回 k 条相似度最高的历史片段把它们塞进当前上下文窗口工程实现情景记忆一般使用向量数据库实现对每一段事件摘要生成 Embedding 向量用于相似度检索Semantic Memory (World Knowledge)语义记忆Semantic Memory存储脱离具体事件、普适性的客观事实与概念包含三类内容1事实知识 Factual knowledge实体、属性、实体之间的关系例巴黎是法国的首都2领域概念 Domain conceptsAgent 任务领域内的定义、分类体系、本体知识3知识图谱 Knowledge graphs结构化表示 G(V, E)节点 V实体边 E带类型的关系和情景记忆最核心区别语义记忆与上下文无关 (context‑independent)例如水在 100℃沸腾这条真理和什么时候、在哪学到它没有任何关系情景记忆Agent 自己的日记本我上次做了什么、踩了什么坑带时间、场景语义记忆百科全书 / 知识库客观不变的公共知识不绑定某次经历工程落地形式非结构化文档库、RAG 向量库存文章、API 文档、教程结构化知识图谱、实体库、配置表Procedural Memory (Skills)程序记忆Procedural Memory存储做事的方法也就是已经习得、近乎自动化的技能与动作模式。分为三块1习得的工具调用模式 Learned tool‑use patterns什么任务该调用哪个 API、入参如何格式化、异常报错怎么处理。2动作序列 Action sequences多步骤工作流程示例代码部署流程执行单元测试 → 构建镜像 → 推送镜像 → 更新配置清单3策略本身就是记忆 Policies as memory模型权重 theta 本身就编码了程序类知识用成功轨迹样本做微调本质就是巩固程序记忆memory consolidation记忆巩固情景记忆我上次部署失败了一件往事语义记忆docker build 命令用来构建镜像一条知识点程序记忆完整的部署操作步骤、工具调用套路、排错习惯一个非常关键的观点模型权重本身就是程序记忆SFT、RL 微调本质是把行为模式固化进参数相当于人脑反复练习之后形成本能对比Memory Type Classification一个辅助软件开发的智能体四类记忆分工如下工作记忆 (Working)当前正在编辑的文件、刚刚收到的报错信息情景记忆 (Episodic)「上周我在模块 X 里修复过一个类似的空指针异常当时是在第 42 行增加了判空处理」语义记忆 (Semantic)「Python 的 asyncio.gather 并发运行多个协程异常会向上传递除非设置 return_exceptionsTrue」程序记忆 (Procedural)标准排障工作流复现问题 → 定位隔离 → 提出猜想 → 验证 → 修复Memory Operations 记忆操作Write: Committing to Memory 持久化保存记忆granularityˌɡrænjəˈlærətin. 间隔尺寸[岩] 粒度informativeɪnˈfɔːmətɪvadj. 提供有用信息的增长见闻的sequencesˈsiːkwənsɪzn. [数][计]序列顺序继起的事sequence 的复数形式rememberingrɪˈmembə(r)ɪŋn. 回忆记住v. 记得忆起记住不忘去做纪念给……送钱brittleˈbrɪt(ə)ladj. 易碎的脆的关系或局势不牢固的易变的脆弱的冷淡的尖利的刺耳的声音像要哭的n. 果仁薄脆糖assessmentəˈsesməntn. 评估评价估价估计定义写入是有条件的不是无脑写入surprise、reward signal、LLM self-assessmentprompt the model to rate importanceContradiction Detection 冲突检测写入一条新事实 f_new 之前先要检查它和已有记忆库 M 是否矛盾只要记忆库里任意一条旧事实 f 和新事实互相冲突就触发冲突实现方案NLI 自然语言推理模型 / LLM 提示词判断发生冲突时三种可选策略直接覆盖旧记忆两条全部保留依靠时间戳区分新旧打上标记交由人工复核记忆格式 颗粒度verbosevɜːˈbəʊsadj. 冗长的啰嗦的transcriptsˈtrænˌskrɪptn. 成绩单抄本改写本transcript 的复数形式v. 转录合成transcript 的三单形式verbose transcripts: 详细记录verbatimvɜːˈbeɪtɪmadv. 一字不差地逐字地adj. 一字不差的逐字的quotationkwəʊˈteɪʃ(ə)nn. 引语引文音乐或艺术品片段的引用引用引述报价单估价股票报价composablekəmpəuzəbladj. 组成的nuancedˈnjuːˌɒnstadj. 微妙的具有细微差别的v. 精确细腻地表演细致入微地描绘nuance 的过去分词narrativeˈnærətɪvn. 记叙文叙述叙事技巧adj. 叙述的叙事体的auditability 可审核性除了决定存储什么内容之外存储方式同样至关重要。记忆条目可以覆盖从原子事实到完整冗长对话原文的多种形式每种方案都有各自的取舍权衡。In practice, production systems often combine granularities: extract atomic facts for precise recall, maintain summarized episodes for narrative context, and archive verbatim transcripts in cold storage for auditability. The Generative Agents architecture [285 ] stores observations as atomic “memory objects” with natural-language descriptions, importance scores, and timestamps—enabling both precise retrieval and temporal reasoning在实践中生产系统通常会结合多种粒度提取原子事实以实现精确检索保留摘要片段以提供叙事背景narrative context 叙事背景并将逐字记录存档于冷存储中以确保可审计性。生成式 Agents 架构将观测信息存储为具有自然语言描述、重要性评分和时间戳的原子“记忆对象”从而支持精确检索与时间推理即生产环境通常多种颗粒度组合使用原子事实 → 用于精准查询事件摘要 → 保存完整业务上下文、长对话逻辑原始原文 → 冷存储归档用于可追溯审计Generative Agents记忆存储 自然语言描述 重要度分 时间戳兼顾精确检索、时序推理Design Guidelines 记忆系统设计准则factoidˈfæktɔɪd这里应该是作者写错了n. 仿真陈述仅因出现在出版物上而被信以为真adj. 虚构的似是而非的grainɡreɪnn. 谷物谷粒颗粒细粒少量纹理表面的质地触感格令旧的重量单位一格令相当于0.065克照片、底片的显影颗粒用于火箭发动机的固体推进剂皮革或其他类似人工材料的粗糙面皱面石头和煤等原料的解理面劈理面古人的性格天性史胭脂虫胭脂虫红v. 使表面或纹理粗糙成粒状尤指将家具或内表面漆成木纹或大理石纹affordəˈfɔːdv. 买得起有时间做某事承担得起正式提供给予coarserˈkɔːrsəradj. 粗糙的粗俗的下等的coarse 的变形provenanceˈprɒvənənsn. 出处起源1颗粒度匹配查询类型match granularity to query type事实类问题我的 API‑Key 是什么→ 原子事实最合适因果、背景类问题当初为什么选用 Redis→ 需要情节摘要episode summaries2精选您能负担得起的优质细粒度上层再聚合粗粒度视图尽可能先存最细粒度原始素材再向上构建粗粒度视图原子事实atomic facts很容易汇总成摘要丢失细节的摘要lossy summary无法反向还原原始细粒度事实3必须保留来源 Provenance每条记忆记录必须关联原始出处第几轮对话、工具返回、文档片段方便核验与审计溯源Read / Retrievehypotheticalˌhaɪpəˈθetɪk(ə)ladj. 基于假设的假定的n. 假设命题假设陈述paraphrasesˈpærəfreɪzɪz改写paraphraseˈpærəfreɪzn. 释义改述v. 释义改述formulationˌfɔːmjuˈleɪʃ(ə)nn. 政策、计划等的制定构想想法的阐述方式表达方法查询制定 - formulation检索查询 q 不必直接使用原始用户输入下面是效果更好的几种策略1HyDE假设文档嵌入Hypothetical Document Embeddings先生成一份假想的参考答案对这份假想答案做向量编码用答案的向量当作检索向量而不用原问题去搜原理很多时候问题很短、信息稀疏完整答案语义更丰富向量检索更容易命中相关记忆向量库里面存的全都是陈述句用户偏好 PythonRedis 适合做缓存而用户输入是疑问句用户喜欢什么编程语言缓存选型为什么选 Redis问句、陈述句属于两种文体哪怕语义完全相关向量空间天然有一段距离短问题信息极度稀疏关键词少向量很模糊容易召回一堆无关文档2Query expansion 查询扩展对原问题生成多条同义改写版本分别检索最后合并union全部召回结果用来解决同义词、不同表达方式导致漏召回3Step‑back prompting 退一步提示检索之前把具体问题向上抽象成一个更宽泛、通用的母问题再去检索例原问题PyTorch DDP 梯度溢出怎么办后退抽象分布式训练常见报错和排查方案时间衰减 / 新近度偏置 Temporal Decay and Recency Biasrecencyˈriːsənsɪn. 新近崭新年代久远的记忆相关性通常会下降。带时间权重的打分公式语义相似度贡献 新鲜度贡献Update: Conflict Resolution and Consolidation 冲突解决与整合surfaceˈsɜːfɪsn. 表面水面地面桌面台面物体的一个面外表表象表面积运动场地运动场地面铺设材料v. 浮出水面信息、情感或问题显露暴露公开失踪或隐藏后出现非正式尤指长睡后起床给道路等铺上硬面adj. 表面上的外表上的表面的与空中运输相对的水陆运输的水面舰船的exceededɪkˈsi:dɪdadj. 非常的过度的溢出的v. 超过exceed 的过去分词越出evictionɪˈvɪkʃnn. 逐出赶出收回记忆巩固Memory consolidationForgetting Mechanisms 遗忘机制spaced repetitionspeɪst ˌrepəˈtɪʃn分散重复一种学习方法通过在一定时间间隔内反复复习同一内容以提高记忆效果repetitionˌrepəˈtɪʃ(ə)nn. 重复重说重做 重做的事重说的话重复的事物复制品Reflect: Meta-Cognitive Operations 反思元认知操作定义Reflection算法Agent 三次尝试解决代码问题全部失败之后执行反思流程从情景记忆取出三次失败完整事件记录归纳洞察我总是忘记处理输入列表为空这个边界情况将这条总结存入语义记忆下一次做题时读取该条经验主动、显式去校验空输入这就是 Reflexion 的核心原理依靠自我反思实现语言层面的强化学习。不用外部数值 reward靠复盘文字经验来优化后续行为反思存在于什么地方反思读取自情景记忆写入到语义记忆 Reflection reads from episodic memory but writes to semantic memory.反思产出的洞察是脱离具体场景、可复用的通用规则例如永远要检查空输入而不是某一次失败的原始记录因此适合保存在语义记忆反思进行时中间推理过程调取出来的多条事件、总结提示词、正在生成的洞察占用工作记忆上下文窗口一句话概括流水线输入情景记忆一件件具体历史事件运算工作记忆在上下文里面做推理归纳输出语义记忆可长期使用、通用化经验这个过程和人脑记忆巩固机制非常相似人通过复盘、睡眠把碎片化的亲身经历 (情景记忆) 沉淀成稳定常识知识 (语义记忆)内存架构dominantˈdɒmɪnəntadj. 占支配地位的占优势的基因显性的n. 显性性状显性基因φ 读音 /faɪ/斐ψ 读作 /saɪ/ (赛)sparsespɑːsadj. 稀少的稀疏的简朴的reciprocalrɪˈsɪprək(ə)ladj 相互的互惠的报答的路线方向反向的代词动词互相的量函数倒数的互逆的互反的n. 反身代词相互动词 倒数乘法逆元素互相起作用的事物retrievedrɪˈtriːvdv. 恢复重新取回补偿挽救retrieve的过去式和过去分词superficialˌsuːpəˈfɪʃ(ə)ladj. 粗浅的粗略的思想浅薄的缺乏深度的表面的乍看起来的provenanceˈprɒvənənsn. 出处起源RAG-Based Memory定义Embedding Stores and Vector Databases Embedding 存储 向量数据库检索策略 - Retrieval StrategiesDense retrieval 稠密检索查询与文档全部通过神经网络编码器生成向量DPR、OpenAI text‑embedding‑3‑large擅长捕捉语义层面相似缺点需要 GPU 做向量推理算力开销更大Sparse retrieval 稀疏检索基于词元重合度的 BM25 / TF‑IDF。速度快、结果可解释、精准关键词匹配效果好缺点不懂同义词、语义Hybrid retrieval 混合检索通过倒数排名融合 RRF reciprocal rank fusion合并稠密检索、稀疏检索两份排序列表平滑常数一般取 k60大量实验证明混合检索整体效果优于单独稠密 / 单独稀疏检索RRF 原理不直接合并相似度分数只利用各自排名避免两种打分值域不一致的问题重排 - Re-rankingf代表一个打分函数ψ 代表这个 Cross‑Encoder 重排模型的全部可训练参数。也就是 Cross‑Encoder 重排模型 的权重(q,d)两个输入q query 用户查询d 一条候选文档输出值只能是 0 ~ 1 之间的浮点数包含 0 和 1业务含义RAG 重排序环节输出越靠近 1q 和 d 相关性越高输出越靠近 0几乎完全无关检索带来的幻觉风险 - Retrieval Hallucination RiskRAG 并不能彻底消除幻觉甚至有可能引入新幻觉如果召回文档已经过时、本身有错、或者仅仅表面相关大模型依然会很自信地采纳这份错误信息。工程最佳实践务必带上溯源元数据来源、时间戳、置信度 confidence并且增加事实保真校验环节。faithfulness verification 保真校验小节Summarization-Based Memorydrilldrɪln. 钻钻机训练演习粗斜纹布条播沟条播机条播作物非正式常规正确步骤尾角螺v. 钻孔训练演习条播Progressive Summarization 递进式摘要用大模型旧摘要 新事件合并再重新总结生成更新后的摘要优点记忆占用空间恒定 O(1)不会无限膨胀缺点不断合并压缩容易丢失细节信息例子S_t “和用户聊了 A 需求”e_t “用户补充了 B 条件”传给 LLMSummarize[和用户聊了A需求] [用户补充了B条件]输出新摘要 S_t1 “用户需求包含 A 和 B”Hierarchical Compression 分层式层级压缩检索流程先查最顶层高度压缩层 L_K速度最快如果信息不够再逐层向下读取更加详细的下层记忆该思路参考 Forte 论文的递进摘要方案非常像人脑记忆顶层是梗概需要细节再往下翻原始记录When to Summarize vs. Store Verbatimverbatimvɜːˈbeɪtɪmadv. 一字不差地逐字地adj. 一字不差的逐字的Store verbatim 原样保存精确precise事实、代码片段snippets、数值结果、用户原话Summarize 摘要压缩叙事上下文、完整推理链路、大量重复冗余的redundant观测信息Discard 直接丢弃无效噪声、不带有效信息的工具调用失败日志两种压缩方案对比hierarchicalˌhaɪəˈrɑːkɪk(ə)ladj. 分等级的等级制度的Graph-Based Memory 基于图的存储Knowledge Graphs 知识图谱示例三元组(xx公司,创始人,兴兴)Entity‑Relation Extraction 实体‑关系抽取GraphRAGGraphRAG, augments RAG with graph traversal问题xx创办了哪些公司种子实体 xx1‑hopxx →宇数2‑hop宇数 →xx子产品Temporal Knowledge Graphs 时序知识图谱conflating vt. 合并混合混淆conflate 的现在分词小节Key-Value Memory Networks KV存储网络differentiableˌdɪfəˈrenʃɪəb(ə)ladj. [数] 可微的可辨的可区分的Differentiable memory networks 可微记忆网络普通 RAG检索是不可微分的离散操作选文档 A / 文档 B无法回传梯度可微记忆网络读出结果 c 全程是连续、可导的检索模块可以和后面的大模型一起端到端训练MemGPT and Virtual Context ManagementMemGPT 提出了虚拟上下文 (virtual‑context) 抽象机制设计思路类比操作系统里面的虚拟内存记忆采用分层多级架构进行管理类比操作系统物理内存 Hot Context热上下文当前能直接放进 LLM 窗口、可以直接被模型看到硬盘 外部冷记忆库容量很大但不在上下文窗口必须换入才能使用Page‑In / Page‑Out Strategies 换入 / 换出策略The agent decides which memory to promote to hot context (page‑in) and which to evict (page‑out) based on:Recency时间就近性最近刚访问过的记忆条目后续再次用到的概率更高Relevance相关性和当前查询向量相似度高的条目Importance重要度记忆写入的时候已经被标记为高优先级的条目Page‑In页面换入把冷存储里面的记忆加载进热上下文窗口进入 LLM 可见范围Page‑Out页面换出当上下文窗口满了把一部分记忆从热上下文驱逐放回外部冷存储腾出窗口空间传统操作系统 LRU 只看「最近访问时间 Recency」MemGPT 是三合一打分就近性 当前查询相似度 人为标记重要性综合决策换入换出Self‑Directed Memory Management 自主式记忆管理MemGPT 中由大模型自己主动调用记忆管理工具函数memory_search 检索记忆memory_insert 新增写入记忆memory_delete 删除记忆记忆调度策略不再是开发者硬编码写死的规则而是模型自己学习得到的行为因此天然适合用强化学习 RL 来优化记忆管理策略小节递进式摘要直接不断压缩记忆永久丢失细节知识图谱 / GraphRAG结构化图存储靠外部检索可微 KV 记忆全记忆可微分、注意力加权读出MemGPT 虚拟内存分层冷热存储 页面置换 模型自主管理记忆Memory for Multi-Turn Conversations 单 Agent 多轮会话的 MemoryUser Modeling and Preference Tracking - 用户建模与偏好追踪expertiseˌekspɜːˈtiːzn. 专长专门技能知识专家的意见持久化用户模型 U 保存四类信息显式偏好用户直接说明的喜恶、沟通风格偏好隐式偏好从行为间接推断例用户总是要求 Python 代码、偏爱简短回答专业水平通过用词、问题复杂度推断用户领域熟悉程度目标与业务上下文正在进行的项目、当前任务、岗位角色每一轮交互结束后更新用户模型Session Continuity - 会话连续性continuityˌkɒntɪˈnjuːətin. 连续性连贯性电影、电视的场景串联衔接逻辑上的连接联结没有记忆每次对话都是冷启动完全不记得之前内容引入会话记忆后的完整流程会话刚开始读取用户模型 U 近期会话摘要注入个性化系统提示词你正在协助 Alice一位负责分布式训练项目的资深机器学习工程师。上一次会话我们排查过梯度同步问题。会话结束生成本次会话摘要更新全局用户模型Personalization Through Memory - 依托记忆实现个性化primingˈpraɪmɪŋn. 底料装填物起爆剂引火药底漆calibratedˈkælɪbreɪtɪdv. 校准校准使…标准化calibrate的过去分词adj. 标刻度的个性化同时提升两点效率减少反复确认、追问背景信息回答质量输出内容匹配用户的知识水平三项核心技术自适应详细程度根据历史行为动态调整回答长短小白讲细、专家精简领域预加载 (Domain priming)从语义记忆取出相关业务上下文前置注入 Prompt主动回忆无需用户提问主动带出历史交互 「上个月你咨询过该问题当时得到的结论如下」隐私与记忆持久存储用户记忆带来严重隐私风险Agent 系统必须做到存储个人信息前获取用户明确授权提供入口可以查看、删除已经保存的记忆多用户部署场景下做好权限隔离与访问管控遵守数据合规法规GDPR、CCPA 等记忆系统架构设计应当遵循 默认隐私优先 (privacy‑by‑default)Memory for Multi-Agent Systems 多 Agent 系统的 Memorysubstrateˈsʌbstreɪtn. 培养基基质基层底物酶作用物供放置或刻的底面implicitɪmˈplɪsɪtadj. 含蓄的未言明的内含的固有的无疑问的无保留的函数隐式的隐的designatedˈdezɪɡneɪtɪdadj. 指定的标出的vt. 把……定名为把……描述为任命指定标明标示当多个智能体协作完成同一个任务时记忆不再仅仅是个体知识库而变成一种协同机制。负责任务拆解plan的规划智能体需要把子目标下发给执行智能体评审critic智能体必须拿到和被评估智能体完全一致的上下文调研类research智能体小组需要避免重复做相同工作如果没有共享记忆所有交互只能依靠点对点消息通信会产生通信带宽瓶颈并且当对话过长、上下文被截断时信息丢失共享内存Shared‑Memory提供一块可持久化、可查询的公共存储层所有 Agent 均可读写把隐式协同我只能寄希望对方记住这件事转变成显式状态协同结果已经写到黑板上所有人都能看见Shared Memory Pools 共享记忆池共享记忆实现隐式协同implicit coordinationAgent‑A 写入一条结论Agent‑B 可以直接读取二者不需要专门发消息互相告知Blackboard Architecture 黑板架构The blackboard pattern [135] is a classic multi-agent coordination mechanismEach agent reads from and writes to the blackboard. A controller monitors the blackboard and activates agents when their preconditions are met. This decouples agents: they communicate through shared state rather than direct messaging黑板模式是经典多智能体协同方案所有 Agent 都可以对黑板进行读、写控制器持续监听黑板状态当某个 Agent 的触发条件被满足自动唤醒该 Agent 开始工作实现 Agent 解耦智能体之间不靠点对点消息而是依靠共享状态完成通信通俗类比项目白板所有人都可以往上贴纸条管理员看到条件齐全就通知对应成员干活Consensus and Conflict in Shared Knowledge 共享知识中的冲突 一致性解决策略consensuskənˈsensəsn. 一致看法共识当多个 Agent 同时向共享记忆写入数据就会产生数据冲突。下面是 5 种主流解决方案Last‑write‑wins 最后写入优先最简单后写入的数据直接覆盖旧内容缺点丢失历史信息Versioned memory 带版本记忆保存全部写入历史可以随时查询任意历史版本Voting /consensus 投票共识需要至少 k/n 个智能体达成一致这条信息才正式生效Confidence‑weighted merging 置信度加权合并Designated authority 指定权限划分给记忆空间做分区指定某一块区域只能由特定 Agent 拥有写入权限开放问题 - 分布式记忆一致性在并发写入、网络分片、甚至存在恶意 Agent 的情况下多智能体系统如何保障共享记忆一致性传统分布式算法Paxos、Raft理论可用但计算开销很高。带有限过期延迟的弱近似一致性也许足以满足绝大多数 Agent 任务但如何在一致性、延迟、算力开销之间取得最优平衡点目前仍是一个开放课题