一文带你搞懂Prompt、RAG、Memory、Tool、MCP、Skills、Agent、Harness 最近几年AI 圈的新词更新得比产品版本还快。刚学会把 Prompt 写清楚讨论里又冒出 Context、RAG、Memory准备让 AI 帮忙做点事Tool、MCP、Skills、Agent、Harness 又排着队出现。每个词单独看都像能懂放到一起就开始犯迷糊它们说的到底是模型的能力、资料的来源、外部的工具还是一套产品怎么运行其实这些词说的是同一套 AI 系统里的不同分工把它们放进一个真实任务里关系一下子就清楚了。比如你对 AI 助手说了这么一句话会议任务“整理本周会议生成待办经我确认后发给相关同事。”听起来挺简单对吧但你细想一下这句话只交代了目标真正要把事情做完AI 还得找到本周的会议记录读懂项目背景认出谁负责、哪天截止再调用任务系统和消息系统碰到缺失或冲突的信息还得处理最后在正式发送前停下来等你点头。你看Prompt、Context、RAG、Memory、Tool、MCP、Skills、Agent、Harness全都藏在这一条任务链里。这篇文章就顺着事情发生的顺序看它们一个个什么时候登场又怎么配合。先把这些词放回各自的位置先别急着背定义我们按干的活儿把它们分成四组准备信息的、接工具和做法的、推进任务的、控制运行的。当然这只是方便理解的分法真实产品里这些活儿经常交叉有时一个组件身兼数职有时又拆成好几个服务。先看一眼全景图心里有个底整套系统的职责分工四组职责可以由同一组件承担也可以拆给多个组件01 当前信息Prompt · Context · RAG · Memory02 工具与做法Tool · MCP · Skills03 任务推进Workflow · Agent04 运行与控制HarnessState · Permission · Eval模型处理输入生成内容或候选动作正式开讲前还有三个最容易混着叫的说法先掰开模型、AI 系统、AI 产品别混在一起**模型**接收输入生成文本、代码、图像或候选动作。**AI 系统**组合模型、上下文、数据、工具、状态和控制机制。**AI 产品**在系统之上加入界面、账号、协作、价格和服务体验。为什么要分这么细因为同一个模型装进不同系统表现能差出一大截换一套资料、换一批工具、换一种重试和验证方式它能做的事、容易犯的错都会跟着变。一、Prompt 与 Context模型这一轮实际能看到什么Prompt给模型的任务说明先从最熟悉的 Prompt 说起。它就是你这一次交给模型的任务说明目标、背景、示例、输出格式、各种限制都可以写进去。放在会议任务里大概长这样请整理本周全部会议提取待办、负责人和截止时间。先生成草稿我确认后再创建任务并发送消息。写代码的同学会发现API 常把指令分成 system、developer、user 这些角色名字和优先级各家平台自己定。还有个容易踩的坑有些论文和 API 会把整次输入统统叫 prompt。所以下次看到这个词先留个心眼对方说的是任务说明还是全部输入。Context模型这次调用能使用的全部信息那 Context 又是什么呢简单说就是模型这一次调用能看到的全部信息。在会议任务里它可能装着这些东西系统与开发者指令用户的任务、格式要求和确认规则会议记录、联系人与项目资料RAG 检索结果与 Memory 召回内容工具名称、参数说明与系统告知的权限范围工具刚刚返回的结果与已传入的任务状态所以按这个叫法你写的 Prompt其实只是 Context 的一部分。要注意的是账户权限、密钥、应用内部的状态通常不会直接交给模型只有被整理成输入的那部分才算 Context真正的权限检查还是在应用里完成的。再说一个常见的疑问改 Prompt 和微调模型到底差在哪可以这么记模型参数存的是训练阶段学到的模式Context 装的是这一次调用的材料。Fine-tuning 改的是前者Prompt、RAG、Memory 改的是后者。Token 与 Context WindowToken 是模型处理输入和输出的编码单位Context Window 就是一次推理能装下多少 Token。输入、历史消息、工具说明和输出通常都要一起挤这个容量各家的计算规则还不太一样。窗口大只说明能放的东西多。材料放在哪个位置、夹了多少噪声、内容靠不靠谱照样会影响结果。Context Engineering为下一步准备信息既然窗口装不下所有东西就得有人来安排哪些历史要保留哪些资料要检索工具和 Skill 什么时候加载结果怎么压缩哪些活儿干脆分给独立的 Subagent 去干。这门手艺就叫上下文工程。目标很朴素该看的要看到无关的别塞太多来源也要靠得住。二、RAG 与 Memory资料怎样取回状态怎样保留RAG先检索再生成模型自己不知道你本周开了什么会这些资料得有人去找这就轮到 RAG 出场了。RAG 的全称是 Retrieval-Augmented Generation中文一般叫“检索增强生成”名字来自 2020 年的一篇同名论文。放在会议任务里它干的活儿就是从本周会议、项目文档、历史决定里把可能相关的资料找回来。很多人一听 RAG 就想到向量数据库其实找资料的路子多得很关键词、BM25、向量搜索、SQL、知识图谱、搜索引擎都能用。向量数据库只是其中一个组件代表不了整套 RAG。顺便说说 Embedding 与 Vector SearchEmbedding 模型把文本、图片这些内容编码成数值向量Vector Search 再在这个空间里比较相似度返回最接近的候选。完整的检索系统通常还会叠上关键词、过滤、重排和权限检查。RAG 最大的好处是能把训练结束之后才出现的新资料送到模型面前。不过资料源和索引要是不更新答案照样会过时。还有一点容易被忽略检索回来的片段只是候选资料不等于证据。来源靠不靠谱、能不能撑住结论都得检查所以系统还要保留来源逐条核对回答有没有被原文真正支持。Memory保存并召回状态RAG 管的是“这次去哪找资料”那上次你告诉过 AI 的事它凭什么还记得靠的就是 Memory。这个词目前没有跨平台的统一定义开发者习惯把当前会话和任务状态叫短期记忆把跨会话保存的偏好、项目事实、历史经验叫长期记忆。回到会议任务Memory 里存的可能是“待办必须有负责人和截止时间”“发送前先确认”这类稳定偏好你说过一次之后每次它都照着办。但别误会这些内容是应用替模型写入、更新、取回、删除的模型自己可不会永久记住。这一段信息量有点大我们用一张图把资料的流动路线捋一遍RAG 把资料送进当前 Context检索结果经过筛选后作为候选资料交给模型01提出问题确定要查什么02检索资料关键词 · 向量 · SQL · 搜索03筛选资料过滤 · 重排 · 权限检查04当前 Context只装入相关片段05模型生成依据候选资料生成结果Memory 保存跨步骤或跨会话的状态召回内容仍需进入 Context。引用可靠性取决于来源记录以及证据与最终输出之间的核对。到这里几个容易混的词可以一句话收个尾Context Window 管一次能装多少RAG 管这次去哪找资料Memory 管以后记住什么Cache 管哪些算过的东西可以直接复用。各管各的谁也替不了谁。如果还想更直观一点下面这张图把 Context、RAG、Memory 画成了一间厨房解释图 P02 · Context、RAG 与 Memory 为什么不同三、Tool、MCP 与 Skills动作、连接与做法怎样分工Tool Calling模型提出动作运行程序负责执行资料备齐了接下来该干活了。模型只会生成文字查日历、建待办、发消息这些实际动作得靠工具来完成。工具调用的过程很直白应用先告诉模型有哪些工具、参数怎么写模型提出调用请求运行程序检查后执行再把结果送回来。注意这里有个关键细节模型自己从头到尾没碰过工具它只是提要求真正动手的是应用。01 应用提供工具名称、用途与参数格式02 模型生成结构化调用请求03 应用检查参数、权限与审批条件04 应用或外部服务执行动作05 执行结果返回当前 Context06 模型根据结果决定下一步这套机制在不同厂商那儿名字还不一样Function Calling、Tool Calling、Tool Use 都很常见范围也不完全重合。Function Calling 常特指按模式定义的自定义函数Tool Calling 还可能包括平台托管的搜索、代码执行或 Computer Use。再提醒一句结构化输出能管住格式管不住事实真假和业务对错。拒绝、截断、权限检查、高影响动作的确认这些还是得应用自己处理。那要是想让 AI 直接操作网页呢路子也有好几条读 DOM、读可访问性树、调用浏览器协议、看截图或者混着用。顺便一提“Browser Use”有时候还是某个具体产品的名字。Computer Use 的范围更大浏览器和桌面应用都算。模型提出点击、输入、滚动这些动作运行环境执行完再把新画面交还给模型看。不过经验上有 API 就优先走 API更稳也更容易审计。目标系统实在没接口才更多靠界面操作兜底。MCP用统一协议连接外部系统工具多了新问题又来了每个工具接法都不一样接十个工具就得写十套对接代码。MCP 想解决的就是这个麻烦。它的全称是 Model Context ProtocolAnthropic 在 2024 年 11 月 25 日公开发布2025 年 12 月捐给了 Linux Foundation 旗下的 AAIF进入社区化治理。你可以把它理解成 AI 世界的通用插座接口统一了谁来都能插。协议里有三个角色。Host 是承载 AI 的应用负责协调模型、权限和连接它会为每个 MCP Server 建一个独立的 ClientServer 提供具体能力跑在本机或远端都行。Server 能提供的东西分三类**Resources**提供数据与上下文资源。**Prompts**提供可参数化的消息模板。**Tools**提供可调用的外部能力。除此之外MCP 还规范了生命周期、能力协商、传输、消息交换和部分授权机制。但说到底它管的只是双方怎么连接、怎么说话。Agent 怎么思考、业务权限怎么检查、审批沙箱怎么落地这些都得靠协议外面的系统继续负责。Agent Skills把任务做法打包复用工具有了连接方式也统一了还差一样东西做事的方法。同样一批工具交给老手和新手干出来的活儿差别很大差的就是经验。Agent Skills 干的事就是把这份经验写成一本 Agent 随时能翻的工作手册。按开放规范一个 Skill 是一个目录入口文件必须叫SKILL.md里面可以打包任务指令、脚本、参考资料和模板。至于它放在哪、能用哪些工具、脚本在哪运行要看客户端怎么实现。它有个很聪明的设计不会一上来就把所有内容塞进 Context。系统先只看名称和描述任务对得上再打开完整说明脚本和参考资料等真用到了再读。这样技能可以攒很多上下文也不会立刻被挤满。提醒一下这里说的 Agent Skills特指以SKILL.md为核心的开放格式。别的产品也爱把自家能力叫 skill但文件长什么样、怎么加载可能完全是两回事。放到会议任务里“会议转待办”这个 Skill 会写清楚要抽哪些字段碰到歧义怎么办什么时候找人确认失败了怎么重试。Agent 照着这本手册去调用任务和消息工具。绕了一圈三个词各自站哪个位置可以用一句话说清三者的分工Tool 是能调用的动作MCP 是统一的连接方式Skill 是可复用的做事方法。下面这张图把三座“工作站”摆在了一起解释图 P03 · Tool、MCP 与 Skill 各管哪件事四、Workflow 与 Agent固定流程和动态决策怎样配合信息、工具、做法都到位了接下来的问题是整件事由谁来推着走这就说到 Agent 了。Agent 在人工智能领域是个老词这里讲的是现在最常见的 LLM Agent模型看着目标、Context 和环境反馈提出下一步运行程序执行工具再把结果送回去就这样一圈一圈循环直到任务完成、触发停止条件或者需要人来拿主意。和它经常一起出现的还有 Workflow。两条路线放在一起看区别很明显Workflow · 路线由程序预先定义步骤、分支、并行、循环、审批路径全部由代码提前写好。流程稳定、边界明确、审计要求高的任务交给它最放心。Agent · 路线根据反馈动态变化模型读取目标和状态自己选下一步和工具再根据执行结果调整计划。分支没法提前列全、需要边走边判断的任务Agent 更顺手。顺带提一个老朋友ReActAgent 的经典实现思路之一模型交替进行推理和行动环境返回观察结果再据此调整下一步。现在的 Agent 大多直接用工具调用内部推理过程未必公开。一次工具调用里到底谁管什么这张图说得最清楚Agent 调用工具时谁负责什么模型提出下一步应用检查并执行结果再回到 ContextHARNESSSkill / Rule提供步骤、约束和模板Agent读取 Context选择下一步Host / 应用检查参数与权限按需经 MCP 路由Tool / 外部系统真正读取、写入或发送结果写回 Context继续、停止或请求确认Harness 贯穿全过程状态 · 权限 · 沙箱 · 超时 · 重试 · 审批 · Trace · Eval这套区分来自 Anthropic 的工程文章Workflow 的整体路径由代码预设Agent 让模型动态决定过程和工具。当然也有人把 workflow 当成更宽的总称把固定步骤和 Agent 步骤全装进去。真正上线的产品呢经常是两个一起用。Workflow 固定关键顺序和审批点Agent 处理开放问题Harness 或 Runtime 再管轮数、超时、预算、状态和权限各干各的配合得刚刚好。顺便认识一下 HookHook 是绑定到生命周期事件的处理器比如“会话开始时加载项目规则”“文件修改后跑一遍检查”“长任务完成后发通知”。它也能观察、阻止或修改操作支持哪些事件、能管到什么程度看具体产品。五、Harness谁来管理循环、权限和失败最后压轴的是这批新词里最陌生的一个Harness。先说清楚Harness 这个词目前没有统一边界。为了把整套系统讲完整这里把范围放宽一些模型外面凡是负责组织 Agent Loop、连接 Context、工具、状态和控制机制的软件都算进 Harness。具体到某个产品Session、Sandbox、Runtime 和基础设施也可能各自独立。听着抽象拆开看它管的就是六摊子事**01 循环**Agent Loop、停止条件、超时与预算。**02 信息**Context、Memory、Rules 与 Skills 的加载。**03 行动**Tools、MCP、浏览器、终端与执行环境。**04 状态**Session、State、Checkpoint、重试与恢复。**05 控制**Permission、Sandbox、Approval 与 Guardrail。**06 记录与评测**Trace、Eval、日志、测试与失败样本。这个词是从软件工程借来的原意是“运行或测试支架”。窄义的 Harness 只指 Agent Loop 和工具执行逻辑广义的用法能覆盖围绕模型的整套运行与控制系统。两种用法都有出处。OpenAI 在 2026 年 1 月讲 Codex Agent Loop 时把 Codex harness 描述为核心循环与执行逻辑到了 2 月的 Harness Engineering 案例又把环境、文档、约束、反馈回路和可观测性都装进了更大的框。Harness 与 Infra运行逻辑和基础环境还有个常被拿来比较的词是 Infra。简单区分一下Harness 关心一次任务怎么被组织和控制Infra 提供计算、存储、网络、身份、沙箱、部署和扩缩容有的产品两边都做。所以看到宣传页上的名词别急着对号入座直接看它到底提供了哪些能力比纠结名字有用得多。权限、沙箱、审批、轨迹与评测为什么控制这么重要想想看工具让 AI 能读文件、写系统、发消息甚至删数据、付款、发布内容。能做的事越多越要管住权限也越要留下能查的记录。**Permission**由 Host、操作系统或外部服务强制执行限定主体能读取什么、能执行什么。**Sandbox**通过文件、网络、进程和计算配额等限制把执行约束在受控环境。**Approval**让高影响动作等待人工确认它不能替代底层权限与沙箱。**Trace**按一次运行关联记录模型调用、工具调用、交接、耗时与异常。**Eval**用明确任务、数据和指标衡量成功率、质量、成本、安全与副作用。安全上还有个必须知道的坑网页、邮件、会议文档、工具结果都可能夹带诱导指令OWASP 把这类 Prompt Injection 列为 2025 年 LLM 应用的头号风险。所以系统得把外部内容当成低信任数据配上内容隔离、最小权限、审批、输出验证和审计。风险最高的执行路径通常同时踩中三个条件能读私有数据会接触不可信内容还能往外发消息。三样凑齐就危险了办法是把这些权限拆开在涉及外发或写入的步骤加上人工确认。模型、循环、控制这三层怎么套在一起看这张“控制中心剖面图”就够了解释图 P04 · 模型、Agent Loop 与 Harness 怎样配合最后对于正在迷茫择业、想转行提升或是刚入门的程序员、编程小白来说有一个问题几乎人人都在问未来10年什么领域的职业发展潜力最大答案只有一个人工智能尤其是大模型方向当下人工智能行业正处于爆发式增长期其中大模型相关岗位更是供不应求薪资待遇直接拉满——字节跳动作为AI领域的头部玩家给硕士毕业的优质AI人才含大模型相关方向开出的月基础工资高达5万—6万元即便是非“人才计划”的普通应聘者月基础工资也能稳定在4万元左右。再看阿里、腾讯两大互联网大厂非“人才计划”的AI相关岗位应聘者月基础工资也约有3万元远超其他行业同资历岗位的薪资水平对于程序员、小白来说无疑是绝佳的转型和提升赛道。如果你还不知道从何开始我自己整理一套全网最全最细的大模型零基础教程我也是一路自学走过来的很清楚小白前期学习的痛楚你要是没有方向还没有好的资源根本学不到东西下面是我整理的大模型学习资源希望能帮到你。扫码免费领取全部内容最后1、大模型学习路线2、从0到进阶大模型学习视频教程从入门到进阶这里都有跟着老师学习事半功倍。3、 入门必看大模型学习书籍文档.pdf书面上的技术书籍确实太多了这些是我精选出来的还有很多不在图里4、AI大模型最新行业报告2026最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5、面试试题/经验【大厂 AI 岗位面经分享107 道】【AI 大模型面试真题102 道】【LLMs 面试真题97 道】6、大模型项目实战配套源码适用人群四阶段学习规划共90天可落地执行第一阶段10天初阶应用该阶段让大家对大模型 AI有一个最前沿的认识对大模型 AI 的理解超过 95% 的人可以在相关讨论时发表高级、不跟风、又接地气的见解别人只会和 AI 聊天而你能调教 AI并能用代码将大模型和业务衔接。大模型 AI 能干什么大模型是怎样获得「智能」的用好 AI 的核心心法大模型应用业务架构大模型应用技术架构代码示例向 GPT-3.5 灌入新知识提示工程的意义和核心思想Prompt 典型构成指令调优方法论思维链和思维树Prompt 攻击和防范…第二阶段30天高阶应用该阶段我们正式进入大模型 AI 进阶实战学习学会构造私有知识库扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架抓住最新的技术进展适合 Python 和 JavaScript 程序员。为什么要做 RAG搭建一个简单的 ChatPDF检索的基础概念什么是向量表示Embeddings向量数据库与向量检索基于向量检索的 RAG搭建 RAG 系统的扩展知识混合检索与 RAG-Fusion 简介向量模型本地部署…第三阶段30天模型训练恭喜你如果学到这里你基本可以找到一份大模型 AI相关的工作自己也能训练 GPT 了通过微调训练自己的垂直大模型能独立训练开源多模态大模型掌握更多技术方案。到此为止大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗为什么要做 RAG什么是模型什么是模型训练求解器 损失函数简介小实验2手写一个简单的神经网络并训练它什么是训练/预训练/微调/轻量化微调Transformer结构简介轻量化微调实验数据集的构建…第四阶段20天商业闭环对全球大模型从性能、吞吐量、成本等方面有一定的认知可以在云端和本地等多种环境下部署大模型找到适合自己的项目/创业方向做一名被 AI 武装的产品经理。硬件选型带你了解全球大模型使用国产大模型服务搭建 OpenAI 代理热身基于阿里云 PAI 部署 Stable Diffusion在本地计算机运行大模型大模型的私有化部署基于 vLLM 部署大模型案例如何优雅地在阿里云私有部署开源大模型部署一套开源 LLM 项目内容安全互联网信息服务算法备案…扫码免费领取全部内容3、这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】