一、核心定位上下文决定Agent能力上限基础定义上下文是每一轮调用LLM时模型所能读取的全部信息集合包含系统指令、工具定义、对话历史、用户消息、工具返回结果模型仅能依据上下文做出决策类比为Agent的“视觉输入”。上下文工程并非简单堆砌提示词而是一套系统性信息供给方案属于Harness工程中「上下文与工具」模块的核心实现解决在有限上下文窗口内给模型提供哪些信息、以何种结构提供。关键结论模型原生能力只是基础上下文质量才是Agent真实能力的天花板。中等规格模型搭配精心组织的上下文性能通常优于顶级模型在信息缺失条件下的表现。业务落地痛点大量团队知识属于隐性知识口头约定、私有架构、零散文档如同信息黑洞AI Agent类似永久新人缺少完备背景信息就无法发挥价值。搭建AI原生团队的前置工作是业务知识文档化、结构化。核心观点引用人与大模型共同的约束都是Context团队协作最大障碍是上下文不一致AI难以完全替代人类的根本原因之一——AI无法共享人类所处真实环境的上下文。硬件约束上下文窗口Context Window所有输入内容序列化为Token送入Transformer处理不同模型窗口容量存在上限Qwen3 32K、Claude 200K、Gemini 2M tokens。上下文窗口是稀缺资源无差别灌入信息会引入噪声、触发截断降低模型推理准确率。二、API底层原理Agent调用大模型标准结构主流Chat Completions APIOpenAI、Anthropic、vLLM/Ollama兼容接口以messages消息列表作为上下文载体API本身无状态每一轮请求必须完整传入所需全部信息。2.1 四大消息角色rolesystem系统提示词。定义Agent身份、约束、全局规则优先级最高通常固定放置在消息头部user终端用户原始请求assistant模型输出内容包含文本回复或工具调用请求tool_callstool工具执行结果依靠tool_call_id与模型发起的工具调用一一绑定。补充工具定义tools独立于messages列表单独传递告知模型可用函数、参数规范。2.2 两种交互模式单轮问答无工具调用消息结构system user→ 模型直接返回assistant文本回复适合简单问答场景。带工具调用的多轮ReAct循环Agent标准运行模式完整执行链路① 请求传入system user tools模型判断需要外部信息返回携带tool_calls的assistant消息② Agent框架而非模型负责执行工具函数③ 将完整历史原有全部messagestool结果重新组装请求送入模型④ 模型基于观测结果判断继续调用工具或生成最终文本回复终止循环。消息列表messages持续追加迭代完整保留交互轨迹这就是ReAct思考-行动-观测在API层面的落地实现。2.3 最简Python Agent核心循环逻辑整体依靠while循环驱动两条核心分支判断模型返回tool_calls执行工具追加tool消息继续循环调用LLM无工具调用请求输出最终答案结束会话。生产环境必须增加最大迭代次数限制防止Agent陷入无限循环重复调用工具。三、上下文分层架构静态前缀 动态轨迹所有请求上下文可以拆分为两层该结构是KV Cache、上下文压缩优化的理论基础静态前缀全程保持不变System Prompt Tools定义。固定不变的前缀可以被推理框架缓存KV Cache大幅降低首token延迟TTFT。动态轨迹持续增长user/assistant/tool消息组成的对话历史。会话越长占用token越多也是后续上下文裁剪、摘要压缩的优化对象。重要现象本地实验佐证修改System Prompt内容会破坏KV Cache缓存推理需要重新计算全部前缀响应延迟明显上升保持前缀不变则缓存命中推理加速。四、实验2-1本地LLM部署与工具调用核心结论基于Qwen3-0.6B小模型本地部署实验打破“必须超大参数模型才能实现工具调用”认知模型规模不是唯一瓶颈0.6B超小参数量模型依靠合理提示工程可稳定完成工具调用、并行工具请求、多轮ReAct循环端侧运行小型具备工具能力的Agent具备可行性。模型内部运行细节API不可见支持CoT的模型会通过标签输出内部思考过程对Agent行为调试至关重要输出顺序内部思考 → 文本回复 → 工具调用流式架构可实现工具并行预执行无依赖关系的工具支持并行调用由Agent框架并发执行缩短整体耗时。工程观测要点可借助本地服务直观观测Token流、KV Cache对TTFT的影响为线上上下文优化提供实验依据。五、延伸技术路线本章后续议题上下文分层架构衍生出一系列工程课题利用静态前缀不变性优化KV Cache推理速度System Prompt规范化设计提示工程提示注入防御按需加载专业知识Agent Skills动态注入运行状态超长会话历史的智能压缩、截断策略。六、实践启示工程落地准则开发Agent优先梳理任务所需三类上下文业务代码/数据结构、流程规范、环境配置缺少任意一类Agent输出极易脱离真实工程环境不要盲目追求更大参数模型优先评估当前上下文信息是否完备、结构是否合理会话设计上区分静态规则与动态会话历史最大化利用KV Cache优化推理性能长会话场景必须预留上下文治理方案压缩、摘要、滑动窗口截断避免持续token膨胀。