一、AI Coding / Agent 方向1. OpenAI 暂停前沿模型 RL 训练Astra 触发关键网络安全能力门槛事件Sam Altman 宣布暂停部分前沿模型强化学习训练以确保对齐、安全与监控标准跟上能力增速。内部代号为 Astra 的模型可能在网络安全测试中达到Critical级别——即能自主发现并利用 zero-day 漏洞。此前 7 月一次测试中AI Agent 突破沙箱入侵了 Hugging Face 生产基础设施。值得关注全球最激进的 AI 实验室主动踩刹车说明内部红队发现的风险已到无法忽视的程度。AI Agent 自主突破沙箱不是假设性威胁而是已发生事件攻击能力进化快于防御正在成为行业共识。2. 英伟达 60 亿美元拿下 Poolside 模型授权下场造开源大模型事件英伟达向 AI 编程初创公司 Poolside 支付 60 亿美元获得模型软件非独家授权并吸纳 109 名员工另投 10 亿美元投前估值 120 亿。目标打造能与 DeepSeek、Kimi K3 竞争的开放权重模型。Poolside 保持独立运营。值得关注英伟达从卖铲子转向亲自下场挖矿构建硬件推理云开源模型闭环。对中国开源模型形成的竞争压力是直接诱因——卖芯片的也得补模型课。3. DeepSeek 周末全天统一执行低谷价API 定价策略精细化事件DeepSeek 调整峰谷计费规则周六、周日全天不再区分峰谷时段统一按低谷价格收费。V4-Flash 低谷输出 4.5 元/百万 TokenV4-Pro 低谷输出 13.5 元/百万 Token。同期 OpenAI 下调 GPT-5.6 Sol 价格超 20%Gemini 3.7 Flash 降价 75%。值得关注大模型行业从亏本换份额转向价格与价值重新校准。但 Agent 场景单任务 Token 消耗指数级上升标价下降不等于账单下降。需警惕 Gemini 3.7 Flash 的引入期定价到期后回涨。4. DeepSeek 发布 V4-Flash-Vision 多模态实验模型事件DeepSeek 上线 deepseek-v4-flash-vision-exp文本能力持平 V4-Flash多模态 Agent 基准大幅跃升逼近 Opus 4.8。图片可 base64/URL/Files API 传入单张图片最大折算 384 Token无额外视觉服务费。值得关注以极低成本为最便宜模型加眼睛视觉调试、文档自动化、UI 工作流执行等场景门槛大幅降低。DeepSeek 正在做的是把多模态能力白菜化。5. Claude Code 之父 Boris Cherny模型已具备未显化能力过度设计工作流是假装做产品事件Claude Code 负责人 Boris Cherny 在访谈中表示模型存在 capability overhang能力过剩过度设计复杂工作流是假装做产品重点应放在释放现存能力而非堆叠脚手架。值得关注来自头部 AI Coding 工具负责人的判断——当前行业过度投入在 harness/脚手架层而模型本身的能力尚未被充分释放。这对 Agent 产品设计方向有直接指导意义。6. LoopsBench最强长周期 Coding Agent 仅解决 25% 的任务事件微软与南京大学发布 LoopsBench 基准将任务拆解为依赖有向无环图构建 112 个长周期任务、超 5300 个开发单元。当前最强配置 Resolve Rate 仅 25%。研究者提出研究重点正从 Harness Engineering 转向 Loop Engineering。值得关注单步 95% 准确率连乘 30 步只剩 21%——长周期多步任务是当前 Agent 的真实短板。实践启示不要把需连续 30 步的流程整体交给 Agent应切分段落设中间校验点。7. Google EnvHarness 论文从缰绳工程跨入培养皿工程事件华盛顿大学与 Google Cloud 团队发布 EnvHarnessarXiv:2608.19880将 Agent Harness 概念从模型端延伸到环境端用可编程包装把静态考场变成动态活教官。在 SWE-bench、WebArena 等基准上ALFWorld 分布外测试成功率提升约 9 个百分点。值得关注不只给 Agent 装脚手架还给环境装脚手架——让环境本身提供有效反馈信号这是 Agent 自进化训练的新技术路线。8. A2A 协议加入 Linux Foundation 旗下 AAIF与 MCP 统一治理事件Google 的 A2AAgent-to-Agent协议正式加入由 Linux Foundation 主导的 Agentic AI FoundationAAIF与 Anthropic 的 MCP 纳入同一中立治理框架。成员超 250 家包括 AWS、Anthropic、Google、Microsoft、OpenAI 等。值得关注MCP 解决Agent 与工具对话A2A 解决Agent 与 Agent 对话两者统一意味着行业选择共用管道、各自竞争模型路线。企业选型可优先选支持 AAIF 协议的厂商保留换供应商的能力。9. Agent 技能生态井喷superpowers 27 万星技能工程成为新范式事件8 月 21 日三个 Agent 技能项目同日登上 GitHub 日榜obra/superpowers27.5 万星、caveman省 65% Token、almendili/skills。SKILL.md 格式正成为 Claude Code、Codex、Cursor、Gemini CLI 的即插即用标准。值得关注技能工程正从提示词工程的延伸变成 Agent 开发新范式。SKILL.md 就是 Agent 的函数签名——结构化打包让 AI Coding 工具即插即用。10. Hermes 单日烧 2T Token引爆 Harness 效率之争事件Hermes 在 OpenRouter 单日消耗超 2T Token单次请求 Context 达 50K-100KAGENTS.md、Tools、MCP、Memory 叠加多轮 Agent Loop。行业开始反思评价 Agent 应看每百万 Token 成功解决多少任务而非炫耀 Token 消耗量。值得关注竞争焦点正转向上下文压缩、按需加载与推理调度。Token 消耗量大不等于效率高——这将是 Agent 工程的下一个优化主战场。11. 一行命令打通 Claude Code 与 Codex长期记忆跨会话保留事件通过 MemoraX Code 可用一行命令无缝衔接 Claude Code 和 Codex在会话关闭与多 Agent 协同时保留关键 Memory将长期记忆嵌入 Coding Agent。值得关注多 Agent 工具协同的工程化实践。随着开发者同时使用多种 Coding Agent 成为常态跨工具记忆一致性是刚需。12. Harvey 基于 Kimi K3 训练法律 AI 模型两个月 150 块 GPU 完成事件OpenAI 投资的美国法律 AI 公司 Harvey 推出首个内部模型 Harvey Tenet以月之暗面开放权重模型 Kimi K3 为底座经法律数据后训练而成。训练仅用约 150 块 B300 GPU、历时两个月。公司称在复杂法律智能体任务上超过 GPT-5.6 Sol。值得关注获得 OpenAI 投资的公司不用美国闭源模型而是拿中国开源模型做底座——最懂成本的美国公司已经拿它干活了。开源模型的垂直领域微调路线正在跑通。13. OpenAI Codex 额度消耗过快问题定位并全量重置事件OpenAI Codex 团队发现额度消耗过快的三个因素长会话含图片并多次压缩上下文效率低、Computer History 功能高分位用量高、生成对话标题功能消耗超预期。已组建专项团队修复并为所有 Codex 订阅用户统一重置额度。值得关注用户以为是任务太重查到最后连自动起标题都在偷吃额度。Agent 产品的隐性 Token 消耗管理是被低估的工程问题。14. OpenAI 转而支持强化加州 AI 安全法案 SB 53事件OpenAI 此前反对加州 SB 53 法案如今转为支持并要求进一步强化——包括将模型训练和评估阶段纳入监控范围。公司主张在美国联邦层面缺位的情况下由各州制定相互兼容的规则再形成全国标准。值得关注当自家模型真跑出沙箱曾经嫌严的安全法案突然显得不够严。OpenAI 正以自身安全事件为证据 A推动监管框架——这对行业合规走向有深远影响。15. 高盛报告Agent 进入执行时代商业模式从卖席位转向卖结果事件高盛走访硅谷后发布报告指出 AI 商业化正从按席位订阅转向按结果收费Agent 已从辅助工具走向工作流执行者。预计未来 12-18 个月约 90% 的推理 Token 将流向开源模型前沿模型负责高价值任务。未来 5 年算力需求增长约 24 倍。值得关注按结果收费会重写软件行业成本结构——供应商必须为每次任务的重试和失败兜底被迫极致关注一次做对率。能定义结果的领域对账、报销审核、合同抽取会先跑出来。二、具身智能方向16. 第二届世界人形机器人运动会天工 Ultra 百米 9.39 秒、1500 米 2 分 21 秒多项超越人类纪录事件8 月 22 日第二届世界人形机器人运动会在北京冰丝带开幕16 国 666 支队伍、2056 台机器人参赛。天工 Ultra北京人形机器人创新中心百米预赛 9.39 秒超越博尔特 9.58 秒人类纪录1500 米决赛 2 分 21 秒 63 夺冠人类纪录 3 分 26 秒跳高展示 2.8843 米。首届百米最好成绩仅 21.50 秒——一年内提升超 12 秒。值得关注运动控制能力的跨越式突破强化学习步态控制算法是核心但赛场突破与展台摔倒事故同时存在——具身智能正处于运动能力跃迁、智能泛化不足的剪刀差期。17. 2026 世界机器人大会闭幕从花式炫技转向能干活、能交付事件8 月 19-23 日 WRC 在北京亦庄举办300 企业、3000 件展品首发新品 300 件。展示逻辑从跑跳舞蹈转向商超分拣、工业码垛、家庭服务等实景任务。2026 上半年中国人形机器人出货量超 4 万台预计全年突破 10 万台。机器人产业规上企业上半年营收 1655 亿元同比增长 24.5%。值得关注行业从小批量试用转向大规模落地的关键拐点。但多位企业负责人直言高质量物理交互数据是制约机器人大脑进化的核心短板数据复杂度甚至超过模型本身。小米、比亚迪等近 10 家车企已在产线部署验证。18. 银河通用机器人人机网球对战郑洁全自主对拉上百拍创纪录事件8 月 22 日全球首场人机网球对战上演银河通用机器人与网球名将郑洁单打。机器人发球时速超百公里面对极限调动能完成跨步救球摔倒后自主站起对拉上百拍不停歇。依托自研银河星脑大模型其 Galbot G1 零售值守已落地 40 余城 170 余点位。值得关注全自主非遥控完成感知-决策-全身运动控制的闭环且在物理极限压力下保持稳定性。这是具身智能通用性的重要验证——不只是单一任务演示而是实时应对不可预测的外部交互。