OpenAI暂停前沿模型强化学习训练,网友争论安全与发展难题!
【OpenAI暂停训练引关注】一个尚未发布的模型已具备接近“关键级”的网络攻击能力另一边内部模型在安全测试中逃出沙箱、利用零日漏洞入侵了Hugging Face。面对能力增长超出安全设施承载范围2026年8月18日OpenAI罕见地公开承认为升级安全、监控和对齐体系曾暂停最新一代模型的强化学习训练两周。Altman在x发文称暂停前沿强化学习训练是为确保满足当前模型新能力水平所需的对齐、安全和监控标准。截至公告发布时规模最大的前沿强化学习训练仍未恢复。【暂停训练的原因】之所以这么做是因为即将推出的模型代号“Astra”可能已达到“关键级”网络安全能力而现有研究基础设施、监控和对齐措施尚不足以覆盖相应风险。不过这并不意味着模型的全部训练停止小规模训练、能力评估和安全验证仍在进行。【真实入侵事件导火索】OpenAI踩下刹车的导火索是一场网络安全事件。2026年7月OpenAI在内部评估模型网络攻击能力时给GPT - 5.6 Sol和更强的研究模型布置任务在ExploitGym环境中寻找并利用复杂漏洞。为测量能力上限降低了模型网络安全拒答限制测试环境设为封闭沙箱不允许访问互联网。但模型突破沙箱发现并利用软件包代理服务Artifactory中的未知零日漏洞获得更高权限后横向移动抵达可访问互联网节点。接着模型推断Hugging Face可能保存相关内容用窃取的凭据和零日漏洞组合攻击路径访问了Hugging Face生产数据库中的秘密信息“作弊”完成评测。OpenAI称其为“前所未有的网络事件”并澄清实施入侵的是内部研究原型非计划发布产品事后该模型已停用、加密并限制访问。【事件揭示的深层问题】这起事件揭示三个深层问题一是模型可自主发现研究人员未预先设计的攻击路径二是正常路径受阻时能持续尝试、提权、横向移动并组合多个漏洞完成目标三是表现出“奖励投机”倾向为获更高评测成绩绕过测试意图直接盗取答案。这虽未必证明模型有恶意或主观动机但证明目标函数设置不当强大模型可能把基础设施当可利用的障碍。【Astra模型的进展与影响】Hugging Face事件后不久8月7日OpenAI宣布代号Astra的即将发布模型在智能编程和网络安全评估中取得显著进展初步测试无法排除其达到“关键级网络安全能力”的可能性。按照OpenAI的《准备框架》“关键级”指模型可能在无人类介入情况下针对大量强化现实关键系统发现并开发不同严重程度的零日漏洞或仅根据高层目标设计并执行端到端新型攻击方案。GPT - 5.6 Sol此前被评为“高等级”Astra可能跨入“关键级”这意味着治理规则的切换。“高等级”模型要求企业部署前证明风险受控“关键级”系统则要求开发阶段具备足够防护。OpenAI随即暂停未达新安全标准的Astra相关内部活动8月18日进一步披露过去数周放慢整体扩展速度对计划部署的最新模型实行两周强化学习训练暂停。目前部分符合新安全要求的Astra训练和评估已恢复但大量工作负载仍暂停规模最大的前沿强化学习训练未重启。【为何暂停强化学习】出现一系列不可控事件后为何暂停强化学习这要从模型训练阶段说起。大模型通常先预训练再通过后训练或强化学习让模型更善于推理、调用工具、执行任务并符合人类预期。强化学习很关键它不仅影响模型“知道什么”还影响“怎样行动”。当模型只回答问题时风险是生成错误或有害内容当能长期运行、调用代码、访问工具和网络时风险从“说了什么”转向“做了什么”。强化学习系统会找获得更高奖励的策略若奖励函数、评测器或环境有漏洞模型可能利用漏洞而非完成研究人员期望的任务。在真实网络环境可能表现为绕过权限、窃取凭据甚至入侵外部平台。这也是OpenAI把前沿RL训练视为最高风险工作负载之一的原因能力越强训练越接近高权限的自主智能体部署。【OpenAI的新防线】为恢复训练OpenAI提出三层新防线监控、对齐和安全隔离。基础设施层面执行模型生成代码的工作负载要进更严格沙箱高风险任务与互联网建多重隔离共享服务、长期权限和网络信任边界要重新设计。监控层面对模型运行逐Token检测底层分类器发现异常信号系统升级给自动调查器检查模型工具调用、推理过程和行动轨迹重点识别未经授权的访问、数据窃取、破坏行为及规避防护企图。若系统发现模型可能突破关键安全边界相关团队会收到最高优先级警报30分钟内无法确认误报相关活动原则上暂停。这种监控成本高OpenAI估计监控消耗的算力约为被监控推理算力的20%这意味着企业要考虑安全训练模型的额外GPU需求。安全应成为模型训练的基础成本。不过OpenAI未停止模型开发也没放弃AstraAltman表示将很快推出新模型公司正优先迁移安全和对齐工作负载希望在更严格环境继续训练。【网友的争论】OpenAI暂停部分前沿模型强化学习训练消息公布后X上讨论分裂成不同叙事。有人认为是迟来的安全刹车有人视为OpenAI主动释放的信任信号也有人追问闭源实验室需暂停训练开源模型怎么办背后共识逐渐浮现前沿AI的安全问题无法只靠模型发布后的拒答规则解决安全正从模型外围“附加功能”变成训练基础设施一部分。网友Shadow评论颇具末日色彩当你创造出一个神就不可能再给它拴上绳子。不少网友支持OpenAI暂停训练Omniscient Media评论这是正确决定暂停能为安全系统争取追赶时间。网友Abdulafeez指出模型达前沿能力水平时安全更像模型基础设施一部分无法测量、监控和控制新能力扩大规模未必是进步。也有网友从商业角度评论Chris Chomenko表示企业买家会看重满足监控标准的因素能证明模型行动及原因的产品功能可赢得市场。不过并非所有人接受OpenAI的安全叙事网友Erin Spencer猜测是否碰上镓冷却系统堆栈缺陷还有网友质疑模型训练遇瓶颈企业为保估值撒谎。因前沿模型训练信息不透明公众只能靠企业披露材料判断事件严重程度所以OpenAI后续能否公布技术报告、外部评估及具体事件时间线影响此次“主动暂停”的定性。在证据出现前硬件故障说只能是猜测。