Anthropic 密码学红队:算法过了“专家评审”,为什么仍可能被 AI 在 60 小时内砍半安全强度? 你是不是也在经历这些团队说「这个方案过了评审 / 是 NIST 候选 / 库用了很多年」于是上线门禁只剩“有没有实现 bug”安全同学只会扫依赖、跑 SAST从没把“算法本身被分析到什么程度”写进验收PQC / 新签名方案选型时只比性能和 key size没有 AI 可复现压力测试的预算出了 paper 或邮件列表告警你才知道密钥参数要翻倍——但业务已经绑死了2026-07-28 Anthropic Frontier Red Team 公开了一组结果用 Claude Mythos Preview不仅在找密码库实现漏洞还在算法层找到了可验证的密码分析进展。重要边界先说清HAWKNIST 后量子附加签名第三轮候选的有效密钥强度被显著削弱小参数量级从约 (2^{64}) 量级攻击代价压到约 (2^{38})等价表述是要保住原安全级别往往需要约翻倍 key size7 轮 AES非完整 10 轮 AES-128的 meet-in-the-middle 攻击被改进约200–800×官方明确不影响当前生产系统HAWK 未部署AES 攻击只对 round-reduced 变体下面不写研究报告体只写你怎么改选型门禁、评测脚手架和披露流程避免“算法看起来很新 / 很权威”变成业务里的静默炸弹。先换问题框架实现审计 ≠ 算法抗分析你现在常做的它回答什么它回答不了什么依赖扫描 / CVE已知实现缺陷算法数学弱点代码审计 / fuzz接口误用、边界条件规约级对称性、结构弱点“专家看过 / 进了标准赛道”社会过程信任是否已被 AI 加速复审性能 key size 对比表工程成本安全参数是否被新攻击重定价Anthropic 自己也区分了两层能力实现层Mythos 曾能在指向的密码库里自主找实现漏洞算法层这次是在算法数学结构上推进攻击上界并做端到端验证如果你的门禁只覆盖第 1 层第 2 层一变所有“已通过”的结论会一起失效。问题 1为什么“过了两轮人类专家评审”仍不够现象PQC / 新方案常见话术“进了 NIST 多轮说明足够硬。”根因标准竞赛的设计意图本来就是公开征求攻击。历史上 SIKE 等候选也曾在后期被彻底打穿。Mythos 对 HAWK 的路径更像工程项目管理 多 agent 协作文献综述 → 锁定 Lattice Isomorphism / 自同构方向计算实验Python / Sage 等一端拒绝、另一端坚持的worker 交叉验证最后用可运行验证管线说服人类操作者全程约60 小时、API 成本量级约10 万美元人类操作者背景是理论 CS并非格密码专家主要做方向管理而非手推全部证明。你可以怎么做把「进标准赛道」改写成状态机而不是布尔安全候选 → 公开评审中 → AI人类复审通过 → 参数冻结 → 有限试点 → 全量在 RFC / ADR 里强制字段最近一次算法层复审日期复审主体内部 / 外部 / AI harness已知最优攻击代价bit 安全量级与谁复现过禁止单独用“专家口头 OK”关闭风险单。问题 2你的安全 backlog 为什么永远排不到“算法层”现象季度规划里永远是修高危 CVE密钥轮换证书与 mTLS……算法选型“等标准尘埃落定再说”根因算法层工作不可见、难 KPI、难在业务周报里画绿勾。但 AI 把“非专家 强 agent 计算工具”的组合成本压下来了同样一周可能出现参数重定价。你可以怎么做可复制的最小门禁对每一个新引入或计划迁移的签名 / KEM / 自定义协议建一张卡[算法层门禁] - 规格来源与版本 - 参数集与宣称安全级别 - 已知最优攻击文献 日期 - 本团队或委托方是否复现过 - AI harness 是否跑过公开测试集 / 自建脚本 - 若 key size 需 ×2业务影响 - 回滚方案算法/库双轨没填完不允许进主干依赖。比“以后再看 paper”可执行得多。问题 3只跑实现 fuzz却没有“可复现密码分析脚手架”现象有 CI 跑 unit test 和 fuzz没有固定环境能复现 paper 里的 attack cost 声明出了新结果只能转发 PDF无法在内部 overnight 验证研究侧信号Anthropic 强调找到攻击后Mythos实现了端到端验证管线并与 ETH Zurich 等合作发布CryptanalysisBench方便社区评测 LLM 的密码分析能力。对你而言重点不是复刻 $10 万实验而是任何“安全强度数字”必须对应可复现脚本或可引用的第三方复现。你可以怎么做为密码相关依赖建crypto-repro/目录固定容器镜像、Sage/Python 版本、随机种子、输入规模上限。只收录防御向产物参数敏感性、已知攻击复杂度复现、规约一致性检查——不把 exploit PoC 当业务资产散播。CI 里加“弱断言”例如关键参数变更时触发复现作业或至少打开人工 checklist。跟学术 / 红队供应商约定交付物 报告 复现说明 负责任披露时间线而不是只给 slide。问题 4PQC 迁移只比性能不比“被 AI 复审过的程度”现象选型表通常三列延迟、公钥/签名体积、是否“NIST 路线”。HAWK 案例的工程含义是一旦有效强度对半砍体积与性能优势可能被“必须加倍参数”一口吃掉。你可以怎么做选型表加第四列方案性能体积标准进度AI/公开复审成熟度参数可伸缩性A………有独立复现 / 无能否在成本可接受下抬参数B……………决策规则建议生产默认优先已广泛部署 持续公开分析的方案而不是只看论文漂亮。候选方案允许预研禁止无回滚地写死。自定义拼装协议默认高风险必须算法层门禁 外部复审。问题 5披露与业务响应是两张皮现象安全邮件列表、NIST 讨论、GitHub advisory 来了业务侧要 2 周才懂“要不要发版”。研究侧做法可借鉴流程不抄攻击细节负责任披露、与作者 / 政府与行业伙伴预沟通公开与协调同步HAWK 与作者及 NIST 邮件列表协调明确“不导致当前生产变更”与“改变候选方案吸引力”是两件不同的事你可以怎么做建 48 小时剧本T0 安全收到算法/协议预警 T4h 判断生产依赖候选依赖仅预研 T24h 若生产补丁/开关/双轨若候选冻结晋级 T48h 对外/对内说明影响面、是否要改参数、时间表把“算法层预警”和“CVE 预警”共用同一 on-call 通道避免掉进学术邮件列表黑洞。本周就能做的 5 步开发 / 安全 / 架构一起盘点列出所有签名、KEM、自定义 token/加密协议标注实现库与规格版本。分层每条依赖打标实现风险/算法风险/配置风险。补门禁新依赖合并必须填「算法层门禁」卡见问题 2。搭最小 repro一个容器 两三个公开测试向量 / 参数一致性检查先跑起来。定预算每季度留出“AI 辅助规约复审”时间或外包预算——不必 $10 万起步但不能是 0。边界写进团队共识避免误读本文基于 Anthropic 公开博文的工程转译不提供攻击步骤、不讨论如何利用具体漏洞。HAWK 攻击是更快的指数级攻击不是宣称一键打穿所有格密码官方称不影响其他 NIST 后量子签名候选与格密码整体。round-reduced AES 结果用于研究安全边际不等于 AES-128 生产部署被破。AI 加速的是复审与发现最终仍依赖可验证数学与负责任披露把它当成“自动黑客工具”会误用。一句话收束实现没洞不等于算法还值钱标准在审不等于参数不会被重定价。把 AI 辅助的算法层复审写进选型与晋级门禁比等一条邮件列表再连夜改密钥便宜得多。原文请完整阅读方法与边界https://www.anthropic.com/research/discovering-cryptographic-weaknesses标签建议人工智能、密码学、后量子、AI安全、安全架构、软件工程可见范围全部可见