2026 年 8 月 2 日欧盟委员会对通用人工智能模型提供者的执法权正式生效。从这一天起AI 办公室不再只是发指南、开研讨会的咨询机构——它有权对不合规的模型提供者开出罚单金额最高可达1500 万欧元或全球年营业额的 3%取两者中较高者。对很多中国开发者来说这条新闻的第一反应是跟我没关系我又不在欧盟——但 AI Act 的管辖逻辑是投放欧盟市场不是注册地在欧盟。你的模型只要在 Hugging Face 上开放下载、你的 API 只要对欧洲用户开放你就已经在射程之内。这不是危言耸听。2025 年 8 月 2 日AI Act 第五章关于 GPAI 的规则已经生效一年2026 年 8 月 2 日罚则开始适用。一个残酷的细节是如果你在 2025 年 8 月 2 日之后把模型投放市场那么从 2026 年 8 月 2 日起你做的每一件事都可能被翻旧账——训练数据用了什么、版权政策有没有、模型文档写了没有、系统性风险评估做了没有。罚款的追溯不是从被查那天起算而是从生效那天起算。也就是说现在开始补合规动作补的是一年多以前就该做的功课时间差越大翻旧账的风险敞口就越大。这篇文章不讲法条原文只回答三个工程师真正关心的问题我的模型算不算 GPAI我的训练规模过没过 10^25 FLOP 红线开源模型到底豁免了什么三个问题都有明确的技术判定标准甚至可以直接用代码算出来。看懂这三件事你就知道自己处在监管的哪个格子、需要优先补哪几样东西。一、先判断你的模型是不是 GPAIAI Act 第 3 条第 63 款给 GPAI 下了一个非常大模型的定义通过大规模数据进行自监督训练、表现出显著通用性、能胜任多种不同任务、可以集成到下游系统。翻译成人话你在大规模语料上做 next-token prediction训出来的模型既能写代码又能聊天又能做分类——你就是 GPAI 提供者。这个定义没有算力门槛小到 1B 参数的开源模型只要符合自监督训练通用性就落入监管范围。有一个常见误区认为只有像 GPT 那样的前沿模型才被管。实际上 AI Act 把 GPAI 提供者的义务分成两个等级一般义务所有 GPAI 提供者都要履行和系统性风险义务只有超大规模模型要履行。一般义务包括三类准备并持续更新技术文档、制定并落实版权政策、在训练数据层面公开足够详细的摘要。这些义务不看你模型多大看你有没有做——很多开源项目现在连 model card 都写不完整这就是第一道坎。第二道坎藏在提供者这个词里。AI Act 对提供者的定义是将 GPAI 模型投放市场或投入服务的自然人或法人。注意两个动作投放市场指在欧盟市场上提供投入服务指在自己的服务里使用。如果你的公司用开源模型做了个面向欧洲客户的 SaaS你既是部署者也是投入服务的一方——虽然你不需要承担模型提供者的全部义务但下游链条上的责任划分、记录义务一样不少。大模型生态是分层的监管也是分层的先搞清楚自己在哪一层比急着抄合规模板更重要。二、10^25 FLOP 红线用代码算清楚系统性风险的判定是 AI Act 里少有的有明确数字的条款训练所用累积计算资源超过 10^25 FLOP 的 GPAI 模型被推定为具有系统性风险第 51 条第 2 款。被推定之后除了承担一般义务还要额外做模型评估、报告严重事件、确保充分的网络安全防护——义务量级直接翻倍。这里的关键词是累积不是最后一次训练的花费而是同一模型所有版本、所有中间训练、所有实验加在一起的计算量。10^25 是什么概念业界估算训练 FLOP 有个通用公式FLOPs ≈ 6 × 参数量 × 训练 token 数。我写了一个可以直接运行的小脚本把你的参数规模和 token 量输进去它会告诉你离红线还有多远def estimate_flops(params_b, tokens_b): 估算训练总 FLOPs参数单位十亿token 单位十亿 flops 6 * (params_b * 1e9) * (tokens_b * 1e9) threshold 10 ** 25 margin flops / threshold verdict 已超过红线触发系统性风险义务 if margin 1 else 未过红线 print(f估算 FLOPs: {flops:.2e}) print(f红线 10^25 的倍数: {margin:.2f}x) print(f判定: {verdict}) return flops # 示例70B 参数 × 15T tokenLlama 3 量级 estimate_flops(70, 15000) # 示例7B 参数 × 2T token中小开源模型 estimate_flops(7, 2000)跑一下就知道70B × 15T token ≈ 6.3×10^24距离 10^25 只差一点勉强在红线内而 1.4T 参数 × 30T token 的巨型模型 ≈ 2.5×10^26超过红线 25 倍系统性风险义务跑不掉。注意这个公式只是粗略估算实际训练还有 attention 计算、激活重计算、数据预处理等开销真实数字通常比估算值高 20%-50%所以离红线 10 倍以内都该按准系统性风险来准备。欧盟委员会还可以依据附件 XIII 的标准指定某个模型为系统性风险——没过红线不代表绝对安全过线基本跑不掉。三、时间线三个 8 月 2 日的区别AI Act 的生效节奏经常被混为一谈我把关键节点整理成一张表日期节点对谁生效2025-08-02GPAI 提供者义务规则生效当天及之后投放市场的模型2026-08-02委员会执法权罚款生效2025-08-02 之后投放的模型含修改版2027-08-02存量模型合规宽限截止2025-08-02 之前已投放的模型这张表最容易被忽视的是最后一行2025 年 8 月 2 日之前就投放市场的模型不是不受管而是宽限到 2027 年 8 月 2 日。也就是说今天还在服役的所有主流开源模型——Llama 3、Qwen2.5、DeepSeek V3 那一代——明年这个时间点之前必须完成合规改造否则同样面临罚款。合规不是新模型的事是所有在欧盟市场流通的模型的事。还有一个灰色地带如果模型的原始版本在 2025 年 8 月 2 日之前投放但修改版在之后发布罚款条款从哪天起算欧盟官方指南没有给出明确答案目前处于法律解释的真空区。对开发者来说这意味着什么每次发布新版本前都要重新评估自己在时间线里的位置——这不是法务部门的工作是需要写进 CI 发布流程的检查项。版本号每升一次合规状态就要重新过一遍。四、开源豁免豁免的不是全部开源社区最关心的问题我的模型 Apache 2.0 开源是不是什么都不用做答案是否定的。AI Act 的豁免条款第 53 条第 4 款说的是以开源许可公开、权重可下载、且不构成系统性风险的 GPAI 模型豁免部分一般义务——具体豁免的是透明度相关的文档义务但版权政策、训练数据摘要这些核心义务并不在豁免范围内。这里有一个非常关键的细节欧盟对开源模型的定义比我们通常理解的严格得多。不是代码开源就算必须是模型权重本身以开源许可发布、且用户可以自由下载和修改。那些开放权重但禁止商用的许可比如某些 API 模型的特殊条款在欧盟眼里不算开源豁免不适用。我见过不少团队把代码在 GitHub 上开源了当成模型开源了这是两回事。代码开源、权重闭源在 AI Act 的框架下就是闭源模型全套义务一个不落。把一般义务和系统性风险义务拆开看义务项开源模型闭源/商业模型技术文档豁免非系统性风险时必须版权政策必须必须训练数据摘要必须必须系统性风险评估过红线就必须过红线就必须严重事件报告过红线就必须过红线就必须换句话说开源豁免的只是写文档的部分负担数据合规和法律风险一个都没少。如果你在 10^25 FLOP 之上又选择了开源那你要同时承担系统性风险义务里最重的那几项——因为你的权重人人可查、你的训练方法全在论文里审查者不需要费任何力气就能完成初步取证。开源身份在这里不是保护伞反而是放大镜。五、行为准则与模型卡片把合规变成模板欧盟委员会在 2025 年 7 月发布了《通用人工智能行为准则》分为透明度、版权、安全三个章节签署准则的提供者可以借此证明自己在第 53 条和第 55 条义务上的合规性。对工程团队来说这套准则最实用的地方是它给出了合规长什么样的具体参照——不用自己发明一套文档体系照着准则的章节结构搭模型卡片就行。一个合格的 model card 至少要覆盖模型的用途与限制、训练数据的规模与来源、版权政策的链接、已知的偏见与风险、评估结果摘要。我见过的最省力的做法是把 model card 做成仓库里的一个 JSON 文件随每次发布自动更新合规检查直接读这个文件而不是人工翻文档{ model: your-model-7b, version: 2.1.0, release_date: 2026-08-01, training: { params_b: 7, tokens_b: 2000, est_flops: 1.2e24, systemic_risk: false }, license: apache-2.0, open_weight: true, copyright_policy: docs/copyright-policy.md, data_summary: { total_docs_b: 1.8, sources: [commoncrawl, github, books], languages: [zh, en], contains_pii: false }, evals: { code_bench: 0.62, safety_harm: 0.03 } }这个文件本身就有三个作用第一发布流水线在发版前读它做门禁校验缺字段直接阻断第二它同时满足了一般义务里技术文档和训练数据摘要的绝大部分要求第三欧盟审查时你交出一个机器可读的合规清单比交 200 页 PDF 更可信。把合规做成数据而不是做成文档是小团队最划算的投入方向。六、开发者的五步自检清单把上面的内容落成可执行动作我建议每个模型提供者按这个顺序自查第一步算 FLOP。把上面那段脚本跑一遍确定自己是否过 10^25 红线也顺带估算一下累积计算资源——注意是累积多个模型版本、多次训练都要算进去这是一个大坑很多人只算最后一遍训练。把每次训练的参数量、token 量、实验轮数登记成一张表这件事本身就已经在满足训练数据透明度的一部分要求。第二步定豁免身份。检查你的许可权重是否真的开放是否允许商用如果你用开放权重限制商用的许可直接按闭源模型准备全部义务别指望豁免。这一步决定你后面所有工作的量级判断错了要么白做一半工作要么漏掉一半义务。第三步补齐版权政策。这是最容易低成本完成的一项明确训练数据的来源、爬虫是否遵守 robots.txt 和权利保留声明、建立投诉联系渠道。欧盟 2025 年发布的《行为准则》版权章节要求的就是这三件事。注意欧盟的立场是爬取需尊重权利保留与公开数据随便爬的美国惯例有本质差别用美国式数据管线的团队要格外小心。第四步写训练数据摘要。不需要公开完整数据集但需要足够详细的摘要——数据规模、来源类型、语言分布、是否包含个人信息。欧盟指南明确说如果无法重新训练或去学习化必须在版权政策和摘要里如实披露不能沉默。很多团队卡在这一步是因为数据来源本身不干净——合规检查暴露的往往不是文档问题而是数据治理问题。第五步把合规检查写进发布流程。在模型发布 pipeline 里加一个合规门禁FLOP 估算、许可文件、版权政策、数据摘要、model card五样缺一不可才能发版。这一步的成本最低收益最高——因为它把合规从事后补救变成事中自动也顺便倒逼团队把数据资产梳理清楚这对后续的训练迭代只有好处。这五步不是给大厂准备的恰恰是给中小团队和独立开发者的。大厂有法务部可以慢慢研究判例小团队没有这个冗余最好的策略就是在 8 月 2 日罚则生效之前用几个晚上把文档补齐。监管的靴子已经落地剩下的问题不是会不会被查而是查到你的时候你拿得出什么。今晚就行动把第一步的脚本跑一遍你会对自己的风险敞口有一个全新的认识。