根据 Anthropic 官方博客 How Anthropic enables self-service data analytics with Claude 提炼而成。用法按从上到下的顺序一项项打勾。节奏参考阶段 0 半天阶段 1 约 1–2 周阶段 2 持续 3–4 周不要跳步阶段 3 也别提前动手术语约定canonical核心概念一个指标唯一、说死的定义。比如收入到底取哪个表、什么口径得先定下来。eval测试题一道问题 正确答案的题专门用来检验 AI 算得对不对。skill技能文档一份说明告诉 AI 该按什么步骤去查数据。agent帮你跑分析的 AI 助手。前置开工前的五问决定投入多少[ ] Q1 今天 vs 未来哪个更重要为什么AI 模型更新很快。如果你是为了补当前模型的短板才去搭基础设施等模型一升级这些设施很可能就白费了。先想清楚你要的是现在够用就行还是长期稳得住这决定了你到底要建多少东西。怎么算完成能说清楚自己选哪条路是赌模型会变好、先凑合着用还是先搭一套能尽量兜底的系统。[ ] Q2 业务复杂度未来会怎么变为什么如果数据量不大、看数据的人不多、业务也不算复杂那大厂那套流程对你来说多半是多余的。怎么算完成能大致判断未来一年数据量和问题复杂度会不会明显往上走。[ ] Q3 看数据的人懂不懂数据为什么看结果的人如果自己能看出错比如分析师本人用那出错率高些也能接受验证可以省一点。反过来如果看结果的人根本不懂数据验证就必须做扎实不然错了他也发现不了。怎么算完成能说清谁会看这些结果以及他能不能自己发现错。[ ] Q4 愿意为准确率花多少钱、忍受多少延迟为什么有些提高准确率的手段是要额外花钱、花时间的。比如 Anthropic 试过的对抗性审查准确率只涨了 6%但 token 多耗 32%、响应慢了 72%。怎么算完成心里大致有个数愿意花多少钱、能接受多长的响应时间。[ ] Q5 数据隐私边界在哪为什么给 AI 的上下文越全它答得越准。但数据开放范围越大就越容易踩到公司的管控红线。这直接决定你是做一个能看全部数据的通用助手还是按权限拆成几个分开的助手。怎么算完成能划清一条线哪些数据可以给 AI 用哪些绝对不能碰。阶段 0盘点[ ] 0.1 写下你最常被问的 5–10 个数据问题为什么起步得从问题出发不是从数据出发。你最常被问到的这些问题就是整套体系的起点阶段 1 定哪些核心概念、阶段 2 出哪些测试题都得从这里往回推。Anthropic 自己也是先把日常最常被问的问题固化下来再搭后面的东西。怎么算完成清单上写的都是具体问题比如上个月收入多少、哪个产品卖得最好、某客户为什么流失而不是做个数据分析这种空话。[ ] 0.2 为每个问题标注答案来源为什么先摸清楚底每个问题的答案到底出自哪张表、什么口径、谁在管。这一步常常会暴露一个问题同一个问题往往有三四种算法而这正是后面要解决的概念说不清的根源。怎么算完成每个问题都能写出至少一个答案来源。写不出来的就是阶段 1 要优先处理的。[ ] 0.3 标出你最痛的 3 类分析为什么先挑最痛的下手用它来决定阶段 1 先定哪个核心概念。是反复返工最痛是口径对不上老吵架最痛还是答完才发现用错表最痛哪类最痛就先把它定成核心概念。怎么算完成能说出哪类分析最费时间、最常出错、最不敢拍板。阶段 1最小三件套核心别贪多Anthropic 原话a handful of canonical datasets, a few dozen offline evals, and a thin knowledge skill will capture most of the upside.几个核心数据集、几十条测试题、一份薄的技能文档就能拿到大部分收益。后面所有东西都是这三件建好之后才往上加的。[ ] 1.1 定义 5–10 个核心概念canonical每个绑定唯一源为什么这一步是在解决最容易出错的根源也就是概念说不清。公司里收入常常有三四种算法不定死AI 和人就一直在猜。Anthropic 的做法是核心定义要少、要准、而且要管严你搜一个概念应该只得到一个权威答案。怎么算完成每个概念写一页纸用哪张表、哪一列、含不含税、什么口径、时间窗口怎么算。要落笔写下来不能只存在脑子里。[ ] 1.2 写一份薄的技能文档knowledge skill为什么这一步把先查核心概念的权威定义查不到再去翻原始数据表这个顺序固定下来免得 AI 在几百万个字段里瞎找它应对的就是检索失败。Anthropic 自己测过没有 skill 时准确率不到 21%加上之后稳定到 95% 以上。怎么算完成一份文档能说清这个问题先看哪份定义查不到再看哪张原始表。不用一上来就拆成好几个文件先一份就够。[ ] 1.3 建 20–30 条测试题eval每条钉死一个快照日期为什么起步阶段能做的验证基本就是备好问题 正确答案的对照题。答案必须钉在一个固定的快照日期上因为如果你用的是会变的实时数字数据一更新正确答案也跟着变题就废了。Anthropic 管这叫标准答案不能漂移。怎么算完成每条题都写全问题 快照日期 正确答案数字和口径都写。比如2026 年 6 月收入 1,234,567 元含税口径6 月 30 日快照。[ ] 1.4 核心概念文档和测试题放同一目录改动一起提交为什么这是 Anthropic 的共置原则改数据的同时文档必须一起改。不然几周下来文档就和实际对不上了。他们实测过不维护的话离线准确率一个月就能从 95% 掉到 65%原因就是没人把维护当回事。怎么算完成有一个统一目录只要口径或表结构一改就同步更新对应的核心概念页和受影响的测试题。公司如果没有自动化检查就靠这条手动规矩兜着。阶段 2验证闭环持续[ ] 2.1 每次回答后对照测试题检查对错为什么验证是唯一能让你知道哪个环节还在出错的办法。不验证哪怕全套环境都搭好了你也说不清到底好不好用Anthropic 说这是很多团队都有的毛病。怎么算完成有一份AI 回答 vs 标准答案的对照记录能说出最近的通过率。[ ] 2.2 答错的题收成新测试题为什么每一次纠正都是一道现成的新测试题而且不要钱。题库跑得越多越准慢慢就积成了你的资产。Anthropic 在线验证里持续收集纠正用的也是这个思路。怎么算完成题库数量每周在增加而不是一直停在原来的地方。[ ] 2.3 每份报告加来源脚注为什么这是防静默失败最划算的办法。静默失败指的是答案其实错了但看着挺合理别人也没多想就直接用了。脚注里写清三件事数据来自哪一层核心定义 › 参考文档 › 原始表、数据新到哪天、归谁管。看到原始表、新鲜度未知这种脚注转发之前你得先自己核一遍。怎么算完成每份输出都带来源层级 新鲜度 归属这三样。[ ] 2.4 每周复盘通过率形成时间序列为什么用来抓那种一点点变差的问题单次检查看不出来得连着看几周的趋势。Anthropic 会把每次测试的结果都存下来版本、模型、通过率、token 用量都记这样那个改动到底有没有用就变成了一条能查的数据。怎么算完成有一份按周记录的通过率曲线能看出走向而不是只盯某一次的数字。阶段 3叠加增值基础打稳之后 · 可选[ ] 3.1 仅当通过率卡住、且错误集中在某一类时才叠加为什么别为了好看而过度设计。如果老在内部术语理解上出错就补业务上下文层。如果老在复杂查询逻辑上出错就上对抗性审查准确率 6%代价是多花 32% 的 token、响应慢 72%。如果手动收集纠正太累就上自动收集。怎么算完成能说清自己卡在哪类错误上所以要补这一层。自检全部勾选后你应该能看到一份写下来的高频问题清单5–10 个 每个问题的答案来源。一份核心概念页5–10 个概念每个绑唯一源和口径。一份能指路的技能文档。20–30 条钉死日期的测试题 每周通过率记录。每份输出都带来源脚注。明确知道下一步该补哪一层或明确知道现在还不需要。歧义让答案不唯一陈旧让答案过期检索失败让答案找不到。起步三件套正好对着这三个毛病。核心概念治歧义维护纪律治陈旧技能文档治检索失败。