AI 数据分析起步阶段 checklist

根据 Anthropic 官方博客 How Anthropic enables self-service data analytics with Claude 提炼而成。

用法:按从上到下的顺序一项项打勾。

节奏参考:

  • 阶段 0 半天

  • 阶段 1 约 1–2 周

  • 阶段 2 持续 3–4 周

  • 不要跳步,阶段 3 也别提前动手

术语约定

  • canonical(核心概念):一个指标唯一、说死的定义。比如"收入"到底取哪个表、什么口径,得先定下来。

  • eval(测试题):一道问题 + 正确答案的题,专门用来检验 AI 算得对不对。

  • skill(技能文档):一份说明,告诉 AI 该按什么步骤去查数据。

  • agent:帮你跑分析的 AI 助手。

前置:开工前的五问(决定投入多少)

[ ] Q1 今天 vs 未来,哪个更重要?

  • 为什么:AI 模型更新很快。如果你是为了补当前模型的短板才去搭基础设施,等模型一升级,这些设施很可能就白费了。先想清楚你要的是现在够用就行,还是长期稳得住,这决定了你到底要建多少东西。

  • 怎么算完成:能说清楚自己选哪条路,是赌模型会变好、先凑合着用,还是先搭一套能尽量兜底的系统。

[ ] Q2 业务复杂度未来会怎么变?

  • 为什么:如果数据量不大、看数据的人不多、业务也不算复杂,那大厂那套流程对你来说多半是多余的。

  • 怎么算完成:能大致判断未来一年数据量和问题复杂度会不会明显往上走。

[ ] Q3 看数据的人懂不懂数据?

  • 为什么:看结果的人如果自己能看出错,比如分析师本人用,那出错率高些也能接受,验证可以省一点。反过来,如果看结果的人根本不懂数据,验证就必须做扎实,不然错了他也发现不了。

  • 怎么算完成:能说清谁会看这些结果,以及他能不能自己发现错。

[ ] Q4 愿意为准确率花多少钱、忍受多少延迟?

  • 为什么:有些提高准确率的手段是要额外花钱、花时间的。比如 Anthropic 试过的对抗性审查,准确率只涨了 6%,但 token 多耗 32%、响应慢了 72%。

  • 怎么算完成:心里大致有个数,愿意花多少钱、能接受多长的响应时间。

[ ] Q5 数据隐私边界在哪?

  • 为什么:给 AI 的上下文越全,它答得越准。但数据开放范围越大,就越容易踩到公司的管控红线。这直接决定你是做一个能看全部数据的通用助手,还是按权限拆成几个分开的助手。

  • 怎么算完成:能划清一条线,哪些数据可以给 AI 用,哪些绝对不能碰。

阶段 0:盘点

[ ] 0.1 写下你最常被问的 5–10 个数据问题

  • 为什么:起步得从问题出发,不是从数据出发。你最常被问到的这些问题,就是整套体系的起点,阶段 1 定哪些核心概念、阶段 2 出哪些测试题,都得从这里往回推。Anthropic 自己也是先把日常最常被问的问题固化下来,再搭后面的东西。

  • 怎么算完成:清单上写的都是具体问题,比如"上个月收入多少"、"哪个产品卖得最好"、"某客户为什么流失",而不是"做个数据分析"这种空话。

[ ] 0.2 为每个问题标注答案来源

  • 为什么:先摸清楚底,每个问题的答案到底出自哪张表、什么口径、谁在管。这一步常常会暴露一个问题,同一个问题往往有三四种算法,而这正是后面要解决的概念说不清的根源。

  • 怎么算完成:每个问题都能写出至少一个答案来源。写不出来的,就是阶段 1 要优先处理的。

[ ] 0.3 标出你最痛的 3 类分析

  • 为什么:先挑最痛的下手,用它来决定阶段 1 先定哪个核心概念。是反复返工最痛?是口径对不上老吵架最痛?还是答完才发现用错表最痛?哪类最痛,就先把它定成核心概念。

  • 怎么算完成:能说出哪类分析最费时间、最常出错、最不敢拍板。

阶段 1:最小三件套(核心,别贪多)

Anthropic 原话:a handful of canonical datasets, a few dozen offline evals, and a thin knowledge skill will capture most of the upside.

几个核心数据集、几十条测试题、一份薄的技能文档,就能拿到大部分收益。

后面所有东西,都是这三件建好之后才往上加的。

[ ] 1.1 定义 5–10 个核心概念(canonical),每个绑定唯一源

  • 为什么:这一步是在解决最容易出错的根源,也就是概念说不清。公司里,"收入"常常有三四种算法,不定死,AI 和人就一直在猜。Anthropic 的做法是,核心定义要少、要准、而且要管严,你搜一个概念应该只得到一个权威答案。

  • 怎么算完成:每个概念写一页纸,用哪张表、哪一列、含不含税、什么口径、时间窗口怎么算。要落笔写下来,不能只存在脑子里。

[ ] 1.2 写一份薄的技能文档(knowledge skill)

  • 为什么:这一步把先查核心概念的权威定义,查不到再去翻原始数据表这个顺序固定下来,免得 AI 在几百万个字段里瞎找,它应对的就是检索失败。Anthropic 自己测过,没有 skill 时准确率不到 21%,加上之后稳定到 95% 以上。

  • 怎么算完成:一份文档能说清这个问题先看哪份定义,查不到再看哪张原始表。不用一上来就拆成好几个文件,先一份就够。

[ ] 1.3 建 20–30 条测试题(eval),每条钉死一个快照日期

  • 为什么:起步阶段能做的验证,基本就是备好问题 + 正确答案的对照题。答案必须钉在一个固定的快照日期上,因为如果你用的是会变的实时数字,数据一更新,正确答案也跟着变,题就废了。Anthropic 管这叫标准答案不能漂移。

  • 怎么算完成:每条题都写全,问题 + 快照日期 + 正确答案(数字和口径都写)。比如"2026 年 6 月收入 = 1,234,567 元(含税口径,6 月 30 日快照)"。

[ ] 1.4 核心概念文档和测试题放同一目录,改动一起提交

  • 为什么:这是 Anthropic 的共置原则,改数据的同时,文档必须一起改。不然几周下来文档就和实际对不上了。他们实测过,不维护的话,离线准确率一个月就能从 95% 掉到 65%,原因就是没人把维护当回事。

  • 怎么算完成:有一个统一目录,只要口径或表结构一改,就同步更新对应的核心概念页和受影响的测试题。公司如果没有自动化检查,就靠这条手动规矩兜着。

阶段 2:验证闭环(持续)

[ ] 2.1 每次回答后对照测试题检查对错

  • 为什么:验证是唯一能让你知道哪个环节还在出错的办法。不验证,哪怕全套环境都搭好了,你也说不清到底好不好用,Anthropic 说这是很多团队都有的毛病。

  • 怎么算完成:有一份AI 回答 vs 标准答案的对照记录,能说出最近的通过率。

[ ] 2.2 答错的题收成新测试题

  • 为什么:每一次纠正,都是一道现成的新测试题,而且不要钱。题库跑得越多越准,慢慢就积成了你的资产。Anthropic 在线验证里持续收集纠正,用的也是这个思路。

  • 怎么算完成:题库数量每周在增加,而不是一直停在原来的地方。

[ ] 2.3 每份报告加来源脚注

  • 为什么:这是防静默失败最划算的办法。静默失败指的是,答案其实错了,但看着挺合理,别人也没多想就直接用了。脚注里写清三件事,数据来自哪一层(核心定义 › 参考文档 › 原始表)、数据新到哪天、归谁管。看到"原始表、新鲜度未知"这种脚注,转发之前你得先自己核一遍。

  • 怎么算完成:每份输出都带来源层级 + 新鲜度 + 归属这三样。

[ ] 2.4 每周复盘通过率(形成时间序列)

  • 为什么:用来抓那种一点点变差的问题,单次检查看不出来,得连着看几周的趋势。Anthropic 会把每次测试的结果都存下来,版本、模型、通过率、token 用量都记,这样那个改动到底有没有用就变成了一条能查的数据。

  • 怎么算完成:有一份按周记录的通过率曲线,能看出走向,而不是只盯某一次的数字。

阶段 3:叠加增值(基础打稳之后 · 可选)

[ ] 3.1 仅当通过率卡住、且错误集中在某一类时才叠加

  • 为什么:别为了好看而过度设计。如果老在内部术语理解上出错,就补业务上下文层。如果老在复杂查询逻辑上出错,就上对抗性审查,准确率 +6%,代价是多花 32% 的 token、响应慢 72%。如果手动收集纠正太累,就上自动收集。

  • 怎么算完成:能说清自己卡在哪类错误上,所以要补这一层。

自检

全部勾选后,你应该能看到:

  1. 一份写下来的高频问题清单(5–10 个)+ 每个问题的答案来源。

  2. 一份核心概念页(5–10 个概念,每个绑唯一源和口径)。

  3. 一份能指路的技能文档。

  4. 20–30 条钉死日期的测试题 + 每周通过率记录。

  5. 每份输出都带来源脚注。

  6. 明确知道下一步该补哪一层,或明确知道现在还不需要。

歧义让答案不唯一,陈旧让答案过期,检索失败让答案找不到。

起步三件套正好对着这三个毛病。

核心概念治歧义,维护纪律治陈旧,技能文档治检索失败。