AI 数据分析很爽,但坑也不少。这 10 个坑是真实的翻车现场,每个都附补救方案,建议收藏。
坑 1:AI 编造不存在的数字(幻觉)
现象:AI 信誓旦旦地给出结论,但原始数据里根本没有那个数。
补救:
- 出结论前加一句”每个数字必须能溯源到数据”
- 抽查 1-2 个关键数字自己验证
- 用模板:“复核以上结论,列出所有无法从数据推出的表述”
坑 2:把”相关”说成”因果”
现象:销量和气温都涨了,AI 就写”气温导致销量上涨”。
补救:
- 提示词里显式声明”相关 ≠ 因果,不要做因果推断”
- 需要因果时另用因果推断方法(DID、倾向匹配等)
坑 3:数据泄漏(用未来预测过去)
现象:建模时不小心把”事后才知道”的字段(如是否还款)当特征,模型准得离谱但上线就废。
补救:
- 告诉 AI 哪些字段”预测时不可得”,要求剔除
- 检查特征重要性 Top 里有没有可疑的未来字段
坑 4:指标口径漂移
现象:同是”成交额”,你算含税、AI 算不含税,结论互相打架。
补救:
- 第一句话就定口径:“成交额统一为含税口径”
- 复杂指标先让 AI 复述口径再计算
坑 5:脏数据没洗就上桌
现象:重复行、异常值没处理,统计结果整体偏掉。
补救:
- 分析前强制做”数据体检”(缺失/重复/异常三件套)
- 让 AI 输出”清洗前后行数对比”,看得出动了什么
坑 6:样本撑不起结论
现象:3 条数据也敢说”趋势明显下降”。
补救:
- 提示词:“说明样本量,样本不足的结论标注’仅供参考’”
- 关注置信区间/分位数,别只看均值
坑 7:SQL JOIN 放大行数没察觉
现象:一对多 JOIN 后行数暴涨,指标翻了几倍。
补救:
- 提示词:“检查 JOIN 是否放大行数,确认粒度不变”
- 让 AI 输出”JOIN 前后行数”
坑 8:敏感数据直接喂给 AI
现象:把客户名单、财务数据原样粘贴到云端 AI。
补救:
- 先脱敏:姓名→ID、手机号→区间
- 敏感场景用本地运行的工具(Codex CLI / WorkBuddy 本地模式)
坑 9:提示词太泛,产出不可用
现象:“分析一下这个数据”——AI 给你 50 个图表,没一个有用。
补救:
- 用本站提示词模板库,套”背景+任务+约束”三段式
- 明确输出格式:“3 条结论 + 1 个建议,给老板看,500 字内”
坑 10:AI 说”完成”就信以为真
现象:AI 说”完成”,你没检查就交付了。
补救:
- 建立复核习惯:数字必查,结论必问
- 关键分析让 AI 写”复算过程”,自己跟一遍
一句话总结
AI 负责快,你负责对。 用提示词把「求快」和「求对」焊在一起,AI 数据分析才能从”好玩”变成”能交付”。
配套阅读:AI 数据分析提示词模板库(30+)。