AI 数据分析很爽,但坑也不少。这 10 个坑是真实的翻车现场,每个都附补救方案,建议收藏。

坑 1:AI 编造不存在的数字(幻觉)

现象:AI 信誓旦旦地给出结论,但原始数据里根本没有那个数。

补救

  • 出结论前加一句”每个数字必须能溯源到数据”
  • 抽查 1-2 个关键数字自己验证
  • 用模板:“复核以上结论,列出所有无法从数据推出的表述”

坑 2:把”相关”说成”因果”

现象:销量和气温都涨了,AI 就写”气温导致销量上涨”。

补救

  • 提示词里显式声明”相关 ≠ 因果,不要做因果推断”
  • 需要因果时另用因果推断方法(DID、倾向匹配等)

坑 3:数据泄漏(用未来预测过去)

现象:建模时不小心把”事后才知道”的字段(如是否还款)当特征,模型准得离谱但上线就废。

补救

  • 告诉 AI 哪些字段”预测时不可得”,要求剔除
  • 检查特征重要性 Top 里有没有可疑的未来字段

坑 4:指标口径漂移

现象:同是”成交额”,你算含税、AI 算不含税,结论互相打架。

补救

  • 第一句话就定口径:“成交额统一为含税口径”
  • 复杂指标先让 AI 复述口径再计算

坑 5:脏数据没洗就上桌

现象:重复行、异常值没处理,统计结果整体偏掉。

补救

  • 分析前强制做”数据体检”(缺失/重复/异常三件套)
  • 让 AI 输出”清洗前后行数对比”,看得出动了什么

坑 6:样本撑不起结论

现象:3 条数据也敢说”趋势明显下降”。

补救

  • 提示词:“说明样本量,样本不足的结论标注’仅供参考’”
  • 关注置信区间/分位数,别只看均值

坑 7:SQL JOIN 放大行数没察觉

现象:一对多 JOIN 后行数暴涨,指标翻了几倍。

补救

  • 提示词:“检查 JOIN 是否放大行数,确认粒度不变”
  • 让 AI 输出”JOIN 前后行数”

坑 8:敏感数据直接喂给 AI

现象:把客户名单、财务数据原样粘贴到云端 AI。

补救

  • 先脱敏:姓名→ID、手机号→区间
  • 敏感场景用本地运行的工具(Codex CLI / WorkBuddy 本地模式)

坑 9:提示词太泛,产出不可用

现象:“分析一下这个数据”——AI 给你 50 个图表,没一个有用。

补救

  • 用本站提示词模板库,套”背景+任务+约束”三段式
  • 明确输出格式:“3 条结论 + 1 个建议,给老板看,500 字内”

坑 10:AI 说”完成”就信以为真

现象:AI 说”完成”,你没检查就交付了。

补救

  • 建立复核习惯:数字必查,结论必问
  • 关键分析让 AI 写”复算过程”,自己跟一遍

一句话总结

AI 负责快,你负责对。 用提示词把「求快」和「求对」焊在一起,AI 数据分析才能从”好玩”变成”能交付”。

配套阅读:AI 数据分析提示词模板库(30+)