做可视化教程最头疼的是找数据:公开数据集要么格式不合适,要么跟分析思路对不上。这篇用一个虚构的新茶饮品牌”茶研社”案例,展示 Codex 可视化全流程——从生成虚拟数据到 2D/3D 图表和仪表盘,每一步附提示词和执行逻辑,拿来就能用。
案例背景:茶研社 2024 年运营分析
全国 10 个城市、155 家门店,数据维度:
- 门店运营:月度营业额、客流量、客单价(1860 条)
- 产品销售:6 大品类月度销量与销售额(72 条)
- 渠道数据:5 个渠道月度表现(60 条)
- 用户画像:5000 名用户的年龄、性别、消费频次与客单价
数据量不大但维度丰富,覆盖大部分日常可视化场景。
Step 1:用 Codex 生成虚拟数据
提示词的价值在”约束条件”:
生成一个新茶饮品牌的 2024 年运营虚拟数据集,4 个 CSV:
1. 门店月度运营:10 城市,每城 8-24 家门店,12 个月,
字段:月份、城市、门店ID、营业额、客流量、客单价。
一线城市场均营收 45 万,二线 32 万,三线 25 万。
6-8 月为旺季(系数 1.1-1.2),2 月淡季(系数 0.7)。
2. 产品月度销售:6 大品类(经典奶茶 30%、水果茶 25%、
芝士茶 18%、纯茶 10%、特调 12%、轻食 5%),总月营收约 1800 万。
3. 渠道月度销售:堂食 35%、小程序 25%、美团 20%、
饿了么 12%、抖音 8%。
4. 用户画像:5000 条,年龄段(18-24 占 28%、25-30 占 35%…),
女性 65%,月消费频次服从泊松分布。
5. 用 pandas 和 numpy,random_seed=42 保证可复现,UTF-8 CSV。
执行逻辑:解析维度层级 → 建参数映射 → 叠加 15%-30% 随机扰动 → 注入季节因子 → 校验一致性(营业额≈客流量×客单价、占比之和=1)。
关键点:你告诉 Codex”一线城市场均 45 万”,它生成的数据就围绕这个基准波动;你不说,它可能生成一线比三线还低的数据。提示词越具体,产出越可控。
Step 2:数据探索
对生成的 4 个 CSV 做探索性分析:
1. 各文件的形状、缺失值、异常值
2. 城市×月份营业额热力图
3. 各品类销售额占比饼图
4. 各渠道月度趋势折线图
Step 3:基础图表
绘制基础图表(2×2 布局):
1. 十大门店营业额横向条形图(Top10)
2. 月度营业额折线图,突出旺季区间
3. 不同城市等级客单价箱线图
4. 用户年龄段分布直方图
Step 4:高级图表
绘制高级图表:
1. 城市×品类 双变量气泡图(客流量 vs 营业额 vs 客单价)
2. 渠道份额随时间变化堆叠面积图
3. 用户消费频次分布 拟合泊松分布曲线
Step 5:3D 可视化
用 mplot3d 绘制 3D 图:
1. 3D 散点:城市等级、客单价、消费频次三个维度
2. 3D 曲面:月份×城市营收曲面
Step 6:数据仪表盘
把上述图表组合成一个仪表盘:
1. 顶部 KPI 卡:总营收、总客流、平均客单价
2. 中部:月度趋势折线 + 城市 Top10 条形
3. 底部:品类占比饼图 + 渠道堆叠面积
4. 统一配色,中文字体,导出为 HTML/PNG
经验要点
- 数据可生成 = 教程可复现:虚拟数据让任何案例都能跟着做
- 约束写进提示词:基准值、占比、分布、seed,一条都不能省
- 图表要服务问题:先想”看什么关系、给谁看”,再选图表类型
小结
- 六步:生成数据 → 探索 → 基础图 → 高级图 → 3D → 仪表盘
- Codex 负责执行,你负责把”业务问题”翻译成”图表需求”
- 先数据后图表,先约束后细节
下一篇:保姆级 Codex 数据分析技能教程,理解 14 个 Skill 的架构。