作者:互联网 时间: 2026-09-01 18:29:56
35 个文件、14.58% 数据是空的,我让 TRAE Work 十分钟收拾干净了的重点在于把前置条件、操作顺序和容易误判的地方分清楚。
我是做数据开发和分析的。上月底,业务那边甩过来 35 个 CSV,说是"全国城市空气质量的公开监测数据,你帮我们出个月报分析"。
这种需求我接了没有一百次也有八十次。文件拿到手,老规矩,先 head 看一眼——好家伙,一个文件 378 列,375 个城市横着排,日期、小时、指标竖着堆。再看数据量,一个月 465 万行。空值?我随手数了一下,14.58%,六十八万个格子是空的,还有的是纯空格糊弄人。有几天的文件行数都不对,7 月 24 号只有 289 行,正常应该是 360 行——那天差不多 5 个小时的监测数据整个没了。
放以前,这活儿我这么干:写个 pandas 脚本,合并、清洗、聚合,跑完还得自己检查哪天的数据不对劲,光检查就得来回折腾。上个月我就栽过一次——有个字段缺数据没处理干净,均值被拉偏,报告交上去被业务的人问"这数字怎么跟统计局对不上",我解释了半天,脸都丢光了。
这次我换了路子。全程用 TRAE Work 对话搞定,从文件到手到报告出来,十来分钟。
我的第一句话是:
这步我坚持必须有。数据都不了解就开洗,跟蒙眼开车没区别。TRAE Work 跑完,报告长这样:
| 体检项 | 结果 |
|---|---|
| 文件结构 | 35 个 CSV,每个 378 列宽表(375 城市 × 15 指标 × 24 小时) |
| 行数异常 | 7/6、7/7、7/20 少 15 行;7/22 只有 302 行;7/24 只有 289 行 |
| 缺失单元格 | 684,815 个,占 14.58%,一部分还是纯空格占位 |
| 换行符 | 行尾混着 r,Excel 一打开就错行 |
跟我自己扫了一遍的印象一致,但人家几十秒就把数据量化和汇总了。这里有个细节:我特意强调"只报告、别改",它还真就没自作主张动数据。
体检完了,下指令:
TRAE Work 生成了脚本直接跑,核心代码就一小段:
# TRAE Work 生成的核心片段(宽转长 + 缺失标准化)for _, rowin raw.iterrows():for city in cities:v = str(row[city]).strip()rows.append({'date': row['date'], 'hour': row['hour'], 'metric': row['type'],'city': city, 'value': float(v) if v and v !='nan'elseNone })
35 个文件合成一张 465.9 万行的长表,字段干净,类型统一。这段代码我自己写也就几分钟,但写完还要调试边界情况——空字符串、nan、空格、r 尾缀,这些坑它一次全踩平了。
合并完先别急着算数,我补了一句:
这就是我上个月丢人的那个坑,这次提前堵上。它复查出来 8 条记录不达标,主要集中在 7/22 和 7/24 两天,处理方式是"标记、保留、统计时排除、报告里写明"。这样哪怕数据缺了,报告里也是清清楚楚的,别人问起来我有依据,而不是"我也不知道怎么就少了"。
最后一句:
它直接给了一份能浏览器打开的完整报告,排名、柱状图、走势、数据质量说明都在里面,不用我再装任何工具。
交付的东西:
clean_long.csv:465.9 万行标准长表,直接能进 BI 工具clean_daily_aqi.csv:11,682 行「城市×日」聚合表,带 AQI 等级和完整性标记report.html:可视化月报报告里的几个真实结论:
换以前,我手工顶多给个"全国平均 AQI 是多少",这次排名、污染日分布、城市对比全有了。业务那边要的"为什么这个月和上个月不一样",也有数据能解释了。
清洗前长这样——378 列宽表,红格全是缺的:
清洗后是这种标准长表,等级自动标好:
完整月报长这样:
数据来源是公开的监测数据整理站:
活儿干完,我把四步流程固化成了一个可复用的 Skill(数据处理技能) ,后续类似的表格整理需求,直接整包调用:
这 Skill 的价值有三点:
intermediate/,标准表和聚合表进 output/,任何数字都能回溯到对应目录report.html,内部自用只要 CSV,不产生多余产物Skill 的完整定义我放在文末附录,可以直接抄走,字段换成你自己的业务数据就能用。
跳过体检,你都不知道数据烂在哪;跳过复核,你就是三个月前的我。
体检:
清洗:
复核:
产出:
r 换行符:Excel 打开直接错行,合并前统一清,不然交付的表客户一打开就是花的| 环节 | 手工写脚本/Excel | TRAE Work | 差距 |
|---|---|---|---|
| 合并 35 个文件 | 40 分钟 | 半分钟 | 约 80 倍 |
| 缺失值处理 | 1 小时 | 1 分钟(含复核) | 约 60 倍 |
| 均值/排名/图表 | 1 个多小时 | 2 分钟 | 约 40 倍 |
| 数据质量说明 | 写不准、不愿写 | 自动生成 | — |
| 合计 | 约 3 小时 | 约 10 分钟 | 约 18 倍 |
数据整理的核心问题从来不是"会不会做",而是"做得稳不稳、快不快、能不能说清楚"。四步法的价值在于把这三件事拆开解决:体检保证"看得清",清洗保证"理得顺",复核保证"算得准",产出保证"交得出"。方法本身不依赖具体业务——销售流水、门店报表、问卷导出、财务明细,只要是多文件、多口径的表格整理需求,均可按 Skill 定义直接复用。