场景与数据调研:脏活干在前头
知识体系数据治理场景与数据调研:脏活干在前头

场景与数据调研:脏活干在前头

胡安 · 2026-08-27 · 来源:原创课程

每个月总有几个老板问我:"我想上AI,第一步该干嘛?"我的回答十有八九让他们意外:先别看AI,先把你的数据摸清楚。AI不是变魔术的,它是干活的——干活就得有料。料在哪、长什么样、脏不脏,这就是本课要讲的"脏活"。这活儿干在前头,后面每一步都顺;跳过它直接掏钱买工具,大概率是被割的开始。上一课《你在哪一级?》帮你定了位,这一课我们把手弄脏。

一、「三个圈」法:不懂技术也能找到机会点

做行业应用盘点,很多人一上来就去搜"某某行业AI解决方案",那是被卖货的牵着走。我的土办法是拿张纸画三个圈:

第一个圈:人天天在用的软件——ERP、进销存、Excel、微信工作群。
第二个圈:系统里已经存着的数——订单、库存、物料、客户档案。
第三个圈:报表和汇报最后要的数——老板月底看到的那张汇总表。

三个圈一对,机会点就藏在对不上的地方。举个最常见的样子:业务员每月从ERP导出订单,粘贴到Excel手工透视,再截图发到群里等回复。你看,三个圈之间全靠人肉搬运——这段搬运就是自动化最好的下口位置:不改任何现有系统,只是把人的重复动作接管掉,阻力最小,见效最快。

判断值不值得做的土办法:数一数这个动作每周花多少分钟、几个人在做。每周合计超过两个小时的人工搬运,就值得拿出来聊聊;低于这个量,先忍着,把精力留给大的。

二、老系统取数的四种姿势(本课核心)

找到机会点后的第一个拦路虎是:数在老系统里,怎么拿出来?某些供应商会吓唬你"要做接口改造,预算六位数"。先别慌。常见的路一共四条,我按优先级从高到低给你排好了——绝大多数场景,走第一条就够了:

取数姿势适用条件成本周期
导出文件(Excel/CSV)系统有导出按钮或报表功能,取数频率不高(每天/每周一次够用)几乎为零当天导出格式不稳定、字段名拼音中文混写;行数超百万Excel会卡死
数据库只读账号公司有IT或懂行的人能对接管理员很低1-3天(走开通权限流程)必须只要SELECT查询权限;老库表结构没人看得懂,得管厂商要数据字典
API接口厂商能提供接口文档;需要实时或高频同步中等,看厂商报价数天到数周很多系统其实有接口但销售不知道;文档质量参差;按调用量计费的先算清账
爬虫 / RPA前三条全部走不通,且数据确属你有权获取表面低实际高(维护)上线快但脆弱页面一改版就断;合规是红线,见下方踩坑框

分享一个我自己踩出来的经验:给集团做品类数据检索平台时,底下的Oracle库跑了十几年,没人敢动。我没有申请接口改造,而是让DBA开了一个只读账号,业务侧所有查询都走它——原系统零风险零改动,两周上线。"只读账号+导出文件"这组免费组合,能解决中小企业八成的取数问题。另外说到采集公开网络数据,我平时用的是浏览器UA标识加访问间隔控制的姿势:每次请求歇几秒,这是尊重对方服务器的基本礼貌,也是合法采集该有的分寸感。

三、拿到CSV之后:清洗工具箱

数到手了通常是乱的:合并单元格、多余空格、"未分类/其他/N/A"混着写。三类常见清洗需求,对应三件趁手的工具:

1. Excel 的 Power Query —— 非技术背景第一推荐

数据在几十万行以内、清洗逻辑固定(去重、拆列、多表合并),Power Query 点几下录制一遍,以后每月一键刷新。学习成本低到你难以置信,Office自带的,一分钱不用加。

2. Python pandas —— 量大或者要自动跑的时候换它

数据超过百万行、逻辑带条件判断和跨表校验、或者需要每天定时无人值守地跑,就该上pandas了。前期投入大一点,换来的是这条管道从此不需要人守着。

3. 语言模型辅助清洗 —— 对付纯文本的一把好手

客服记录、备注字段这类自由文本,让模型帮忙打标签、抽关键词、归类异常,效果常常超过人肉。两个提醒:贵,所以先抽样试效果再整批跑;涉密的客户隐私字段先脱敏再喂。

给你算笔账:某品类8万行历史规格数据,人工核对约需2-3天;语言模型辅助加人工抽查后压到30分钟左右,出错率反而下降——机器不会看串行。这笔账永远是「人时单价 × 人天 × 每月次数」对比「一次性搭建 + 几乎为零的边际成本」。搬运是每月都发生的,这才值得数字化;一年干一回的,别折腾。
爬虫合规红线,这段请逐字读完。动手前先看对方的robots协议和服务条款;对方明确反爬、页面标了禁止自动抓取,就立刻停手,换别的路。"破解验证码""绕过加密参数""模拟登录套他人账号数据"这类动作,法律风险是真实存在的——《刑法》第285条非法获取计算机信息系统数据罪和各地不正当竞争判例都是现成的案子。合法和非法之间差的是「方式」,不是「技术高低」。技术上能做到,和法律上允许你做,从来是两码事。

数盘清楚了、路选对了、管道搭稳了,才算真正做完调研。至于这套东西最后放在哪跑——你自己电脑还是云上,《实施:API还是本地》会给你答案。而拿着这份调研去挑工具之前,请先读下一课《工具选型》,别把锤子当目标。

  1. 拿张纸画三个圈:把你最熟业务的"天天用的软件/库里存的数/报表要的数"各列五项,标出对不上的地方。
  2. 打开你的主力业务系统,找到并按下那个"导出"按钮,亲手导一份CSV存好——这就是你未来的数据金矿样本。
  3. 问一句IT或厂商:"能不能开个只读查询账号?顺便给份数据字典。"记住只提这两个词,别提"改造"。
  4. 挑一个最烦的重复搬运动作,统计周耗时(单次分钟 × 每周次数 × 人数),超过120分钟就列入候选清单。
  5. 如果你正考虑采集外部网站数据,先查它的robots协议和服务条款,再决定动不动手——拿不准就放。
有想法?不同做法、想拍砖、或者想合作,都欢迎留言交流。联系我 →