场景与数据调研:脏活干在前头
每个月总有几个老板问我:"我想上AI,第一步该干嘛?"我的回答十有八九让他们意外:先别看AI,先把你的数据摸清楚。AI不是变魔术的,它是干活的——干活就得有料。料在哪、长什么样、脏不脏,这就是本课要讲的"脏活"。这活儿干在前头,后面每一步都顺;跳过它直接掏钱买工具,大概率是被割的开始。上一课《你在哪一级?》帮你定了位,这一课我们把手弄脏。
一、「三个圈」法:不懂技术也能找到机会点
做行业应用盘点,很多人一上来就去搜"某某行业AI解决方案",那是被卖货的牵着走。我的土办法是拿张纸画三个圈:
第一个圈:人天天在用的软件——ERP、进销存、Excel、微信工作群。
第二个圈:系统里已经存着的数——订单、库存、物料、客户档案。
第三个圈:报表和汇报最后要的数——老板月底看到的那张汇总表。
三个圈一对,机会点就藏在对不上的地方。举个最常见的样子:业务员每月从ERP导出订单,粘贴到Excel手工透视,再截图发到群里等回复。你看,三个圈之间全靠人肉搬运——这段搬运就是自动化最好的下口位置:不改任何现有系统,只是把人的重复动作接管掉,阻力最小,见效最快。
二、老系统取数的四种姿势(本课核心)
找到机会点后的第一个拦路虎是:数在老系统里,怎么拿出来?某些供应商会吓唬你"要做接口改造,预算六位数"。先别慌。常见的路一共四条,我按优先级从高到低给你排好了——绝大多数场景,走第一条就够了:
| 取数姿势 | 适用条件 | 成本 | 周期 | 坑 |
|---|---|---|---|---|
| 导出文件(Excel/CSV) | 系统有导出按钮或报表功能,取数频率不高(每天/每周一次够用) | 几乎为零 | 当天 | 导出格式不稳定、字段名拼音中文混写;行数超百万Excel会卡死 |
| 数据库只读账号 | 公司有IT或懂行的人能对接管理员 | 很低 | 1-3天(走开通权限流程) | 必须只要SELECT查询权限;老库表结构没人看得懂,得管厂商要数据字典 |
| API接口 | 厂商能提供接口文档;需要实时或高频同步 | 中等,看厂商报价 | 数天到数周 | 很多系统其实有接口但销售不知道;文档质量参差;按调用量计费的先算清账 |
| 爬虫 / RPA | 前三条全部走不通,且数据确属你有权获取 | 表面低实际高(维护) | 上线快但脆弱 | 页面一改版就断;合规是红线,见下方踩坑框 |
分享一个我自己踩出来的经验:给集团做品类数据检索平台时,底下的Oracle库跑了十几年,没人敢动。我没有申请接口改造,而是让DBA开了一个只读账号,业务侧所有查询都走它——原系统零风险零改动,两周上线。"只读账号+导出文件"这组免费组合,能解决中小企业八成的取数问题。另外说到采集公开网络数据,我平时用的是浏览器UA标识加访问间隔控制的姿势:每次请求歇几秒,这是尊重对方服务器的基本礼貌,也是合法采集该有的分寸感。
三、拿到CSV之后:清洗工具箱
数到手了通常是乱的:合并单元格、多余空格、"未分类/其他/N/A"混着写。三类常见清洗需求,对应三件趁手的工具:
1. Excel 的 Power Query —— 非技术背景第一推荐
数据在几十万行以内、清洗逻辑固定(去重、拆列、多表合并),Power Query 点几下录制一遍,以后每月一键刷新。学习成本低到你难以置信,Office自带的,一分钱不用加。
2. Python pandas —— 量大或者要自动跑的时候换它
数据超过百万行、逻辑带条件判断和跨表校验、或者需要每天定时无人值守地跑,就该上pandas了。前期投入大一点,换来的是这条管道从此不需要人守着。
3. 语言模型辅助清洗 —— 对付纯文本的一把好手
客服记录、备注字段这类自由文本,让模型帮忙打标签、抽关键词、归类异常,效果常常超过人肉。两个提醒:贵,所以先抽样试效果再整批跑;涉密的客户隐私字段先脱敏再喂。
数盘清楚了、路选对了、管道搭稳了,才算真正做完调研。至于这套东西最后放在哪跑——你自己电脑还是云上,《实施:API还是本地》会给你答案。而拿着这份调研去挑工具之前,请先读下一课《工具选型》,别把锤子当目标。
- 拿张纸画三个圈:把你最熟业务的"天天用的软件/库里存的数/报表要的数"各列五项,标出对不上的地方。
- 打开你的主力业务系统,找到并按下那个"导出"按钮,亲手导一份CSV存好——这就是你未来的数据金矿样本。
- 问一句IT或厂商:"能不能开个只读查询账号?顺便给份数据字典。"记住只提这两个词,别提"改造"。
- 挑一个最烦的重复搬运动作,统计周耗时(单次分钟 × 每周次数 × 人数),超过120分钟就列入候选清单。
- 如果你正考虑采集外部网站数据,先查它的robots协议和服务条款,再决定动不动手——拿不准就放。