实施:API 还是本地部署?算笔明白账
知识体系选型决策实施:API 还是本地部署?算笔

实施:API 还是本地部署?算笔明白账

胡安 · 2026-08-27 · 来源:原创课程

上周一位制造业老板把服务商的报价单拍在我面前,第二行印着「私有化部署大模型平台,48 万」。他问的第一句话是:"是不是不走本地部署,我的数据就不安全?"我没直接回答,反问他:"你打算让 AI 每天替你处理多少字的活?"他答不上来。答不上这个问题,任何路线选择都是在替别人交学费。这一课不讲概念,就把这笔账摊开算。

一、两条路线,各一句话说清

所谓「调用云端 API」,就是模型放在 DeepSeek、GLM、Qwen 这些厂商的机房里,你隔着网络用,按用量付费——行话叫按 token 计费,你直接理解成按字数交话费。所谓「本地部署」,是用 Ollama、vLLM 这类免费工具,把 Qwen、GLM-4-9B 这些开源模型装到你自己的服务器上——数据不出门,但机器、电费、维护全是你的。两张路线卡对齐了看:

对比维度调云端 API(DeepSeek / GLM / Qwen 官方)本地部署开源模型(Ollama / vLLM 跑 Qwen、GLM-4-9B 等)
初始投入零。注册、充值、当天可用能跑模型的显卡整机入门数千元起(2026-08 价位),要「像样体验」普遍万元级
每月成本日常问答与文档处理,通常几十到几百元人民币量级电费+维护细水长流;调用量越低,摊到每一次的成本越难看
效果上限直接用各家最新旗舰,上限最高,隔几个月自动升级受限于你的显卡和开源版进度,一般落后旗舰半代到一代
数据是否出域内容会传到厂商服务器(可在设置里关闭用于训练)完全不出内网,这是它唯一的王牌
运维要求几乎为零,坏了也是厂商的事得有人管驱动、管升级、管崩了重启——最好是个人而非兼职会计

二、按真实档位算账(2026-08 价位)

落到具体数字:一个三五十人的公司,让 AI 干日常问答、合同摘要、文档翻译这类活,走 API 的月开销通常就在几十到几百元人民币的量级。注意我说的是量级不是精确报价,但这足够戳破很多方案书里的水分。换到本地这条路:想跑出能用的体验,你得先有一块能喂饱模型的显卡,入门整机动辄数千元起,后面电费和折腾都还没算进去。所以我的默认结论从不变:90% 的中小场景先用 API,数据敏感的部分才考虑本地。顺序颠倒过来,就是往坑里跳。

我的算法简单到不值钱:日均要处理的字数 × 官网单价 × 30 天。之前帮朋友核过一回——他们预估的调用量走 API 一年不到两千元,而某供应商报的私有化部署是六位数。这不是技术选型问题,是小学算术问题。任何人再推本地部署,先让他陪你把这乘法做完。

三、模型怎么挑:三个问题定位

经常有人问"哪家模型最好",这问题没法答;换个问法立刻清晰:"你最在乎什么?"

1. 图量大、图便宜——优先 DeepSeek 系

同样的活,它的单价长期处在第一梯队里最低的那一档(2026-08 价位),批量处理文本管道的首选。

2. 图问答体验——优先 GLM 系

它带思考输出,回答前会把推理过程亮出来。你要拿着结论去说服老板或客户时,这个过程本身就是说服力。

3. 已有国产化偏好——直接 Qwen 系

开源版本谱系最全,将来想转本地的过渡成本最低,适配资料也最多。

那什么时候才轮到本地?三条判据,命中任意一条再来谈:一是保密等级有硬性红头文件,明确规定某类数据不许出门;二是调用量真的大到 API 反而更贵——必须是算过账之后说的话,不是感觉;三是断网刚需,比如车间内网物理隔离、压根不通外网。三条都不沾的,本地部署对你就是负资产。

本地部署最大的陷阱是只算买卡的账。真实的隐性成本有两笔:显卡的电费(设备七乘二十四小时待命)和版本升级——模型每隔几个月换代一轮,驱动、环境、重新调参都要人伺候。见过不止一家:到手才发现「省下来的 API 费」不够付电费,模型还半年落后一代。买卡的报价单不会告诉你这些,因为它不影响签单。

四、跟老板承诺"数据不出域"的三种落地法

真有敏感数据的场景,也不是只有"全部本地化"这一条路,从重到轻有三档:

其一,全本地模型。最彻底,也最贵最慢,适合保密等级真正高的少数几条流程。其二,本地网关过滤。在自己服务器上架一道闸:带敏感特征的请求由本地小模型兜底处理,其余放行去调 API,兼顾安全和成本。其三,敏感字段脱敏后再调 API。把姓名、单号、价格替换成占位符送出去,结果拿回来再还原,全程云端只见到"张三"变成了"[姓名]"。多数实际场景里,第三种脱敏中转是最优性价比——花最小的改造代价,拿到了九成的合规交代。对外承诺口径我也替你想好了:"核心业务数据经脱敏处理,敏感字段全程不出公司边界",比空喊"绝对安全"专业一百倍。

说句托底的实话:我自己运营的内容站和站内助手就是纯 API 路线——GLM-4-9B 负责站内问答,DeepSeek 负责内容生成管道,天天在生产环境干活。真事是并发刚摸到 3 就触发过官方限流,所以我所有调用都做成低并发排队加失败重试的标配。即便如此,月账单依然只是百元级的量级——这条路的性价比,我是拿真金白银验证过的。

总结一下这一课:先用算术否掉 80% 的伪需求,再用保密等级圈出真正需要围栏的那一小块,默认答案永远是 API 起步。至于路线定了之后,东西怎么放到服务器上、证书域名怎么配,那是《上线之后:运维与钱》要讲的事;整套系统层面的取舍,也可以直接翻《番外:我的推荐架构》。如果你还没想清楚该做哪件事,先回《场景与数据调研》补课,别急着花钱。

  1. 列出你想让 AI 干的所有事,标记哪些内容带客户名、价格、工艺参数——这份清单决定哪些流程将来要特殊对待。
  2. 打开任一家模型官网的价格页,套公式「日均字数 × 单价 × 30 天」算出你们的月账单,写下来。
  3. DeepSeek、GLM、Qwen 任选一家注册充值 50 元,拿真实业务试一周——五十块钱买一个不后悔的判断。
  4. 对着三条判据自查保密等级、调用量、断网要求,一条都不中的,在本子上写"暂不考虑本地部署"。
  5. 再有人推私有化部署,要求他把购置费、电费、三年运维责任人写进同一张表再来谈。
  6. 拿不准就把你的场景原样发我,我按上面的框架免费帮你过一遍账。
有想法?不同做法、想拍砖、或者想合作,都欢迎留言交流。联系我 →