企业做一个 AI 智能体,到底要花多少钱?
📖 摘要:同一个「AI 客服」需求,报价能差出上百倍——不是有人黑心,是「AI 项目」这四个字底下装的东西完全不同。本文用一手实测数据拆开成本结构:4277 页手册全量索引约 16 元、单次问答不到 1 分钱——模型调用是最便宜的部分,真正的钱花在语料工程、应用编排、环境集成和上线后维护。并给出三个问题,帮你估出自己项目的量级。适合:正在评估 AI 项目预算的企业决策者与项目负责人。
一、一个被问得最多、也最容易被答歪的问题
上个月有人问我:「我们想做个 AI 客服,大概要多少钱?」
我说这得看范围。他说:「别打太极,别人给我报三千,你报多少?」
这个问题不好答,因为它背后藏着一个大多数人没意识到的前提——「AI 项目」这四个字,可以指完全不同的东西:
- 可以指「把公司 FAQ 灌进一个平台,当天就能对话」
- 也可以指「4277 页设备手册变成能定位故障、带引用溯源、能接进企业 IM 的支持助手」
前者和后者,工作量差着几十倍。报价差一百倍不是有人黑心,是大家在说不同的事。
但还有一个更反直觉的事实,我想先讲——这个项目里最便宜的部分,恰恰是大家以为最贵的部分:模型调用。
二、先破一个误解:钱不花在模型上
很多人对 AI 项目成本的直觉是「模型按 token 收费,用得越多越贵,肯定是个无底洞」。
我们拿一个真实交付项目的数据说话——4277 页设备手册,234 个文档,全部转成可检索知识库:
| 成本项 | 实测值 |
|---|---|
| 全量索引(一次性把 4277 页入库) | 约 16 元 |
| 单次问答(检索 + 大模型生成回答) | 不到 0.01 元 |
| 回答中位耗时 | 17.9 秒(其中 LLM 生成占 91%,检索不到 1 秒) |
索引一次 16 块,问答一次不到一分钱。
为什么这么便宜?因为检索做得好,模型就不用读一堆无关内容。一次问答只把最相关的几段材料交给模型,token 消耗自然低。反过来说——如果检索没调好,把整本手册塞给模型,那成本才会失控。
所以成本的下限不由模型决定,由语料和检索工程决定。这也就引出了真正的成本项。
三、钱实际花在哪:四块
| 成本块 | 具体内容 | 特点 |
|---|---|---|
| ① 语料工程 | 格式转换、清洗、分段策略、入库、检索调优 | 最容易被低估的一块 |
| ② 应用编排 | 流程设计、节点配置、分支兜底、联调 | 与场景复杂度强相关 |
| ③ 环境与集成 | 部署方式、私有化要求、接 IM / 内部系统 | 相对可预估 |
| ④ 上线后维护 | 定期复检、语料更新、模型版本变化后的回归 | 最容易被漏算的一块 |
为什么语料工程最容易被低估——因为外人以为「清洗 = 转成文本」。实际做过才知道,光是这一环就有一堆必须处理的事,而且每一件都会被用户肉眼发现:
- 图被截断:我们真实踩过一次——流程图提取只覆盖了一个文本区域,流程图下半部分的判断框被排除,输出是「只有四分之一高度」的图。这是交付前用户自己发现的问题,不是我们自测出来的。后来回溯把同批次 176 张流程图全部重渲染,才把这个坑补上。
- 分段切断了代码块:按固定长度切分时,一段配置命令被从中间劈开,检索命中后半段时给出的答案是残的。
- 空段与重复段:转换过程产生的空白段落进库,占了索引却没内容。
这些问题的共同点是:不处理不会报错,但会让答案变差——而「答案变差」这件事,不做到检索层和内容层是看不出来的。
语料质量决定天花板:语料处理得糙,后面模型再强、提示词再讲究,检索命不中就是命不中。
四、为什么「便宜报价」最后往往更贵
这是我在项目里见过最多的分歧来源。三个机制:
① 范围没写清 → 边做边加
「AI 客服」这句话里没写明:要不要接企业 IM?要不要带引用溯源?答不上来时怎么兜底?范围每模糊一处,后面就多一次「这个我以为含在里面了」。
② 没有验收标准 → 做完「感觉不对」
如果开工前没定「什么算成功」,交付时就只能靠感觉评判——而感觉这东西,双方永远不会一致。
③ 上线即结束 → 效果退化后二次投入
AI 应用不是装完就完。语料要更新、模型版本会变、业务口径会调整——上线三个月后「悄悄变差」是很常见的状态。
一个真实案例:我们做过一次应用体检,那个系统从外面看完全正常——页面能开、问题能答、演示流畅,运行统计里失败次数是 0。体检查下来 41 分(满分 100),其中:
- 13.6% 的问题被系统故障拒答(不是答错,是根本没答)
- 知识库 24.3% 是碎块(分段问题)
- 响应 P95 达到 42 秒
这些问题没有一个会体现在「失败次数」里,但它们都在消耗使用者的耐心。修这些的成本,往往比当初省下的那点钱高。
五、怎么估自己项目的量级(三个问题)
我不给「一个 AI 项目 X 万」这种数字——不同范围的项目没有可比性,报个绝对值反而误导。但你可以用三个问题,把大致量级框出来:
| # | 问题 | 决定了什么 |
|---|---|---|
| 1 | 语料有多少?(页数 / 文档数 / 格式复杂度) | 语料工程投入——这是最大变量 |
| 2 | 要接几个系统?(内部系统、IM、数据库) | 集成复杂度与联调成本 |
| 3 | 上线后谁来维护? | 要不要把维护成本算进预算 |
量级参考:
- 文档 < 500 页 + 单一场景 + 不接系统 → 语料工程可控,主要投入在编排和联调
- 1000–5000 页 + 需要调优检索质量 → 语料工程成为主要工作量,必须要有一套质量门禁
- 多系统集成 + 长期运行 → 除开发外必须算上维护,且要按「会持续产生投入」来规划
六、不同投入对应什么交付深度
同一件事,投入不同,交付物完全不同。这个差异比价格差异更值得关心:
| 档位 | 流程深度 | 你会拿到什么 |
|---|---|---|
| 轻量 | 半天对齐边界、跑通交付 | 可运行应用 + 一份极简验收单(10–20 条用例) |
| 标准 | 加全量用例、完整验收 | 上述 + 完整验收报告(缺陷分级 + 归因) |
| 完整 | 全链 + 独立复验 | 上述 + 完整文档链 + 维护说明 + 定期复检 |
这里有一个反直觉的建议:如果你的项目属于「文档量不大、场景单一」,不要为了『看起来正规』而要求完整流程——流程是为风险服务的,没有风险的地方上了流程,只是花钱买安心。
反过来,如果这个应用要长期承载业务,那验收和复检就不能省——省掉的不是文档,是「出问题时你能不能定位到哪一环」的能力。
七、一个比价比不出来、但更重要的判断
与其在各家报价之间比数字,不如问一个更具体的问题:
「这个报价里,含不含验收标准?含不含上线后的复检?」
因为价格只说明「收多少」,不说明「交付什么」。一个报价 3000 的方案和一个报价 3 万的方案,如果前者的范围是「把 FAQ 灌进去能对话」,后者的范围是「4277 页手册 + 引用溯源 + 接入 IM + 上线验收报告」,那它们根本不是在卖同一个东西。
便宜的项目不是不能做,是你要知道省掉的是哪一块——以及那一块的代价,会在什么时候还回来。
常见问题
模型调用真的这么便宜吗?为什么还有人说 AI 项目贵?
模型调用本身确实便宜——实测 4277 页语料全量索引约 16 元、单次问答不到 1 分钱。说贵的那些项目,成本大头通常在另外三处:语料工程的工时(清洗、分段、调优,这部分是人力和工程时间)、集成联调(接企业内部系统、IM 平台)、以及上线后的持续维护。
另外一个容易被忽略的点:如果检索没调好,每次问答都要把大量无关内容塞给模型,token 消耗会成倍上升——检索质量同时决定答案质量和调用成本。
语料工程为什么比想象中贵?
因为「清洗」不是把 PDF 转成文字就完事。实际要处理的问题包括:图表被截断(我们真实遇到过流程图只输出四分之一高度)、分段切断了代码块、转换产生的空段与重复段、图文对应关系丢失。
这些问题的共性是:不处理不会报错,但会让最终答案变差,而且往往要等使用者肉眼发现。做一次全量质检和返工,成本通常高于一开始就按流程做。
AI 应用上线后为什么还会持续产生投入?
三个原因:语料会更新(文档改版、新增内容需要重新入库并回归验证);模型版本会变化(平台或模型升级后行为可能改变);业务口径会调整(回答边界、术语、流程需要跟着改)。
不处理的后果是「悄悄变差」——系统还在跑、也不报错,但答案的可用性在下降。这也是定期复检存在的意义。
相关文章:RAG 知识库交付实战(下):18 条用例与成本测算(成本与质量基线的完整实测数据)|AI 项目烂尾的七个征兆,你经历过哪些?(系统还在跑但不产生价值的七种表现)|AI 项目交付全流程:一张表从启动跑到沉淀(九步流程与档位裁剪)
本文基于真实交付项目实测数据撰写(2026-08,4277 页手册知识库交付项目与应用体检项目)。文中成本数字均来自实际运行记录。AI 参与创作声明:本文由 AI 辅助写作,内容基于作者真实实测记录。