← 返回文章列表

企业做一个 AI 智能体,到底要花多少钱?

📖 摘要:同一个「AI 客服」需求,报价能差出上百倍——不是有人黑心,是「AI 项目」这四个字底下装的东西完全不同。本文用一手实测数据拆开成本结构:4277 页手册全量索引约 16 元、单次问答不到 1 分钱——模型调用是最便宜的部分,真正的钱花在语料工程、应用编排、环境集成和上线后维护。并给出三个问题,帮你估出自己项目的量级。适合:正在评估 AI 项目预算的企业决策者与项目负责人。

一、一个被问得最多、也最容易被答歪的问题

上个月有人问我:「我们想做个 AI 客服,大概要多少钱?」

我说这得看范围。他说:「别打太极,别人给我报三千,你报多少?」

这个问题不好答,因为它背后藏着一个大多数人没意识到的前提——「AI 项目」这四个字,可以指完全不同的东西

前者和后者,工作量差着几十倍。报价差一百倍不是有人黑心,是大家在说不同的事。

但还有一个更反直觉的事实,我想先讲——这个项目里最便宜的部分,恰恰是大家以为最贵的部分:模型调用。

二、先破一个误解:钱不花在模型上

很多人对 AI 项目成本的直觉是「模型按 token 收费,用得越多越贵,肯定是个无底洞」。

我们拿一个真实交付项目的数据说话——4277 页设备手册,234 个文档,全部转成可检索知识库

成本项 实测值
全量索引(一次性把 4277 页入库) 约 16 元
单次问答(检索 + 大模型生成回答) 不到 0.01 元
回答中位耗时 17.9 秒(其中 LLM 生成占 91%,检索不到 1 秒)

索引一次 16 块,问答一次不到一分钱。

为什么这么便宜?因为检索做得好,模型就不用读一堆无关内容。一次问答只把最相关的几段材料交给模型,token 消耗自然低。反过来说——如果检索没调好,把整本手册塞给模型,那成本才会失控。

所以成本的下限不由模型决定,由语料和检索工程决定。这也就引出了真正的成本项。

三、钱实际花在哪:四块

成本块 具体内容 特点
① 语料工程 格式转换、清洗、分段策略、入库、检索调优 最容易被低估的一块
② 应用编排 流程设计、节点配置、分支兜底、联调 与场景复杂度强相关
③ 环境与集成 部署方式、私有化要求、接 IM / 内部系统 相对可预估
④ 上线后维护 定期复检、语料更新、模型版本变化后的回归 最容易被漏算的一块

为什么语料工程最容易被低估——因为外人以为「清洗 = 转成文本」。实际做过才知道,光是这一环就有一堆必须处理的事,而且每一件都会被用户肉眼发现

这些问题的共同点是:不处理不会报错,但会让答案变差——而「答案变差」这件事,不做到检索层和内容层是看不出来的。

语料质量决定天花板:语料处理得糙,后面模型再强、提示词再讲究,检索命不中就是命不中。

四、为什么「便宜报价」最后往往更贵

这是我在项目里见过最多的分歧来源。三个机制:

① 范围没写清 → 边做边加

「AI 客服」这句话里没写明:要不要接企业 IM?要不要带引用溯源?答不上来时怎么兜底?范围每模糊一处,后面就多一次「这个我以为含在里面了」。

② 没有验收标准 → 做完「感觉不对」

如果开工前没定「什么算成功」,交付时就只能靠感觉评判——而感觉这东西,双方永远不会一致。

③ 上线即结束 → 效果退化后二次投入

AI 应用不是装完就完。语料要更新、模型版本会变、业务口径会调整——上线三个月后「悄悄变差」是很常见的状态。

一个真实案例:我们做过一次应用体检,那个系统从外面看完全正常——页面能开、问题能答、演示流畅,运行统计里失败次数是 0。体检查下来 41 分(满分 100),其中:

这些问题没有一个会体现在「失败次数」里,但它们都在消耗使用者的耐心。修这些的成本,往往比当初省下的那点钱高。

五、怎么估自己项目的量级(三个问题)

我不给「一个 AI 项目 X 万」这种数字——不同范围的项目没有可比性,报个绝对值反而误导。但你可以用三个问题,把大致量级框出来:

# 问题 决定了什么
1 语料有多少?(页数 / 文档数 / 格式复杂度) 语料工程投入——这是最大变量
2 要接几个系统?(内部系统、IM、数据库) 集成复杂度与联调成本
3 上线后谁来维护? 要不要把维护成本算进预算

量级参考

六、不同投入对应什么交付深度

同一件事,投入不同,交付物完全不同。这个差异比价格差异更值得关心:

档位 流程深度 你会拿到什么
轻量 半天对齐边界、跑通交付 可运行应用 + 一份极简验收单(10–20 条用例)
标准 加全量用例、完整验收 上述 + 完整验收报告(缺陷分级 + 归因)
完整 全链 + 独立复验 上述 + 完整文档链 + 维护说明 + 定期复检

这里有一个反直觉的建议:如果你的项目属于「文档量不大、场景单一」,不要为了『看起来正规』而要求完整流程——流程是为风险服务的,没有风险的地方上了流程,只是花钱买安心。

反过来,如果这个应用要长期承载业务,那验收和复检就不能省——省掉的不是文档,是「出问题时你能不能定位到哪一环」的能力。

七、一个比价比不出来、但更重要的判断

与其在各家报价之间比数字,不如问一个更具体的问题:

「这个报价里,含不含验收标准?含不含上线后的复检?」

因为价格只说明「收多少」,不说明「交付什么」。一个报价 3000 的方案和一个报价 3 万的方案,如果前者的范围是「把 FAQ 灌进去能对话」,后者的范围是「4277 页手册 + 引用溯源 + 接入 IM + 上线验收报告」,那它们根本不是在卖同一个东西。

便宜的项目不是不能做,是你要知道省掉的是哪一块——以及那一块的代价,会在什么时候还回来。

常见问题

模型调用真的这么便宜吗?为什么还有人说 AI 项目贵?

模型调用本身确实便宜——实测 4277 页语料全量索引约 16 元、单次问答不到 1 分钱。说贵的那些项目,成本大头通常在另外三处:语料工程的工时(清洗、分段、调优,这部分是人力和工程时间)、集成联调(接企业内部系统、IM 平台)、以及上线后的持续维护

另外一个容易被忽略的点:如果检索没调好,每次问答都要把大量无关内容塞给模型,token 消耗会成倍上升——检索质量同时决定答案质量和调用成本

语料工程为什么比想象中贵?

因为「清洗」不是把 PDF 转成文字就完事。实际要处理的问题包括:图表被截断(我们真实遇到过流程图只输出四分之一高度)、分段切断了代码块、转换产生的空段与重复段、图文对应关系丢失。

这些问题的共性是:不处理不会报错,但会让最终答案变差,而且往往要等使用者肉眼发现。做一次全量质检和返工,成本通常高于一开始就按流程做。

AI 应用上线后为什么还会持续产生投入?

三个原因:语料会更新(文档改版、新增内容需要重新入库并回归验证);模型版本会变化(平台或模型升级后行为可能改变);业务口径会调整(回答边界、术语、流程需要跟着改)。

不处理的后果是「悄悄变差」——系统还在跑、也不报错,但答案的可用性在下降。这也是定期复检存在的意义。


相关文章:RAG 知识库交付实战(下):18 条用例与成本测算(成本与质量基线的完整实测数据)|AI 项目烂尾的七个征兆,你经历过哪些?(系统还在跑但不产生价值的七种表现)|AI 项目交付全流程:一张表从启动跑到沉淀(九步流程与档位裁剪)


本文基于真实交付项目实测数据撰写(2026-08,4277 页手册知识库交付项目与应用体检项目)。文中成本数字均来自实际运行记录。AI 参与创作声明:本文由 AI 辅助写作,内容基于作者真实实测记录。

这套方法,如何应用到您的项目?看看方案与服务 →

联系我

邮箱contact@fishsun.cn

点击邮箱直接写信 · 扫码加微信沟通

微信

微信二维码

扫码加微信 · 备注「门户」更快通过