AI 智能体 · 从需求到验收
AI 智能体项目合作指南
把一条业务流程交出去之前,先想清楚要交的是什么、怎么才算做完、跑错了谁来兜底,这三件事定了,报价和排期才谈得动。
结论:先把要自动化的流程写成输入、规则、输出三段,再谈钱。参考行情,单场景工作流按 5 到 15 个工作日估,接内部知识库与多系统调用的智能体按 20 到 40 个工作日估。第一步不是找人,而是准备三条真实业务样例和一份验收口径,让所有报价方按同一份样例报价,可比性才出得来。
智能体项目,先看这组数字
以下数字来自公开评测与年度报告,用来对齐预期,不是报价表。
| 指标 | 数值 | 数据出处 |
|---|---|---|
| 多智能体架构的令牌用量 | 约 15 倍 | Anthropic 工程博客与聊天场景的实测对比 |
| 工具调用任务的一次通过率 | 接近五成 | τ-bench 对主流函数调用智能体的评测 |
| 重复八轮全部通过的比例 | 约两成半 | τ-bench 的 pass^8 指标,衡量结果稳定性 |
| 桌面操作类基准的准确率 | 12% 升至 66.3% | AI Index 2026 记录的一年内变化 |
| 全球已在使用 AI 的组织 | 78% | 斯坦福 AI 指数 2025 报告经济章节 |
| AI 原生应用月活规模 | 4.99 亿 | QuestMobile 2026 年 6 月的国内数据 |
AI 智能体项目指的是什么
AI 智能体项目是指把一段真实业务流程交给一套能自主调用工具的程序去跑通,并对最终结果负责的合作;企业买的不是模型本身,而是一条能稳定跑完、出错时也能兜住的流程。
一份能被报价的需求,要一次说清五件事:数据从哪里来、判断规则是什么、允许调用哪些系统、输出成什么格式、遇到异常怎么兜底。这五条里少写一条,后面就会在验收环节反复扯皮,谁也说不清算不算做完。
常见形态分三类。单场景工作流,比如把邮件里的订单信息整理进表格;知识问答型智能体,接内部文档回答员工与客户的提问;多系统编排型智能体,跨客户管理、工单与财务系统串起一整条流程,还要处理各系统之间的口径差异。
三类之间的工作量差距常在数倍以上。先把自己的需求对号入座,再谈周期、预算与验收方式,双方才有共同语言,也才能横向比较不同报价方的方案。
- 口径
- 全球调查
- 出处
- AI 指数 2025
斯坦福 AI 指数 2025 报告:两年之内两条曲线都在抬升。
哪些流程值得先交给智能体
相比让人工反复处理同一类信息,智能体的价值集中在三种流程上:规则说得清、样本量足够大、结果能被机器校验。三条都占的流程,投入产出最容易算明白,通常两三周内就能看到可衡量的变化。
反过来,需要现场判断、责任重大而样本又少的环节,先别整包交出去。可以只把资料收集与初稿整理交出去,最终决定仍由内部同事来做,这样上线速度快、风险也压得住,后面再逐步扩大自动化的比例。
挑第一个场景时,建议选一个每周至少发生几十次、并且现在已经有人在手工做的流程。有历史记录才有比对基准,也才有人能说清楚什么叫做对了;全新的、谁都没做过的流程不适合当首发。
把候选流程列成一张表,按发生频次、单次耗时、出错代价三列打分,排在最前面那一条就是首发场景,其余的排进第二、第三期,一期只解决一件事。
| 判断维度 | 适合先交出去 | 建议先自己做 |
|---|---|---|
| 规则清晰度 | 写得出判断规则 | 靠现场经验 |
| 样本量 | 每周几十次以上 | 偶尔才发生 |
| 结果可校验 | 机器能对答案 | 只能人工判断 |
三条都占的流程投入产出最好算,两三周就能看到变化。
四步把需求写成可报价的文档
第一步,录一遍现状。让现在做这件事的同事把一次完整操作从头走一遍,截图或录屏留档,把每一次需要动脑判断的地方都标出来,这份记录就是需求文档的骨架,比凭空描述准确得多。
第二步,挑三条真实样例。一条最常见的、一条边界情况、一条一定会出错的,分别写清输入原文和期望输出。样例比任何形容词都管用,也是后面验收时唯一不会跑偏的尺子。
第三步,划权限与数据边界。写明可以接哪些系统、用测试环境还是生产环境、哪些字段必须脱敏、哪些动作必须人工确认后才允许执行,以及项目结束后账号怎么回收。
第四步,定验收口径。写清一共跑多少条样例、允许错几条、错了怎么被发现、多久之内修复。四步写完,把同一份文档发给多个报价方,报价才具备可比性,也才谈得清增项。
| 步骤 | 要交付什么 | 算完成的标准 |
|---|---|---|
| 录现状 | 一次完整操作录屏 | 判断点都标出 |
| 挑样例 | 三条真实样例 | 写清期望输出 |
| 划边界 | 系统与字段清单 | 写明脱敏范围 |
| 定验收 | 样例数与容错数 | 双方确认口径 |
四步写完再发给多方报价,收到的数字才具备可比性。
预算与周期怎么估才一次到位
预算按四块拆:流程梳理、搭建与联调、评测与调优、上线后一个月的陪跑。很多报价只覆盖中间那一块,结果评测和陪跑没人管,上线即返工。建议把评测与调优单独列成一行,留够总预算的两到三成。
周期给一个参考区间:单场景工作流 5 到 15 个工作日;接内部知识库的问答型智能体 15 到 30 个工作日;跨多系统编排的 20 到 40 个工作日。真正拖期的往往不是搭建,而是接口不通、测试数据拿不到、账号迟迟不开。
还有一笔容易被忽略的运行成本。多智能体架构的令牌消耗量级明显高于单轮问答,方案定稿前就该按预计调用量算一遍月度开销,必要时改成单智能体加人工复核,先把账算平。
把这三笔账写进合同附件:一次性开发费、月度运行费、超出约定调用量后的计费方式。写清楚,后面谁都不用猜。
- 评测预留
- 两到三成
- 陪跑期
- 一个月
取各档区间的上限,接口与账号到位越早越接近下限。
远程协作时进度怎么看得见
用能跑起来的东西当进度,而不是文字周报。约定每周交一个可运行版本,跑同一批样例并贴出通过条数,进度就从形容词变成一条能横向对比的曲线,好坏一眼看得出来。
里程碑建议设三个:样例跑通、接真实系统跑通、连续一周稳定运行。每个里程碑对应一笔款项和一次演示,节奏清楚,双方都不必靠感觉判断项目到底走到了哪一步。
沟通上把异步做扎实。需求变更一律落在同一份文档里并标注日期,讨论结论当天回写,避免只在语音里改需求。跨时区合作时更要如此,一次口径误解就可能白做三天,返工成本远高于多写两行字。
再留一个共享的问题清单,写明每条谁负责、什么时候给答复。企业侧不给答复同样会拖期,所以这一栏必须也写上自己人的名字,双方一起对进度负责。
| 里程碑 | 演示什么 | 对应动作 |
|---|---|---|
| 样例跑通 | 跑同一批样例 | 第一笔款 |
| 接真实系统 | 在测试环境跑通 | 第二笔款 |
| 稳定一周 | 连续七天不掉线 | 尾款结清 |
每周交一个可运行版本,进度就从形容词变成一条曲线。
验收清单与交接该包含什么
验收先跑量,再跑稳。同一批样例至少重复跑八轮,看的不是某一次跑对了,而是每一轮都对;公开评测里,单轮通过率与八轮全对率之间的差距非常明显,企业验收必须把这一点复现出来。
然后看四件事:错误能不能靠日志定位到具体环节、关键动作是否保留了人工确认、超出规则时会不会停下来而不是硬猜、实际成本是否落在事先估算的区间内。这四项任意一项不过关,都不该签字。
交接物建议列成清单:流程图、提示词与配置文件、评测样例集、部署说明、常见故障处理表、账号与密钥回收记录。让内部同事照着文档独立跑通一次,跑通了才算交付完成,而不是演示一遍就结束。
最后约定一段维护期,通常一到三个月,写清响应时限、修复范围与超出范围后的计费方式,把上线之后的模糊地带一并说死。
桌面操作基准的准确率
- 一年前
- 约 12%
- 验收轮次
- 八轮
- 八轮全对
- 约两成半
AI Index 2026 口径:单轮跑对不等于八轮都对。
数据与来源
- Anthropic 工程博客:多智能体研究系统文中给出多智能体令牌消耗约为聊天场景 15 倍
- Anthropic 工程博客:为智能体编写工具支撑工具要少而准、用真实多步任务做评测的说法
- τ-bench:工具与智能体交互评测基准主流函数调用智能体的一次通过率与八轮全对率口径
- 斯坦福 AI 指数 2025 报告 · 经济章节组织使用 AI 由 55% 升至 78%,生成式 AI 由 33% 升至 71%
- QuestMobile 2026 年 AI 应用市场半年报AI 原生应用月活 4.99 亿,同比增长 85.4%
- 斯坦福 AI Index 2026:技术表现章节OSWorld 桌面操作准确率一年内由 12% 升至 66.3%