一个流程值不值得上 AI?先做这张场景筛选表
用一张 18 分筛选表,从业务价值、数据条件、风险和实施成本判断企业 AI 场景的优先级。本文提供评分维度、判断问题和结果解释,帮助团队选出适合先验证的流程。

本文目录
企业讨论 AI 项目时,很容易从工具开始:选哪个模型、要不要 Agent、知识库放在哪里。更该先问的是:这个流程到底值不值得改?
模型能力再强,也无法让低频、无标准、责任不清的流程真正跑起来。下面这张表用于第一次筛选候选场景。它不负责预测项目成败,也不自命为行业标准;它的作用,是让业务、技术和管理者用同一套问题讨论优先级。
一张 18 分场景筛选表
打分前先记住一条原则。
每项按 0—3 分评分。不要凭印象打分,最好让实际执行流程的人提供数据或样本。
| 维度 | 0 分 | 1 分 | 2 分 | 3 分 |
|---|---|---|---|---|
| 频率与耗时 | 偶发,成本可忽略 | 低频或耗时不稳定 | 经常发生,占用可见工时 | 高频重复,已形成积压或瓶颈 |
| 输入可用性 | 输入不存在或无法取得 | 大量依赖口头信息 | 主要输入已电子化 | 输入稳定、结构清楚、可授权访问 |
| 流程边界 | 每次做法都不同 | 依赖少数人的隐性经验 | 主流程明确,异常较多 | 步骤、责任和异常路径都清楚 |
| 结果可验证性 | 无法定义好坏 | 只能主观判断 | 可抽样复核 | 有明确字段、规则或业务结果可比对 |
| 失败可恢复性 | 错误难发现且不可逆 | 发现较晚,修复成本高 | 可人工复核或回退 | 全程可追踪,错误容易拦截和重做 |
| 接入与责任 | 无系统接口,也无人负责 | 需大规模改造 | 有接口或替代方案,责任人待明确 | 系统可接入,业务负责人和技术负责人明确 |
总分只是排序工具,可以先按以下区间处理:
- 14—18 分:适合进入小范围验证;
- 9—13 分:先补数据、规则或接口,再决定是否做;
- 0—8 分:暂缓,不要用模型掩盖流程问题。
这些分界线同样不是成功率承诺。若某一项是 0 分,即使总分不低,也要单独解释为什么可以继续。
先排除四类”伪场景”
有些场景看起来诱人,一做就塌。
第一类是只在演示里成立。输入由演示者精心准备,真实业务里却充满缺字段、旧模板和例外。
第二类是无法验收。团队只说“回答要更智能”,却说不出正确样本、可接受错误和人工复核方式。这样的项目上线后只能靠感觉争论。
第三类是高风险终局决策。授信、用工、付款、法律承诺等动作可以让 AI 辅助整理信息,但不应在责任和审批机制缺失时直接自动执行。
第四类是低频定制需求。半年发生一次、每次规则又不同,通常不值得先做复杂系统。用现成工具辅助一次,可能比建设长期工作流更合算。
一个假设例子:把会议纪要写回 CRM
用上面的表实战一遍。
假设某销售团队每天有多场客户会议,会后需要整理要点、提取下一步动作,再录入 CRM。按上表初评:
- 频率与耗时 3 分:每天重复,挤占销售时间;
- 输入可用性 2 分:已有录音和会议记录,但格式不完全统一;
- 流程边界 2 分:主字段明确,少数行业有特殊要求;
- 结果可验证性 3 分:可与原始记录和 CRM 必填字段比对;
- 失败可恢复性 3 分:提交前由销售确认,记录可以修改;
- 接入与责任 2 分:CRM 有接口,但权限和负责人仍需落实。
合计 15 分,值得验证。但第一版不必自动写入 CRM,可以先生成结构化草稿,由销售确认后提交。这样既能测出节省的时间,也能收集模型最常出错的字段。
验证阶段只回答四个问题
进入原型后,不要一口气做完整平台。先拿一批脱敏的真实样本,回答四个问题:
- 哪些步骤能稳定交给 AI,哪些必须保留人工判断?
- 相比现有做法,完成时间、返工量或积压是否改善?
- 最常见的失败类型是什么,能否在产生后果前被发现?
- 运行一次的模型、系统和人工复核成本是否可以接受?
Anthropic 对工作流与 Agent 的区分很有参考价值:路径明确、可预期的任务,优先使用预先定义的工作流;只有当任务确实需要动态决策时,才增加 Agent 的自主性。复杂度本身不是成果。
最后看”谁愿意负责”
评分之外,还有一个更关键的变量。
一个 16 分但没有业务负责人的场景,往往不如一个 13 分、负责人清楚且愿意提供样本的场景。AI 项目需要有人定义结果、判断例外、接受或拒绝流程变化。技术团队无法代替业务完成这些决定。
场景筛选的目标不是找到最炫的想法,而是找到一个边界清楚、能被验证、失败可接管的流程。把第一步选对,后面的模型和工程选择才有意义。