AI 产品评估指标

8039 字
40 分钟
AI 产品评估指标

1. 今日主题与一句话结论#

主题:AI 产品评估指标

一句话结论: AI 产品不能只用“模型答得好不好”来评估,而要同时看模型质量、用户体验、业务结果、安全风险、成本效率和运营闭环;指标体系不是上线后的报表,而是决定 AI 功能能不能上线、能不能放量、能不能进入核心流程的产品治理工具。

前两天我们讨论了 AI 产品设计范式和概率性挑战。你已经看到,AI 产品和传统产品最大的不同,是系统输出不再完全确定。模型可能答错、漏答、同问不同答、格式不稳定,也可能在大多数场景里显著提高效率和体验。

这就带来一个实际问题:产品经理到底如何判断一个 AI 功能“可用”?

不能只看内部演示效果。不能只看模型排行榜。不能只看用户说“挺智能”。也不能只看调用量,因为调用量高可能意味着用户喜欢,也可能意味着用户反复追问仍然没解决问题。

AI 产品需要一套分层指标:

模型指标:答案是否准确、忠实、稳定、安全
体验指标:用户是否愿意用、是否理解、是否能完成任务
业务指标:是否提升转化、效率、留存、收入或降本
安全指标:是否避免隐私、越权、错误承诺和高风险输出
成本指标:Token、模型调用、缓存命中、单次任务成本是否可控
运营指标:是否能发现失败样本、更新知识库、优化 Prompt 和流程

如果没有这些指标,AI 项目就会变成主观争论:算法说模型不错,产品说体验不好,运营说用户投诉,研发说日志看不出来,老板说成本太高。指标体系的作用,是把这些争论变成可观测、可比较、可复盘的数据。


2. 学习目标#

  1. 区分模型指标、体验指标、业务指标、安全指标、成本指标和运营指标。

  2. 为智能问答类 AI 功能设计准确率、引用率、拒答率、满意度等核心指标。

  3. 判断一个指标是离线评估指标、线上监控指标,还是业务结果指标。

  4. 设计 AI 功能上线前、灰度中、放量后的指标门槛。

  5. 识别“看起来好但会误导决策”的虚假指标,例如调用量、互动轮次和生成字数。

  6. 输出一份 12 项以上的 AI 功能指标体系表,用于产品评审和上线复盘。


3. 深度阅读:AI 指标体系要同时回答质量、体验、业务和风险#

3.1 为什么传统产品指标不够#

传统互联网产品常用指标包括访问量、点击率、转化率、留存率、任务完成率、页面停留时长、漏斗转化、客单价、GMV、NPS 等。这些指标仍然重要,但对 AI 产品不够。

原因很简单:AI 产品多了一层“生成质量”和“不确定性风险”。一个普通搜索功能,如果用户点击率高,基本说明结果有吸引力;一个 AI 问答功能,如果互动轮次高,可能说明用户很喜欢,也可能说明第一轮没答对,用户不得不反复追问。一个内容生成工具,如果生成量高,可能说明提效,也可能说明生成内容质量差,用户反复重生成。

因此,AI 产品指标必须同时回答四类问题:

它答得对吗?
用户觉得有用吗?
业务真的变好吗?
风险和成本可控吗?

只回答其中一类都会失真。比如一个智能客服机器人,自动回复率很高,但错误承诺率也高,这不是成功;一个导购助手用户满意度不错,但每次转化成本高于毛利,这也不可持续;一个数据分析助手模型评估分高,但用户不采纳建议,业务价值就没有闭环。

产品负责人需要建立“指标分层”意识。不同指标负责不同决策:

指标层级主要回答典型用途
离线模型指标模型在测试集上是否达标上线前评估、Prompt 回归
在线体验指标用户使用过程是否顺畅灰度监控、交互优化
业务结果指标是否创造业务价值资源投入、放量决策
风险安全指标是否越过红线上线准入、风控拦截
成本效率指标单位价值成本是否合理预算、商业模式、增长策略
运营闭环指标是否能持续改进质检、知识库、团队协作

3.2 模型指标:先判断输出是否可信#

模型指标是 AI 产品评估的基础,但不是全部。它关注的是模型输出本身是否符合要求。

常见模型指标包括:

指标含义适用场景
准确率答案是否符合事实或标准答案客服问答、知识库问答、分类
忠实度是否只基于给定资料回答,没有编造RAG、合同摘要、政策解释
引用准确率引用资料是否真实支持答案企业知识问答、法务、制度问答
格式合规率输出是否符合 JSON、表格、字段要求API、自动化工作流
一致性相同或相似输入是否得到稳定答案客服、政策问答、审核
拒答正确率不该回答时是否拒答或转人工合规、高风险、权限场景
召回率应识别的问题是否被识别出来风险识别、投诉识别、审核
幻觉率输出中无依据或错误事实的比例问答、摘要、分析

这些指标需要评估集支撑。没有评估集,准确率就只是主观判断。评估集应覆盖常规问题、边界问题、高风险问题、恶意输入、格式要求和真实线上失败样本。

以智能问答为例,一个基本评估流程是:

准备 100 条问题
-> 每条绑定标准答案或参考资料
-> 运行当前 Prompt 和模型
-> 标注答案是否正确
-> 标注引用是否支持答案
-> 标注是否应该拒答
-> 统计准确率、引用率、拒答率、幻觉率
-> 对失败样本归因

产品经理要参与评估集设计,而不是完全交给算法。因为“正确答案”往往不是纯技术问题,而是业务口径问题。客服政策、运营规则、销售话术、合同风险、数据指标,都需要业务负责人确认标准。

3.3 体验指标:看用户是否真的完成任务#

AI 输出正确,不代表体验好。体验指标关注用户在产品中是否顺利完成任务。

常见体验指标包括:

指标含义
任务完成率用户是否通过 AI 完成原本想做的任务
首轮解决率第一轮回答是否解决问题
多轮澄清率系统是否需要追问,追问是否有效
用户满意度点赞、点踩、评分、问卷
采纳率用户是否采用 AI 建议或草稿
编辑率用户对 AI 输出修改多少
重生成率用户是否频繁要求重新生成
转人工率AI 是否无法继续处理
放弃率用户是否中途退出
响应时间首字延迟、完整响应时间

这里要注意指标解释。比如转人工率不是越低越好。如果高风险问题应该转人工,转人工率太低反而可能危险。重生成率也不是绝对坏事,创意生成场景中用户本来就需要多个版本;但客服回复场景中频繁重生成说明答案不稳定。

体验指标必须结合场景解读:

客服:首轮解决率、转人工率、满意度、投诉率更重要。
文案生成:采纳率、编辑率、重生成率、生成耗时更重要。
数据分析:任务完成率、结论采纳率、口径纠错率更重要。
导购:推荐点击率、加购率、澄清完成率、错误推荐率更重要。
内部知识问答:引用点击率、追问率、无答案拒答率更重要。

产品经理要避免单指标崇拜。比如只追求首轮解决率,模型可能在信息不足时硬答;只追求转人工率下降,可能牺牲高风险场景;只追求互动轮次,可能鼓励无效聊天。

3.4 业务指标:证明 AI 不是玩具#

业务指标回答一个关键问题:AI 功能是否创造了真实业务价值。

不同业务的目标不同:

场景业务指标
智能客服人工工单减少、平均处理时长下降、满意度提升、投诉下降
电商导购商品点击率、加购率、转化率、客单价、长尾曝光
商品文案上架效率、点击率、转化率、运营人效
销售助手客户跟进效率、有效触达率、续约率、扩容率
经营分析报告产出时间、异常发现速度、决策采纳率
内部知识库搜索成功率、员工自助率、重复咨询下降

业务指标通常不能只看 AI 使用用户,还要有对照组。否则很难判断增长来自 AI 还是其他因素。

例如电商导购上线后转化率提升 5%,可能是 AI 导购有效,也可能是活动折扣、季节因素或流量结构变化。正确做法是做 A/B 测试:

A 组:传统搜索筛选
B 组:传统搜索 + AI 导购入口
对比:
- 导购入口点击率
- 推荐商品点击率
- 加购率
- 支付转化率
- 客单价
- 退款率
- 单次转化 AI 成本

对增长负责人来说,AI 功能必须进入单位经济模型。尤其使用外部模型 API 时,每一次交互都有边际成本。一个 AI 导购如果带来更多互动但没有带来足够转化,就不是合格增长;一个客服机器人如果减少人工但增加投诉和赔付,也不是成功。

3.5 安全指标:把红线变成可监控数据#

Day 16 我们建立了错误分级。今天要把错误分级变成指标。

安全指标通常包括:

指标含义
高风险错误率L4 / L5 错误占比
错误承诺率AI 是否承诺退款、赔付、疗效、收益等
隐私泄露率是否输出无权限个人信息或敏感数据
越权调用率是否调用用户无权限工具或数据
提示注入成功率恶意指令是否绕过系统约束
拒答正确率高风险问题是否正确拒答
人工接管命中率应转人工问题是否成功转人工
内容安全拦截率敏感、违法、违规内容是否被拦截

安全指标和业务指标可能冲突。比如提高拒答率可以降低风险,但可能伤害用户体验;降低转人工率可以减少成本,但可能增加错误承诺。产品负责人要定义优先级:红线指标优先级高于增长指标。

一般建议:

  • L5 安全红线:0 容忍。

  • L4 高风险业务错误:通常 0 容忍或极低阈值。

  • L3 关键任务错误:按场景设灰度阈值。

  • L1-L2 错误:可进入迭代优化。

安全指标也需要红线样本集。上线前必须测试提示注入、越权、隐私、错误承诺、违法违规等样本,不能等真实用户踩坑。

3.6 成本指标:AI 功能必须算账#

AI 产品成本不只是服务器成本,还包括模型调用、Token、向量检索、重排、日志存储、人工质检、失败重试和人工接管。

常见成本指标包括:

指标含义
单次调用成本每次模型 API 平均成本
单任务完成成本完成一次用户任务的总 AI 成本
输入 TokenPrompt、上下文、知识片段消耗
输出 Token模型生成长度
强模型调用占比多少请求用了高成本模型
缓存命中率多少请求避免了模型调用
重试率失败后重新调用比例
无效调用率空输入、误触、重复点击、低价值请求
成本 / 业务结果每新增转化、每节省工单、每生成有效内容的成本

成本指标要和业务指标绑定。只看成本下降可能会误伤体验,只看业务提升可能会忽略亏损。正确问题是:

每多花 1 元 AI 成本,带来了多少收入、节省、效率或风险降低?

客服场景可以算:

AI 成本 = 模型调用 + 检索 + 日志 + 质检
收益 = 减少人工工单成本 + 提升满意度带来的留存价值 - 错误导致的投诉成本

导购场景可以算:

AI 成本 / 增量成交订单
AI 成本 / 增量毛利
AI 导购用户转化率 - 对照组转化率

如果 AI 功能要商业化,成本指标更关键。SaaS、API、订阅、按量计费都必须知道单位成本,否则定价会失真。

3.7 运营闭环指标:质量能否持续变好#

AI 产品上线不是结束。模型、知识库、用户问题、业务规则都会变化,必须建立运营闭环。

运营闭环指标包括:

指标含义
失败样本入库率线上失败是否进入评估集
标注完成率质检团队是否完成错误归因
知识库更新时效新政策、新规则多久进入知识库
Prompt 回归通过率修改后是否通过测试
版本回滚次数新版本是否频繁导致问题
人工修改率人工对 AI 草稿改动比例
用户反馈处理时长点踩、投诉多久被处理
评估集覆盖率是否覆盖主要意图和高风险样本

这些指标决定 AI 产品能否长期可靠。如果失败样本不入库,团队会反复犯同样错误;如果知识库更新慢,模型会基于旧政策回答;如果 Prompt 修改没有回归测试,质量会随机波动。

产品经理要把运营闭环写进方案。AI 功能不是只交给算法团队维护,它需要产品、运营、客服、法务、数据和研发共同维护。

3.8 指标门槛:上线、灰度和放量要有准入标准#

指标体系最终要服务决策。至少要定义三个阶段的门槛:

上线前:

  • 离线评估集通过率是否达标。

  • 红线样本是否全部拦截。

  • 输出格式是否稳定。

  • 成本预算是否可接受。

  • 日志和监控是否完备。

灰度中:

  • 用户满意度是否高于基线。

  • L3 以上错误是否低于阈值。

  • 转人工率是否符合预期。

  • 成本是否在预算内。

  • 用户反馈是否可处理。

放量前:

  • 业务指标是否显著改善。

  • 风险指标是否稳定。

  • 运营团队是否能承接质检。

  • 模型和 Prompt 是否可回滚。

  • 高峰流量下性能和成本是否可控。

没有门槛,灰度就会变成形式。团队会因为“已经做了”而继续放量,而不是因为指标真的达标。


4. 案例一:中国智能客服问答的准确率、引用率、拒答率和满意度#

4.1 业务背景#

某国内消费品牌上线智能客服,用于回答售后政策、物流、发票、会员积分、活动规则等问题。初期团队只看自动回复率,发现机器人能处理 60% 的会话,于是计划扩大范围。但投诉复盘发现,部分自动回复虽然减少了人工接入,却回答不完整或引用旧政策,导致用户重复咨询。

团队决定重建指标体系,不再只看“自动化率”,而是同时看质量、体验、业务和风险。

4.2 相关角色#

角色关注点
客服负责人减少人工压力,提高满意度
产品经理指标定义、灰度策略、转人工机制
算法团队问答准确率、检索召回、拒答能力
运营团队知识库维护、质检、失败样本标注
法务 / 风控错误承诺、用户权益、隐私
数据分析师看板、归因、A/B 测试

4.3 原始流程#

用户提问
-> AI 检索知识库
-> 大模型生成回答
-> 直接返回用户
-> 用户满意或继续追问
-> 必要时转人工

原流程的问题:

  • 只统计自动回复率,不知道回答是否正确。

  • 知识库引用没有校验,模型可能答非所引。

  • 拒答能力弱,不该回答的问题也尝试回答。

  • 用户点踩后没有进入评估集。

  • 没有区分政策类、订单类、投诉类问题。

4.4 AI 改造流程#

用户提问
-> 意图分类:政策 / 订单 / 活动 / 投诉 / 无关 / 高风险
-> 权限和上下文检查
-> 知识库检索
-> 生成回答和引用
-> 输出质检:准确性、引用支持、风险承诺
-> 返回用户或转人工
-> 收集满意度、追问、点踩、人工修改
-> 失败样本进入评估集

4.5 数据 / 系统依赖#

系统用途
客服会话系统用户问题、上下文、满意度
知识库政策、活动、流程、FAQ
订单系统订单状态和售后进度
工单系统转人工、投诉、处理结果
质检后台人工标注准确性和错误类型
日志系统Prompt、模型、引用、输出、成本
BI 看板指标监控和灰度分析

4.6 方案架构#

客服入口
|
AI 问答编排层
|-- 意图识别
|-- 权限检查
|-- 知识库检索
|-- 模型生成
|-- 引用校验
|-- 风险拦截
|-- 转人工
|
数据闭环
|-- 用户反馈
|-- 人工质检
|-- 失败样本库
|-- 指标看板

4.7 关键指标#

指标定义目标
问答准确率回答符合政策和事实大于 95%
引用准确率引用内容能支持答案大于 92%
拒答正确率不该回答时拒答或转人工大于 98%
首轮解决率第一轮解决用户问题大于 70%
用户满意度点赞或满意评价占比大于 85%
转人工合理率应转人工问题成功转人工大于 95%
错误承诺率错误赔付、退款、权益承诺0
知识命中率问题能命中有效知识大于 80%
失败样本入库率点踩和投诉进入样本库大于 90%
单会话 AI 成本平均模型和检索成本低于预算

4.8 主要风险#

风险说明应对
自动化率虚高AI 接了很多问题但没解决用首轮解决率和满意度校正
引用不支持答案模型答对但引用错误,或引用旧政策引用校验和知识版本管理
拒答不足高风险问题硬答红线样本测试和转人工规则
成本不透明高峰调用成本失控按意图和模型拆分成本
反馈无闭环用户点踩后没人处理失败样本入库和质检 SLA

4.9 复盘结论#

客服 AI 的核心指标不是自动回复率,而是“正确地解决问题”。自动化率必须被准确率、引用率、拒答率、满意度、投诉率和成本共同约束。否则机器人看似减少人工,实际可能增加用户重复咨询和投诉。


5. 案例二:B2B 销售助手如何用指标证明业务价值#

5.1 业务背景#

一家 B2B SaaS 公司上线销售助手,帮助销售生成客户摘要、识别续约风险、草拟跟进邮件。内部试用时销售反馈“挺方便”,但管理层要求证明它是否真的提升续约和销售效率。

团队需要建立从模型质量到业务结果的完整指标体系。

5.2 相关角色#

角色关注点
销售代表减少准备时间,提高跟进质量
销售主管识别风险客户,提升团队效率
客户成功续约风险、工单问题、客户健康度
产品经理功能使用、采纳率、工作流嵌入
数据团队CRM、邮件、会议、工单数据
安全团队客户数据权限和隐私
管理层续约率、扩容率、销售人效

5.3 原始流程#

销售打开 CRM
-> 查看客户资料、会议、邮件、工单
-> 手工总结风险和机会
-> 写跟进邮件
-> 主管检查重点客户

原流程的问题:

  • 销售准备客户会议耗时长。

  • 不同销售总结质量不一致。

  • 高风险客户发现不及时。

  • AI 试用后只看使用量,无法证明业务效果。

5.4 AI 改造流程#

销售进入客户页
-> AI 生成结构化客户摘要
-> 标注风险、机会、下一步建议
-> 销售采纳、编辑或忽略
-> 跟进动作写回 CRM
-> 对比客户后续续约和扩容结果

5.5 数据 / 系统依赖#

系统用途
CRM客户阶段、金额、续约日期、负责人
邮件 / 会议纪要最近沟通、异议、承诺事项
工单系统客户问题和满意度
客户健康度模型风险评分和使用情况
权限系统控制客户数据访问
埋点系统AI 使用、采纳、编辑、忽略
BI 看板指标分析和对照组比较

5.6 方案架构#

CRM 客户页
|
AI 销售助手
|-- 数据聚合
|-- 权限过滤
|-- 客户摘要生成
|-- 风险识别
|-- 邮件草稿
|-- 采纳和编辑记录
|
业务结果追踪
|-- 跟进动作
|-- 续约结果
|-- 扩容结果
|-- 销售效率

5.7 关键指标#

指标定义目标
摘要准确率摘要是否符合 CRM 和会议事实大于 92%
风险识别召回率高风险客户是否被识别大于 85%
建议采纳率销售采纳 AI 下一步建议大于 30%
草稿编辑率邮件草稿被修改比例中等且下降
准备时间节省销售会议前准备时间下降降低 20%
有效触达率AI 建议后产生有效客户互动提升 10%
续约风险提前发现率风险客户提前进入跟进提升 15%
续约率实验组相对对照组变化正向提升
权限违规数无权限数据进入 Prompt0
单客户摘要成本生成一次摘要的 AI 成本低于预算

5.8 主要风险#

风险说明应对
使用量高但无业务价值销售觉得新鲜但不改变结果关注采纳率、触达率、续约率
摘要遗漏关键信息影响销售判断增加人工反馈和失败样本
权限风险客户数据越权进入上下文后端权限过滤,日志审计
指标归因困难续约受很多因素影响设置对照组和分层分析
销售不信任AI 建议太泛跟踪编辑率和忽略原因

5.9 复盘结论#

销售助手不能只用“使用次数”证明价值。真正有用的指标是采纳率、准备时间节省、有效触达率、风险提前发现率和续约结果。AI 产品必须嵌入工作流,记录用户是否采纳,才能连接到业务结果。


6. 动手实操任务#

任务:为一个 AI 功能设计 12 个指标#

选择一个 AI 功能,例如智能客服、AI 导购、销售助手、合同摘要、经营分析、商品文案生成、内部知识问答。为它设计一套指标体系。

必须包含:

  1. 功能说明:用户是谁,任务是什么。

  2. 指标分层:模型、体验、业务、安全、成本、运营六类。

  3. 至少 12 个指标:每类至少 1 个。

  4. 指标定义:每个指标怎么计算。

  5. 数据来源:日志、埋点、业务系统、人工标注、用户反馈。

  6. 阈值:上线前、灰度中、放量前的目标。

  7. 决策用途:指标用于上线、优化、风控、增长还是预算。

验收标准#

验收项标准
指标数量至少 12 个
分层完整覆盖模型、体验、业务、安全、成本、运营
定义清晰每个指标可计算,不是口号
数据来源明确能说明从哪里采集
阈值明确有上线、灰度或放量门槛
决策可用能指导是否上线、是否放量、是否回滚

7. 测试题与参考答案#

7.1 理解题#

题 1:为什么 AI 产品不能只看调用量?

参考答案: 调用量只能说明有人使用,不说明问题被解决。调用量高可能来自用户喜欢,也可能来自 AI 没答好导致反复追问。AI 产品还要看准确率、任务完成率、满意度、业务结果、风险和成本。

题 2:模型指标和业务指标有什么区别?

参考答案: 模型指标衡量输出本身是否正确、安全、稳定,例如准确率、引用率、格式合规率。业务指标衡量 AI 是否创造业务价值,例如转化率、人工工单减少、续约率、运营效率提升。模型好不等于业务一定好。

题 3:为什么拒答率不能简单理解为越低越好?

参考答案: 在高风险、无权限或信息不足场景中,正确拒答或转人工是安全行为。拒答率过低可能说明模型硬答,带来错误承诺和合规风险。应看拒答正确率,而不是单纯降低拒答。

题 4:什么是运营闭环指标?

参考答案: 运营闭环指标衡量 AI 产品能否持续改进,例如失败样本入库率、标注完成率、知识库更新时效、Prompt 回归通过率。它们决定线上问题能否被发现、归因和修正。

7.2 应用题#

题 5:智能客服自动回复率提升,但满意度下降,你会如何分析?

参考答案: 说明自动化可能处理了不该自动处理的问题。应拆分意图类型,看准确率、引用率、转人工合理率、错误承诺率、首轮解决率和投诉率。必要时降低高风险场景自动回复范围,增加转人工和知识库质检。

题 6:AI 导购入口点击率高,但转化没有提升,可能是什么原因?

参考答案: 可能是入口吸引但推荐不准、澄清流程太长、推荐理由不可信、商品库存价格不匹配、购买路径断裂,或 AI 成本高于增量收益。需要看推荐点击率、加购率、澄清完成率、错误推荐率、单次转化成本和对照组转化。

题 7:如何为合同摘要 AI 设计安全指标?

参考答案: 应包含关键条款遗漏率、错误解释率、引用准确率、无依据结论率、风险条款召回率、人工复核通过率、隐私泄露率、越权访问率。合同摘要应明确辅助阅读,不替代法务审查。


8. 当日产出模板#

8.1 AI 功能指标体系表#

指标层级指标名称定义计算方式数据来源阈值决策用途
模型准确率输出符合标准答案正确样本数 / 总样本数评估集、人工标注上线准入
模型引用准确率引用是否支持答案正确引用数 / 有引用回答数知识库、质检RAG 质量
模型格式合规率输出结构是否可解析合规输出数 / 总输出数API 日志工程接入
体验任务完成率用户是否完成目标任务完成任务用户 / 使用用户埋点、业务系统体验优化
体验满意度用户点赞或评分满意反馈 / 总反馈用户反馈灰度监控
体验转人工率AI 无法处理转人工转人工会话 / AI 会话工单系统人机协作
业务转化提升AI 组相对对照组提升B 组转化 - A 组转化A/B 测试放量决策
业务人效提升人工处理时间下降节省时间 / 原时间业务系统ROI
安全高风险错误率L4/L5 错误占比高风险错误 / 抽检样本质检、安全日志0风控
安全拒答正确率应拒答问题是否拒答正确拒答 / 应拒答样本红线评估集上线准入
成本单任务成本完成一次任务的 AI 成本总 AI 成本 / 完成任务数API 账单、日志预算
成本缓存命中率避免模型调用比例缓存命中 / 总请求缓存日志成本优化
运营失败样本入库率失败是否沉淀评估集入库失败样本 / 失败样本质检后台持续优化
运营Prompt 回归通过率新版本是否通过测试通过样本 / 回归样本测试平台发布管理

8.2 智能问答评估指标模板#

功能名称:智能问答
适用范围:
知识来源:
上线阶段:内部试用 / 灰度 / 全量
一、模型质量
- 答案准确率:
- 引用准确率:
- 幻觉率:
- 拒答正确率:
- 同问一致性:
二、用户体验
- 首轮解决率:
- 平均追问轮次:
- 用户满意度:
- 转人工率:
- 放弃率:
三、业务结果
- 人工咨询减少:
- 平均处理时长下降:
- 投诉率变化:
- 自助解决率:
四、安全风险
- 错误承诺率:
- 隐私泄露率:
- 越权回答率:
- 红线样本通过率:
五、成本效率
- 单会话成本:
- 平均输入 Token:
- 平均输出 Token:
- 缓存命中率:
- 强模型调用占比:
六、运营闭环
- 点踩样本入库率:
- 质检完成率:
- 知识库更新时效:
- Prompt 回归通过率:
上线结论:
- 允许上线:
- 仅灰度:
- 需人工审核:
- 阻塞上线:

8.3 指标评审问题清单#

1. 这个指标用于什么决策?
2. 指标是否可计算,数据从哪里来?
3. 指标是否可能被误读?
4. 是否需要按意图、用户、渠道、模型版本拆分?
5. 是否有上线前、灰度中、放量前门槛?
6. 哪些指标是红线指标?
7. 哪些指标需要人工标注?
8. 指标异常时谁负责处理?
9. 指标是否能连接业务价值?
10. 指标是否能支撑复盘和迭代?

9. 延伸阅读资料#

  1. 大模型评估方法:准确性、忠实度、引用准确率、拒答能力、一致性。

  2. 产品数据分析基础:漏斗、留存、A/B 测试、分群和归因。

  3. 客服质检指标:首轮解决率、转人工率、满意度、投诉率。

  4. RAG 评估资料:检索召回、答案忠实度、引用正确率。

  5. SRE 和风控指标:错误预算、红线指标、告警和回滚。

  6. FinOps:云成本归因、单位经济模型、预算告警和 ROI 评估。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

AI 产品评估指标
https://www.shanfengpm.com/posts/2026-04-28-ai-product-evaluation-metrics/
作者
山风
发布于
2026-04-28
许可协议
CC BY-NC-SA 4.0
本文首发于「山风blog」,作者:山风(余涛)。欢迎转发、分享本文链接, 但禁止任何形式的未授权转载、摘编、改写或商业使用
推荐文章AI产品
Profile Image of the Author
山风
12年产品经验,持续记录产品思考、业务设计、数据分析和团队管理实践。
站点统计