大模型选型

4157 字
21 分钟
大模型选型

1. 今日主题与一句话结论#

主题:大模型选型

一句话结论: 大模型选型不是问“哪个模型最强”,而是判断某个业务场景在中文能力、长上下文、推理、结构化输出、工具调用、成本、延迟、稳定性、合规和部署方式之间如何取舍。

从产品经理视角看,模型不是信仰对象,而是生产资源。选型要服务业务任务,而不是服务排行榜。

同一个模型,可能很适合长文档总结,但不适合低成本高并发客服;可能适合复杂推理,但不适合批量生成商品标题;可能 API 体验好,但企业私有化条件不满足。

所以今天的核心判断是:

模型选型 = 任务需求 × 质量要求 × 成本边界 × 延迟要求 × 数据安全 × 工程可用性

2. 学习目标#

  1. 区分通用模型、垂直模型、开源模型、私有化模型的适用场景。

  2. 用中文能力、长上下文、工具调用、结构化输出、推理能力、成本、延迟、安全合规等维度做模型选型。

  3. 给 3 个 AI 场景建立模型选型矩阵。

  4. 判断什么时候用强模型,什么时候用小模型、规则、缓存或模型路由。

  5. 形成一份可用于项目评审的模型选型说明。


3. 深度阅读:不要选“最强模型”,要选“最合适链路”#

3.1 为什么模型选型不能只看排行榜#

排行榜通常测的是一组通用能力,比如数学、代码、知识问答、推理、指令遵循、多语言等。但业务上线看的是另一组问题:

业务问题排行榜不一定回答
我们的用户问法是否能稳定处理?需要真实样本测试
输出 JSON 是否稳定?需要格式合规率
高峰期延迟能否接受?需要压测
单次调用成本是否可承受?需要单位经济模型
是否支持私有化或专有云?需要合规评审
模型更新后会不会影响 Prompt?需要回归测试
供应商 SLA 是否可靠?需要工程和采购评估

产品经理不要问“哪个模型最好”,而要问:

在这个场景里,哪个模型以可接受成本稳定完成任务?

3.2 模型能力维度#

常用选型维度如下:

维度说明典型影响
中文能力是否理解中文口语、行业词、复杂表达客服、制度问答、访谈分析
长上下文能否处理长文档、长对话、多资料合同、会议、知识库
推理能力能否处理多条件、多步骤判断数据分析、复杂客服、方案评审
结构化输出JSON、表格、字段抽取是否稳定API 产品化、需求抽取
工具调用是否稳定调用外部系统和函数Agent、客服、BI
多模态是否支持图片、语音、视频、表格商品图、票据、会议
成本输入/输出价格、缓存、并发成本高频功能
延迟首字延迟、完整响应时间客服、搜索、交互工具
稳定性多次调用是否一致生产系统
合规数据留存、隐私、审计、部署方式金融、医疗、政企

3.3 通用模型、垂直模型、开源模型、私有化#

类型优势风险适合
通用闭源模型能力强、API 成熟、迭代快成本、数据合规、供应商依赖快速验证、复杂生成
垂直模型行业知识和格式更贴近泛化能力可能弱医疗、金融、法律、代码等
开源模型可控、可私有化、成本可优化运维、调优、工程复杂数据敏感、规模化部署
私有化模型数据安全、可定制初始投入高、维护重政企、金融、制造、医疗

选型不是二选一。真实项目常见组合是:

简单分类 -> 小模型
复杂生成 -> 强模型
企业知识 -> RAG + 通用模型
高风险判断 -> 规则系统 + 人工审核
敏感数据 -> 私有化或专有云

3.4 为什么要做模型路由#

如果所有请求都用最强模型,质量可能不错,但成本和延迟会很快失控。

更合理的方式是模型路由:

用户请求
-> 任务分类
-> 简单 FAQ:缓存/小模型
-> 普通生成:中等模型
-> 复杂推理:强模型
-> 高风险审批:规则系统/人工

例如智能客服:

问题类型推荐处理
物流进度查询查系统 + 模板回复
普通 FAQ缓存或小模型
售后政策解释RAG + 中等模型
投诉赔付强模型辅助 + 人工接管
退款审批规则系统,不由模型决定

模型路由的本质是:把模型能力当作资源调度,而不是单一入口。

3.5 模型选型和 Prompt 评估的关系#

Day 10 讲过 Prompt 评估。模型选型不能脱离测试集。

正确流程是:

定义场景
-> 设计 Prompt
-> 准备测试集
-> 多模型对比
-> 统计通过率、成本、延迟
-> 选择模型或路由策略

不要只看一次体验。每个候选模型至少要用同一批样本测试:

  • 格式合规率。

  • 任务成功率。

  • 引用支持率。

  • 拒答正确率。

  • 高风险拦截率。

  • 平均成本。

  • 平均延迟。

  • 人工修改率。

3.6 成本不是越低越好#

低成本模型适合高频、低风险、结构简单任务。但如果低成本导致错误率升高,最终可能更贵。

例如客服:

低价模型节省调用成本
但错误承诺率上升
导致投诉、赔付、人工复核增加
最终总成本上升

所以应看总成本:

总成本 =
模型调用成本
+ 检索和存储成本
+ 人工审核成本
+ 错误处理成本
+ 客诉和信任损失

3.7 模型选型必须进入项目评审#

在 AI 项目评审会上,模型选型不应只是一句“使用某某大模型”。至少要说明:

  1. 为什么这个场景需要大模型。

  2. 任务是否拆分为多个子任务。

  3. 每个子任务用什么模型或系统能力。

  4. 候选模型的测试集结果。

  5. 成本和延迟估算。

  6. 数据安全和供应商风险。

  7. 失败时的降级方案。

一个合格的选型说明应该类似:

本场景采用 RAG + 中等通用模型作为主链路。
原因:任务以制度解释为主,要求中文理解、引用稳定和拒答能力,不需要最高强度推理。
高风险审批问题不由模型判断,转规则系统或人工。
简单 FAQ 使用缓存。
后续用 100 条真实问题评估引用支持率、拒答正确率和单次成本。

3.8 国产模型生态的产品选型视角#

在中文和国内企业场景中,常见模型生态包括通义、文心、混元、豆包、Kimi、DeepSeek、智谱、讯飞星火、Qwen 开源系列等。产品经理不需要背每个平台的参数和榜单,但要建立评估方法。

选型时重点看:

  • 中文口语和行业词理解。

  • 长文档处理稳定性。

  • 结构化输出能力。

  • 工具调用能力。

  • 多模态能力。

  • API 可用性和限流。

  • 企业数据政策。

  • 私有化、专有云或本地部署支持。

  • 价格和商务条件。

  • 生态工具链。

对国内企业来说,模型能力只是第一层,合规、采购、售后、部署和生态往往同样重要。

3.9 强模型、小模型、规则系统如何协作#

AI 产品稳定性来自协作,而不是模型单点能力。

规则系统:确定性判断
小模型:分类、标签、低风险初稿
中等模型:常规问答、摘要、结构化抽取
强模型:复杂推理、多约束生成、困难样本
人工:高风险确认和最终责任

例如用户访谈需求抽取:

  • 小模型可做初步标签分类。

  • 中等模型可抽取痛点和证据。

  • 强模型可处理长访谈、多角色和复杂归纳。

  • 产品经理必须审核最终需求池。

这比“全量强模型处理”更可控,也比“全量小模型处理”更稳。

3.10 模型切换和供应商风险#

模型选型还要考虑长期风险:

  • 模型 API 价格变化。

  • 模型版本升级导致输出变化。

  • 供应商限流或故障。

  • 数据合规政策变化。

  • 私有化成本超预期。

  • Prompt 和评估集绑定某个模型。

因此关键 AI 功能应设计可切换能力:

业务系统
-> AI 编排层
-> 模型适配器
-> 模型 A / 模型 B / 私有模型

不要让业务代码直接绑定某个模型 API 的细节。后续 Day 12 会讲 API 产品化,这里先记住:模型选型要留出切换空间。


4. 案例一:企业知识库问答模型选型#

业务背景#

企业要做制度问答助手,覆盖报销、采购、合同、请假、信息安全等制度。用户用自然语言提问,系统基于文档回答并给引用。

关键要求#

要求说明
中文理解员工问法口语化
RAG 兼容必须基于检索片段回答
引用稳定结论必须有来源
拒答能力资料不足不能硬答
权限安全不同员工看到不同资料
成本可控高频内部工具

原始流程#

员工查制度文档
-> 搜索关键词
-> 打开多个制度 PDF
-> 问 HR/财务/法务
-> 等人工答复

AI 改造流程#

员工自然语言提问
-> 权限校验
-> 语义检索
-> 重排
-> 模型基于引用回答
-> 资料不足拒答或转人工
-> 用户反馈进入评估集

选型方案#

Embedding 模型:负责语义检索
重排模型:提高关键片段排序
中等/强语言模型:基于引用回答
规则系统:权限、版本、拒答
人工:高风险制度解释

数据与系统依赖#

  • 制度文档库。

  • 组织架构和权限。

  • 文档版本和生效日期。

  • 向量库。

  • 评估样本集。

  • 人工反馈记录。

模型评估指标#

  • Top K 召回率。

  • 引用准确率。

  • 引用支持率。

  • 无依据回答率。

  • 拒答正确率。

  • 平均响应时间。

  • 单次问答成本。

  • 员工满意度。

主要风险#

  • 旧制度误召回。

  • 模型引用不支持结论。

  • 高风险制度解释被模型说成确定承诺。

  • 权限过滤不严。

  • 高频内部工具成本被低估。

复盘结论#

企业知识库问答不一定需要最强生成模型,更需要稳定的 RAG 链路、权限控制、引用约束和拒答能力。模型只是系统的一环。


5. 案例二:智能客服高峰期模型选型#

业务背景#

电商大促期间客服咨询激增,平台希望 AI 分担物流、退款、优惠券、发票和投诉问题。

任务拆分#

任务推荐方案
意图识别小模型或分类器
高频 FAQ缓存/模板
政策解释RAG + 中等模型
情绪识别小模型/规则结合
投诉赔付强模型辅助 + 人工
退款资格规则系统

原始流程#

用户咨询
-> FAQ 机器人尝试命中
-> 命不中转人工
-> 人工查订单和政策
-> 回复或创建工单

AI 改造流程#

用户消息
-> 意图识别
-> 风险分级
-> 查询订单/物流/优惠券
-> 检索政策
-> 模型路由
-> 缓存/小模型
-> 中等模型
-> 强模型辅助
-> 自动回复或人工接管
-> 质检和复盘

数据与系统依赖#

  • 订单系统。

  • 物流系统。

  • 售后政策知识库。

  • 优惠券系统。

  • 工单系统。

  • 客服质检系统。

  • 风险标签规则。

指标#

  • 自助解决率。

  • 错误承诺率。

  • 高风险接管率。

  • 平均响应时间。

  • 单会话成本。

  • 用户满意度。

  • 人工客服节省工时。

主要风险#

  • 为降低接管率而让模型处理高风险赔付。

  • 统一强模型导致成本失控。

  • 小模型处理复杂问题导致错答。

  • 工具调用失败时模型硬答。

  • 大促政策更新滞后。

复盘结论#

智能客服不应全量使用强模型。最优方案通常是任务分层和模型路由:简单问题低成本处理,复杂问题强模型辅助,高风险问题人工确认。


6. 动手实操任务#

任务:设计一个模型选型矩阵#

选择 3 个场景,例如:

  1. 企业知识库问答。

  2. 智能客服回复。

  3. 商品文案生成。

  4. 合同摘要。

  5. 用户访谈需求抽取。

  6. 运营日报生成。

按下面表格打分,1-5 分:

场景中文能力长上下文推理结构化输出工具调用成本延迟合规推荐模型策略
企业知识库问答54342335RAG + 中等/强模型
智能客服53345554模型路由
商品文案42231533小模型 + 审核

验收标准#

合格:

  1. 至少选择 3 个场景。

  2. 每个场景至少评估 8 个维度。

  3. 写出推荐模型策略。

  4. 说明为什么不是只用最强模型。

优秀:

  1. 能设计模型路由。

  2. 能写出测试集指标。

  3. 能把成本、质量、风险和业务价值联系起来。


7. 测试题与参考答案#

理解题#

1. 模型选型为什么不能只看排行榜? 参考答案:排行榜不能代表真实业务样本、成本、延迟、合规、输出格式稳定性和供应商可用性。

2. 什么场景适合小模型? 参考答案:高频、低风险、结构简单、任务边界清晰的场景,如分类、标签、简单 FAQ、初稿生成。

3. 什么场景适合强模型? 参考答案:复杂推理、长文档、多约束生成、需要较强中文理解和结构化输出的场景。

4. 为什么需要模型路由? 参考答案:不同任务成本、风险和质量要求不同。模型路由能在质量和成本之间取得平衡。

5. 模型选型和 Prompt 评估有什么关系? 参考答案:必须用同一批测试集比较不同模型的格式合规率、任务成功率、风险通过率、成本和延迟。

应用题#

6. 企业知识库问答选型重点是什么? 参考答案:RAG 兼容、引用稳定、拒答能力、中文理解、权限和版本控制,不只是生成能力。

7. 智能客服为什么不应全量用强模型? 参考答案:高频场景成本和延迟压力大,许多问题可用缓存、小模型或规则系统处理,高风险问题还需人工确认。


8. 当日产出模板#

8.1 模型选型矩阵#

维度权重模型 A模型 B模型 C说明
中文能力
长上下文
推理能力
结构化输出
工具调用
多模态
成本
延迟
合规
稳定性

8.2 模型路由方案模板#

场景名称:
用户任务:
任务类型:
风险等级:
推荐处理:
- 规则系统:
- 小模型:
- 中等模型:
- 强模型:
- 人工接管:
成本预估:
评估指标:
回退策略:

8.3 三场景模型策略对比表#

场景主模型策略辅助能力不交给模型的环节核心评估指标
企业知识库问答RAG + 中等/强模型Embedding、重排、权限审批结论引用支持率、拒答正确率
智能客服模型路由缓存、规则、工具调用赔付和退款审批错误承诺率、接管率
商品文案小模型初稿 + 审核禁词、商品字段材质和功效确认采用率、描述不符率

9. 延伸阅读资料#

  1. Prompt 评估方法:模型选型必须基于测试集。

  2. 准备你自己的 20 条测试样本,用至少 2 个模型对比输出。

  3. 关注模型官方文档的上下文长度、价格、工具调用、数据使用政策和部署方式。

  4. API 产品化入门:会把模型调用接入真实系统链路。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

大模型选型
https://www.shanfengpm.com/posts/2025-12-11-llm-selection/
作者
山风
发布于
2025-12-11
许可协议
CC BY-NC-SA 4.0
本文首发于「山风blog」,作者:山风(余涛)。欢迎转发、分享本文链接, 但禁止任何形式的未授权转载、摘编、改写或商业使用
推荐文章AI产品
Profile Image of the Author
山风
12年产品经验,持续记录产品思考、业务设计、数据分析和团队管理实践。
站点统计