Token 与成本意识

5791 字
29 分钟
Token 与成本意识

1. 今日主题与一句话结论#

主题:Token 与成本意识

一句话结论: Token 是大模型产品的“计量单位”,但对产品经理来说,它不只是技术概念,而是直接决定成本、延迟、上下文设计、功能边界、商业模式和增长 ROI 的核心变量。

很多 AI Demo 看起来都能跑通,但上线后会遇到几个非常具体的问题:

  • 用户一多,模型调用成本明显上升。

  • 长文档、长对话导致响应变慢。

  • Prompt 越写越长,质量可能提升,但成本也随之上升。

  • 智能客服每轮都把全部历史对话塞给模型,成本失控。

  • 商品文案批量生成时,单条看起来便宜,日调用量一上来就变成预算问题。

  • 免费试用、低价套餐、内部工具如果没有用量限制,会被高频用户迅速打穿成本。

所以,AI 产品经理不能只会说“接一个大模型”。必须能把模型调用拆成可计算、可监控、可优化的成本结构。


2. 学习目标#

今天学完后,你要能做到:

  1. 解释 Token 是什么,以及为什么中文、英文、代码、表格、长文档的 Token 消耗不同。

  2. 区分输入 Token、输出 Token、上下文窗口、缓存命中、批处理等成本变量。

  3. 为商品文案生成、智能客服、企业知识库问答等场景建立粗略成本模型。

  4. 判断一个 AI 功能的成本风险来自哪里:长输入、长输出、高频调用、多轮对话、低命中缓存、模型选型过重,还是无用上下文太多。

  5. 设计基本的成本优化方案:Prompt 压缩、上下文裁剪、RAG 精检索、结果缓存、小模型路由、人工确认前置、套餐限额。


3. 深度阅读:Token 是 AI 产品的成本语言#

3.1 Token 到底是什么#

大语言模型不是直接按“字”或“词”理解文本,而是先把文本切成一个个 Token。Token 可以粗略理解为模型处理文本的最小片段,但它不完全等于中文的“字”,也不完全等于英文的“单词”。

例如:

人工智能正在改变商品运营效率

这句话可能被切成若干个中文片段。不同模型的 tokenizer 不同,切法也会不同。英文里,一个单词也可能被拆成多个子词。例如 unbelievable 可能被拆成 unbelievable 一类片段。代码、URL、JSON、表格、特殊符号也会带来额外 Token 消耗。

产品经理不需要记住具体 tokenizer 算法,但要形成一个判断:

模型每次读进去的内容和写出来的内容,都会被换算成 Token;Token 越多,通常成本越高、延迟越高、上下文管理越复杂。

3.2 输入 Token 与输出 Token#

一次模型调用通常包含两类 Token:

总 Token = 输入 Token + 输出 Token

输入 Token 包括:

  • 系统提示词。

  • 用户问题。

  • 历史对话。

  • RAG 检索出来的资料。

  • 商品资料、合同文本、表格数据。

  • 输出格式要求。

  • 示例样本。

  • 安全约束、拒答规则。

输出 Token 包括:

  • 模型最终回答。

  • JSON 结构化结果。

  • 摘要、文案、报告、代码。

  • 推理说明或解释文本。

很多团队只关注用户输入,却忽略了系统提示词和检索资料。实际上,企业级 AI 功能里,用户一句话可能很短,但系统塞给模型的上下文很长。

例如用户问:

这个订单可以退款吗?

用户输入只有几个字,但系统可能会拼接:

  • 退款政策。

  • 订单状态。

  • 商品类目。

  • 活动规则。

  • 用户等级。

  • 历史客服记录。

  • 输出格式约束。

  • 风险提示。

真正花钱的是整个请求,不是用户这句话。

3.3 上下文窗口不是免费空间#

上下文窗口指模型一次能看到的 Token 范围。窗口越大,能塞进去的文档、对话、资料越多。但它不是免费空间。

产品上常见误区:

  1. 以为上下文越长越好。 实际上,上下文越长,成本越高,响应越慢,模型也可能忽略中间信息。

  2. 把所有历史对话都塞进去。 多轮客服、AI 助手、销售跟进场景里,这会快速拉高成本。

  3. RAG 检索越多越安全。 检索片段太多会稀释重点,让模型更难定位答案。

  4. Prompt 不断加规则。 为了解决一个问题就在 Prompt 里加一段规则,长期会变成“巨型 Prompt”,成本和维护性都变差。

更合理的做法是:

  • 只放当前任务需要的信息。

  • 历史对话做摘要,而不是全量塞入。

  • RAG 检索后做重排,只保留最相关片段。

  • 高风险规则用系统侧规则校验,而不是全写进 Prompt。

  • 对固定规范做版本化管理,而不是每个请求重复塞全部内容。

3.4 Token 成本公式#

不同模型供应商的价格不同,而且会变化。产品经理不应该死记某个价格,而应该掌握估算公式。

可以用下面这个通用公式:

单次调用成本 =
输入 Token 数 / 1,000,000 × 输入单价
+ 输出 Token 数 / 1,000,000 × 输出单价
+ 其他成本

其他成本可能包括:

  • Embedding 成本。

  • 向量数据库成本。

  • 重排模型成本。

  • 图片、音频、视频模型成本。

  • 日志和存储成本。

  • 人工审核成本。

  • 研发和运维成本。

如果只是做 Demo,可以只估算模型调用成本。但如果要上线,需要估算完整链路成本。

3.5 产品经理要做的是“单位经济模型”#

AI 功能上线后,不能只看“模型单次调用很便宜”。真正要算的是单位经济模型。

例如智能客服:

单次会话成本 =
平均轮次 × 单轮模型成本
+ RAG 检索成本
+ 工单创建/查询接口成本
+ 人工接管成本 × 接管率
+ 日志与质检成本

再看价值:

单次会话价值 =
节省人工客服成本
+ 提升响应速度带来的满意度收益
+ 提升转化或减少流失
- 错答导致的赔付/投诉/信任损失

如果只看模型成本,很容易误判。如果一个 AI 客服单次会话花 0.02 元,但错答率导致投诉和赔付增加,这个功能仍然可能不划算。

3.6 商品文案生成的成本结构#

商品文案生成是一个适合理解 Token 成本的场景。

假设生成一个商品详情页,需要输入:

  • 商品标题。

  • 商品类目。

  • 规格参数。

  • 卖点。

  • 目标人群。

  • 平台规范。

  • 品牌语气。

  • 输出格式。

  • 禁用词。

输出包括:

  • 商品标题。

  • 五点卖点。

  • 详情页段落。

  • 小红书/抖音/淘宝不同渠道文案。

  • SEO 关键词。

成本风险来自:

  1. 输入资料太长。 运营把整份商品说明、竞品文案、平台规范全塞进去。

  2. 输出版本太多。 一次生成 10 个版本,看似方便,但输出 Token 翻倍增长。

  3. 批量规模大。 单个商品成本很低,但每天几千、几万商品就明显了。

  4. 返工率高。 如果生成内容质量差,需要多次重试,成本成倍增加。

  5. 审核成本被忽略。 文案生成后还需要人工校对、合规审查、平台审核。

所以商品文案生成不是简单比较“一次调用多少钱”,而要看:

单商品最终可用成本 =
首次生成成本
+ 平均重试次数 × 重试成本
+ 人工审核时间成本
+ 违规/驳回成本

3.7 智能客服的成本结构#

智能客服比商品文案更复杂,因为它是多轮对话。

一个用户可能连续问:

  1. 什么时候发货?

  2. 能不能催一下?

  3. 如果今天不发能退款吗?

  4. 我用了优惠券,退款怎么算?

  5. 那你帮我申请吧。

每一轮都可能需要订单查询、政策检索、历史对话上下文和风险判断。成本增长有几个特点:

  • 轮次越多,历史上下文越长。

  • 问题越复杂,RAG 检索资料越多。

  • 高风险问题需要人工接管。

  • 如果答案不准,用户会追问,进一步增加轮次。

因此,智能客服的成本优化不只是“换便宜模型”,更重要的是减少无效轮次:

  • 第一轮就识别意图。

  • 能用按钮和结构化信息解决的,不让用户反复自然语言输入。

  • 高频问题直接走 FAQ 或缓存。

  • 高风险问题尽早转人工。

  • 对重复问题做语义缓存。

  • 对长对话做摘要,不全量塞入。

3.8 成本、质量、体验三角#

AI 产品永远在三角之间权衡:

质量
成本 ───── 体验

想提升质量,可能要用更强模型、更多上下文、更复杂 RAG、更高人工审核,成本和延迟会上升。

想降低成本,可能要用小模型、减少上下文、缓存、模板化,但质量和灵活性可能下降。

想提升体验,可能要流式输出、预加载、减少等待、简化交互,但后端复杂度增加。

产品经理要做的不是追求单点最优,而是为不同场景设置不同策略。

例如:

场景策略
商品标题初稿小模型 + 模板 + 批处理
高价值商品详情页强模型 + 多版本 + 人工审核
普通客服 FAQ缓存 + RAG + 小模型
投诉/赔付问题RAG + 强模型辅助 + 人工确认
数据分析摘要强模型 + 结构化输出 + 结果校验
内部头脑风暴低成本模型即可

3.9 成本优化不是只砍 Token#

很多人一听 Token 成本,就以为成本优化等于压缩 Prompt。这只是一部分。

完整优化手段包括:

  1. 任务路由:简单任务用规则或小模型,复杂任务用强模型。

  2. 上下文裁剪:只保留任务相关信息。

  3. RAG 精准检索:不要把太多资料塞给模型。

  4. 缓存:高频问题、相似问题、固定说明直接复用。

  5. 批处理:批量生成商品文案、摘要、标签时统一处理。

  6. 结构化输入:用字段替代大段自然语言描述。

  7. 结构化输出:避免模型输出冗长解释。

  8. 限制重试:重试次数要有策略,不是失败就无限重跑。

  9. 人工前置:高风险或资料缺失时不要让模型反复猜。

  10. 监控异常用量:识别超长输入、异常高频用户、循环调用。

3.10 AI 商业化必须考虑用量边界#

如果你未来做 AI 项目商业化,Token 成本会影响定价。

常见模式:

  • 按账号订阅。

  • 按调用次数。

  • 按 Token 或额度包。

  • 按功能套餐。

  • 按项目交付 + 运维年费。

  • 按业务结果分成。

其中最危险的是“固定低价不限量”。如果用户使用量没有上限,模型成本可能超过收入。

所以 AI 产品定价通常需要:

  • 基础套餐包含固定额度。

  • 超出额度按量计费。

  • 高成本功能单独计费。

  • 企业版支持更高额度和私有化。

  • 后台实时展示用量。

  • 管理员可设置预算和预警。


4. 详细案例一:国内电商商品详情页批量生成#

业务背景#

一个中小电商团队每天需要上新大量商品。运营要根据供应商资料、商品图片、规格参数、平台规则,生成淘宝、抖音、小红书、拼多多等不同渠道的标题、卖点、详情页文案和短视频口播稿。

原来人工流程通常是:

供应商给资料
-> 运营整理参数
-> 参考竞品
-> 写标题和卖点
-> 适配平台格式
-> 检查禁用词
-> 上架
-> 根据点击率和转化率修改

痛点:

  • 上新慢。

  • 文案质量依赖个人经验。

  • 多平台重复改写。

  • 违规词和夸大宣传容易漏。

  • 很难快速做 A/B 测试。

相关角色#

  • 商品运营:负责上新和文案。

  • 设计/内容团队:负责图片、短视频、详情页。

  • 类目负责人:负责转化率和毛利。

  • 合规/平台规则负责人:负责禁用词和广告法风险。

  • 产品经理:设计生成流程、审核机制、指标和成本边界。

  • 研发/AI 工程:实现模型调用、模板、缓存、批处理、日志。

原始流程成本#

假设一个运营人工写一个商品详情需要 20 分钟。每天 500 个商品,需要 10000 分钟,也就是 166 小时。即使多人协作,整体上新效率也受限。

AI 可以把首次草稿生成压缩到秒级,但不能忽略审核、重试和平台适配成本。

AI 改造流程#

商品结构化资料
-> 图片/类目/参数识别
-> 文案生成 Prompt 模板
-> 平台规则和禁用词校验
-> 多版本输出
-> 人工审核
-> 上架
-> 点击率/转化率回流
-> 优化 Prompt 和模板

数据与系统依赖#

  • 商品主数据:类目、品牌、规格、价格、库存。

  • 商品图片。

  • 历史高转化文案。

  • 平台规则库。

  • 禁用词库。

  • 竞品卖点库。

  • 上架系统。

  • 数据看板:曝光、点击、转化、退款、投诉。

Token 成本估算方法#

不要一开始算精确值,先算量级。

假设每个商品:

  • 输入 Token:商品资料 800,平台规则摘要 500,Prompt 700,竞品参考 800,总计约 2800。

  • 输出 Token:标题、卖点、详情页、短视频脚本,总计约 1800。

  • 首次生成总 Token:约 4600。

  • 平均重试 0.5 次。

则:

单商品 Token 消耗 ≈ 4600 × 1.5 = 6900
每日 500 商品 ≈ 3,450,000 Token
每月 22 个工作日 ≈ 75,900,000 Token

然后再套供应商价格:

月模型成本 =
输入 Token / 1,000,000 × 输入单价
+ 输出 Token / 1,000,000 × 输出单价

这一步的目的不是追求精确到分,而是让项目评审能判断:

  • 预算是否可接受。

  • 是否需要小模型。

  • 是否需要批处理。

  • 是否需要平台规则摘要缓存。

  • 是否需要限制单商品生成版本数。

方案架构#

商品资料库
-> 字段清洗
-> 文案生成编排层
-> 类目 Prompt 模板
-> 平台规则摘要
-> 禁用词校验
-> 模型调用
-> 多版本结果
-> 人工审核工作台
-> 上架系统
-> 数据回流
-> 模板优化

关键指标#

  • 单商品上新耗时。

  • 文案一次通过率。

  • 人工修改率。

  • 平台审核驳回率。

  • 商品点击率。

  • 商品转化率。

  • 单商品生成成本。

  • 多版本测试收益。

主要风险#

  • 生成内容夸大宣传。

  • 商品参数被模型改写错误。

  • 平台规则更新但知识库未更新。

  • 批量生成导致同质化严重。

  • 输出版本过多导致成本上升。

  • 人工审核被低估。

复盘结论#

这个场景适合用 AI,但产品设计重点不是“让模型会写文案”,而是控制整个内容生产系统:

  • 输入要结构化。

  • 平台规则要可维护。

  • 输出要可审核。

  • 成本要按商品和渠道核算。

  • 效果要回流到模板和 Prompt。

如果只做一个“输入商品信息,输出文案”的工具,价值有限。真正有价值的是把 AI 嵌入上新流程,形成内容生产流水线。


5. 详细案例二:智能客服多轮对话成本控制#

业务背景#

一个平台型业务每天有大量客服咨询,包括物流、退款、优惠券、售后、活动规则、账号问题。团队希望引入 AI 客服降低人工压力。

原始流程:

用户咨询
-> 机器人 FAQ 命中
-> 命不中转人工
-> 人工查订单/规则
-> 回复用户
-> 创建工单或关闭会话

痛点:

  • FAQ 命中率有限。

  • 用户表达口语化,关键词匹配不准。

  • 人工处理重复问题多。

  • 高峰期响应慢。

  • 新活动上线后客服压力激增。

AI 改造流程#

用户输入
-> 意图识别
-> 风险分级
-> 订单/用户信息查询
-> RAG 检索政策
-> 生成回答
-> 低风险自动回复
-> 高风险转人工
-> 用户反馈
-> 质检与评估

Token 成本问题#

智能客服最容易成本失控,因为它是多轮对话。

假设:

  • 平均每个会话 5 轮。

  • 每轮输入包含历史摘要、用户问题、政策片段和系统规则。

  • 每轮输出 200-500 Token。

如果每一轮都塞完整历史记录,成本会随轮次增长:

第 1 轮:用户问题 + 政策片段
第 2 轮:第 1 轮历史 + 新问题 + 政策片段
第 3 轮:前 2 轮历史 + 新问题 + 政策片段
...

这会带来两个问题:

  • 成本增长。

  • 模型注意力被历史信息稀释。

成本优化策略#

更合理的方式:

  1. 意图先行:先用轻量模型或规则判断问题类型。

  2. 高频问题缓存:物流时效、发票规则、活动说明等直接缓存。

  3. 历史对话摘要:不保留全量历史,只保留当前任务状态。

  4. RAG 精检索:只给最相关 3-5 个片段。

  5. 风险分级:退款、赔付、投诉、法律威胁直接转人工或强约束。

  6. 结构化按钮:能用按钮收集信息,就不要让用户反复自然语言描述。

  7. 模型路由:简单 FAQ 用便宜模型,复杂投诉用强模型辅助。

方案架构#

用户消息
-> 意图分类器
-> 风险分级器
-> 会话状态摘要
-> 知识库检索
-> 模型路由
-> 小模型:FAQ/低风险
-> 强模型:复杂解释/多约束
-> 回复生成
-> 置信度判断
-> 自动回复或人工接管
-> 反馈与质检

关键指标#

  • 自助解决率。

  • 人工接管率。

  • 单会话平均 Token。

  • 单会话平均成本。

  • 平均轮次。

  • 首次响应时间。

  • 错答率。

  • 用户满意度。

  • 高风险问题拦截率。

主要风险#

  • AI 错误承诺退款或赔付。

  • 活动规则过期。

  • 用户绕过安全限制诱导模型输出不当内容。

  • 长对话中模型忘记关键上下文。

  • 成本被高频用户或异常流量打穿。

复盘结论#

智能客服不是越智能越好,而是要把低风险、高频、重复问题自动化,把高风险问题尽早识别并交给人工。Token 成本控制的核心不是“回答少一点”,而是“少走无效轮次、少塞无关上下文、少让强模型处理简单任务”。


6. 动手实操任务#

任务:估算 3 个 AI 功能的 Token 成本#

请选择 3 个你熟悉的场景,例如:

  1. 商品详情页生成。

  2. 智能客服问答。

  3. 合同条款摘要。

  4. 企业制度问答。

  5. 运营日报生成。

按下面模板估算。

场景单次输入内容估算输入 Token单次输出内容估算输出 Token日调用量重试/多轮系数日 Token 总量成本风险
商品文案生成商品资料 + 规则 + Prompt标题 + 卖点 + 详情

验收标准#

合格:

  1. 至少估算 3 个场景。

  2. 每个场景区分输入 Token 和输出 Token。

  3. 每个场景写明日调用量。

  4. 每个场景识别至少 1 个成本风险。

优秀:

  1. 能提出至少 2 个成本优化策略。

  2. 能说明成本优化是否会影响质量或体验。

  3. 能把成本和业务指标联系起来,例如转化率、人工节省、客诉率。


7. 测试题与参考答案#

理解题#

1. Token 为什么不等于中文的字或英文的词? 参考答案:Token 是模型 tokenizer 切分后的文本片段。中文、英文、代码、数字、符号的切分方式不同,一个词可能被拆成多个 Token,一个中文短语也可能被拆成不同片段。

2. 为什么企业 AI 问答里用户问题很短,但成本可能很高? 参考答案:因为输入不只包括用户问题,还包括系统提示词、历史对话、RAG 检索资料、权限规则、输出格式和安全约束。

3. 上下文窗口越大是否一定越好? 参考答案:不是。上下文越大通常成本越高、延迟越高,模型也可能忽略中间信息。产品应只放当前任务需要的信息。

4. 智能客服为什么容易成本失控? 参考答案:多轮对话会带来历史上下文累积;复杂问题需要检索资料;用户追问会增加轮次;高风险问题如果不及时转人工,会造成重复调用和错误成本。

5. 成本优化是否等于压缩 Prompt? 参考答案:不是。Prompt 压缩只是手段之一,还包括任务路由、缓存、上下文裁剪、RAG 精检索、批处理、结构化输入输出、限制重试、异常用量监控等。

应用题#

6. 商品详情页生成如何降低成本但不明显降低质量? 参考答案:结构化商品输入;平台规则做摘要缓存;按类目维护 Prompt 模板;先用小模型生成初稿,高价值商品再用强模型优化;限制输出版本数;用禁用词和规则系统做后处理;将点击率和转化率回流优化模板。

7. 智能客服什么时候不应该继续调用模型? 参考答案:当问题涉及赔付、退款审批、法律威胁、用户情绪激烈、资料不足、低置信、权限不足或多轮未解决时,应转人工或触发确定性规则,而不是继续让模型猜。


8. 当日产出模板#

8.1 Token 成本估算表#

AI 功能用户任务输入 Token 构成输出 Token 构成日调用量多轮/重试系数日 Token成本优化策略关联业务指标

8.2 成本-质量-体验权衡表#

场景当前方案成本风险质量要求体验要求推荐优化可能副作用
高/中/低高/中/低

9. 延伸阅读资料#

  1. 模型供应商官方价格页:用于查看输入/输出 Token 单价。不要死记价格,重点掌握公式和估算方式。

  2. OpenAI tokenizer / tiktoken 类工具:用于理解文本如何被切成 Token。

  3. 本地材料:AI产品商业化模式.pptxAI产品性能优化.pptx大模型API产品化.pptx

  4. 飞书《AI每日同步》Day1、Day4、Day6,可对照 Token、API 产品化和商业化内容。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Token 与成本意识
https://www.shanfengpm.com/posts/2026-07-23-token-cost-awareness/
作者
山风
发布于
2025-12-15
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author
山风
12年产品经验,持续记录产品思考、业务设计、数据分析和团队管理实践。
公告
欢迎来到我的博客!我将竭力帮助产品人夯实需求拆解、方案设计、项目管控、数据决策的核心专业能力,精准把握行业趋势与技术脉搏,在复杂商业场景中实现产品价值的精准锚定与高效落地,共攀产品专业主义的进阶之巅。
站点统计
文章
15
分类
4
标签
46
总字数
126,513
运行时长
0
最后活动
0 天前
站点信息
构建平台
Cloudflare Pages
博客版本
Firefly v6.14.3
文章许可
CC BY-NC-SA 4.0