多模态 AI 基础

6227 字
31 分钟
多模态 AI 基础

1. 今日主题与一句话结论#

主题:多模态 AI 基础

一句话结论: 多模态 AI 让模型不只处理文字,还能理解图片、语音、视频、表格和屏幕内容;对产品经理来说,它的价值不是“模型会看图听音”,而是把原本分散在视觉、语音、文档和业务系统里的信息合成一个可执行的任务流程。

今天开始把视角从“文本大模型”扩展到“多模态 AI”。这一步很重要,因为真实业务并不是只有文字。电商有商品图、详情页、评价图片、短视频;客服有语音、截图、聊天记录;财务有发票、合同、表格;会议有录音、PPT、白板;产品和设计有原型图、截图、埋点表;线下业务有门店照片、货架图片、监控视频。

如果 AI 只能处理用户输入的一段文字,它能解决的任务有限。多模态 AI 的产品价值在于:

让 AI 直接读懂业务现场,而不是要求用户先把现场转成文字。

这会改变很多工作流。例如:

  • 用户不用描述商品图片,AI 可以直接识别款式、材质、颜色和缺陷。

  • 客服不用让用户反复解释问题,AI 可以看截图、读订单、听语音。

  • 财务不用人工录入发票字段,AI 可以识别票据并校验规则。

  • 会议纪要不只转文字,还能结合屏幕共享、PPT 和白板内容生成待办。

  • 设计评审不只看文字需求,还能理解原型、截图和交互状态。

但多模态也不是“输入越多越智能”。输入越复杂,错误来源越多,成本越高,权限和隐私风险也更高。产品经理必须知道:哪些任务真的需要多模态,哪些任务只需要结构化数据,哪些任务即使模型能识别,也不应该让它做最终判断。


2. 学习目标#

  1. 解释文本、图片、语音、视频、表格、屏幕理解分别能解决什么业务问题。

  2. 判断一个业务流程是否值得加入图片、语音或视频输入,而不是盲目做“多模态化”。

  3. 设计一个多模态 AI 功能的输入、处理、输出、校验和人工兜底流程。

  4. 识别多模态 AI 的关键风险:识别错误、上下文缺失、隐私泄露、版权风险、成本失控和责任边界。

  5. 产出一份多模态场景清单,为后续电商、客服、内容、BI 和 Agent 场景做准备。


3. 深度阅读:多模态不是多加几个输入框#

3.1 什么是多模态#

“模态”可以理解为信息的类型。常见模态包括:

  • 文本:问题、文档、聊天记录、合同、评论、代码。

  • 图片:商品图、票据、截图、设计稿、现场照片。

  • 语音:客服录音、会议录音、语音消息、访谈录音。

  • 视频:短视频、监控、课程、直播回放、屏幕录制。

  • 表格:订单表、财务表、库存表、数据报表。

  • 屏幕:网页、App 截图、后台系统界面、操作过程。

多模态 AI 指模型能处理其中一种以上的信息,并在同一个任务中综合理解。例如:

商品图片 + 商品标题 + 类目属性 -> 生成商品卖点
用户语音 + 客服聊天记录 + 订单状态 -> 判断用户意图
发票图片 + 报销制度 + 员工信息 -> 识别字段并提示风险
会议录音 + PPT 截图 + 聊天消息 -> 生成会议纪要和待办

关键点是“综合理解”。如果只是先用 OCR 把图片转文字,再把文字给模型,这也可以算多模态工作流,但它不是完整的视觉理解。真正的多模态系统会同时利用图像内容、文本信息、业务数据和上下文。

3.2 为什么多模态对产品经理重要#

很多业务问题之所以难,不是因为用户不会表达,而是因为信息原本就不在文字里。

例如电商售后:

用户说:这个包有瑕疵,我要退货。

如果只看文字,系统不知道瑕疵是什么。用户可能需要继续描述:

  • 是划痕、开线、掉色还是色差?

  • 在哪个部位?

  • 是否影响使用?

  • 是否属于运输损坏?

  • 是否符合平台退货规则?

如果用户上传照片,多模态 AI 可以辅助识别瑕疵类型和位置,再结合订单、商品类目和售后规则给客服提供处理建议。

再看产品经理自己的工作。需求评审经常涉及:

  • 原型截图。

  • 用户流程图。

  • 埋点表。

  • 数据看板。

  • 竞品页面截图。

  • 客服反馈截图。

如果 AI 只能读文字,它无法直接理解这些材料。多模态能力会让 AI 从“文档助手”升级为“工作现场助手”。

3.3 文本模态:AI 产品的基础层#

文本仍然是最基础的模态。即使多模态系统最终处理图片和语音,很多中间结果仍会转成文本或结构化字段。

文本适合:

  • 问答。

  • 总结。

  • 改写。

  • 信息抽取。

  • 分类。

  • 翻译。

  • 代码生成。

  • 报告生成。

文本的优势是可编辑、可检索、可审计、成本相对低。产品上常见做法是把其他模态转换成文本或结构化数据,再进入后续流程:

语音 -> 转写文本 -> 摘要/意图识别/质检
图片 -> OCR 文本 -> 字段抽取/规则校验
视频 -> 关键帧 + 转写文本 -> 内容理解/摘要

但要注意:转换过程会丢信息。语音里的情绪、停顿、语气,图片里的布局、颜色、空间关系,视频里的动作变化,都不是普通文本能完整表达的。

3.4 图片理解:从 OCR 到视觉语义#

图片理解可以分成几个层次:

层次能力示例
OCR识别图片中的文字发票、截图、合同扫描件
物体识别识别图中有什么商品、配件、包装、缺陷
属性识别识别颜色、材质、形状、风格红色、棉麻、圆领、极简
场景理解判断图片发生了什么门店货架缺货、包裹破损
关系理解判断对象之间关系商品和标签是否一致
审美/质量判断判断清晰度、构图、违禁元素商品主图是否合规

产品经理要区分这些层次。很多团队说“让 AI 看图”,但实际上需求可能只是 OCR,也可能是复杂视觉判断。两者成本、准确率、验收方式完全不同。

例如票据识别主要是 OCR + 字段抽取 + 规则校验;商品图生成卖点则需要视觉语义;质检图片判断是否破损,则需要识别缺陷和部位。

3.5 语音理解:不只是转文字#

语音 AI 常见第一步是 ASR,也就是语音转文字。它适合:

  • 会议转写。

  • 客服录音转写。

  • 用户访谈整理。

  • 语音消息转文本。

  • 课程字幕。

但语音里还有文本之外的信息:

  • 情绪:愤怒、焦虑、犹豫、满意。

  • 语速:是否急促。

  • 停顿:是否不确定。

  • 重音:用户真正强调什么。

  • 多人说话:谁在说,是否打断。

例如客服质检,如果只看转写文本,可能漏掉客服语气差、抢话、长时间沉默等问题。多模态语音理解可以帮助识别情绪和互动质量。

产品上要明确:语音识别结果不应直接作为唯一事实。口音、噪音、多人重叠、专业术语都会导致转写错误。因此高风险流程要保留原音频和可回听能力。

3.6 视频理解:时间维度带来新复杂度#

视频是图片 + 语音 + 时间。它能表达动作、过程和变化。

典型场景:

  • 短视频内容审核。

  • 直播切片和摘要。

  • 课程视频生成笔记。

  • 门店巡检视频分析。

  • 设备故障视频辅助诊断。

  • 用户录屏反馈 Bug。

视频理解的难点在于:不能只看某一帧。很多信息来自时间变化。

例如用户录屏反馈:

打开页面 -> 点击付款 -> loading 很久 -> 弹出错误 -> 返回上一页

如果只截最后一张图,无法理解操作过程。AI 需要结合时间序列、屏幕文本、用户操作和错误提示,才能生成有效问题描述。

视频成本也更高。产品设计中不应默认把整段视频都给模型。更合理的流程是:

视频上传
-> 抽取关键帧
-> 语音转写
-> 操作事件识别
-> 模型综合摘要
-> 人工校验

3.7 表格理解:AI+BI 的基础能力#

表格是业务系统中最常见的信息形态。订单、库存、财务、用户增长、广告投放、客服工单都以表格存在。

表格理解包括:

  • 识别表头和字段含义。

  • 理解行列关系。

  • 识别指标、维度、口径。

  • 从表格中提取异常。

  • 生成摘要和结论。

  • 转成可查询的结构化数据。

一个常见误区是把表格截图直接给模型,让它“分析一下”。这样风险很高:

  • 截图 OCR 可能错。

  • 表头层级可能丢失。

  • 数字单位可能误读。

  • 指标口径可能不清楚。

  • 模型可能编造归因。

更可靠的方式是让 AI 接入结构化数据或 CSV/Excel,并明确指标定义。后续 Day 36 到 Day 42 会深入 AI+BI,这里先建立直觉:表格不是普通文本,它需要口径、权限、计算规则和可追溯查询。

3.8 屏幕理解:从看截图到理解操作流#

屏幕理解是近两年 AI 产品很重要的方向。模型可以读取网页、App、后台系统截图,理解按钮、表单、列表、弹窗和错误提示。

它适合:

  • 根据截图生成 Bug 报告。

  • 分析产品页面信息架构。

  • 评审设计稿和实现差异。

  • 自动填写简单表单。

  • 解释后台操作步骤。

  • 帮客服理解用户截图。

但屏幕理解要谨慎。截图里可能包含隐私信息、客户资料、订单、手机号、身份证、财务数据。产品经理必须设计:

  • 上传权限。

  • 敏感信息脱敏。

  • 保存周期。

  • 谁能查看。

  • 是否用于训练。

  • 操作前确认。

如果屏幕理解进一步连接到 Agent,让 AI 能点击按钮、提交表单、修改数据,风险会显著上升。此时必须做工具权限分级和人工确认。

3.9 多模态工作流如何设计#

多模态功能不能只写成:

用户上传图片 -> AI 输出结果

至少应该拆成:

输入采集
-> 格式校验
-> 质量检测
-> 预处理
-> 模型理解
-> 结构化抽取
-> 业务规则校验
-> 结果展示
-> 用户确认
-> 人工兜底
-> 日志和反馈

举例:发票识别报销助手。

上传发票图片
-> 检查清晰度和完整性
-> OCR 识别字段
-> 抽取发票代码、金额、税号、日期
-> 校验是否重复报销
-> 校验金额是否符合制度
-> 生成报销单草稿
-> 用户确认
-> 财务审核

这里 AI 负责识别和辅助填写,系统负责查重和规则校验,财务负责高风险审核。不能让模型仅凭图片直接判断“可以报销”。

3.10 多模态场景判断公式#

产品经理可以用下面公式判断是否值得做多模态:

多模态价值 =
非文本信息的重要性
× 高频程度
× 人工识别成本
× 识别后可执行性
× 错误可控性

逐项解释:

非文本信息的重要性:如果图片、语音或视频只是附属信息,不一定需要多模态。 高频程度:低频场景很难支撑模型接入和流程改造成本。 人工识别成本:人工看图、听录音、看视频是否耗时。 识别后可执行性:识别结果能不能进入流程,例如生成工单、填表、审核、推荐。 错误可控性:识别错了是否可以人工复核、撤回或重新上传。

如果一个场景只是为了演示“AI 能看图”,但识别结果不能进入业务流程,那价值有限。

3.11 多模态的主要风险#

多模态 AI 比纯文本更容易带来复杂风险。

风险示例控制方式
识别错误发票金额识别错字段校验、人工确认
输入质量差图片模糊、录音嘈杂质量检测、重新上传
上下文缺失只看截图不知道订单状态接入业务系统
隐私泄露截图含手机号、身份证脱敏、权限、保存周期
版权风险用商品图生成侵权内容授权校验、素材来源管理
成本失控大量视频直接给模型关键帧、采样、分层处理
责任边界AI 判断“商品破损可赔”规则系统和人工审核

产品经理要在 PRD 中把这些风险写清楚。多模态输入越丰富,越不能省略数据治理和权限设计。


4. 案例一:电商商品图识别生成详情页素材#

业务背景#

一个中小电商团队每天要上新大量商品。供应商提供的资料质量参差不齐,有的只有几张商品图和简单标题。运营需要补充标题、卖点、详情页文案和短视频口播稿。

原来运营需要人工看图:

  • 判断商品类目。

  • 识别颜色、材质、款式、配件。

  • 提炼卖点。

  • 对照平台规则写文案。

  • 检查是否夸大宣传。

团队希望用多模态 AI 加速商品上新。

相关角色#

  • 商品运营:负责上新和文案审核。

  • 视觉/内容团队:负责图片、短视频和详情页。

  • 类目负责人:关注点击率、转化率和退货率。

  • 合规负责人:关注广告法、平台禁词和侵权。

  • 产品经理:负责流程、字段、审核和指标。

  • AI 工程:负责图片理解、文案生成、规则校验。

原始流程#

供应商给商品图
-> 运营人工看图
-> 补充商品属性
-> 写标题和卖点
-> 适配平台规则
-> 人工审核
-> 上架

痛点:

  • 上新速度慢。

  • 图片信息需要人工逐张识别。

  • 文案质量依赖运营经验。

  • 多平台改写重复。

  • 商品参数容易被误写。

AI 改造流程#

商品图片上传
-> 图片质量检测
-> 视觉识别:类目、颜色、材质、款式、部件
-> OCR 识别包装或吊牌文字
-> 结合供应商标题和规格
-> 生成结构化商品属性
-> 生成标题、卖点、详情页文案
-> 禁用词和夸大宣传校验
-> 人工审核
-> 上架
-> 点击率/转化率/退货原因回流

数据与系统依赖#

  • 商品图片。

  • 商品类目体系。

  • 标准属性字典。

  • 供应商资料。

  • 平台规则和禁用词。

  • 历史高转化文案。

  • 上架系统。

  • 点击、转化、退货和投诉数据。

方案架构#

图片输入
-> 质量检测
-> 清晰度
-> 主体完整性
-> 是否水印/违规
-> 多模态识别
-> 类目
-> 颜色
-> 材质
-> 款式
-> OCR
-> 商品属性结构化
-> 文案生成
-> 标题
-> 卖点
-> 详情页
-> 短视频脚本
-> 规则校验
-> 人工审核
-> 数据回流

关键指标#

  • 单商品上新耗时。

  • 商品属性识别准确率。

  • 文案一次通过率。

  • 人工修改率。

  • 平台审核驳回率。

  • 点击率。

  • 转化率。

  • 退货原因中“描述不符”占比。

  • 单商品 AI 成本。

主要风险#

  • 模型把材质识别错,例如把 PU 说成真皮。

  • 视觉识别没有依据却生成确定卖点。

  • 图片里的装饰品被当成商品配件。

  • 生成文案夸大功效。

  • 侵权图片或品牌元素未识别。

  • 商品图和实际商品不一致,导致退货。

复盘结论#

这个场景适合多模态,因为商品图片承载了大量非文本信息,人工识别成本高,识别结果可以进入上新流程。但 AI 不应直接发布商品。更稳的设计是:模型负责识别和生成草稿,规则系统负责校验,运营负责最终审核,数据回流负责持续优化。


5. 案例二:会议转写生成纪要和待办#

业务背景#

一个产品团队每周有需求评审、项目例会、增长复盘和跨部门同步会。会议结束后,项目经理需要整理纪要、结论、待办、责任人和时间点。

传统会议纪要只基于人工记录或录音转写,问题是:

  • 口头讨论很长,重点分散。

  • PPT 或原型图里的内容没有进入转写。

  • 白板上的流程和草图没有被记录。

  • 责任人和时间点容易漏。

  • 会后大家对结论理解不一致。

相关角色#

  • 产品经理:负责需求背景和方案。

  • 项目经理:负责纪要、排期和跟进。

  • 研发:关注技术方案和风险。

  • 设计:关注交互和视觉变更。

  • 运营/业务:关注上线目标和指标。

  • 管理者:关注结论、资源和风险。

原始流程#

开会
-> 人工记录
-> 会后补听录音
-> 整理纪要
-> 手动提取待办
-> 发群确认
-> 后续跟进

痛点:

  • 记录耗时。

  • 转写文本很长,不易读。

  • 屏幕共享和 PPT 内容丢失。

  • 责任人、截止时间和决策依据不完整。

AI 改造流程#

会议录音
-> 语音转写
-> 说话人识别
-> PPT/屏幕关键帧抽取
-> 白板或截图 OCR
-> 结合会议议程
-> 生成纪要、结论、待办、风险
-> 参会人确认
-> 同步到项目管理工具

数据与系统依赖#

  • 会议录音。

  • 参会人名单。

  • 会议议程。

  • PPT 或屏幕截图。

  • 白板图片。

  • 项目管理工具。

  • 历史决策记录。

  • 需求文档和 PRD。

方案架构#

会议材料
-> 音频处理
-> 转写
-> 说话人识别
-> 视觉处理
-> PPT 关键帧
-> 白板 OCR
-> 屏幕内容摘要
-> 内容融合
-> 议题
-> 结论
-> 分歧
-> 待办
-> 风险
-> 人工确认
-> 任务同步
-> 复盘归档

关键指标#

  • 纪要生成耗时。

  • 语音转写准确率。

  • 待办提取准确率。

  • 责任人识别准确率。

  • 参会人修改率。

  • 会后确认时间。

  • 任务遗漏率。

  • 项目延期原因中“沟通不清”占比变化。

主要风险#

  • 语音识别错误导致结论错误。

  • 说话人识别错,把责任人归错。

  • PPT 关键页未捕获。

  • AI 把讨论中的假设写成最终决策。

  • 会议涉及敏感商业信息,存储和权限不清。

  • 自动同步任务前未经过确认。

复盘结论#

会议纪要适合多模态,因为会议决策来自声音、屏幕、文档和上下文的组合。但产品设计必须保留人工确认。AI 可以生成纪要草稿和待办建议,不能把未经确认的内容直接变成正式承诺。


6. 动手实操任务#

任务:找 3 个业务流程,判断能否加入多模态输入#

请选择你熟悉的 3 个业务流程,例如:

  1. 商品上新。

  2. 智能客服售后。

  3. 会议纪要。

  4. 发票报销。

  5. 用户访谈整理。

  6. 门店巡检。

  7. 竞品页面分析。

  8. Bug 反馈处理。

按下面模板分析。

流程当前输入可加入的多模态输入AI 可完成的任务需要的业务系统风险是否值得做
商品上新标题、规格商品图、包装图属性识别、卖点生成商品库、类目库、规则库材质误识别值得

验收标准#

合格:

  1. 至少分析 3 个业务流程。

  2. 每个流程说明当前输入和新增多模态输入。

  3. 每个流程写清楚 AI 输出如何进入业务流程。

  4. 每个流程至少识别 1 个风险。

优秀:

  1. 能区分“只是识别”与“可执行流程改造”。

  2. 能说明哪些结果必须人工确认。

  3. 能估算多模态输入带来的成本、效率和质量影响。


7. 测试题与参考答案#

理解题#

1. 多模态 AI 的“模态”是什么意思? 参考答案:模态是信息类型,例如文本、图片、语音、视频、表格和屏幕内容。多模态 AI 指模型能处理并综合多种信息类型。

2. 为什么多模态 AI 不只是 OCR? 参考答案:OCR 主要识别图片中的文字,而多模态理解还包括物体、属性、场景、关系、动作、语音情绪、屏幕布局等信息,并能与业务上下文结合。

3. 多模态功能为什么通常需要人工确认? 参考答案:图片、语音、视频识别可能受清晰度、噪音、角度、遮挡和上下文影响。涉及金额、审批、赔付、发布等高风险动作时,必须由人或规则系统确认。

4. 视频理解为什么比图片理解更复杂? 参考答案:视频包含时间维度,很多信息来自动作和过程。只看单帧可能误判,需要结合关键帧、音频、字幕、操作序列和上下文。

5. 多模态 AI 的主要产品风险有哪些? 参考答案:识别错误、输入质量差、上下文缺失、隐私泄露、版权风险、成本失控、责任边界不清。

应用题#

6. 如果做发票报销助手,多模态 AI 应该负责什么,不应该负责什么? 参考答案:AI 可以识别发票字段、抽取金额、日期、税号,生成报销单草稿,并提示可能缺失的信息。但是否重复报销、是否符合制度、是否最终通过,应由规则系统和财务审核决定。

7. 商品图生成文案如何降低“描述不符”风险? 参考答案:需要把视觉识别结果结构化,标注置信度;对材质、功效、品牌等高风险字段做人工确认;接入平台禁词和广告法规则;上线后监控退货原因和用户反馈。


8. 当日产出模板#

8.1 多模态场景清单#

场景现有输入新增模态AI 任务输出形态人工确认点核心指标
商品上新标题、规格图片属性识别、文案生成商品属性、卖点材质、功效、品牌上新耗时、修改率
会议纪要录音PPT、白板纪要、待办、风险文档、任务结论和责任人纪要耗时、遗漏率

8.2 多模态输入输出流程表#

阶段关键问题示例
输入采集用户上传什么,格式是否限制图片、录音、视频、截图
质量检测是否清晰、完整、可识别图片模糊则重传
预处理是否需要 OCR、转写、抽帧语音转文字、视频抽关键帧
模型理解模型要识别什么类目、字段、情绪、动作
结构化输出输出是否可进入系统JSON 字段、工单、纪要
规则校验哪些必须系统判断金额、权限、库存、赔付
人工确认哪些不能自动提交发布、审批、赔付、发券
日志反馈如何评估和复盘原输入、模型输出、人工修改

8.3 多模态 PRD 检查清单#

功能场景:
目标用户:
当前流程:
新增模态:
输入格式:
输入质量要求:
模型识别目标:
结构化字段:
业务系统依赖:
必须人工确认的字段:
高风险动作:
隐私和权限:
成本估算:
验收指标:
失败兜底:

9. 延伸阅读资料#

  1. Token 与成本意识:多模态输入通常更贵,要设计抽帧、压缩和分层处理。
  2. 大模型为什么会幻觉:多模态识别错误同样会诱发错误结论。
  3. 内部可收集材料:商品图、客服截图、会议录音、发票样本、用户录屏、设计稿截图,用于建立多模态评估集。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

多模态 AI 基础
https://www.shanfengpm.com/posts/2026-01-07-multimodal-ai-basics/
作者
山风
发布于
2026-01-07
许可协议
CC BY-NC-SA 4.0
本文首发于「山风blog」,作者:山风(余涛)。欢迎转发、分享本文链接, 但禁止任何形式的未授权转载、摘编、改写或商业使用
推荐文章大模型
Profile Image of the Author
山风
12年产品经验,持续记录产品思考、业务设计、数据分析和团队管理实践。
站点统计