多模态 AI 基础
1. 今日主题与一句话结论
主题:多模态 AI 基础
一句话结论: 多模态 AI 让模型不只处理文字,还能理解图片、语音、视频、表格和屏幕内容;对产品经理来说,它的价值不是“模型会看图听音”,而是把原本分散在视觉、语音、文档和业务系统里的信息合成一个可执行的任务流程。
今天开始把视角从“文本大模型”扩展到“多模态 AI”。这一步很重要,因为真实业务并不是只有文字。电商有商品图、详情页、评价图片、短视频;客服有语音、截图、聊天记录;财务有发票、合同、表格;会议有录音、PPT、白板;产品和设计有原型图、截图、埋点表;线下业务有门店照片、货架图片、监控视频。
如果 AI 只能处理用户输入的一段文字,它能解决的任务有限。多模态 AI 的产品价值在于:
让 AI 直接读懂业务现场,而不是要求用户先把现场转成文字。
这会改变很多工作流。例如:
-
用户不用描述商品图片,AI 可以直接识别款式、材质、颜色和缺陷。
-
客服不用让用户反复解释问题,AI 可以看截图、读订单、听语音。
-
财务不用人工录入发票字段,AI 可以识别票据并校验规则。
-
会议纪要不只转文字,还能结合屏幕共享、PPT 和白板内容生成待办。
-
设计评审不只看文字需求,还能理解原型、截图和交互状态。
但多模态也不是“输入越多越智能”。输入越复杂,错误来源越多,成本越高,权限和隐私风险也更高。产品经理必须知道:哪些任务真的需要多模态,哪些任务只需要结构化数据,哪些任务即使模型能识别,也不应该让它做最终判断。
2. 学习目标
-
解释文本、图片、语音、视频、表格、屏幕理解分别能解决什么业务问题。
-
判断一个业务流程是否值得加入图片、语音或视频输入,而不是盲目做“多模态化”。
-
设计一个多模态 AI 功能的输入、处理、输出、校验和人工兜底流程。
-
识别多模态 AI 的关键风险:识别错误、上下文缺失、隐私泄露、版权风险、成本失控和责任边界。
-
产出一份多模态场景清单,为后续电商、客服、内容、BI 和 Agent 场景做准备。
3. 深度阅读:多模态不是多加几个输入框
3.1 什么是多模态
“模态”可以理解为信息的类型。常见模态包括:
-
文本:问题、文档、聊天记录、合同、评论、代码。
-
图片:商品图、票据、截图、设计稿、现场照片。
-
语音:客服录音、会议录音、语音消息、访谈录音。
-
视频:短视频、监控、课程、直播回放、屏幕录制。
-
表格:订单表、财务表、库存表、数据报表。
-
屏幕:网页、App 截图、后台系统界面、操作过程。
多模态 AI 指模型能处理其中一种以上的信息,并在同一个任务中综合理解。例如:
商品图片 + 商品标题 + 类目属性 -> 生成商品卖点用户语音 + 客服聊天记录 + 订单状态 -> 判断用户意图发票图片 + 报销制度 + 员工信息 -> 识别字段并提示风险会议录音 + PPT 截图 + 聊天消息 -> 生成会议纪要和待办关键点是“综合理解”。如果只是先用 OCR 把图片转文字,再把文字给模型,这也可以算多模态工作流,但它不是完整的视觉理解。真正的多模态系统会同时利用图像内容、文本信息、业务数据和上下文。
3.2 为什么多模态对产品经理重要
很多业务问题之所以难,不是因为用户不会表达,而是因为信息原本就不在文字里。
例如电商售后:
用户说:这个包有瑕疵,我要退货。如果只看文字,系统不知道瑕疵是什么。用户可能需要继续描述:
-
是划痕、开线、掉色还是色差?
-
在哪个部位?
-
是否影响使用?
-
是否属于运输损坏?
-
是否符合平台退货规则?
如果用户上传照片,多模态 AI 可以辅助识别瑕疵类型和位置,再结合订单、商品类目和售后规则给客服提供处理建议。
再看产品经理自己的工作。需求评审经常涉及:
-
原型截图。
-
用户流程图。
-
埋点表。
-
数据看板。
-
竞品页面截图。
-
客服反馈截图。
如果 AI 只能读文字,它无法直接理解这些材料。多模态能力会让 AI 从“文档助手”升级为“工作现场助手”。
3.3 文本模态:AI 产品的基础层
文本仍然是最基础的模态。即使多模态系统最终处理图片和语音,很多中间结果仍会转成文本或结构化字段。
文本适合:
-
问答。
-
总结。
-
改写。
-
信息抽取。
-
分类。
-
翻译。
-
代码生成。
-
报告生成。
文本的优势是可编辑、可检索、可审计、成本相对低。产品上常见做法是把其他模态转换成文本或结构化数据,再进入后续流程:
语音 -> 转写文本 -> 摘要/意图识别/质检图片 -> OCR 文本 -> 字段抽取/规则校验视频 -> 关键帧 + 转写文本 -> 内容理解/摘要但要注意:转换过程会丢信息。语音里的情绪、停顿、语气,图片里的布局、颜色、空间关系,视频里的动作变化,都不是普通文本能完整表达的。
3.4 图片理解:从 OCR 到视觉语义
图片理解可以分成几个层次:
| 层次 | 能力 | 示例 |
|---|---|---|
| OCR | 识别图片中的文字 | 发票、截图、合同扫描件 |
| 物体识别 | 识别图中有什么 | 商品、配件、包装、缺陷 |
| 属性识别 | 识别颜色、材质、形状、风格 | 红色、棉麻、圆领、极简 |
| 场景理解 | 判断图片发生了什么 | 门店货架缺货、包裹破损 |
| 关系理解 | 判断对象之间关系 | 商品和标签是否一致 |
| 审美/质量判断 | 判断清晰度、构图、违禁元素 | 商品主图是否合规 |
产品经理要区分这些层次。很多团队说“让 AI 看图”,但实际上需求可能只是 OCR,也可能是复杂视觉判断。两者成本、准确率、验收方式完全不同。
例如票据识别主要是 OCR + 字段抽取 + 规则校验;商品图生成卖点则需要视觉语义;质检图片判断是否破损,则需要识别缺陷和部位。
3.5 语音理解:不只是转文字
语音 AI 常见第一步是 ASR,也就是语音转文字。它适合:
-
会议转写。
-
客服录音转写。
-
用户访谈整理。
-
语音消息转文本。
-
课程字幕。
但语音里还有文本之外的信息:
-
情绪:愤怒、焦虑、犹豫、满意。
-
语速:是否急促。
-
停顿:是否不确定。
-
重音:用户真正强调什么。
-
多人说话:谁在说,是否打断。
例如客服质检,如果只看转写文本,可能漏掉客服语气差、抢话、长时间沉默等问题。多模态语音理解可以帮助识别情绪和互动质量。
产品上要明确:语音识别结果不应直接作为唯一事实。口音、噪音、多人重叠、专业术语都会导致转写错误。因此高风险流程要保留原音频和可回听能力。
3.6 视频理解:时间维度带来新复杂度
视频是图片 + 语音 + 时间。它能表达动作、过程和变化。
典型场景:
-
短视频内容审核。
-
直播切片和摘要。
-
课程视频生成笔记。
-
门店巡检视频分析。
-
设备故障视频辅助诊断。
-
用户录屏反馈 Bug。
视频理解的难点在于:不能只看某一帧。很多信息来自时间变化。
例如用户录屏反馈:
打开页面 -> 点击付款 -> loading 很久 -> 弹出错误 -> 返回上一页如果只截最后一张图,无法理解操作过程。AI 需要结合时间序列、屏幕文本、用户操作和错误提示,才能生成有效问题描述。
视频成本也更高。产品设计中不应默认把整段视频都给模型。更合理的流程是:
视频上传-> 抽取关键帧-> 语音转写-> 操作事件识别-> 模型综合摘要-> 人工校验3.7 表格理解:AI+BI 的基础能力
表格是业务系统中最常见的信息形态。订单、库存、财务、用户增长、广告投放、客服工单都以表格存在。
表格理解包括:
-
识别表头和字段含义。
-
理解行列关系。
-
识别指标、维度、口径。
-
从表格中提取异常。
-
生成摘要和结论。
-
转成可查询的结构化数据。
一个常见误区是把表格截图直接给模型,让它“分析一下”。这样风险很高:
-
截图 OCR 可能错。
-
表头层级可能丢失。
-
数字单位可能误读。
-
指标口径可能不清楚。
-
模型可能编造归因。
更可靠的方式是让 AI 接入结构化数据或 CSV/Excel,并明确指标定义。后续 Day 36 到 Day 42 会深入 AI+BI,这里先建立直觉:表格不是普通文本,它需要口径、权限、计算规则和可追溯查询。
3.8 屏幕理解:从看截图到理解操作流
屏幕理解是近两年 AI 产品很重要的方向。模型可以读取网页、App、后台系统截图,理解按钮、表单、列表、弹窗和错误提示。
它适合:
-
根据截图生成 Bug 报告。
-
分析产品页面信息架构。
-
评审设计稿和实现差异。
-
自动填写简单表单。
-
解释后台操作步骤。
-
帮客服理解用户截图。
但屏幕理解要谨慎。截图里可能包含隐私信息、客户资料、订单、手机号、身份证、财务数据。产品经理必须设计:
-
上传权限。
-
敏感信息脱敏。
-
保存周期。
-
谁能查看。
-
是否用于训练。
-
操作前确认。
如果屏幕理解进一步连接到 Agent,让 AI 能点击按钮、提交表单、修改数据,风险会显著上升。此时必须做工具权限分级和人工确认。
3.9 多模态工作流如何设计
多模态功能不能只写成:
用户上传图片 -> AI 输出结果至少应该拆成:
输入采集-> 格式校验-> 质量检测-> 预处理-> 模型理解-> 结构化抽取-> 业务规则校验-> 结果展示-> 用户确认-> 人工兜底-> 日志和反馈举例:发票识别报销助手。
上传发票图片-> 检查清晰度和完整性-> OCR 识别字段-> 抽取发票代码、金额、税号、日期-> 校验是否重复报销-> 校验金额是否符合制度-> 生成报销单草稿-> 用户确认-> 财务审核这里 AI 负责识别和辅助填写,系统负责查重和规则校验,财务负责高风险审核。不能让模型仅凭图片直接判断“可以报销”。
3.10 多模态场景判断公式
产品经理可以用下面公式判断是否值得做多模态:
多模态价值 = 非文本信息的重要性× 高频程度× 人工识别成本× 识别后可执行性× 错误可控性逐项解释:
非文本信息的重要性:如果图片、语音或视频只是附属信息,不一定需要多模态。 高频程度:低频场景很难支撑模型接入和流程改造成本。 人工识别成本:人工看图、听录音、看视频是否耗时。 识别后可执行性:识别结果能不能进入流程,例如生成工单、填表、审核、推荐。 错误可控性:识别错了是否可以人工复核、撤回或重新上传。
如果一个场景只是为了演示“AI 能看图”,但识别结果不能进入业务流程,那价值有限。
3.11 多模态的主要风险
多模态 AI 比纯文本更容易带来复杂风险。
| 风险 | 示例 | 控制方式 |
|---|---|---|
| 识别错误 | 发票金额识别错 | 字段校验、人工确认 |
| 输入质量差 | 图片模糊、录音嘈杂 | 质量检测、重新上传 |
| 上下文缺失 | 只看截图不知道订单状态 | 接入业务系统 |
| 隐私泄露 | 截图含手机号、身份证 | 脱敏、权限、保存周期 |
| 版权风险 | 用商品图生成侵权内容 | 授权校验、素材来源管理 |
| 成本失控 | 大量视频直接给模型 | 关键帧、采样、分层处理 |
| 责任边界 | AI 判断“商品破损可赔” | 规则系统和人工审核 |
产品经理要在 PRD 中把这些风险写清楚。多模态输入越丰富,越不能省略数据治理和权限设计。
4. 案例一:电商商品图识别生成详情页素材
业务背景
一个中小电商团队每天要上新大量商品。供应商提供的资料质量参差不齐,有的只有几张商品图和简单标题。运营需要补充标题、卖点、详情页文案和短视频口播稿。
原来运营需要人工看图:
-
判断商品类目。
-
识别颜色、材质、款式、配件。
-
提炼卖点。
-
对照平台规则写文案。
-
检查是否夸大宣传。
团队希望用多模态 AI 加速商品上新。
相关角色
-
商品运营:负责上新和文案审核。
-
视觉/内容团队:负责图片、短视频和详情页。
-
类目负责人:关注点击率、转化率和退货率。
-
合规负责人:关注广告法、平台禁词和侵权。
-
产品经理:负责流程、字段、审核和指标。
-
AI 工程:负责图片理解、文案生成、规则校验。
原始流程
供应商给商品图-> 运营人工看图-> 补充商品属性-> 写标题和卖点-> 适配平台规则-> 人工审核-> 上架痛点:
-
上新速度慢。
-
图片信息需要人工逐张识别。
-
文案质量依赖运营经验。
-
多平台改写重复。
-
商品参数容易被误写。
AI 改造流程
商品图片上传-> 图片质量检测-> 视觉识别:类目、颜色、材质、款式、部件-> OCR 识别包装或吊牌文字-> 结合供应商标题和规格-> 生成结构化商品属性-> 生成标题、卖点、详情页文案-> 禁用词和夸大宣传校验-> 人工审核-> 上架-> 点击率/转化率/退货原因回流数据与系统依赖
-
商品图片。
-
商品类目体系。
-
标准属性字典。
-
供应商资料。
-
平台规则和禁用词。
-
历史高转化文案。
-
上架系统。
-
点击、转化、退货和投诉数据。
方案架构
图片输入 -> 质量检测 -> 清晰度 -> 主体完整性 -> 是否水印/违规 -> 多模态识别 -> 类目 -> 颜色 -> 材质 -> 款式 -> OCR -> 商品属性结构化 -> 文案生成 -> 标题 -> 卖点 -> 详情页 -> 短视频脚本 -> 规则校验 -> 人工审核 -> 数据回流关键指标
-
单商品上新耗时。
-
商品属性识别准确率。
-
文案一次通过率。
-
人工修改率。
-
平台审核驳回率。
-
点击率。
-
转化率。
-
退货原因中“描述不符”占比。
-
单商品 AI 成本。
主要风险
-
模型把材质识别错,例如把 PU 说成真皮。
-
视觉识别没有依据却生成确定卖点。
-
图片里的装饰品被当成商品配件。
-
生成文案夸大功效。
-
侵权图片或品牌元素未识别。
-
商品图和实际商品不一致,导致退货。
复盘结论
这个场景适合多模态,因为商品图片承载了大量非文本信息,人工识别成本高,识别结果可以进入上新流程。但 AI 不应直接发布商品。更稳的设计是:模型负责识别和生成草稿,规则系统负责校验,运营负责最终审核,数据回流负责持续优化。
5. 案例二:会议转写生成纪要和待办
业务背景
一个产品团队每周有需求评审、项目例会、增长复盘和跨部门同步会。会议结束后,项目经理需要整理纪要、结论、待办、责任人和时间点。
传统会议纪要只基于人工记录或录音转写,问题是:
-
口头讨论很长,重点分散。
-
PPT 或原型图里的内容没有进入转写。
-
白板上的流程和草图没有被记录。
-
责任人和时间点容易漏。
-
会后大家对结论理解不一致。
相关角色
-
产品经理:负责需求背景和方案。
-
项目经理:负责纪要、排期和跟进。
-
研发:关注技术方案和风险。
-
设计:关注交互和视觉变更。
-
运营/业务:关注上线目标和指标。
-
管理者:关注结论、资源和风险。
原始流程
开会-> 人工记录-> 会后补听录音-> 整理纪要-> 手动提取待办-> 发群确认-> 后续跟进痛点:
-
记录耗时。
-
转写文本很长,不易读。
-
屏幕共享和 PPT 内容丢失。
-
责任人、截止时间和决策依据不完整。
AI 改造流程
会议录音-> 语音转写-> 说话人识别-> PPT/屏幕关键帧抽取-> 白板或截图 OCR-> 结合会议议程-> 生成纪要、结论、待办、风险-> 参会人确认-> 同步到项目管理工具数据与系统依赖
-
会议录音。
-
参会人名单。
-
会议议程。
-
PPT 或屏幕截图。
-
白板图片。
-
项目管理工具。
-
历史决策记录。
-
需求文档和 PRD。
方案架构
会议材料 -> 音频处理 -> 转写 -> 说话人识别 -> 视觉处理 -> PPT 关键帧 -> 白板 OCR -> 屏幕内容摘要 -> 内容融合 -> 议题 -> 结论 -> 分歧 -> 待办 -> 风险 -> 人工确认 -> 任务同步 -> 复盘归档关键指标
-
纪要生成耗时。
-
语音转写准确率。
-
待办提取准确率。
-
责任人识别准确率。
-
参会人修改率。
-
会后确认时间。
-
任务遗漏率。
-
项目延期原因中“沟通不清”占比变化。
主要风险
-
语音识别错误导致结论错误。
-
说话人识别错,把责任人归错。
-
PPT 关键页未捕获。
-
AI 把讨论中的假设写成最终决策。
-
会议涉及敏感商业信息,存储和权限不清。
-
自动同步任务前未经过确认。
复盘结论
会议纪要适合多模态,因为会议决策来自声音、屏幕、文档和上下文的组合。但产品设计必须保留人工确认。AI 可以生成纪要草稿和待办建议,不能把未经确认的内容直接变成正式承诺。
6. 动手实操任务
任务:找 3 个业务流程,判断能否加入多模态输入
请选择你熟悉的 3 个业务流程,例如:
-
商品上新。
-
智能客服售后。
-
会议纪要。
-
发票报销。
-
用户访谈整理。
-
门店巡检。
-
竞品页面分析。
-
Bug 反馈处理。
按下面模板分析。
| 流程 | 当前输入 | 可加入的多模态输入 | AI 可完成的任务 | 需要的业务系统 | 风险 | 是否值得做 |
|---|---|---|---|---|---|---|
| 商品上新 | 标题、规格 | 商品图、包装图 | 属性识别、卖点生成 | 商品库、类目库、规则库 | 材质误识别 | 值得 |
验收标准
合格:
-
至少分析 3 个业务流程。
-
每个流程说明当前输入和新增多模态输入。
-
每个流程写清楚 AI 输出如何进入业务流程。
-
每个流程至少识别 1 个风险。
优秀:
-
能区分“只是识别”与“可执行流程改造”。
-
能说明哪些结果必须人工确认。
-
能估算多模态输入带来的成本、效率和质量影响。
7. 测试题与参考答案
理解题
1. 多模态 AI 的“模态”是什么意思? 参考答案:模态是信息类型,例如文本、图片、语音、视频、表格和屏幕内容。多模态 AI 指模型能处理并综合多种信息类型。
2. 为什么多模态 AI 不只是 OCR? 参考答案:OCR 主要识别图片中的文字,而多模态理解还包括物体、属性、场景、关系、动作、语音情绪、屏幕布局等信息,并能与业务上下文结合。
3. 多模态功能为什么通常需要人工确认? 参考答案:图片、语音、视频识别可能受清晰度、噪音、角度、遮挡和上下文影响。涉及金额、审批、赔付、发布等高风险动作时,必须由人或规则系统确认。
4. 视频理解为什么比图片理解更复杂? 参考答案:视频包含时间维度,很多信息来自动作和过程。只看单帧可能误判,需要结合关键帧、音频、字幕、操作序列和上下文。
5. 多模态 AI 的主要产品风险有哪些? 参考答案:识别错误、输入质量差、上下文缺失、隐私泄露、版权风险、成本失控、责任边界不清。
应用题
6. 如果做发票报销助手,多模态 AI 应该负责什么,不应该负责什么? 参考答案:AI 可以识别发票字段、抽取金额、日期、税号,生成报销单草稿,并提示可能缺失的信息。但是否重复报销、是否符合制度、是否最终通过,应由规则系统和财务审核决定。
7. 商品图生成文案如何降低“描述不符”风险? 参考答案:需要把视觉识别结果结构化,标注置信度;对材质、功效、品牌等高风险字段做人工确认;接入平台禁词和广告法规则;上线后监控退货原因和用户反馈。
8. 当日产出模板
8.1 多模态场景清单
| 场景 | 现有输入 | 新增模态 | AI 任务 | 输出形态 | 人工确认点 | 核心指标 |
|---|---|---|---|---|---|---|
| 商品上新 | 标题、规格 | 图片 | 属性识别、文案生成 | 商品属性、卖点 | 材质、功效、品牌 | 上新耗时、修改率 |
| 会议纪要 | 录音 | PPT、白板 | 纪要、待办、风险 | 文档、任务 | 结论和责任人 | 纪要耗时、遗漏率 |
8.2 多模态输入输出流程表
| 阶段 | 关键问题 | 示例 |
|---|---|---|
| 输入采集 | 用户上传什么,格式是否限制 | 图片、录音、视频、截图 |
| 质量检测 | 是否清晰、完整、可识别 | 图片模糊则重传 |
| 预处理 | 是否需要 OCR、转写、抽帧 | 语音转文字、视频抽关键帧 |
| 模型理解 | 模型要识别什么 | 类目、字段、情绪、动作 |
| 结构化输出 | 输出是否可进入系统 | JSON 字段、工单、纪要 |
| 规则校验 | 哪些必须系统判断 | 金额、权限、库存、赔付 |
| 人工确认 | 哪些不能自动提交 | 发布、审批、赔付、发券 |
| 日志反馈 | 如何评估和复盘 | 原输入、模型输出、人工修改 |
8.3 多模态 PRD 检查清单
功能场景:目标用户:当前流程:新增模态:输入格式:输入质量要求:模型识别目标:结构化字段:业务系统依赖:必须人工确认的字段:高风险动作:隐私和权限:成本估算:验收指标:失败兜底:9. 延伸阅读资料
- Token 与成本意识:多模态输入通常更贵,要设计抽帧、压缩和分层处理。
- 大模型为什么会幻觉:多模态识别错误同样会诱发错误结论。
- 内部可收集材料:商品图、客服截图、会议录音、发票样本、用户录屏、设计稿截图,用于建立多模态评估集。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!












