生成式 AI 三十讲第 14 讲 / 共 30 讲从会说到会做

多模态:看图、读表、听声音

哪些已经可以放进流程,哪些还只适合做演示,按场景逐个说清楚。

同一张仓库照片,人一眼能看出“左边有 4 个纸箱,右边通道被托盘挡住”;模型可能正确读出纸箱标签,却把箱子数成 5 个。它能描述图片,不等于完成了可靠测量。把图片、声音和视频交给模型之后,最容易犯的判断错误,就是把“能接收这种文件”当成“能稳定完成其中所有任务”。

先给答案

多模态是同一个模型或系统能够处理或生成不止一种数据模态,例如文字、图片、音频或视频。本文重点讨论图片、音频和视频输入:输入类型变多了,但准确性仍取决于任务。读清晰标题和概括画面已很实用;精确计数、细小文字、复杂表格、空间位置与长音频细节必须实测并保留人工复核。

模型“看图”时到底收到了什么

图片不会以“完整原图”的方式直接变成答案。系统通常会调整尺寸、拆分图块或提取视觉特征,再与文字问题一起交给模型。也就是说,模型得到的是便于计算的视觉表示,不是拿着放大镜逐像素检查。不同产品还会根据清晰度设置、文件大小和模型类型采用不同处理方式,具体限制应以当前官方文档为准。

这解释了为什么任务难度差别很大。一张 1200 像素宽的商品图,标题占半个画面,问“这是什么产品”通常信息充足;一张手机拍摄的 A3 价目表有 18 列、90 行,问“第 67 行含税单价是多少”,目标文字可能只剩十几个像素。旋转、反光、遮挡和手写批注会继续增加误差。

“图片里有表格”也不代表模型得到电子表格。它可能先识别单元格文字,再推断行列关系。合并单元格尤其容易让数值串行:原表中 A 产品数量 12、B 产品数量 21,解析后可能交换。若任务要汇总 300 行发票,稳妥做法是先用专门的文档解析或表格工具提取结构,再让模型解释异常;抽取后还要用合计数、字段类型和抽样原图校验。

音频和视频为什么不是“多一双耳朵”

音频任务至少分三类:把语音转成文字、理解内容、生成声音。也就是说,“能听会议”可能实际是先得到转写稿,再由语言模型总结;也可能由支持音频输入的模型直接处理。两条路线都能产出纪要,但错误来源不同。前者可检查逐句转写,后者可能更好利用语气,却未必提供可核对的完整文字。

一段 35 分钟会议录音里,人名“周岑”和产品名“舟辰”发音接近;如果没有参会人名单,系统可能全程写错。两人抢话、空调噪声、方言和远距离收音也会影响结果。企业若要从录音生成任务单,应把“负责人、截止日期、金额”列为必须回听的字段,并保留时间戳,不能只保存一页摘要。

视频还增加了时间采样。10 分钟监控片段包含成百上千帧,系统未必逐帧等量处理。一个持续 0.5 秒的操作可能刚好落在采样间隔中;“看过视频”不等于“没有漏掉瞬间”。适合先落地的往往是粗粒度任务,例如找出“叉车大约何时进入画面”,再由人查看前后 30 秒;不适合直接用一句自然语言结论代替安全事故认定。

哪些任务可直接用,哪些要加校验

可以按“容错空间”和“可核对性”分层。给 20 张产品照片生成初版描述,即使某个颜色词不准,也能快速人工改;从仪表照片读取压力值并自动控制阀门,一位小数读错就可能造成真实损失。前者适合把模型当草稿工具,后者必须使用经过验证的识别方案、阈值检查和人工批准。

不要用厂商准备好的 6 张样例图验收。应收集真实分布:清晰图、反光图、倾斜扫描件、缺角票据、多人重叠语音各若干份,并提前写标准答案。比如抽取 100 张收据的日期、金额和税号,分别统计字段正确率,不能只统计“整张看起来不错”。发现某类输入持续失败,就在上传时拦截并要求重拍,而不是期待模型临场补救。

多模态输出仍可能出现幻觉。也就是说,图里看不清的地方,模型可能根据常见样式补出一个像真的数值。提示它“看不清就说看不清”有帮助,但不是保证。高风险字段需要与原图局部并排展示,让审核者能在 5 秒内比对,而不是在整页图片里寻找证据。

自己试一下

用纸画一个 4 行 4 列的小表格,故意把其中一个数字写得很淡,再用手机斜着拍照。表格内容可以是:

产品 / 一月 / 二月 / 三月 A / 12 / 15 / 18 B / 21 / 17 / 13 C / 8 / 11 / 14

把照片上传到支持图片输入的聊天模型,先问“总销量是多少”,再问“逐格抄写成表格,并对每一行显示计算过程;看不清的格子标记为不确定”。观察第一次是否直接给出无法核对的总数,第二次能否暴露淡字和行列错位。最后用计算器核对正确总和。

本实验于 2026 年 8 月 27 日按通用视觉输入模式设计,拍摄质量和模型版本都会影响结果。你试的时候结果可能不同,重点是看它的行为模式:要求展示中间抽取结果,往往比只要一个总数更容易发现错误。

常见误解

误解一:能描述图片,就具备专业视觉检测能力。 日常物体识别与仪表测量、工程图审查不是同一难度。后者需要专门数据、明确误差范围和现场验证。

误解二:直接听音频一定比“转写再总结”更准确。 直接音频可能保留更多语气信息,但是否适合人名、金额和任务分配,要用你的录音测试;可核对的时间戳与文字记录往往更重要。

三句话总结

  1. 多模态表示能处理多种输入,不表示每种输入里的每项任务都可靠。
  2. 细小文字、复杂表格、精确计数和短暂视频事件是常见薄弱点。
  3. 风险越高,越要展示原始证据、拆分字段评测并保留人工确认。

如果你要做决定

用真实坏样本验收,不用展示样本;按字段、场景和清晰度分别统计。要求供应商说明输入怎样处理、失败怎样提示、原图和时间戳能否追溯,再决定哪些结果可以自动进入业务系统。

下一篇,我们看“先多想一会儿”为什么对部分任务有效,又为什么不能包治百病。