看见图纸:多模态与长上下文
2023 至 2024 年,GPT-4 视觉、GPT-4o、Gemini 长上下文与 Sora 把大模型从「读文字」推进到「看图、看视频、读整库资料」,工厂与设计场景开始可验证落地。
2023 年 3 月 GPT-4 发布时,公众关注点多半在「考试分数又提高了」。更深层的变化在半年后显现:模型开始稳定接收图片输入,能描述图表、读屏幕截图、辨认手写标注;随后音频与视频生成、百万级 token 上下文窗口相继登场。对制造业、建筑、电商与设计行业,这意味着「把图纸、产线照片、长 PDF 手册一次性丢给模型」从演示变成可试点的工作方式。
先给答案
2023—2024 年的能力扩张沿三条轴同步推进:视觉理解(GPT-4 with vision,2023 年 9 月向 ChatGPT 用户推出)、原生多模态与低延迟(GPT-4o,2024 年 5 月 13 日发布,支持文本、图像、音频输入输出)、超长上下文(Google Gemini 1.5 Pro 2024 年 2 月宣布实验性 100 万 token 上下文)。视频生成方面,OpenAI 2024 年 2 月 15 日预览 Sora,展示文生视频质量跃升,虽未立即开放,但改变了市场对「内容生产链」的预期。这些能力叠加后,「看见图纸」成为工业与建造场景的可核对用例,而非科幻描述。
当时现场
2023 年 9 月,ChatGPT 移动应用更新后,用户可直接拍照或上传图片提问。早期用例集中在:解释报错截图、识别植物、读菜单翻译。工厂与设备维护团队很快尝试更高风险场景:拍摄仪表读数、阀体铭牌、电气柜线号,让模型辅助填写巡检表——准确率不稳定,但比纯文字描述效率更高。
2024 年 5 月 13 日,OpenAI Spring Update 发布 GPT-4o(「o」代表 omni)。演示中,模型几乎实时响应摄像头画面与语音,能看表情、听语调、用自然语音回复。同日宣布向免费用户开放部分能力,付费层获得更高限额。媒体称此为「多模态的 iPhone 时刻」,争议点在于实时音视频的数据隐私与误识别风险。
Google 阵营的回应是上下文长度。2023 年 12 月 6 日,Google 发布 Gemini 1.0;2024 年 2 月 15 日,Gemini 1.5 Pro 技术报告宣布可处理高达 100 万 token 的上下文(实验阶段),相当于把整本技术手册、长篇代码库或数小时视频字幕放入一次请求。对法务尽调、代码审计与设备文档问答,这比「多轮切片上传」更接近真实 workflow。
同一日(2024-02-15),OpenAI 公布 Sora 文生视频模型预览视频,最长可达一分钟、保持相对一致的场景与物体运动。产品未向公众开放,但影视、广告与游戏行业立刻评估分镜预览、概念片与素材生成的成本结构。
发生了什么
2023-03-14:GPT-4 发布。 文本能力显著提升;图像输入能力在发布时仅预告,稍后以 GPT-4V / GPT-4 with vision 形式落地。
2023-09-25:ChatGPT 支持图像输入与语音对话。 基于 GPT-4 多模态能力,标志视觉理解进入主流消费产品。
2023-12-06:Google Gemini 1.0 发布。 Ultra / Pro / Nano 分级,强调与 Google 搜索、Android、云服务的整合。
2024-02-15:Gemini 1.5 Pro 长上下文与 Sora 预览同日占据头条。 长文档与视频生成两条叙事并列,分别指向「读得更多」与「生成动态画面」。
2024-05-13:GPT-4o 发布。 统一文本、视觉、音频的单模型路线,降低多模态延迟,推动实时助手与翻译耳机类硬件想象。
2024 年内:Claude 3 系列、Llama 3 多模态实验、国内厂商图文模型迭代。 竞争从「能不能看图」转向「看图是否可靠、是否够快、是否够便宜」。
谁的工作因此变了
设计与工程审图: 模型可辅助读 CAD 导出 PDF 的标注、对照规范条文找矛盾,但不能替代注册工程师签字。价值在「初筛」与「整理疑问清单」,风险在「漏看关键尺寸」。
设备维护与售后: 现场拍照 + 手册 RAG 成为常见 POC(概念验证)。长上下文减少手工拼接章节;视觉输入帮助识别零件型号,但光照、模糊、遮挡会导致误识。
电商与内容团队: 商品图生成、详情页文案、短视频脚本与 Sora 类工具的期待交织。2024 年多数团队仍用「生成草稿 + 人工修图」流程,全自动上线较少。
合规与知识产权: 训练数据是否包含受版权保护的图像与视频、生成物是否侵犯肖像权,在 2024 年引发多起诉讼与平台政策更新。企业使用多模态前需增加「输入图像是否含客户机密」审查。
当时看错的地方
误判一:「模型能看图,就等于能当检验员。」 视觉幻觉表现为「看见不存在的标注」或「读错小数点」。计量与安规场景仍需仪器读数与人工复核,不能把对话输出当检测报告。
误判二:「一百万 token 上下文可以取代 RAG。」 长上下文降低切片复杂度,但不保证模型关注正确段落;成本随长度陡增。工程上常见组合仍是「检索缩小范围 + 长窗口精读」。
误判三:「Sora 马上颠覆影视业。」 2024 年 Sora 仅限安全测试人员与少数创作者试用,时长、物理一致性与可控性仍不足,更像「预览未来两年」而非「本周替代拍摄」。
今天还能核对什么
- OpenAI GPT-4 技术报告与 2023-09-25 ChatGPT 视觉功能公告。
- OpenAI 2024-05-13 GPT-4o 系统卡与 Spring Update 实录。
- Google Gemini 1.5 技术报告(2024-02-15)与 Gemini 1.0 发布博客(2023-12-06)。
- OpenAI Sora 介绍页(2024-02-15)及后续安全测试说明。
延伸阅读
- 上一篇:中国回应:大模型备案元年——文心一言、通义千问与暂行办法。
- 下一篇:会想一步:推理模型与产线决策——OpenAI o1 与工艺故障报价场景。