早期的 AI 只能处理文字。现在的多模态模型能同时看图、听声、读文档、生成视频——这彻底改变了一些日常工作的方式。
多模态能做什么
看图说话 / 图像理解:把截图丢给 AI,它能读出报错信息、解释图表、对比设计稿、提取表格数据。实测最有用的三个场景:
- 截图排错:软件报错弹窗截图直接问"这是什么问题";
- 表格还原:照片里的表格转成 Markdown/Excel 格式;
- 设计参考:上传草图描述布局,让 AI 给出实现思路(甚至生成前端代码)。
文档理解:扫描件、手写笔记、带复杂排版的 PDF,多模态模型可以直接"看"而不是依赖 OCR 文字提取,表格和公式还原效果好得多。
语音:实时语音对话(如各家的语音模式)已经接近自然对话,延迟降到秒级以下。
使用中的注意点
- 图片里的手写体和小字仍偶有识别错误,关键数字要复核;
- 上传截图同样遵守隐私清单(上一期讲过的"公告栏测试");
- 多模态输入消耗的 Token 通常远多于纯文本(一张图折算几百到几千 Token),批量处理注意成本。
快速体验
主流对话产品(ChatGPT、通义、Kimi 等)都已支持直接上传图片提问。本地化方案方面,Ollama 已支持 LLaVA、Qwen-VL 等视觉模型,ollama run llava 即可体验。
本文共 373 个字数,平均阅读时长 ≈ 1分钟
评论