多模态
也叫:Multimodal · 视觉语言模型 · VLM
多模态指模型能处理文字以外的信息,如图片、语音、PDF 等。
他们说
多模态模型支持文本、图像、音频的统一理解与生成
老白翻译
不只会读字,还能看图、听声、读文件。
它到底是什么
“模态”就是信息形态:文字、图片、声音、视频。多模态模型能同时处理不止一种。
生活里的例子
你给人看菜单照片并问“有没有素食”,对方又看又听又答。多模态就是让 AI 也能这样跨形式理解。
常见误解
- 误解:能看图就等于视觉很强。 小字、表格、复杂版式仍常出错。
- 误解:所有模型都一样会看图。 要看具体产品是否支持。
普通人怎么用
截图问报错、拍白板整理纪要、上传表格解释趋势——很适合;关键数字仍要自己核对。