全部词条
白话词典

多模态

也叫:Multimodal · 视觉语言模型 · VLM

多模态指模型能处理文字以外的信息,如图片、语音、PDF 等。

他们说

多模态模型支持文本、图像、音频的统一理解与生成

老白翻译

不只会读字,还能看图、听声、读文件。

它到底是什么

“模态”就是信息形态:文字、图片、声音、视频。多模态模型能同时处理不止一种。

生活里的例子

你给人看菜单照片并问“有没有素食”,对方又看又听又答。多模态就是让 AI 也能这样跨形式理解。

常见误解

  • 误解:能看图就等于视觉很强。 小字、表格、复杂版式仍常出错。
  • 误解:所有模型都一样会看图。 要看具体产品是否支持。

普通人怎么用

截图问报错、拍白板整理纪要、上传表格解释趋势——很适合;关键数字仍要自己核对。