和 AI 沟通
Multimodal
多模态
免费阅读 · 更新于
一句话理解
让模型处理文字之外的图片、音频等内容。
打个比方
描述一件衣服时,既能写文字,也能给朋友看照片。多模态让模型有机会从不同类型的信息中理解你的问题。
模态指信息的形式,例如文本、图片和音频。多模态模型可以处理多种形式,但每个模型支持的输入与输出不同;能看图不代表能生成图片。
看个例子
输入:一张页面截图 + 一段说明
请检查这张截图:
哪些文字太小?哪些按钮不容易看清?
先列出问题,再给出修改建议。截图提供视觉信息,文字交代任务。模型仍可能误读小字、位置或细节,重要内容要自己核对。
什么时候会遇到
- 给 AI 看页面截图,讨论布局和视觉问题。
- 使用支持相应能力的模型理解图片或音频。
常见误解
多模态不是“支持所有文件”。能否读取视频、音频或特定文档,要看模型和应用实际支持。
想一想
能看懂截图的 AI,一定可以直接改网页吗?
查看答案
不一定。理解图片是模型能力;修改网页还需要代码、编辑工具及相应权限。