MiniCode

Multimodal

多模态

免费阅读 · 更新于

一句话理解

让模型处理文字之外的图片、音频等内容。

打个比方

描述一件衣服时,既能写文字,也能给朋友看照片。多模态让模型有机会从不同类型的信息中理解你的问题。

模态指信息的形式,例如文本、图片和音频。多模态模型可以处理多种形式,但每个模型支持的输入与输出不同;能看图不代表能生成图片。

看个例子

任务示例
输入:一张页面截图 + 一段说明

请检查这张截图:
哪些文字太小?哪些按钮不容易看清?
先列出问题,再给出修改建议。

截图提供视觉信息,文字交代任务。模型仍可能误读小字、位置或细节,重要内容要自己核对。

什么时候会遇到

  • 给 AI 看页面截图,讨论布局和视觉问题。
  • 使用支持相应能力的模型理解图片或音频。

常见误解

多模态不是“支持所有文件”。能否读取视频、音频或特定文档,要看模型和应用实际支持。

想一想

能看懂截图的 AI,一定可以直接改网页吗?

查看答案

不一定。理解图片是模型能力;修改网页还需要代码、编辑工具及相应权限。

继续查阅官方资料

Anthropic · 图像理解本文为面向新手的概念解释,具体工具行为以对应文档为准。