术语图鉴/AI 基础/多模态
←→切换Esc返回

多模态 Multimodal

你可能会说

这个 AI 功能涉及到多模态,帮我理解一下然后集成进去。

AI 不只懂文字,还能看图、听音频、生成图片/视频。

AI 不只懂文字,还能看图、听音频、生成图片/视频。能处理多种「模态」(类型)的信息。

也常被叫作Multimodal

生活类比

像一个既会看图纸、又会听描述、还能画草图的全能设计师。

🎮 动手试试

→
🧠 AI
→
纯文本回答
选择题选择一个你认为最合适的答案

关于「多模态」,以下哪个描述最准确?

你可以这样告诉 AI

帮我看看这张设计稿截图有哪些 UI 问题——按钮间距、颜色对比度、字号层级,逐条列出来并给出修改建议。

容易混淆?这样区分

多模态 Multimodal≠
跨模态 Cross-modal

多模态是模型能同时「接收」多种输入(图文音),跨模态是从一种模态「转换」到另一种(如文字生图)。前者是输入能力,后者是转换能力。

什么时候用

图片识别与分析

让 AI 识别截图中的 UI 问题、从照片提取文字、分析图表数据时,必须用多模态模型。

和 AI 协作时

截一张报错页面发给 AI,说「看图帮我分析为什么报这个错,怎么修」,AI 能直接读图给出方案。

什么时候不用

纯文本处理

做文本摘要、翻译、代码生成等只涉及文字的任务,用纯文本模型更快更省钱。

无视觉或音频输入需求

后台管理系统、API 服务、数据处理脚本等不涉及图像音频的项目,多模态能力完全用不上。

组成结构 · Anatomy

1
核心概念Core

AI 不只懂文字,还能看图、听音频、生成图片/视频。能处理多种「模态」(类型)的信息。

2
实际表现In Practice

像一个既会看图纸、又会听描述、还能画草图的全能设计师。

3
与 AI 的关联AI Context

你发张截图让 AI 分析,用的就是多模态能力。

典型使用场景

看图分析UI
告诉 AI「传你一张竞品 App 截图,帮我分析它的信息架构和交互逻辑,总结出我们可以借鉴的 5 个设计要点」
想弄懂概念时
告诉 AI「用大白话给我解释什么是多模态,举个生活中的例子」

延伸阅读