GLOSSARY /先弄明白,再做选择

多模态是什么?

多模态 AI 不只处理文字,还能处理图片、声音、视频等不同类型的信息。

10秒看懂

多模态是什么?

多模态 AI 不只处理文字,还能处理图片、声音、视频等不同类型的信息。

Multimodal AI

10 秒看懂

多模态 AI 不只处理文字,还能处理图片、声音、视频等不同类型的信息。

说人话

多模态 AI 不只处理文字,还能处理图片、声音、视频等不同类型的信息。 这是帮助入门的简化说法,不代表所有产品的实现都完全一样。

一个比喻

它不只是会“读”,还可能会“看”和“听”。

比喻只帮助理解,不是完整技术定义。

真实使用例子

你什么时候会遇到它?

图片问答、语音助手、视频分析和文档理解都会用到它。

你需要关心它吗

如果你会上传图片、音频或视频给 AI,就值得了解。

最容易搞混

多模态描述处理多种信息的能力;VLM 特指视觉与语言结合的模型。

相关词条

继续把这些有关联的概念弄明白。

信息来源与最后核对

依据官方文档核对整理。官方定位与本站选择建议分别说明,未进行插件实测或 Token Benchmark。

官方资料

01
Google for Developers — Machine Learning Glossarydevelopers.google.com

最后核对: 2026年9月5日

official-docs