10 秒看懂
多模态 AI 不只处理文字,还能处理图片、声音、视频等不同类型的信息。
说人话
多模态 AI 不只处理文字,还能处理图片、声音、视频等不同类型的信息。 这是帮助入门的简化说法,不代表所有产品的实现都完全一样。
一个比喻
它不只是会“读”,还可能会“看”和“听”。
比喻只帮助理解,不是完整技术定义。
真实使用例子
你什么时候会遇到它?
图片问答、语音助手、视频分析和文档理解都会用到它。
你需要关心它吗
如果你会上传图片、音频或视频给 AI,就值得了解。
最容易搞混
多模态描述处理多种信息的能力;VLM 特指视觉与语言结合的模型。
Related Terms
相关词条
继续把这些有关联的概念弄明白。
信息来源与最后核对
依据官方文档核对整理。官方定位与本站选择建议分别说明,未进行插件实测或 Token Benchmark。
官方资料
01Google for Developers — Machine Learning Glossarydevelopers.google.com
最后核对: 2026年9月5日
official-docs