Model
PaLM-E
PaLM-E是由Google研发的多模态大型语言模型,将视觉感知与语言理解能力相结合,能够处理图像和文本的联合输入。该模型以PaLM为语言基础,融合视觉编码器,主要面向具身智能(Embodied AI)场景,支持机器人任务规划、视觉问答及场景理解等应用,是将大型语言模型能力扩展至物理世界交互领域的代表性研究成果之一。
Timeline (last 90 days)
Jun 3
Google的多模态AI技术路线从早期的PaLM-E发展到Gemini系列
Unverified85%