Unverified50% confidenceFactExact time
RT-2(2023年)将55B参数的视觉-语言模型PaLM-E微调为可直接输出离散化动作token的策略模型
1
Sources
50%
Confidence
Long-term
Relevance
8/21/2026
First Seen
Sources
Related Claims
UnverifiedRT-2的基座是280亿参数的PaLM-E模型,动作被编码为离散token序列,与语言token在同一自回归框架下生成76% similarUnverified基于LLM的现代Agent以大语言模型为大脑,通过ReAct、Plan-and-Execute等范式自主规划步骤、调用外部工具并根据反馈动态调整策略64% similarVerified该模型属于视觉-语言-动作(VLA)模型的范畴,将视觉编码器、语言理解模块与动作预测头统一在端到端架构中64% similarUnverifiedLLM 0.32a0引入了两个核心变化:将模型输入建模为消息序列,以及将模型响应建模为类型化的流式部分63% similarUnverified工具调用机制允许大语言模型在推理过程中动态调用外部函数,是从语言模型到行动模型的本质跨越63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/783809API
curl https://kongchang.com/api/v1/knowledge/claims/783809MCP
get_claim(id=783809)