待验证50% 置信解决方案精确时间
Decision Transformer将离线轨迹数据建模为因果序列生成问题,通过引入回报条件使模型能够在不与环境交互的情况下从静态数据集学习条件策略
1
来源数
50%
置信度
长期有效
时效性
2026/7/19
首次发现
来源
相关事实
待验证Decision Transformer 于 2021 年提出,将强化学习问题重新表述为序列建模问题,使用 Transformer 架构对(回报、状态、动作)序列进行自回归预测77% 相似待验证少样本提示利用Transformer架构的上下文学习能力,模型无需更新参数仅凭上下文示例就能推断期望的输出格式77% 相似待验证大模型幻觉现象根植于Transformer的自回归生成机制,模型在预训练阶段通过Next Token Prediction任务学习概率分布75% 相似待验证Transformer架构中模型参数量与推理延迟之间呈近似线性关系73% 相似待验证Transformer模型是纯粹的序列到序列映射函数,其参数在推理阶段完全静态,无机制在推理中主动探测外部环境状态72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/563183API
curl https://kongchang.com/api/v1/knowledge/claims/563183MCP
get_claim(id=563183)