Unverified50% confidenceSolutionExact time
Decision Transformer将离线轨迹数据建模为因果序列生成问题,通过引入回报条件使模型能够在不与环境交互的情况下从静态数据集学习条件策略
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
UnverifiedDecision Transformer 于 2021 年提出,将强化学习问题重新表述为序列建模问题,使用 Transformer 架构对(回报、状态、动作)序列进行自回归预测77% similarUnverified少样本提示利用Transformer架构的上下文学习能力,模型无需更新参数仅凭上下文示例就能推断期望的输出格式77% similarUnverified大模型幻觉现象根植于Transformer的自回归生成机制,模型在预训练阶段通过Next Token Prediction任务学习概率分布75% similarUnverifiedTransformer架构中模型参数量与推理延迟之间呈近似线性关系73% similarUnverifiedTransformer模型是纯粹的序列到序列映射函数,其参数在推理阶段完全静态,无机制在推理中主动探测外部环境状态72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/563183API
curl https://kongchang.com/api/v1/knowledge/claims/563183MCP
get_claim(id=563183)