Unverified50% confidenceFactExact time
POMDP在MDP基础上增加了观测函数O(o|s,a),智能体只能获得状态的部分信息,需要维护对真实状态的置信度
1
Sources
50%
Confidence
Long-term
Relevance
8/7/2026
First Seen
Sources
Related Claims
UnverifiedPOMDP(部分可观测马尔可夫决策过程)是MDP(马尔可夫决策过程)的推广形式,在标准MDP中智能体能完全观测环境状态,而POMDP承认智能体无法直接获知真实状态,只能通过带噪声的观测间接推断74% similarUnverifiedPOMDP引入信念状态(belief state),即定义在所有可能隐藏状态上的概率分布,智能体根据该分布而非单一确定状态做决策67% similarUnverified贝叶斯滤波是POMDP中维护信念状态的核心机制,通过状态转移模型预测先验概率、用观测模型计算似然、归一化得到后验信念65% similarUnverified当序贯决策问题同时具备隐藏状态、带噪声的观测和序贯决策三个要素时,适合用POMDP建模62% similarUnverified自注意力机制的QK^T计算对于序列长度n、隐藏维度d的模型需要O(n²d)次乘加运算61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/699557API
curl https://kongchang.com/api/v1/knowledge/claims/699557MCP
get_claim(id=699557)