[KongchangAI]
Unverified50% confidenceFactExact time

在强化学习语境中,Agent被定义为在马尔可夫决策过程(MDP)框架下通过感知状态、选择动作并从环境获取奖励来学习最优策略的自主实体

1
Sources
50%
Confidence
Long-term
Relevance
7/22/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/592642
API
curl https://kongchang.com/api/v1/knowledge/claims/592642
MCP
get_claim(id=592642)