Unverified50% confidenceFactExact time
DQN的经验回放缓冲区通常存储100万条(s,a,r,s')元组,目标网络每隔固定步数(如10000步)同步参数
1
Sources
50%
Confidence
Long-term
Relevance
8/21/2026
First Seen
Sources
Related Claims
Unverified目标网络维护参数更新滞后的网络副本来计算目标值,每隔固定步数(如1000步)将主网络参数同步过去,解决追逐移动目标问题78% similarUnverifiedReAct的推理链会持续消耗上下文token,一个执行20步操作的Agent其历史推理链可能消耗数万token62% similarUnverifiedAnthropic提供提示缓存机制,当连续多次调用中系统提示保持不变时,重复部分的Token只按首次的10%计费62% similarUnverified多智能体系统的Token优化策略包括模型路由、压缩智能体间传递的上下文、缓存中间结果62% similarUnverifiedAnthropic提供的提示词缓存机制允许将重复出现的长系统提示或技能定义缓存于服务端,后续调用仅需传输差异部分61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/782691API
curl https://kongchang.com/api/v1/knowledge/claims/782691MCP
get_claim(id=782691)