待验证50% 置信事实精确时间
DQN的经验回放缓冲区通常存储100万条(s,a,r,s')元组,目标网络每隔固定步数(如10000步)同步参数
1
来源数
50%
置信度
长期有效
时效性
2026/8/21
首次发现
来源
相关事实
待验证目标网络维护参数更新滞后的网络副本来计算目标值,每隔固定步数(如1000步)将主网络参数同步过去,解决追逐移动目标问题78% 相似待验证ReAct的推理链会持续消耗上下文token,一个执行20步操作的Agent其历史推理链可能消耗数万token62% 相似待验证Anthropic提供提示缓存机制,当连续多次调用中系统提示保持不变时,重复部分的Token只按首次的10%计费62% 相似待验证多智能体系统的Token优化策略包括模型路由、压缩智能体间传递的上下文、缓存中间结果62% 相似待验证Anthropic提供的提示词缓存机制允许将重复出现的长系统提示或技能定义缓存于服务端,后续调用仅需传输差异部分61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/782691API
curl https://kongchang.com/api/v1/knowledge/claims/782691MCP
get_claim(id=782691)