待验证60% 置信事实精确时间
decisionrl 支持的算法包括 DQN、PPO、SAC、TRPO 等在线算法,以及离线RL、基于模型的方法、多智能体和元强化学习
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/15
首次发现
有效期至:2026/10/13
来源
相关事实
待验证decisionrl 底层是一个带类型标注、有测试覆盖的通用RL框架,支持DQN、PPO、SAC、TRPO等主流在线算法83% 相似待验证decisionrl 是由开发者 Denis Drobyshev 开发的、专门面向运营决策问题的强化学习开源库65% 相似待验证工具调用层允许模型通过标准化接口如Function Calling操作搜索引擎、代码解释器、日历、邮件等外部系统64% 相似待验证主流本地推理框架包括 llama.cpp、MLX(Apple 为自家芯片优化的机器学习框架)和 Ollama64% 相似待验证多模型工作流的分层调用策略可通过LangChain、LlamaIndex等框架的路由模块实现自动化62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/514226API
curl https://kongchang.com/api/v1/knowledge/claims/514226MCP
get_claim(id=514226)