Unverified60% confidenceFactExact time
decisionrl 支持的算法包括 DQN、PPO、SAC、TRPO 等在线算法,以及离线RL、基于模型的方法、多智能体和元强化学习
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
7/15/2026
First Seen
Valid until: 10/13/2026
Sources
Related Claims
Unverifieddecisionrl 底层是一个带类型标注、有测试覆盖的通用RL框架,支持DQN、PPO、SAC、TRPO等主流在线算法83% similarUnverifieddecisionrl 是由开发者 Denis Drobyshev 开发的、专门面向运营决策问题的强化学习开源库65% similarUnverified工具调用层允许模型通过标准化接口如Function Calling操作搜索引擎、代码解释器、日历、邮件等外部系统64% similarUnverified主流本地推理框架包括 llama.cpp、MLX(Apple 为自家芯片优化的机器学习框架)和 Ollama64% similarUnverified多模型工作流的分层调用策略可通过LangChain、LlamaIndex等框架的路由模块实现自动化62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/514226API
curl https://kongchang.com/api/v1/knowledge/claims/514226MCP
get_claim(id=514226)