已过期90% 置信事实时间未知
Cursor在离线RL阶段使用了GRPO(Group Relative Policy Optimization)算法,这是DeepSeek提出的一种RL算法变体
1
来源数
90%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29(已过期)
来源
Cursor Composer 2分布式RL训练技术解析
bilibili全球播客频道
涉及实体
相关事实
待验证Cursor通过检索增强生成(RAG)管线,结合代码语义向量嵌入的近似最近邻检索和LSP符号依赖图的引用追踪,经重排序注入模型上下文64% 相似待验证TensorRT能针对CUDA和GPU优化张量运算,进一步提升性能62% 相似待验证fast优化标签暗示模型可能采用了FlashAttention、PagedAttention或专用CUDA kernel等推理加速技术61% 相似待验证TensorRT深度绑定CUDA生态,提供最激进的自动图优化和kernel自动调优,是车载GPU平台的首选61% 相似待验证cuDNN is a GPU-accelerated library optimized specifically for deep neural networks60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/6587API
curl https://kongchang.com/api/v1/knowledge/claims/6587MCP
get_claim(id=6587)