Unverified50% confidenceFactExact time
自我改进机制主要在推理阶段通过上下文工程实现行为优化,不同于涉及模型参数更新的在线微调
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified策略更新的参数化方式直接修改模型权重(如LoRA微调层在线更新),能力上限更高但引入灾难性遗忘风险;非参数化方式通过修改提示、检索内容或工具配置改变行为,可逆性强但表达能力有限76% similarUnverified自我反思通过让模型评估自身输出质量并迭代改进来实现,Reflexion框架展示了Agent可以从失败尝试中学习并在下一轮迭代中调整策略75% similarUnverified推理增强模型本质上是以推理时算力(Inference-time Compute)换取准确率74% similarUnverified提示词工程正在从通用技巧向模型特定优化方向演进74% similarUnverified使用高能力模型进行优化的推荐交互模式包括:明确定义成功指标、提供基线方案、让模型提出改进假设并预估收益、将执行结果反馈给模型迭代调整73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/829598API
curl https://kongchang.com/api/v1/knowledge/claims/829598MCP
get_claim(id=829598)