RSI
递归自我改进,指AI系统通过自身的使用反馈和参与研发过程,持续优化自身能力的循环机制,是通往AGI的关键路径之一
Core Facts
Timeline (last 90 days)
论文讨论四类限制回路的因素:研究回报递减、实验需要算力和数据、有些任务难以交给AI、长时间流程无法靠复制研究员缩短
重复性劳损(RSI)是由重复动作、过度用力或长时间保持不良姿势引发的一类肌肉骨骼疾病的统称
本文关于LLM缓解RSI的观察来自单一个人经验,样本有限,并非经过验证的医学结论
使用LLM辅助编程可能导致替代性劳损风险,将负荷从手指转移到鼠标操作等别处
过去RSI的解决方案多集中在硬件层面,如人体工学键盘、垂直鼠标、语音输入、定时休息提醒
击键次数的下降可直接减少手腕和手指承受的累积性负荷
一篇来自Hacker News的分享提出大语言模型可能在无意中帮助缓解了作者的RSI症状
部分职业健康研究估计软件开发者中RSI相关症状的发生率可达20%–50%
有效的RSI管理需要综合手段,包括合理休息节奏、正确坐姿、人体工学设备及必要时的专业诊疗
RSI与RLHF和模型蒸馏存在本质区别:后两者仍依赖人类反馈信号或教师模型,而RSI强调系统自主生成改进方向
28 more timeline events
All Facts (20)
RSI(递归自我改进)指的是AI能够自己创造下一个版本的自己
80%UnverifiedRSI(Recursive Self-Improvement,递归自我改进)指一个系统能够不断优化自己的能力,形成正反馈循环
60%Unverified论文讨论四类限制回路的因素:研究回报递减、实验需要算力和数据、有些任务难以交给AI、长时间流程无法靠复制研究员缩短
50%Unverified使用LLM辅助编程可能导致替代性劳损风险,将负荷从手指转移到鼠标操作等别处
50%Unverified过去RSI的解决方案多集中在硬件层面,如人体工学键盘、垂直鼠标、语音输入、定时休息提醒
50%Unverified击键次数的下降可直接减少手腕和手指承受的累积性负荷
50%Unverified一篇来自Hacker News的分享提出大语言模型可能在无意中帮助缓解了作者的RSI症状
50%Unverified部分职业健康研究估计软件开发者中RSI相关症状的发生率可达20%–50%
50%Unverified重复性劳损(RSI)是由重复动作、过度用力或长时间保持不良姿势引发的一类肌肉骨骼疾病的统称
50%Unverified有效的RSI管理需要综合手段,包括合理休息节奏、正确坐姿、人体工学设备及必要时的专业诊疗
50%Unverified本文关于LLM缓解RSI的观察来自单一个人经验,样本有限,并非经过验证的医学结论
50%UnverifiedRSI与RLHF和模型蒸馏存在本质区别:后两者仍依赖人类反馈信号或教师模型,而RSI强调系统自主生成改进方向
50%UnverifiedRaven 是一个专为 RSI(递归自我改进)场景构建的项目,被其作者定位为'the harness of harnesses'(框架的框架)
50%Unverified能够修改自身的系统很容易在迭代中偏离目标甚至崩溃,因此 RSI 框架需要内置严格的评估与回滚机制
50%Unverified当前 LLM 驱动的 RSI 实践依赖模型的代码生成与自我批评能力,典型代表包括 AlphaCode 的迭代修复流程以及 Reflexion 论文所描述的 reflection 机制
50%Unverified在 RSI 场景下奖励黑客问题被放大,因为系统可以修改自身的评估逻辑,有可能直接篡改裁判
50%Unverified递归自我改进(RSI)意味着系统需要评估自己的输出、修改自己的策略、甚至重构自己的执行流程
50%Unverified限制递归自我改进(RSI)的不是GPU算力,而是训练环境的供给
50%Unverified目前的AI辅助研究依然需要人类研究员把关决策,尚未脱离人类控制形成闭环加速,真正的RSI仍是理论假设
50%Unverified递归自我改进(RSI)概念最早由AI安全研究者I.J. Good在1965年提出,称之为智能爆炸
50%