NeoHorse-1-4B
由Token Rhythm团队开发的约40亿参数开源小模型,基于Coin 3.5框架,支持VLM多模态,采用递归式自我改进训练范式,通过观察实时路由系统决策日志和课程学习方式提升能力
时间轴 (近 90 天)
NeoHorse-1-4B 是一款约 40 亿参数的开源模型,基于 Coin 3.5 框架,由 Token Rhythm 团队开发
NeoHorse-1-4B 通过观察实时路由系统的决策过程来改进自己,而非依靠学习静态样本
NeoHorse 的训练数据按难易程度依次输入模型,采用由易到难的顺序积累能力
NeoHorse 在第二轮训练中由更强大的教师模型实时观察并纠正其尝试过程,而非直接给出预写好的标准答案
NeoHorse 的自我递归循环发生在训练阶段,推理阶段不会触发
在博主搭建的 GlacierWatch 冰川洪水预警系统演示中,NeoHorse-1-4B 通过 Hermes 代理运行,自主发现并修复了系统显示'淹没区内无人员'的逻辑漏洞,修复后正确显示淹没区内有超过 4.1 万人
模型在递归推理过程中出现思考过程夹杂疑似俄语内容的语言漂移现象
开发团队将 NeoHorse-1-4B 与五个约 40 亿参数的小型模型对比,在代理任务、编程、指令执行等类别中该模型名列前茅,且 10 项测试基准的平均分表现均衡
NeoHorse-1-4B 在创意写作任务中出现人物身份不稳定、指代混乱的问题,博主认为其创意写作能力不如原版 Coin 模型
递归训练大量使用以任务完成率、代码运行结果为奖励信号,缺乏对叙事一致性的显式监督,可能导致语言建模通用能力的灾难性遗忘,在小参数量模型上更明显
还有 1 条时间轴事件
全部知识事实 (11)
NeoHorse-1-4B 是一款约 40 亿参数的开源模型,基于 Coin 3.5 框架,由 Token Rhythm 团队开发
50%待验证NeoHorse-1-4B 通过观察实时路由系统的决策过程来改进自己,而非依靠学习静态样本
50%待验证NeoHorse 的训练数据按难易程度依次输入模型,采用由易到难的顺序积累能力
50%待验证NeoHorse 在第二轮训练中由更强大的教师模型实时观察并纠正其尝试过程,而非直接给出预写好的标准答案
50%待验证NeoHorse 的自我递归循环发生在训练阶段,推理阶段不会触发
50%待验证递归训练大量使用以任务完成率、代码运行结果为奖励信号,缺乏对叙事一致性的显式监督,可能导致语言建模通用能力的灾难性遗忘,在小参数量模型上更明显
50%待验证NeoHorse-1-4B 适合本地部署和代理型任务(编程与 bug 排查),但不适合创意写作或需要长文一致性的场景
50%待验证开发团队将 NeoHorse-1-4B 与五个约 40 亿参数的小型模型对比,在代理任务、编程、指令执行等类别中该模型名列前茅,且 10 项测试基准的平均分表现均衡
50%待验证NeoHorse-1-4B 在创意写作任务中出现人物身份不稳定、指代混乱的问题,博主认为其创意写作能力不如原版 Coin 模型
50%待验证在博主搭建的 GlacierWatch 冰川洪水预警系统演示中,NeoHorse-1-4B 通过 Hermes 代理运行,自主发现并修复了系统显示'淹没区内无人员'的逻辑漏洞,修复后正确显示淹没区内有超过 4.1 万人
50%待验证模型在递归推理过程中出现思考过程夹杂疑似俄语内容的语言漂移现象
50%