COMED
一种多模型推理框架,通过锚点后控制器实现选择性跨模型协作,介于单一路由和密集协作之间,利用自一致性、路由器间隔和轻量级同伴探针三个信号决定是否升级调用更多模型
时间轴 (近 90 天)
COMED(Controlled Model Escalation for Multi-LLM Deliberation)是一篇arXiv论文提出的多模型推理方案,旨在填补路由与密集协作之间的中间地带
COMED被设计为一个锚点后控制器(post-anchor controller),实现选择性的跨模型协作
COMED通过三个信号决定处理策略:锚点自一致性、路由器间隔、轻量级同伴探针
COMED提出挽救-损害分解(rescue-harm decomposition),当被挽救的错误数量超过协作引入的损害时选择性协作带来净收益
在16组开源权重设置中,COMED全部改进了固定锚点和路由锚点的表现
COMED在MedQA医学问答基准上的提升最高达到+10.7个百分点
相比密集协作,COMED调用了更少的模型、解码了更少的token,同时提升准确率并降低计算成本
在HLE基准测试中,COMED将GPT-5.5的表现从23.1%提升到28.1%
COMED在医学、科学和通用推理等多个基准上进行了验证
全部知识事实 (9)
COMED(Controlled Model Escalation for Multi-LLM Deliberation)是一篇arXiv论文提出的多模型推理方案,旨在填补路由与密集协作之间的中间地带
50%待验证COMED被设计为一个锚点后控制器(post-anchor controller),实现选择性的跨模型协作
50%待验证COMED通过三个信号决定处理策略:锚点自一致性、路由器间隔、轻量级同伴探针
50%待验证COMED提出挽救-损害分解(rescue-harm decomposition),当被挽救的错误数量超过协作引入的损害时选择性协作带来净收益
50%待验证在16组开源权重设置中,COMED全部改进了固定锚点和路由锚点的表现
50%待验证COMED在MedQA医学问答基准上的提升最高达到+10.7个百分点
50%待验证相比密集协作,COMED调用了更少的模型、解码了更少的token,同时提升准确率并降低计算成本
50%待验证在HLE基准测试中,COMED将GPT-5.5的表现从23.1%提升到28.1%
50%待验证COMED在医学、科学和通用推理等多个基准上进行了验证
50%