决策模型
由Maggie Appleton提出的AI模型新范式概念,指接受文本输入但输出结构化概率决策(而非文本)的模型类型,适用于分类、评分、排序等决策任务
核心事实
时间轴 (近 90 天)
决策模型是一类区别于生成式语言模型的专用架构,核心目标是对给定输入输出结构化判断结果而非生成自然语言文本
决策模型在棋类博弈、机器人运动控制、数据中心能耗调度等需要多步规划的场景中已展现出远超传统方法的性能上限
决策模型的输出往往是有限动作集合中的一个标签或概率分布,类似于强化学习中的策略网络,而生成模型需要在巨大词汇表上进行自回归采样
Agent harness的决策主要分为三类:Choice(从预定义集合中选一个)、Truth(评估断言的真值或概率)、Score(对候选项打分排序)
决策模型不产生自由格式的token流,而是针对一个有界的假设空间去评估当前状态
动态技能注入通过决策模型对每个候选技能做真值评估,只有超过置信阈值的技能才被注入本轮Agent上下文
选择性记忆压缩通过决策模型判断某个执行片段是否'已了结',已了结则折叠为语义摘要,否则保留原始日志
混合Schema拆分在运行时检查schema:纯离散类型完全走决策模型,混合schema则拆分为离散字段(决策模型)和自由文本字段(生成式模型)并发执行后拼接
约束解码、微调小型分类模型、logprobs接口三种决策模型实现路径在延迟、成本和工程复杂度上各有权衡,但共同点是输出约束发生在架构层面
决策模型是专门为实时行为控制设计的轻量推理模型,以极低延迟输出离散动作指令(如上下左右),可压缩到几百 MB 以内,与通用大语言模型有本质区别
还有 6 条时间轴事件
全部知识事实 (16)
决策型模型擅长分类、路由、判断这类结构化任务,而非长篇文本生成
75%待验证云端推理需要经历网络往返(请求上行、服务器排队、模型计算、结果下行),每一步都会引入延迟
60%待验证当控制层比模型推理更难维护时,本身就是应该将决策权放给模型的信号
60%待验证决策模型是一类区别于生成式语言模型的专用架构,核心目标是对给定输入输出结构化判断结果而非生成自然语言文本
50%待验证决策模型在棋类博弈、机器人运动控制、数据中心能耗调度等需要多步规划的场景中已展现出远超传统方法的性能上限
50%待验证决策模型的输出往往是有限动作集合中的一个标签或概率分布,类似于强化学习中的策略网络,而生成模型需要在巨大词汇表上进行自回归采样
50%待验证Agent harness的决策主要分为三类:Choice(从预定义集合中选一个)、Truth(评估断言的真值或概率)、Score(对候选项打分排序)
50%待验证决策模型不产生自由格式的token流,而是针对一个有界的假设空间去评估当前状态
50%待验证动态技能注入通过决策模型对每个候选技能做真值评估,只有超过置信阈值的技能才被注入本轮Agent上下文
50%待验证选择性记忆压缩通过决策模型判断某个执行片段是否'已了结',已了结则折叠为语义摘要,否则保留原始日志
50%待验证混合Schema拆分在运行时检查schema:纯离散类型完全走决策模型,混合schema则拆分为离散字段(决策模型)和自由文本字段(生成式模型)并发执行后拼接
50%待验证约束解码、微调小型分类模型、logprobs接口三种决策模型实现路径在延迟、成本和工程复杂度上各有权衡,但共同点是输出约束发生在架构层面
50%待验证决策模型是专门为实时行为控制设计的轻量推理模型,以极低延迟输出离散动作指令(如上下左右),可压缩到几百 MB 以内,与通用大语言模型有本质区别
50%待验证在金融风控、医疗分诊、供应链调度等对可解释性要求极高的场景中,决策类模型比 GPT 类模型更具实用价值
50%待验证判断型决策模型的输出是封闭的结构化结果,本质上是一次前向传播的分类或回归任务,不存在自回归迭代开销
50%待验证低延迟与高质量推理往往难以兼得,前后台分离架构通过任务分级路由解决这一矛盾
50%