小语言模型
参数量较小(通常数十亿以下)、可在端侧设备本地运行的语言模型,在保持一定能力的同时具备低延迟、低功耗、离线可用等优势
核心事实
时间轴 (近 90 天)
在91%的数据集-模型组合中,无论答案正确与否,平均token熵都接近于零
熵方法在SLM中的价值主张并非节省计算,而是智能的算力分配
语义熵成功恢复了一个可用的置信度信号,弥补了token级熵在SLM上的盲区
在小语言模型中,基于token熵的置信度信号几乎失效,无法区分正确与错误答案
SLM的推理成本可比主流大模型低1至2个数量级,且能在本地或边缘设备上运行
Parsec引入一个专门训练用于压缩token的小语言模型(SLM),在内容进入主模型之前先做预处理
使用便宜的小模型处理过滤、路由、摘要等辅助任务,再将精炼信息交给昂贵的主模型,是控制成本与延迟的一种分层架构路径
近期研究指出,agentic工作负载中大量重复且范围狭窄的子任务由专门化的SLM处理可能比使用单一庞大的LLM更合适
交互式编排策略(如多模型辩论、迭代式验证)要求模型维持多轮对话上下文,对上下文窗口长度和计算量要求较高,恰是SLM的两个主要瓶颈
非交互式范式通过将生成与选择彻底解耦,规避了SLM在上下文窗口和计算量上的瓶颈依赖
还有 2 条时间轴事件
全部知识事实 (13)
小语言模型(SLM)通常指参数量在1B-7B之间的模型
90%待验证熵方法在SLM中的价值主张并非节省计算,而是智能的算力分配
50%待验证在91%的数据集-模型组合中,无论答案正确与否,平均token熵都接近于零
50%待验证在小语言模型中,基于token熵的置信度信号几乎失效,无法区分正确与错误答案
50%待验证语义熵成功恢复了一个可用的置信度信号,弥补了token级熵在SLM上的盲区
50%待验证使用便宜的小模型处理过滤、路由、摘要等辅助任务,再将精炼信息交给昂贵的主模型,是控制成本与延迟的一种分层架构路径
50%待验证Parsec引入一个专门训练用于压缩token的小语言模型(SLM),在内容进入主模型之前先做预处理
50%待验证SLM的推理成本可比主流大模型低1至2个数量级,且能在本地或边缘设备上运行
50%待验证交互式编排策略(如多模型辩论、迭代式验证)要求模型维持多轮对话上下文,对上下文窗口长度和计算量要求较高,恰是SLM的两个主要瓶颈
50%待验证非交互式范式通过将生成与选择彻底解耦,规避了SLM在上下文窗口和计算量上的瓶颈依赖
50%待验证近期研究指出,agentic工作负载中大量重复且范围狭窄的子任务由专门化的SLM处理可能比使用单一庞大的LLM更合适
50%待验证SLM的能力和上下文窗口相对有限,制约了它们在长链条推理及依赖高频交互的编排策略上的表现
50%待验证小语言模型(SLM)参数量通常在几十亿以内,追求在手机、笔记本等设备上本地运行
50%