Neural 3
Cactus Compute(YC孵化)推出的超小型端侧语言模型,专注于结构化输出与工具调用,完整版仅29MB,支持在手机、手表、嵌入式开发板等边缘设备上运行
Timeline (last 90 days)
Neural 3(又称Needle)是由YC孵化的旧金山创业公司Cactus Compute推出的端侧模型,不需要联网,可运行在手机、手表和小开发板上
Neural 3完整版只有29MB,最小可用版本约8MB,权重被压缩到约每个2比特
Neural 3通过语法约束(grammar-constrained decoding)将函数schema编译成字节级语法,确保生成的每个token都符合语法,使JSON永远能解析成功
Cactus将传统Transformer的前馈层替换为headband MLP,每层仅约2.56万参数而非470万,大部分知识存放在engram表中通过哈希查找2到3个词的短片段
1.21亿参数的完整Neural 3模型实际计算量约等于一个5000万参数模型
Neural 3的智能滑块设计使模型共20层,深度2到4都能作为独立模型运行,4层版本有2900万参数,每多加一层约多消耗1MB内存
Neural 3在小开发板上报告解码速度约为每秒400到4000个token
Neural 3的三路分流路由模式为:置信度≥0.7直接执行,中间区间请用户确认,无返回则回复无法完成,引擎默认置信度下限为0.5
Neural 3的抽取功能填充的每个字段都是从原文复制的span,如果值没在文本里明确写出模型就产不出来,信息分散的文本比干净的文本更难处理
Neural 3 base模型4层版在mobile action基准上只有11.7分、droid call上21分,完整20层分别为86和47分,有开发者自测只得到32.2%
3 more timeline events
All Facts (13)
Neural 3(又称Needle)是由YC孵化的旧金山创业公司Cactus Compute推出的端侧模型,不需要联网,可运行在手机、手表和小开发板上
50%UnverifiedNeural 3完整版只有29MB,最小可用版本约8MB,权重被压缩到约每个2比特
50%UnverifiedNeural 3通过语法约束(grammar-constrained decoding)将函数schema编译成字节级语法,确保生成的每个token都符合语法,使JSON永远能解析成功
50%UnverifiedCactus将传统Transformer的前馈层替换为headband MLP,每层仅约2.56万参数而非470万,大部分知识存放在engram表中通过哈希查找2到3个词的短片段
50%Unverified1.21亿参数的完整Neural 3模型实际计算量约等于一个5000万参数模型
50%UnverifiedNeural 3的智能滑块设计使模型共20层,深度2到4都能作为独立模型运行,4层版本有2900万参数,每多加一层约多消耗1MB内存
50%UnverifiedNeural 3在小开发板上报告解码速度约为每秒400到4000个token
50%UnverifiedNeural 3的三路分流路由模式为:置信度≥0.7直接执行,中间区间请用户确认,无返回则回复无法完成,引擎默认置信度下限为0.5
50%UnverifiedNeural 3的抽取功能填充的每个字段都是从原文复制的span,如果值没在文本里明确写出模型就产不出来,信息分散的文本比干净的文本更难处理
50%UnverifiedNeural 3 base模型4层版在mobile action基准上只有11.7分、droid call上21分,完整20层分别为86和47分,有开发者自测只得到32.2%
50%UnverifiedCactus官方表示Needle是任务专用模型,上生产前应先微调,base模型是起点而非成品助手
50%UnverifiedNeural 3微调默认10个epoch,在冻结的base上训练LoRA适配器,支持为macOS、Windows、Linux、Android、iOS、watchOS及WebAssembly浏览器导出不到1MB的预编译引擎
50%UnverifiedNeural 3采用Apache 2.0开源协议,按次调用零成本,数据永不离开设备
50%