[KongchangAI]
ModelNeedle / Neural3

Neural 3

Cactus Compute(YC孵化)推出的超小型端侧语言模型,专注于结构化输出与工具调用,完整版仅29MB,支持在手机、手表、嵌入式开发板等边缘设备上运行

Timeline (last 90 days)

Oct 5

Neural 3(又称Needle)是由YC孵化的旧金山创业公司Cactus Compute推出的端侧模型,不需要联网,可运行在手机、手表和小开发板上

Unverified50%
Oct 5

Neural 3完整版只有29MB,最小可用版本约8MB,权重被压缩到约每个2比特

Unverified50%
Oct 5

Neural 3通过语法约束(grammar-constrained decoding)将函数schema编译成字节级语法,确保生成的每个token都符合语法,使JSON永远能解析成功

Unverified50%
Oct 5

Cactus将传统Transformer的前馈层替换为headband MLP,每层仅约2.56万参数而非470万,大部分知识存放在engram表中通过哈希查找2到3个词的短片段

Unverified50%
Oct 5

1.21亿参数的完整Neural 3模型实际计算量约等于一个5000万参数模型

Unverified50%
Oct 5

Neural 3的智能滑块设计使模型共20层,深度2到4都能作为独立模型运行,4层版本有2900万参数,每多加一层约多消耗1MB内存

Unverified50%
Oct 5

Neural 3在小开发板上报告解码速度约为每秒400到4000个token

Unverified50%
Oct 5

Neural 3的三路分流路由模式为:置信度≥0.7直接执行,中间区间请用户确认,无返回则回复无法完成,引擎默认置信度下限为0.5

Unverified50%
Oct 5

Neural 3的抽取功能填充的每个字段都是从原文复制的span,如果值没在文本里明确写出模型就产不出来,信息分散的文本比干净的文本更难处理

Unverified50%
Oct 5

Neural 3 base模型4层版在mobile action基准上只有11.7分、droid call上21分,完整20层分别为86和47分,有开发者自测只得到32.2%

Unverified50%

3 more timeline events

All Facts (13)

Unverified

Neural 3(又称Needle)是由YC孵化的旧金山创业公司Cactus Compute推出的端侧模型,不需要联网,可运行在手机、手表和小开发板上

50%
Unverified

Neural 3完整版只有29MB,最小可用版本约8MB,权重被压缩到约每个2比特

50%
Unverified

Neural 3通过语法约束(grammar-constrained decoding)将函数schema编译成字节级语法,确保生成的每个token都符合语法,使JSON永远能解析成功

50%
Unverified

Cactus将传统Transformer的前馈层替换为headband MLP,每层仅约2.56万参数而非470万,大部分知识存放在engram表中通过哈希查找2到3个词的短片段

50%
Unverified

1.21亿参数的完整Neural 3模型实际计算量约等于一个5000万参数模型

50%
Unverified

Neural 3的智能滑块设计使模型共20层,深度2到4都能作为独立模型运行,4层版本有2900万参数,每多加一层约多消耗1MB内存

50%
Unverified

Neural 3在小开发板上报告解码速度约为每秒400到4000个token

50%
Unverified

Neural 3的三路分流路由模式为:置信度≥0.7直接执行,中间区间请用户确认,无返回则回复无法完成,引擎默认置信度下限为0.5

50%
Unverified

Neural 3的抽取功能填充的每个字段都是从原文复制的span,如果值没在文本里明确写出模型就产不出来,信息分散的文本比干净的文本更难处理

50%
Unverified

Neural 3 base模型4层版在mobile action基准上只有11.7分、droid call上21分,完整20层分别为86和47分,有开发者自测只得到32.2%

50%
Unverified

Cactus官方表示Needle是任务专用模型,上生产前应先微调,base模型是起点而非成品助手

50%
Unverified

Neural 3微调默认10个epoch,在冻结的base上训练LoRA适配器,支持为macOS、Windows、Linux、Android、iOS、watchOS及WebAssembly浏览器导出不到1MB的预编译引擎

50%
Unverified

Neural 3采用Apache 2.0开源协议,按次调用零成本,数据永不离开设备

50%

Source Articles