[控场AI]
模型Layla模型家族

Layla

开源决策模型家族,采用Apache 2.0许可,基于双向编码器架构,专注结构化决策任务(分类、打分、是非判断),不具备文本生成能力,包含英文、多语言和类型化决策三个检查点

时间轴 (近 90 天)

10月1日

Layla是在Jev发布三天后推出的开源模型家族,采用Apache 2.0许可开源权重

待验证50%
10月1日

Layla不是单一模型,而是包含英文、多语言和类型化决策三个检查点的模型家族

待验证50%
10月1日

Layla采用双向编码器架构,去掉传统语言头,换成由两层Transformer组成的决策头,一次前向计算只输出结构化决策而不生成文本

待验证50%
10月1日

Layla的输出原语分三种:Choice(单选输出选中项与分布概率)、Score(打分题给出期望等级)、Bool(是非题返回一个概率值)

待验证50%
10月1日

Layla英文版为4.2亿参数,多语言版为3.2亿参数并覆盖上百种语言,另有一个针对工作流微调的版本

待验证50%
10月1日

官方宣称一次调用里的多个问题在同一次前向计算中完成,但Anthros团队和AXERA NPU部署包实测发现每多一道题就多跑一次前向计算

待验证50%
10月1日

Layla作者未获得Jev的API权限从未亲测,所谓比Jev快7.8倍的对比是用本地单卡极限对比别人从法国调用云端API的跨国公网延迟

待验证50%
10月1日

在普通i5处理器上跑Layla单题飙到416毫秒,50道题并发卡死14.5秒,速度强依赖本地GPU算力

待验证50%
10月1日

Layla在Typed Decisions数据集上微调后得分0.766,但未微调的基础模型只有0.35左右,低于全猜多数选项的基线0.461

待验证50%
10月1日

Layla官方宣称校准误差0.081优于Jev,但这是重新拟合温度后的结果,原生校准误差比Jev还差,多语言版出厂温度表为空导致概率坍缩

待验证50%

还有 4 条时间轴事件

全部知识事实 (14)

待验证

Layla做工程架构时判别语言必须在前向计算之前完成,不能依赖跑完看置信度低再换路的兜底方案

50%
待验证

Layla不是单一模型,而是包含英文、多语言和类型化决策三个检查点的模型家族

50%
待验证

Layla采用双向编码器架构,去掉传统语言头,换成由两层Transformer组成的决策头,一次前向计算只输出结构化决策而不生成文本

50%
待验证

Layla的输出原语分三种:Choice(单选输出选中项与分布概率)、Score(打分题给出期望等级)、Bool(是非题返回一个概率值)

50%
待验证

Layla英文版为4.2亿参数,多语言版为3.2亿参数并覆盖上百种语言,另有一个针对工作流微调的版本

50%
待验证

官方宣称一次调用里的多个问题在同一次前向计算中完成,但Anthros团队和AXERA NPU部署包实测发现每多一道题就多跑一次前向计算

50%
待验证

Layla作者未获得Jev的API权限从未亲测,所谓比Jev快7.8倍的对比是用本地单卡极限对比别人从法国调用云端API的跨国公网延迟

50%
待验证

在普通i5处理器上跑Layla单题飙到416毫秒,50道题并发卡死14.5秒,速度强依赖本地GPU算力

50%
待验证

Layla在Typed Decisions数据集上微调后得分0.766,但未微调的基础模型只有0.35左右,低于全猜多数选项的基线0.461

50%
待验证

Layla官方宣称校准误差0.081优于Jev,但这是重新拟合温度后的结果,原生校准误差比Jev还差,多语言版出厂温度表为空导致概率坍缩

50%
待验证

Layla对选项基数和位置极度敏感,在77类分类题上准确率跌到0.425,打乱选项顺序能让20%的答案发生翻转

50%
待验证

英文版Layla碰到高棉语等未知字符时准确率为0,但平均置信度高达95%以上,表明文字跨区时模型置信度失灵

50%
待验证

Layla英文版上下文长度512,多语言版1024,面对超长输入会静默截断且不报错不提示

50%
待验证

Layla是在Jev发布三天后推出的开源模型家族,采用Apache 2.0许可开源权重

50%

来源文章