待验证50% 置信基准精确时间
研究团队在15个长文本任务上对现成模型进行了零样本评估,测试对象包括Gemma-4-31B和Qwen-3.6-27B
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/6
首次发现
有效期至:2026/12/5
来源
涉及实体
相关事实
待验证早期在Opus模型上测试精确字符串识别率为15分之0,而Fable 5发布后同样测试变成15分之1365% 相似待验证本次测试共产生147次模型调用65% 相似待验证FFMQ-15简版在保留五因子结构的同时将题量减半,适合既想看维度剖面又需重复施测的用户,但简版对'观察'和'不反应'因子的测量精度低于完整版39题64% 相似待验证nomic-embed-text嵌入模型有137M参数,all-MiniLM-L6-v2有22M参数,BGE-small为24M-109M参数64% 相似待验证Reddit社区的大规模基准测试基于BeeLlama.cpp v0.4.0,在Qwen 3.6 27B和Gemma 4 31B两款模型上累计跑了413组配置对比,其中Qwen模型238组、Gemma模型175组63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/865959API
curl https://kongchang.com/api/v1/knowledge/claims/865959MCP
get_claim(id=865959)