Unverified50% confidenceBenchmarkExact time
研究团队在15个长文本任务上对现成模型进行了零样本评估,测试对象包括Gemma-4-31B和Qwen-3.6-27B
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/6/2026
First Seen
Valid until: 12/5/2026
Sources
Related Entities
Related Claims
Unverified早期在Opus模型上测试精确字符串识别率为15分之0,而Fable 5发布后同样测试变成15分之1365% similarUnverified本次测试共产生147次模型调用65% similarUnverifiedFFMQ-15简版在保留五因子结构的同时将题量减半,适合既想看维度剖面又需重复施测的用户,但简版对'观察'和'不反应'因子的测量精度低于完整版39题64% similarUnverifiednomic-embed-text嵌入模型有137M参数,all-MiniLM-L6-v2有22M参数,BGE-small为24M-109M参数64% similarUnverifiedReddit社区的大规模基准测试基于BeeLlama.cpp v0.4.0,在Qwen 3.6 27B和Gemma 4 31B两款模型上累计跑了413组配置对比,其中Qwen模型238组、Gemma模型175组63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/865959API
curl https://kongchang.com/api/v1/knowledge/claims/865959MCP
get_claim(id=865959)