Unverified50% confidenceFactExact time
研究对六个主流大语言模型进行了测试
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/11/2026
First Seen
Valid until: 12/10/2026
Sources
Related Entities
Related Claims
UnverifiedOpenAI、DeepMind等机构的多项研究都证实了大语言模型谄媚问题的普遍性67% similarUnverified一篇题为《A global workspace in language models》的研究试图将全局工作空间理论引入大语言模型的可解释性研究66% similarUnverified研究界逐步转向结合大语言模型的新一代评估框架如COMET和BERTScore以更好捕捉语义层面翻译质量66% similarUnverified评估大语言模型能力的常见基准测试包括MMLU、HumanEval、MATH以及LMSYS Chatbot Arena66% similarUnverifiedEleutherAI的Language Model Evaluation Harness专注于能力基准测试65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/892948API
curl https://kongchang.com/api/v1/knowledge/claims/892948MCP
get_claim(id=892948)