Unverified50% confidenceFactExact time
研究团队在五个被广泛使用的GUI智能体上进行了实验验证
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified尼尔森诺曼集团的研究表明,大多数可用性问题在5名测试用户后就能被发现71% similarUnverified判断此类研究可信度可从实验对象、样本规模、同行评审、机制解释、可重复性五个维度审视70% similarUnverified研究团队使用基于Opus 4.8的智能体对StochBench进行了系统测试70% similarUnverified研究团队以Llama-3.1-8B-Instruct模型为实验对象,在3个留出的欺骗检测数据集上考察探针泛化性能68% similarUnverified研究团队在专有模型和开源权重模型上使用多种智能体框架进行了广泛评测,最先进模型如GLM-5.2、Claude-Sonnet-4.6等表现仅过半67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/898616API
curl https://kongchang.com/api/v1/knowledge/claims/898616MCP
get_claim(id=898616)