Unverified70% confidenceFactTime unknown
在吃豆人测试中,Opus经过两次迭代实现了正常的游戏机制,而Gemini给了三次机会后吃豆人甚至无法移动
1
Sources
70%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
Gemini 3.1 Pro vs Opus 4.6:前端编程能力实测对比
bilibili伊莱文思帕
Related Entities
Related Claims
Unverified在超级马里奥复刻测试中,Opus经过三次迭代后几乎还原了原版游戏体验,而Gemini三次迭代后音乐不准确、游戏玩法不正确76% similarUnverifiedGemini 3在SWE-bench基准测试中智能体场景下的得分远超同类模型70% similarUnverifiedGemini 2.5 Pro在数学能力基准测试中与O3 Mini持平,两者都将其他模型远远甩在身后67% similarUnverified科技博主Theo在实战编码测试中发现Gemini 3.5 Flash是所有测试模型中唯一一个没能让游戏正常运行的65% similarVerifiedGemini 3.5 Flash在几乎所有基准测试中超越了Gemini 3.1 Pro64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/9557API
curl https://kongchang.com/api/v1/knowledge/claims/9557MCP
get_claim(id=9557)