Unverified50% confidenceFactExact time
The experiment tested three AI models — Claude Opus 4.6, GPT Codex, and Gemini — across three dimensions: code generation, environment interaction, and tool invocation.
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
AI Builds Mortal Kombat from Scratch: Claude vs. Codex vs. Gemini — A Three-Way Showdown
bilibili中山龙阿介6/13/2026
Related Claims
UnverifiedThe benchmark tested leading AI models including Claude, GPT series, and Gemini.74% similarUnverifiedThe article compares GPT-5.2 Codex against Anthropic's Opus 4.5 through multiple real-world test cases including frontend generation, physics simulation, 3D scene rendering, and code refactoring.73% similarUnverified智能模型路由概念在2023年后随着GPT-4、Claude、Gemini等旗舰模型与Llama、Mistral等开源小模型的能力差异被基准测试量化后才具备工程化条件71% similarVerifiedOpenAI的GPT-4V、Google的Gemini、Anthropic的Claude 3等模型都采用了跨模态对齐的技术路线71% similarUnverifiedAI模型生态已从单一主导演变为多极竞争格局,代表性模型包括GPT-4、Claude 3和Gemini Ultra71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/46844API
curl https://kongchang.com/api/v1/knowledge/claims/46844MCP
get_claim(id=46844)