Unverified50% confidenceFactExact time
Previous benchmarks for AI web development only tested static pages or isolated code snippets, not full-stack systems.
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Tsinghua and Zhipu Release Full-Stack Web Dev Benchmark: Top AI Models Fail Spectacularly
bilibili跟我学一辈子AI吧5/22/2026
Related Claims
UnverifiedTheo在测试Codex Max进行AI SDK升级任务时遭遇严重问题:搜索工具报错崩溃、模型引入大量as any类型断言破坏TypeScript类型安全、从未主动运行tsc进行类型检查62% similarUnverified突变测试通过对源代码进行小规模随机修改后运行现有测试套件,若测试未检测到突变体则说明测试覆盖存在盲区,主流工具包括 Java 的 PIT、Python 的 mutmut、JavaScript 的 Stryker60% similarUnverifiedPortel七个月里从未坐下来完整读过AI生成的代码,只做了编译通过和Happy Path测试的最低限度审查59% similarUnverified现有基准测试如WebSRC、Design2Code主要衡量结构还原度,并不涉及品位判断59% similarUnverifiedWebApp UI 自动化测试通常基于 Selenium、Playwright 或 Cypress 等框架实现,核心挑战在于页面元素定位的稳定性和测试脚本的可维护性59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/50422API
curl https://kongchang.com/api/v1/knowledge/claims/50422MCP
get_claim(id=50422)