Unverified85% confidenceFactTime unknown
在Mermaid流程图生成测试中,GPT-OSS 120B和20B均生成了有语法错误的代码,测试失败
1
Sources
85%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026
Sources
GPT-OSS 120B/20B开源模型深度测评:幻觉、推理、代码全面实测
bilibiliAI超元域
Related Entities
Related Claims
UnverifiedGPT-OSS在联网搜索功能测试中出现严重幻觉问题,编造了不存在的模型版本号(1.3B、7B、34B、70B)和错误的发布时间72% similarUnverifiedGPT-OSS 20B在经典逻辑推理题(判断谁在说谎)测试中给出了错误答案70% similarUnverified在贪吃蛇游戏代码生成测试中,GPT-OSS 120B的代码生成质量与O4 Mini基本持平,某些细节上表现更好70% similarUnverified在幻觉测试中,GPT-OSS 120B和20B均通过了全部六道陷阱题70% similarUnverifiedgpt-oss-20b能够以比gemma4:12B更快的速度发现相同的代码问题64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/23227API
curl https://kongchang.com/api/v1/knowledge/claims/23227MCP
get_claim(id=23227)