Unverified50% confidenceFactTime unknown
Anthropic的Claude Mythos Preview早期版本在228项任务套件中,达到50%成功率对应的估计时长超过16小时,是此前最优模型的两倍以上
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
AI日报:Claude自主任务超16小时,GPT5.5证明数学定理
bilibili硅基米德AI
Related Claims
UnverifiedAnthropic发布论文称Claude Mythos Preview可在复杂任务上自主工作至少16小时75% similarUnverified以Mythos Preview为例,成功率在4小时任务节点开始显著下滑,且在15分钟内的短任务中某些类别模型也无法稳定完成71% similarUnverifiedIn Theo's test, asking about video pipeline optimizations without AgentMD completed in 1 minute 11 seconds, while with AgentMD it took 1 minute 29 seconds64% similarUnverified本次实验(47分钟51秒)比上次实验(15-20分钟)运行时间更长,但复杂度更高,输出质量理论深度显著提升62% similarUnverified两个模型完成Dino Run游戏生成任务的速度相近,均在数分钟内完成61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/57424API
curl https://kongchang.com/api/v1/knowledge/claims/57424MCP
get_claim(id=57424)