待验证50% 置信基准精确时间
在自动化业务流程测试中,GPT-6 Sol表现超越Cloud Opus 5,单任务成本约为对方的9%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/29
首次发现
有效期至:2026/12/28
来源
涉及实体
相关事实
待验证GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一79% 相似部分验证三个 GPT-5.6 模型在长程代理微调任务上均拿满分 10 分,而 GPT-5.5 和 Opus 4.7 在该任务只能拿两三分76% 相似待验证在数学难题上SOL和TERRA均拿到满分10分,在自适应微调任务上三款GPT-5.6模型全部满分,而此前GPT-5.5和Opus 4.7在同一任务上仅能拿到两三分75% 相似待验证GPT-6 Sol和GPT-6 Luna在更低成本下实现了强劲表现,并在OfficeQA Pro基准测试上推高了帕累托前沿75% 相似待验证TwinCheck 完整策略将 GPT-5.6 Sol 模型的任务成功率从 45.3% 提升到 58.5%,95%任务自助法置信区间为[8.2, 18.8]74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/958996API
curl https://kongchang.com/api/v1/knowledge/claims/958996MCP
get_claim(id=958996)