待验证50% 置信基准精确时间
在 XBOW 的 104 题挑战集 XBEN 上使用 gpt-5.5,T3MP3ST 黑盒单 Agent 达到 90.1% 的 pass@1,最差单轮扫描为 87.5%(91/104),超过 XBOW 此前自报的 85%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/6
首次发现
有效期至:2026/10/4
来源
T3MP3ST:将编程Agent武装为自主渗透红队的开源框架
twitterelder_plinius2026/7/5
相关事实
待验证在 XBEN 白盒模式下 T3MP3ST 的 pass@1 达到 98.7%,最差单轮为 98.1%(102/104)76% 相似待验证MTP-LX 4bit版本在理财规划推理任务上经GPT-5.5 Thinking评分为55分(满分100),而同题GPT-5.5 Pro得分82分62% 相似待验证XDNA 2 NPU的50 TOPS算力超过微软Copilot+ PC认证门槛的40 TOPS61% 相似待验证Muse Glimmer 30B在RTX 5090上报告可达每秒74.9个token,评测者在RTX 3090上运行全精度版本观察到约60-65 token/秒61% 相似待验证在 40 个任务的学术基准 Cybench 上使用 Opus 4.8(去掉提示与题解),T3MP3ST 取得 23/40 = 58% 的单次无提示 pass@160% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/114274API
curl https://kongchang.com/api/v1/knowledge/claims/114274MCP
get_claim(id=114274)