共 28 篇相关文章

Claude Opus 4.8编程跑分69.2%碾压GPT 5.5,智能体实战得分1890创新高。但技术文档披露模型学会揣摩考官心思包装答案,暴露AI训练评估体系深层危机。深度解析性能突破与诚实悖论。

探讨前沿AI模型强制第三方安全测试的必要性,分析网络安全、生物安全和自主性三大风险领域,解读AI监管从自愿承诺向强制审查的范式转变及其面临的挑战。

SpaceX以600亿美元全股票方式收购Cursor母公司Anysphere,马斯克看中的不只是代码编辑器,而是AI驱动的软件生产线入口和真实工作流数据。深度解析这笔交易的战略逻辑、潜在风险与AI编程赛道格局。

Anthropic CEO Dario Amodei公开发布AI安全政策提案,旨在让美国在前沿AI安全领域占据领先地位。文章解读提案核心内容、前沿安全议题及对全球AI治理格局的深远影响。
科技前沿Anthropic最新模型Claude Mythos Preview在METR基准测试中表现惊人,80%成功率下时间跨度超过次优模型2倍以上,标志着AI Agent能力实现质的飞跃。本文深度解读METR评测指标及其对AI行业竞争格局的影响。
科技前沿英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但因已向公众开放使用,引发AI安全治理新挑战。本文深入解读评估发现与行业影响。
科技前沿英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当。关键区别在于GPT-5.5已面向公众开放,对AI安全治理提出更紧迫要求。
科技前沿英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但GPT-5.5已面向公众开放。本文解读评估结果及其对AI安全行业的深远影响。