共 8 篇相关文章

视觉语言模型在放射学报告生成中获得高评测分数,却系统性抹除关键临床术语并引入幻觉偏见。本文解析VLM评测指标缺陷,探讨术语抹除、模板化输出等隐患,以及如何测量模型沉默的失败。

Anthropic旗下Claude Mythos Preview模型据称发现密码算法改进攻击方式,引发安全争议。本文从技术角度分析AI密码分析的现实能力边界、双刃剑效应及对加密行业的启示。

GPT-5.6正式发布,ChatGPT与Codex合并为统一App,推出Sol、Terra、Luna三级模型。本文详解网页生成、3D建模、财报分析等16项实测结果,解析Worker模式与Codex开发者升级亮点。

伊利诺伊州通过前沿AI安全法案SB 315,涵盖透明度、审计和事件报告三大核心要求。OpenAI公开背书支持,称其采取了深思熟虑的方法。美国州级AI立法正构建事实上的国家监管框架。

深入解析AI Agent权限管理的沙箱机制,探讨OpenAI如何通过执行隔离、资源限制和渐进式信任模型来限制潜在破坏性操作,为AI安全开发提供实践参考。

OpenAI揭示模型发布前的关键环节:专门的红队团队负责破坏和压力测试AI模型。本文解析红队测试的工作方式、行业安全实践趋势,以及对开发者和用户的实际启示。