共 4 篇相关文章

Anthropic发布Jacobian-Lens(雅可比透镜)后,开发者将其从可解释性工具反向用于行为编辑,通过手动调整J-Space定向修改大模型输出。本文深度解析其技术原理、表征工程价值与AI安全隐忧。
Claude Mythos预览版漏洞激增:大模型安全性如何保障?
Claude Mythos Preview发布后严重安全漏洞数量骤增,引发安全研究者广泛关注。本文深度解析新模型快速迭代与安全审查的矛盾,探讨大模型攻击面扩大的深层挑战,并为企业开发者提供实用防御策略。

智谱最新旗舰模型GLM-5.2全量开放,支持超长上下文与分档思考;同期Anthropic因安全漏洞遭美政府出口管制,Fable 5与Methos 5模型被迫下线。一文速览AI行业最新动态。
科技前沿英国政府数字服务部门GDS发布官方指南,公开反对NHS因AI安全漏洞一刀切关闭开源代码仓库,主张"保持默认开放"。这场罕见的政府内部公开分歧,揭示了公共部门在AI时代如何平衡开源透明与代码安全的深层治理挑战。