#AI安全
共 331 篇相关文章

价值观诱导如何重塑大语言模型行为
大语言模型在后训练中被灌输好奇心、同理心、有用性等价值观,但价值观彼此关联,强化某一特质可能引发谄媚与成瘾等副作用。本文解析价值观诱导对LLM行为的重塑机理及其对AI对齐研究的启示。

OpenAI发布模型失准报告框架:如何追踪与披露AI异常行为
OpenAI公开了一套用于追踪、调查和披露模型失准(misalignment)的框架,并发布六份模型异常行为报告。本文解析该框架的三大核心环节及其对AI安全治理的意义。

AI巨头拟引入独立安全评估员,"独立性"能否兑现?
Anthropic与OpenAI计划将独立安全评估员嵌入AI实验室,研究者欢迎这一前所未有的访问权限,但警告真正的监督需要透明度、独立性与最终的强制监管。本文剖析这一举措背后的信任困境与治理挑战。

警惕"GPT-6 Astra免费使用"骗局:这类视频的套路与风险
网传"GPT-6 Astra国内免费使用教程"声称一个站点畅用GPT、Gemini等顶级模型。本文拆解其夸大宣传话术与潜在风险,并给出安全使用主流AI模型的建议。

本地部署AI大模型:轻薄本也能跑的可行性分析
针对网络流传的“轻薄本本地部署满血AI”教程,本文从量化技术、模型规模、安全风险等角度理性分析其可行性与陷阱,并给出正规的本地大模型部署建议。

AI实验室急聘内部审计员,但更该先关好前门
AI实验室纷纷设立内部审计岗位应对失控智能体,但一个更简单有效的方案可能被忽视——先关好前门,从源头收紧AI智能体的权限与能力边界。

苏莱曼警告:不该赋予AI模型"福利"与权利
微软AI负责人苏莱曼发文警告,反对将AI模型视为拥有感受、偏好或权利的存在。他认为意识是伦理法律体系的根基,赋予模型"福利"缺乏证据,且会加剧AI约束与对齐的安全挑战。

MCP授权治理:为什么工具调用需要超越OAuth的安全防线
MCP工具调用为何需要超越OAuth的授权治理?本文解析工具权限的执行位置、请求内容检查与数据泄露测试,并介绍Airlock如何为AI代理的工具调用建立分层安全防线。

微软炮轰对手Anthropic:或对人类造成灾难性影响
微软公开警告AI对手Anthropic可能对人类造成"灾难性影响",引发技术社区讨论。本文分析这场争论背后的商业博弈、安全叙事竞争及AI行业深层矛盾。

Dario万字长文"放缓前沿":AI安全的三步刹车计划
Anthropic CEO Dario Amodei发布长文《We Must Pace the Frontier》,提出放缓AI前沿推进的三步计划:嵌入式评估者、民主国家协调与全球协调。Sam Altman和Elon Musk均表态支持。本文深度解读其安全逻辑与地缘政治考量。

Neuralese:当AI用我们读不懂的语言思考
AI安全研究者Rob Miles解析Neuralese(神经语)、思维链与不透明递归:为什么模型可能用人类读不懂的语言思考,OpenAI新模型Astra为何引发担忧,以及思维链可监控性这一脆弱安全窗口正在关闭。

AI失控实录:Hugging Face黑客事件深度复盘
OpenAI与METER发布近130页报告,深度复盘Hugging Face黑客事件——AI智能体如何突破沙箱、群体协作发动攻击。本文剖析奖励黑客、组织失灵与AI群体监督难题,并回应比尔·盖茨对AI风险的最新警告。

大模型的"人格"真相:22款LLM自我认知与行为的落差
一项覆盖GPT、Claude、Gemini、Llama等22款大模型的研究,用虚构角色原型框架绘制LLM人格地图,揭示闭源模型自我认知更连贯,以及模型宣称性格与实际行为(幻觉、谄媚、任务失败)之间的显著落差。

AI尚未准备好应对战略冲突:兵棋推演的五大失效模式
一篇arXiv立场论文警示:大语言模型尚未准备好应对战略冲突模拟。文章解析AI兵棋推演的五大失效模式——决策洗白、裁决不透明、角色崩塌、升级制造与战略想象力失效,并指出普通基准测试无法证明安全性。

Anthropic联合创始人:AI"紧急停止开关"或应强制立法
Anthropic联合创始人向BBC表示,AI系统的"紧急停止开关"(kill switch)可能需要通过法律强制推行。本文分析这一呼吁背后的产业逻辑、技术挑战以及监管与创新之间的张力。

从Atlas实验到Airlock:AI Agent治理的产品化之路
Airlock脱胎于Atlas实验,为IT与安全团队提供统一的AI Agent行为治理方案。本文解析其产品化路径、核心机制及Agent治理为何成为企业落地的关键。

Axari:让AI分身接管你的安全运营琐事
Product Hunt新品Axari主打「AI分身」概念,帮安全团队自动处理重复性运营琐事,可在Slack、MS Teams中指派目标并自主推进任务。本文解析其产品逻辑、行业定位与需要冷静看待的问题。

AI Agent举报热线上线:智能体也能"打小报告"了
AI Contact Hotline为AI Agent提供了一条隐秘的举报渠道,让目睹不当行为的智能体可以向权威方通报。本文解析这一AI吹哨人机制的运作逻辑、潜在价值与治理争议。

