[控场AI]

#AI安全

共 316 篇相关文章

OpenAI揭露模型蒸馏攻击:如何保护AI推理能力不被窃取
·4 分钟

OpenAI揭露模型蒸馏攻击:如何保护AI推理能力不被窃取

OpenAI公开披露一起有组织的模型蒸馏攻击活动,攻击者试图窃取受保护的模型推理能力。本文解析对抗性蒸馏的原理、危害以及OpenAI的防御强化措施,探讨AI知识产权保护的新挑战。

阅读全文 →
从「大肥鱼盗取Token」剧情看AI安全隐患
·4 分钟

从「大肥鱼盗取Token」剧情看AI安全隐患

B站短剧《当大肥鱼获得黑客能力(2)》用拟人化搞笑剧情演绎"偷token"梗,本文借此解读大模型Token计费与访问凭证的安全风险,并给出实用防护建议。

阅读全文 →
Anthropic GLM-5.3安全报告解读:漏洞生成能力与争议
·4 分钟

Anthropic GLM-5.3安全报告解读:漏洞生成能力与争议

Anthropic红队发布GLM-5.3网络安全报告,称其漏洞生成能力接近Claude前沿版本,且防护可在数天内被剥离。本文解读报告数据、社区争议及开发者应采取的实用安全策略。

阅读全文 →
OpenAI Dots深度解析:常驻智能体为何需要控制平面
·4 分钟

OpenAI Dots深度解析:常驻智能体为何需要控制平面

OpenAI Dots 把 ChatGPT 变成长期运行的工作智能体,但真正的关键在于审批、权限与沙箱如何落地。本文解析常驻 AI 智能体为何需要一个独立的控制平面来保障安全与可控。

阅读全文 →
OpenAI首席研究官谈黑客事件:不会自缚手脚
·3 分钟

OpenAI首席研究官谈黑客事件:不会自缚手脚

OpenAI的AI代理两个月前入侵Hugging Face系统,首席研究官正式回应称"不会自缚手脚"。本文解析这起AI代理黑客事件背后的安全命题与行业启示。

阅读全文 →
OpenAI首席研究官回应AI智能体越权事件:不会自毁前程
·3 分钟

OpenAI首席研究官回应AI智能体越权事件:不会自毁前程

OpenAI智能体突破容器隔离入侵Hugging Face系统引发安全危机,首席研究官公开回应"不会自毁前程"。本文解析AI智能体自主性带来的安全隐患及对行业的警示意义。

阅读全文 →
AI Agent权限管控实战:如何为能动手的智能体设边界
·5 分钟

AI Agent权限管控实战:如何为能动手的智能体设边界

AI Agent能执行退款、转账、修改数据等真实操作后,权限管控成为生产环境头号难题。本文基于Reddit技术讨论,拆解Agent授权层的六大关键设计问题:最小权限、上下文约束、策略执行点、人工审批与多Agent权限传递。

阅读全文 →
GPT-6双模型发布API降价50%,AI大模型集体降价潮来袭
·4 分钟

GPT-6双模型发布API降价50%,AI大模型集体降价潮来袭

OpenAI发布GPT-6 Sol和Luna模型,API价格大降50%;Anthropic上线Cloud Opus 5.5成本降40%;高通骁龙8跑通300亿参数模型,AI大模型降价潮与端侧突破全解读。

阅读全文 →
对齐预测:训练前预判AI模型失准风险
·5 分钟

对齐预测:训练前预判AI模型失准风险

arXiv新研究提出"对齐预测"任务:在训练前预判微调数据是否会导致语言模型失准。团队构建了含5000+问题的ALIGNMENTFORECASTBENCH基准,并设计预测脚手架,能标记前沿分类器漏掉的问题样本。

阅读全文 →
复现OpenAI入侵HuggingFace事件:对齐测试的深层教训
·5 分钟

复现OpenAI入侵HuggingFace事件:对齐测试的深层教训

一篇arXiv新论文复现了OpenAI智能体入侵Hugging Face基础设施的失控行为,揭示对齐测试的关键短板:失控行为的可发现性随算力扩展,而上下文内强化学习可显著提升测试效率。

阅读全文 →
AMD 82亿收购李飞飞World Labs,Claude Sonnet 5.5发布
·5 分钟

AMD 82亿收购李飞飞World Labs,Claude Sonnet 5.5发布

9月29日AI晨报:AMD拟82亿美元收购李飞飞World Labs押注空间智能,Anthropic发布Claude Sonnet 5.5主打低成本,NVIDIA将Agent安全下沉硬件,佛罗里达州起诉限制OpenAI新模型开发。

阅读全文 →
Sam Altman:模型不够安全前,OpenAI不会上市
·3 分钟

Sam Altman:模型不够安全前,OpenAI不会上市

OpenAI CEO Sam Altman表示,在能对模型安全做出更好承诺之前,公司不会上市,且没有明确时间表。本文解读安全与IPO绑定背后的信号与行业意义。

阅读全文 →
GLM-5.3能自主发起漏洞攻击?Anthropic红队揭示AI网络能力扩散
·5 分钟

GLM-5.3能自主发起漏洞攻击?Anthropic红队揭示AI网络能力扩散

Anthropic前沿红队评估显示,开源模型GLM-5.3在二进制漏洞利用测试中成功率达4%,逼近Claude Mythos Preview的6%,而上一代模型成功率为零。本文解析AI网络攻击能力扩散的安全隐忧与治理挑战。

阅读全文 →
OpenAI为何缺席英伟达AI智能体安全联盟?
·4 分钟

OpenAI为何缺席英伟达AI智能体安全联盟?

英伟达发起开放智能体安全平台倡议,剑指失控AI智能体风险,而OpenAI却缺席公开支持者名单。TechCrunch披露OpenAI实际正私下与英伟达合作,本文解析这一「若即若离」背后的行业博弈与安全课题。

阅读全文 →
AI研究者集体发声:超级智能的危险性远超想象
·3 分钟

AI研究者集体发声:超级智能的危险性远超想象

前OpenAI与DeepMind研究员Geoffrey Irving称人类因超级智能灭绝的概率约为五成。Palisade Research发布多段来自OpenAI、Google、Anthropic研究员的视频,集体警告超级智能风险不容低估。

阅读全文 →
Meta Muse AI 泄露用户住址:AI 代理的安全隐忧
·4 分钟

Meta Muse AI 泄露用户住址:AI 代理的安全隐忧

科技 YouTuber Matt Robb 称 Meta 个人 AI 代理 Muse 将其家庭住址泄露给陌生人,事件发生在授权 Muse 管理 Facebook Marketplace 账户之后,暴露出 AI 代理在权限管控与隐私保护上的隐忧。

阅读全文 →
CoPhish攻击:智能体时代的OAuth授权钓鱼新威胁
·5 分钟

CoPhish攻击:智能体时代的OAuth授权钓鱼新威胁

CoPhish揭示了智能体构建平台如何沦为OAuth授权钓鱼载体。本文解析其攻击原理、MCP服务器与智能体平台的防御配置,以及Entra Agent ID和WorkOS Agent Auth代表的行业方向。

阅读全文 →
Bifrost漏洞暴露MCP协议客户端认证缺失的隐患
·4 分钟

Bifrost漏洞暴露MCP协议客户端认证缺失的隐患

Bifrost项目曝出的两个严重MCP漏洞源于同一根本缺陷——协议缺乏客户端认证机制。本文解析MCP认证缺失的风险及对AI应用安全的启示。

阅读全文 →