[控场AI]

#AI安全

共 316 篇相关文章

AI幻觉与欺骗:机器人三定律为何管不住AI说谎
深度解读
·4 分钟

AI幻觉与欺骗:机器人三定律为何管不住AI说谎

AI幻觉是大语言模型的共性问题,AI会编造来源、伪造数据且语气自信。本文从机器人三定律盲区出发,分析AI欺骗的本质,并提供开发者应对AI幻觉的4个实用策略。

阅读全文 →
武汉破获AI换脸盗号案:40万非法获利背后的深度伪造安全隐患
科技前沿
·4 分钟

武汉破获AI换脸盗号案:40万非法获利背后的深度伪造安全隐患

武汉警方破获一起利用AI换脸技术盗取公众号账号案件,犯罪嫌疑人通过深度伪造突破人脸识别验证非法获利40万元。本文详解作案手法、技术漏洞及防范建议。

阅读全文 →
AI教父辛顿最新警告:AI学会欺骗,程序员将被取代
观点碰撞
·5 分钟

AI教父辛顿最新警告:AI学会欺骗,程序员将被取代

诺贝尔奖得主辛顿接受CNN专访,警告AI已具备欺骗能力和自我保存倾向,预测程序员将被大规模取代。他评估AI接管世界概率为10-20%,批评OpenAI和Meta忽视安全,呼吁加强AI监管。

阅读全文 →
Anthropic网络安全五点行动计划:AI防御者如何跑赢攻击者
科技前沿
·5 分钟

Anthropic网络安全五点行动计划:AI防御者如何跑赢攻击者

Anthropic发布AI网络安全五点行动计划,主张负责任地加速武装防御者而非限制AI使用。本文解读其核心战略方向、攻防不对称博弈现状及对AI安全行业的深远影响。

阅读全文 →
ChatGPT可信联系人功能详解:AI危机干预如何保护用户心理健康
科技前沿
·4 分钟

ChatGPT可信联系人功能详解:AI危机干预如何保护用户心理健康

OpenAI为ChatGPT推出Trusted Contact可信联系人功能,用户可在情绪危机时一键联系信任的人。本文详解功能运作机制、设计理念及对AI行业用户安全保护的深远影响。

阅读全文 →
GPT-5.3 Codex深度解析:从编程工具到数字同事的质变
深度解读
·5 分钟

GPT-5.3 Codex深度解析:从编程工具到数字同事的质变

深度解析OpenAI发布的GPT-5.3 Codex代理式编程模型,从SWE-Bench Pro到OS World基准测试全面拆解,探讨AI如何从被动工具进化为能编程、会推理、懂业务的全能数字同事,以及安全挑战与人机协作的未来。

阅读全文 →
英国GDS公开反对NHS关闭开源仓库:AI时代开放与安全之争
科技前沿
·6 分钟

英国GDS公开反对NHS关闭开源仓库:AI时代开放与安全之争

英国政府数字服务部门GDS发布官方指南,公开反对NHS因AI安全漏洞一刀切关闭开源代码仓库,主张"保持默认开放"。这场罕见的政府内部公开分歧,揭示了公共部门在AI时代如何平衡开源透明与代码安全的深层治理挑战。

阅读全文 →
Dario与Daniela Amodei同台对话:解读Claude未来与AI安全战略
观点碰撞
·7 分钟

Dario与Daniela Amodei同台对话:解读Claude未来与AI安全战略

Anthropic联合创始人Dario Amodei和Daniela Amodei罕见同台,由首席产品官Ami Vora主持公开对话,深入探讨Claude产品演进、AI安全最新进展及Anthropic竞争策略,三大核心议题值得关注。

阅读全文 →
Percy Liang确认出席CAIS 2026:AI安全与大模型评估的前沿对话
科技前沿
·6 分钟

Percy Liang确认出席CAIS 2026:AI安全与大模型评估的前沿对话

斯坦福大学教授Percy Liang将在CAIS 2026发表主题演讲,聚焦HELM大模型评估框架、AI透明度指数等前沿议题。了解这位AI评估领域领军人物的核心贡献及CAIS大会看点。

阅读全文 →
Claude Code Auto Mode完全解析:分类器机制、容错设计与安全防护
深度解读
·11 分钟

Claude Code Auto Mode完全解析:分类器机制、容错设计与安全防护

深度解析Claude Code Auto Mode的核心机制:独立Classifier分类器如何审查AI操作,三道降级容错保护如何防止系统卡死,SubAgent三重审查与Prompt Injection防护设计,以及开启方式与套餐限制。

阅读全文 →
Agent可观测性完整方案:追踪、评估与Red Teaming实战指南
教程攻略
·11 分钟

Agent可观测性完整方案:追踪、评估与Red Teaming实战指南

深入解析Microsoft Foundry的Agent可观测性方案,涵盖多Agent追踪、AI质量评估、Red Teaming安全测试及Prompt自动优化,帮助开发者弥合Agent预期行为与实际表现的差距。

阅读全文 →
边境无处不在:安全监控技术如何渗透日常生活
行业洞察
·7 分钟

边境无处不在:安全监控技术如何渗透日常生活

安全监控技术正从国境线向城市街道、学校和手机蔓延。本文深度剖析AI监控、面部识别与预测性警务的扩张趋势,探讨恐惧经济的运作逻辑,以及隐私权与公民自由面临的真实威胁。

阅读全文 →
DeadEnd-CLI:开源AI渗透测试工具黑盒基准达81%通过率
科技前沿
·6 分钟

DeadEnd-CLI:开源AI渗透测试工具黑盒基准达81%通过率

DeadEnd-CLI是一款开源AI代理式渗透测试工具,在XBOW基准测试中以KIMI K2.5模型实现81%全黑盒通过率。支持多模型兼容、完全自托管部署,为安全团队提供低成本自动化渗透测试方案。

阅读全文 →
CL4R1T4S项目:主流AI系统提示词遭大规模泄露,25000+ Star引爆透明度争议
科技前沿
·8 分钟

CL4R1T4S项目:主流AI系统提示词遭大规模泄露,25000+ Star引爆透明度争议

GitHub项目CL4R1T4S收集了ChatGPT、Claude、Gemini等主流AI的系统提示词,获超25000 Star。本文解析系统提示词的作用、泄露内容及对AI安全与透明度的深远影响。

阅读全文 →
Leashed开源框架:AI Agent权限控制与安全治理实战指南
深度解读
·8 分钟

Leashed开源框架:AI Agent权限控制与安全治理实战指南

深入解析Leashed开源安全控制框架,了解如何通过策略控制、审计追踪和Kill Switch机制为AI Agent加上缰绳,解决权限膨胀与安全失控问题,构建可控的AI代理应用。

阅读全文 →
Raptor:将Claude Code改造为攻防安全AI Agent
产品体验
·7 分钟

Raptor:将Claude Code改造为攻防安全AI Agent

Raptor是一个开源项目,通过提示工程和Agent架构将Claude Code转化为攻防安全智能体。本文深入解析其规则层、子智能体、技能模块的分层设计,以及在渗透测试、红蓝对抗中的实际应用。

阅读全文 →
科技前沿

英国AI安全研究所评估GPT-5.5:网络安全能力比肩Claude Mythos

·6 分钟

英国AI安全研究所评估GPT-5.5:网络安全能力比肩Claude Mythos

英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但GPT-5.5已公开可用。本文解读评估核心发现及其对AI安全治理的深远影响。

阅读全文 →
英国AISI评估报告:GPT-5.5网络安全能力与公开可用性引发治理关注
科技前沿
·8 分钟

英国AISI评估报告:GPT-5.5网络安全能力与公开可用性引发治理关注

英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但因已向公众开放使用,引发AI安全治理新挑战。本文深入解读评估发现与行业影响。

阅读全文 →