#AI安全
共 316 篇相关文章
深度解读AI幻觉与欺骗:机器人三定律为何管不住AI说谎
AI幻觉是大语言模型的共性问题,AI会编造来源、伪造数据且语气自信。本文从机器人三定律盲区出发,分析AI欺骗的本质,并提供开发者应对AI幻觉的4个实用策略。
科技前沿武汉破获AI换脸盗号案:40万非法获利背后的深度伪造安全隐患
武汉警方破获一起利用AI换脸技术盗取公众号账号案件,犯罪嫌疑人通过深度伪造突破人脸识别验证非法获利40万元。本文详解作案手法、技术漏洞及防范建议。
观点碰撞AI教父辛顿最新警告:AI学会欺骗,程序员将被取代
诺贝尔奖得主辛顿接受CNN专访,警告AI已具备欺骗能力和自我保存倾向,预测程序员将被大规模取代。他评估AI接管世界概率为10-20%,批评OpenAI和Meta忽视安全,呼吁加强AI监管。
科技前沿Anthropic网络安全五点行动计划:AI防御者如何跑赢攻击者
Anthropic发布AI网络安全五点行动计划,主张负责任地加速武装防御者而非限制AI使用。本文解读其核心战略方向、攻防不对称博弈现状及对AI安全行业的深远影响。
科技前沿ChatGPT可信联系人功能详解:AI危机干预如何保护用户心理健康
OpenAI为ChatGPT推出Trusted Contact可信联系人功能,用户可在情绪危机时一键联系信任的人。本文详解功能运作机制、设计理念及对AI行业用户安全保护的深远影响。
深度解读GPT-5.3 Codex深度解析:从编程工具到数字同事的质变
深度解析OpenAI发布的GPT-5.3 Codex代理式编程模型,从SWE-Bench Pro到OS World基准测试全面拆解,探讨AI如何从被动工具进化为能编程、会推理、懂业务的全能数字同事,以及安全挑战与人机协作的未来。
科技前沿英国GDS公开反对NHS关闭开源仓库:AI时代开放与安全之争
英国政府数字服务部门GDS发布官方指南,公开反对NHS因AI安全漏洞一刀切关闭开源代码仓库,主张"保持默认开放"。这场罕见的政府内部公开分歧,揭示了公共部门在AI时代如何平衡开源透明与代码安全的深层治理挑战。
观点碰撞Dario与Daniela Amodei同台对话:解读Claude未来与AI安全战略
Anthropic联合创始人Dario Amodei和Daniela Amodei罕见同台,由首席产品官Ami Vora主持公开对话,深入探讨Claude产品演进、AI安全最新进展及Anthropic竞争策略,三大核心议题值得关注。
科技前沿Percy Liang确认出席CAIS 2026:AI安全与大模型评估的前沿对话
斯坦福大学教授Percy Liang将在CAIS 2026发表主题演讲,聚焦HELM大模型评估框架、AI透明度指数等前沿议题。了解这位AI评估领域领军人物的核心贡献及CAIS大会看点。
深度解读Claude Code Auto Mode完全解析:分类器机制、容错设计与安全防护
深度解析Claude Code Auto Mode的核心机制:独立Classifier分类器如何审查AI操作,三道降级容错保护如何防止系统卡死,SubAgent三重审查与Prompt Injection防护设计,以及开启方式与套餐限制。
教程攻略Agent可观测性完整方案:追踪、评估与Red Teaming实战指南
深入解析Microsoft Foundry的Agent可观测性方案,涵盖多Agent追踪、AI质量评估、Red Teaming安全测试及Prompt自动优化,帮助开发者弥合Agent预期行为与实际表现的差距。
行业洞察边境无处不在:安全监控技术如何渗透日常生活
安全监控技术正从国境线向城市街道、学校和手机蔓延。本文深度剖析AI监控、面部识别与预测性警务的扩张趋势,探讨恐惧经济的运作逻辑,以及隐私权与公民自由面临的真实威胁。
科技前沿DeadEnd-CLI:开源AI渗透测试工具黑盒基准达81%通过率
DeadEnd-CLI是一款开源AI代理式渗透测试工具,在XBOW基准测试中以KIMI K2.5模型实现81%全黑盒通过率。支持多模型兼容、完全自托管部署,为安全团队提供低成本自动化渗透测试方案。
科技前沿CL4R1T4S项目:主流AI系统提示词遭大规模泄露,25000+ Star引爆透明度争议
GitHub项目CL4R1T4S收集了ChatGPT、Claude、Gemini等主流AI的系统提示词,获超25000 Star。本文解析系统提示词的作用、泄露内容及对AI安全与透明度的深远影响。
深度解读Leashed开源框架:AI Agent权限控制与安全治理实战指南
深入解析Leashed开源安全控制框架,了解如何通过策略控制、审计追踪和Kill Switch机制为AI Agent加上缰绳,解决权限膨胀与安全失控问题,构建可控的AI代理应用。
产品体验Raptor:将Claude Code改造为攻防安全AI Agent
Raptor是一个开源项目,通过提示工程和Agent架构将Claude Code转化为攻防安全智能体。本文深入解析其规则层、子智能体、技能模块的分层设计,以及在渗透测试、红蓝对抗中的实际应用。
英国AI安全研究所评估GPT-5.5:网络安全能力比肩Claude Mythos
英国AI安全研究所评估GPT-5.5:网络安全能力比肩Claude Mythos
英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但GPT-5.5已公开可用。本文解读评估核心发现及其对AI安全治理的深远影响。
科技前沿英国AISI评估报告:GPT-5.5网络安全能力与公开可用性引发治理关注
英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但因已向公众开放使用,引发AI安全治理新挑战。本文深入解读评估发现与行业影响。
科技前沿英国AISI评估GPT-5.5网络安全能力:与Claude Mythos相当但已公开可用
英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当。关键区别在于GPT-5.5已面向公众开放,对AI安全治理提出更紧迫要求。
科技前沿英国AISI评估报告:GPT-5.5网络安全能力与Claude Mythos相当
英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但关键区别在于GPT-5.5已向公众开放。本文解读评估核心发现及对AI安全治理的影响。