速率限制为何挡不住模型蒸馏攻击?

分布式蒸馏攻击将流量摊薄至数千账户,令单密钥速率限制完全失效,AI平台须转向跨账户行为模式检测。
文章揭示了一种针对大模型API的新型威胁形态:攻击者通过控制4,000余个账户、每账户仅发起约4次请求,在两天内向OpenAI完成了16,000次模型能力抽取,整体行为极具组织性,但每个单独账户都貌似正常用户。这种「伪装成人群」的分布式蒸馏攻击,使得基于单密钥配额的速率限制彻底失效——防御机制的观察粒度恰好是攻击者精心规避的维度。文章指出,有效应对需将防御视角从单账户频率上升至跨账户行为模式的整体分析,包括提高批量注册门槛、识别协同查询的账户簇、以及对语义层面的系统性探测行为进行异常检测。这一案例标志着AI平台安全防御思路的根本转变:「频率即风险」的假设已经过时,行为意图的识别才是新的核心命题。
分布式蒸馏攻击的真实样貌
大模型厂商长期依赖速率限制(rate limit)来防止滥用,但一个被忽视的事实正在浮现:针对模型的蒸馏攻击(distillation attack)早已学会了绕过这套机制。据相关来源披露,OpenAI 在短短两天内观测到来自 4,000 多个账户的 16,000 次提取(extraction)请求——平均每个账户仅发起约 4 次调用。
这个数字背后的含义极具冲击力:每个单独的账户看起来都像是正常用户,请求量低到不足以触发任何告警。但当你把视角拉高,4,000 个账户汇聚成的整体,却是一次有组织、有规模的数据抽取行动。攻击者并没有用单一密钥疯狂请求,而是把攻击流量「摊薄」到了人群当中。

为什么速率限制会失效
速率限制的核心逻辑是:以单个 API key 或单个账户为单位,设定调用上限。这种设计在对抗「单点高频滥用」时非常有效——一个密钥狂刷请求,很容易被限流或封禁。
问题在于,蒸馏攻击的形态已经从「个体」演化为「群体」。原文一句话点破了要害:Per-key quotas can't see an actor shaped like a crowd(按密钥计的配额,看不见一个伪装成人群的攻击者)。
当一个攻击者控制数千个账户、每个账户只发出寥寥几次请求时,任何基于单账户阈值的防御都形同虚设。每个账户的行为都落在「正常用户」的分布区间内,速率限制根本没有理由去拦截它们。攻击者用分布式的身份,成功地把自己隐藏在了合法流量的噪声里。
蒸馏攻击的目的
所谓模型蒸馏,是指通过大量查询目标模型、收集其输入输出对,进而训练出一个能力相近的「学生模型」。对攻击者而言,这是一种低成本复制昂贵大模型能力的手段。16,000 次请求采集到的问答数据,足以构成一份有价值的训练语料。
这也解释了为什么厂商必须认真对待这类行为:被蒸馏意味着核心能力被廉价复刻,商业投入面临直接威胁。
从技术实现角度看,模型蒸馏攻击通常分为几个阶段:首先构造覆盖广泛任务类型的提示词集合(prompt dataset),系统性地探测目标模型在推理、代码、创作、问答等不同能力维度上的输出;然后将收集到的输入输出对作为监督训练数据,用来微调一个规模更小、成本更低的开源基础模型;最终得到一个在特定能力分布上接近目标模型的「影子模型」。这一过程的核心优势在于,攻击者无需承担原始预训练的数百万美元算力成本,只需支付少量 API 调用费用和微调算力即可获得近似能力。Meta 的 LLaMA 系列、Mistral 等开源模型的普及,极大降低了发动此类攻击的技术门槛——攻击者已有现成的学生模型基座可供使用,蒸馏所需的数据量也因此大幅减少。
账户层面的控制才是答案
原文给出的解法指向明确:Account controls can(账户层面的控制可以)。
既然威胁来自「伪装成人群」的分布式行为,防御的视角就必须从「单个密钥」上升到「跨账户的整体模式」。换句话说,真正有效的检测不再是问「这个 key 调用了多少次」,而是问「这一批账户的行为是否呈现出协同抽取的特征」。
可能的防御维度包括:
- 账户注册与身份验证:提高批量注册账户的门槛,让攻击者难以廉价获取数千个可用身份。
- 跨账户行为关联分析:识别那些查询模式高度相似、时间上协同、内容上系统性覆盖模型能力边界的账户簇。
- 语义层面的异常检测:蒸馏请求往往在内容分布上与真实用户有差异——它们更倾向于系统性地探测模型,而非解决具体问题。
这些手段的共同点是:它们关注的是行为模式的整体形态,而非单次调用的频率。
跨账户行为关联分析在工程实现上面临不小的挑战。攻击者可以通过轮换 IP 地址、使用不同支付方式、错开请求时间窗口等手段来降低账户间的可观测关联性。因此,更鲁棒的检测方案往往依赖于请求内容的语义指纹而非元数据:蒸馏型请求在内容上呈现出明显的「能力探针」特征——大量涉及模型自我认知的问题(如「你能做什么」「解释你的推理过程」)、系统性覆盖专业领域的边界测试、以及刻意构造的对比性提示。这类语义模式与真实用户「有具体任务需求」的请求分布存在统计差异,可作为检测信号。部分厂商也开始在服务条款层面明确禁止以蒸馏为目的的使用行为,并将相关检测结果作为账户封禁的法律依据,使防御从纯技术手段扩展到合规与法律层面。
这对 AI 安全意味着什么
这则简短的观察,揭示了 AI 平台安全防御思路的一次必要转变。传统的 API 滥用防护建立在「频率即风险」的假设之上,但面对成本敏感、组织化的蒸馏攻击者,频率本身已不再是可靠的信号。
攻击者的策略进化提醒我们:防御的边界需要从技术指标扩展到行为意图的识别。当攻击流量被精心伪装成正常用户的集合,唯一能拆穿伪装的,是在更高维度上观察这群「用户」是否共享着同一个目标。
对于所有提供模型 API 的厂商来说,这是一个值得警惕的信号——保护模型的知识产权,不能再只靠一道限流的闸门。
相关推荐

无GPU也能跑大模型?老旧DDR3服务器的本地推理性价比探讨
一场Reddit讨论探讨了无GPU本地部署大模型的可行性:用老旧DDR3多路服务器靠内存带宽跑Qwen 3.8 Flash,以及4bit量化、KV缓存与上下文长度的实用权衡与电费成本争议。

拓扑域外泛化:让AI预测系统从未见过的动力学突变
NeurIPS论文提出拓扑域外泛化方法,通过特征分离与物理稀疏先验修复分层DSR模型缺陷,使AI能在不知控制参数的情况下预测系统分岔与动力学突变,适用于PLRNN和Neural ODE。

用不好AI Agent是你的错吗?破解AI工具焦虑的实用指南
用不好AI Agent是你的能力问题吗?本文从产品成熟度、使用预期和场景匹配三个角度剖析AI工具使用困境,提供破解AI焦虑的实用方法与选型建议。