[控场AI]

#模型蒸馏

共 5 篇相关文章

速率限制为何挡不住模型蒸馏攻击?
·4 分钟

速率限制为何挡不住模型蒸馏攻击?

OpenAI 两天内遭遇 4,000 账户发起的 16,000 次模型提取请求,每账户仅约 4 次。本文解析为何速率限制挡不住分布式蒸馏攻击,以及账户层面控制为何成为必要防御。

阅读全文 →
在线策略蒸馏中的提示广度与响应刷新交互效应研究
·5 分钟

在线策略蒸馏中的提示广度与响应刷新交互效应研究

arXiv 新论文研究在线策略蒸馏(OPD)中提示广度与响应刷新的交互效应,通过 3×3 数学推理实验揭示提示效率同时取决于响应刷新策略与推理预算,交互效应达 4.07 个百分点。

阅读全文 →
窃取推理链:闭源大模型API的新型知识蒸馏攻击
·5 分钟

窃取推理链:闭源大模型API的新型知识蒸馏攻击

Panfilov 等人的论文探讨如何从 Claude、ChatGPT 等闭源大模型 API 中大规模蒸馏推理链数据,以及这种做法对强化学习训练与行业竞争的影响。解析推理链蒸馏的技术机制与合规争议。

阅读全文 →
9美元让Gemini训练出替代自己的小模型:模型蒸馏实践观察
·5 分钟

9美元让Gemini训练出替代自己的小模型:模型蒸馏实践观察

Hacker News热帖"9美元让Gemini训练自己的替代品"引发讨论。本文解析大模型蒸馏训练小模型的技术逻辑、成本构成、现实意义与合规局限,探讨AI应用降本新范式。

阅读全文 →
悟空2.2P开源:35B MOE模型性能超越Qwen3.6-27B,速度快3-5倍
科技前沿
·2 分钟

悟空2.2P开源:35B MOE模型性能超越Qwen3.6-27B,速度快3-5倍

悟空2.2P 35B MOE模型正式开源,采用对抗式杂交蒸馏技术,综合性能超越Qwen3.6-27B。4090显卡Q5量化达158 tokens/s,仅需8.9G显存即可运行,支持256K上下文。详解核心技术、硬件配置与实测数据。

阅读全文 →