#注意力机制
共 3 篇相关文章

·4 分钟
从「大肥鱼面试」段子看大模型的能力边界
B站「大肥鱼给用户做面试」段子以拟人化AI「豆宝」的形式,调侃大模型答案不稳定、拟人化命名等特征,并通俗解释了Transformer核心的注意力机制。本文借梗解析大模型能力边界与AI娱乐化传播的两面性。
阅读全文 →

·6 分钟
上下文投毒:长上下文模型为何被干扰信息拖垮
arXiv 论文提出"上下文投毒"概念,将长上下文语言模型的性能退化解释为注意力中的极值干扰,指出有效干扰项数量而非原始长度才是关键,并给出证据边际需按 √logN 增长的理论边界及多种缓解方案。
阅读全文 →
深度解读·9 分钟
DeepSeek V4技术深度拆解:百万Token与极致性价比
深入解析DeepSeek V4核心技术架构,包括混合压缩注意力机制、流形约束超链接和MUON优化器三大创新,详解其如何将推理成本降低10倍,实现百万Token长上下文处理,以及MIT开源协议带来的生态价值。
阅读全文 →