Verified65% confidenceFactExact time
GQA(分组查询注意力)是标准多头注意力的高效变体,由Google在2023年提出,已被LLaMA 3、Mistral等主流模型采用
3
Sources
65%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
26M超轻量模型Needle:本地微调工具调用全流程实战
bilibili薛定猫AI7/3/2026
Related Claims
UnverifiedGQA由Google在2023年提出,将多个查询头共享同一组Key-Value头,已被LLaMA 3、Mistral等主流模型采用81% similarUnverifiedGQA最早由Google在训练PaLM 2时提出并应用,随后被Llama 2/3、Mistral等开源模型采纳69% similarUnverifiedGQA由Google在2023年提出,将多个查询头共享同一组Key-Value头,可降低KV Cache内存消耗50%-75%67% similarUnverifiedMeta的LLaMA、Google的Gemma等主流开源模型均大量采用量化和知识蒸馏技术62% similarVerified自注意力机制由Google在2017年的论文《Attention Is All You Need》中提出61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/114485API
curl https://kongchang.com/api/v1/knowledge/claims/114485MCP
get_claim(id=114485)