[控场AI]
待验证60% 置信解决方案精确时间

GQA(分组查询注意力)是介于多头注意力(MHA)和多查询注意力(MQA)之间的注意力机制,通过将多个 Query 头分组共享 Key-Value 投影来减少 KV Cache 显存占用

2
来源数
60%
置信度
长期有效
时效性
2026/9/5
首次发现

来源

涉及实体

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/860211
API
curl https://kongchang.com/api/v1/knowledge/claims/860211
MCP
get_claim(id=860211)