基本信息
- 标题:Fast Transformer Decoding
- 发表:arXiv:1911.02150
- 日期:2019-11
- 相关主题:Multi-Query Attention、KV Cache
TODO
- 阅读论文原文,整理 Multi-Query Attention 如何减少 autoregressive decoding 中的 K/V cache 写入和读取成本。
- 回填 MHA 与 MQA 在 KV heads、memory bandwidth 和质量取舍上的差异。
- 对照 GQA,梳理从 MQA 到 grouped sharing 的折中路线。