阿里巴巴面试题更新 2026-08-05

MLA(多头潜在注意力)相比GQA(分组查询注意力)的优势是什么?

阿里巴巴人工智能电商技术原理方案权衡

考察说明

考察对MLA与GQA在KV缓存效率、推理速度与模型质量上的权衡理解

回答思路

  1. 明确说明GQA通过分组共享KV头减少缓存,但仍有部分冗余
  2. 指出MLA通过低秩联合压缩将KV压缩为潜在向量,缓存更小
  3. 强调MLA在相同缓存预算下质量损失更小,训练推理更高效
  4. 能对比两者在长上下文、高吞吐场景下的实际影响