1. MLA 和 MHA 的 Kernel 区别

    从 Kernel 实现角度对比 MLA 和 MHA,包括内存访问、计算强度和量化影响。

  2. Multi-head Attention

    你需要写一个运行在 GPU 上的程序,实现多头注意力机制。