跳转到内容

推理与内核

  • Dao et al. (2022, 2023) “FlashAttention” v1/v2;Shah et al. (2024) v3(→ 第五卷)
  • Kwon et al. (2023) “Efficient Memory Management for LLM Serving with PagedAttention”(vLLM,→ 第六卷)
  • Yu et al. (2022) “Orca”——连续批处理(→ 第六卷)
  • Leviathan et al. (2023);Chen et al. (2023) 投机解码(→ 第六卷)
  • Frantar et al. (2022) “GPTQ”;Lin et al. (2023) “AWQ”;Xiao et al. (2022) “SmoothQuant”(→ 第六卷)
  • Zhong et al. (2024) “DistServe”;Patel et al. (2024) “Splitwise”——Prefill/Decode 分离(→ 第六卷)
  • Tillet et al. (2019) “Triton”(→ 第五卷)