推理与内核
- Dao et al. (2022, 2023) “FlashAttention” v1/v2;Shah et al. (2024) v3(→ 第五卷)
- Kwon et al. (2023) “Efficient Memory Management for LLM Serving with PagedAttention”(vLLM,→ 第六卷)
- Yu et al. (2022) “Orca”——连续批处理(→ 第六卷)
- Leviathan et al. (2023);Chen et al. (2023) 投机解码(→ 第六卷)
- Frantar et al. (2022) “GPTQ”;Lin et al. (2023) “AWQ”;Xiao et al. (2022) “SmoothQuant”(→ 第六卷)
- Zhong et al. (2024) “DistServe”;Patel et al. (2024) “Splitwise”——Prefill/Decode 分离(→ 第六卷)
- Tillet et al. (2019) “Triton”(→ 第五卷)