跳转到内容
AI Infra 百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 全景与基础
第二卷 · 硬件与算力
第三卷 · 网络与通信
第四卷 · 分布式训练
第五卷 · 编译器与内核
第六卷 · 推理与服务
第七卷 · 存储与数据管道
第八卷 · 调度与集群
第九卷 · 可观测性与可靠性
第十卷 · 效率与成本
第十一卷 · 平台与 MLOps
第十二卷 · 安全与治理
术语表
参考文献与延伸阅读
导读
第一部分 · 编程模型与编译器
CUDA 编程模型
Triton:块级编程
torch.compile、Inductor 与 XLA
第二部分 · 关键内核
FlashAttention 与算子融合
混合精度与 FP8
GEMM、cuBLAS/CUTLASS 与算子库
选择主题
深色
浅色
自动
第五卷 · 编译器与内核
›
第一部分 · 编程模型与编译器
›
Triton:块级编程
Triton:块级编程
Triton 把编程粒度从线程提升到块,由编译器处理共享内存分配与同步。本章讲 Triton 的编程模型、自动调优、以及它在融合算子与自定义注意力上的典型用法与局限。
本章要点
Section titled “本章要点”
块级抽象大幅降低编写融合内核的门槛
自动调优搜索空间需要人工限定
Triton 内核在不同 GPU 代际上的可移植性