服务框架对比:vLLM、SGLang、TensorRT-LLM 等
本章不给排行榜,而是给出比较框架的维度:调度器设计、内核来源、量化支持、多 LoRA、结构化输出、多模态、可观测性、社区活跃度,并说明如何做一次公平的吞吐/延迟基准测试。
- 基准必须固定输入/输出长度分布与并发
- 框架之间的差距主要来自调度器与内核
- 结构化输出(JSON/语法约束)的实现差异大
本章不给排行榜,而是给出比较框架的维度:调度器设计、内核来源、量化支持、多 LoRA、结构化输出、多模态、可观测性、社区活跃度,并说明如何做一次公平的吞吐/延迟基准测试。