跳转到内容

服务框架对比:vLLM、SGLang、TensorRT-LLM 等

本章不给排行榜,而是给出比较框架的维度:调度器设计、内核来源、量化支持、多 LoRA、结构化输出、多模态、可观测性、社区活跃度,并说明如何做一次公平的吞吐/延迟基准测试。

  • 基准必须固定输入/输出长度分布与并发
  • 框架之间的差距主要来自调度器与内核
  • 结构化输出(JSON/语法约束)的实现差异大