跳过正文

模型部署

LLM 推理引擎怎么选——2026 年从本地单机到 PD 分离的全景选型地图

阿里云 CAP 有一篇讲推理引擎选型的文章,把候选收敛到四个:Ollama、vLLM、SGLang、Hugging Face Pipeline。这个划分在 2024 年是够用的。 但到 2026 年,它至少漏掉了半张地图——NVIDIA 的 TensorRT-LLM 完成了「PyTorch 化」转身、SGLang 因为首个开源复现 DeepSeek 大规模部署而封神、Hugging Face 自己给 TGI 挂上了「维护模式」横幅并劝你改用 vLLM,而整个 2025 年推理引擎领域真正的主线,其实是一个字:拆。 这篇文章把这张地图更新到 2026 年年中。它不替你拍板选哪个产品——它给你一套分层框架、一张决策矩阵和一棵决策树,让你自己把候选收敛到 1–2 个。 第一张图先解决最常见的比较错误:Ollama、KTransformers 和 vLLM 并不在解决同一层问题。先按本地运行、异构卸载与高性能服务划层,再在层内比较吞吐、格式和硬件支持,才有意义。 三层推理地图:L1 追求跑得起与安装简单,L1.5 用内存换显存,L2 追求并发、吞吐和多 GPU 服务。它是分类框架,不是综合排名。 为什么 2026 年「选推理引擎」才是个真问题 # 三年前不需要纠结这个。那时候能把一个 7B 模型在 GPU 上跑起来、返回还算流畅的 token 流,就已经过关。