<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>模型部署 on 卓琪的开发笔记</title>
    <link>https://zhuoqidev.com/tags/%E6%A8%A1%E5%9E%8B%E9%83%A8%E7%BD%B2/</link>
    <description>Recent content in 模型部署 on 卓琪的开发笔记</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <copyright>© 2026 Liu ZhuoQi</copyright>
    <lastBuildDate>Thu, 30 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://zhuoqidev.com/tags/%E6%A8%A1%E5%9E%8B%E9%83%A8%E7%BD%B2/index.xml" rel="self" type="application/rss+xml" />
    
    <item>
      <title>LLM 推理引擎怎么选——2026 年从本地单机到 PD 分离的全景选型地图</title>
      <link>https://zhuoqidev.com/posts/llm-inference-engine-selection/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      
      <guid>https://zhuoqidev.com/posts/llm-inference-engine-selection/</guid>
      <description>&lt;p&gt;阿里云 CAP 有一篇讲推理引擎选型的文章，把候选收敛到四个：&lt;strong&gt;Ollama、vLLM、SGLang、Hugging Face Pipeline&lt;/strong&gt;。这个划分在 2024 年是够用的。&lt;/p&gt;&#xA;&lt;p&gt;但到 2026 年，它至少漏掉了半张地图——NVIDIA 的 TensorRT-LLM 完成了「PyTorch 化」转身、SGLang 因为首个开源复现 DeepSeek 大规模部署而封神、Hugging Face 自己给 TGI 挂上了「维护模式」横幅并劝你改用 vLLM，而整个 2025 年推理引擎领域真正的主线，其实是一个字：&lt;strong&gt;拆&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;div class=&#34;lead text-neutral-500 dark:text-neutral-400 !mb-9 text-xl&#34;&gt;&#xA;  这篇文章把这张地图更新到 2026 年年中。它不替你拍板选哪个产品——&lt;strong&gt;它给你一套分层框架、一张决策矩阵和一棵决策树，让你自己把候选收敛到 1–2 个。&lt;/strong&gt;&#xA;&lt;/div&gt;&#xA;&#xA;&lt;p&gt;第一张图先解决最常见的比较错误：Ollama、KTransformers 和 vLLM 并不在解决同一层问题。先按本地运行、异构卸载与高性能服务划层，再在层内比较吞吐、格式和硬件支持，才有意义。&lt;/p&gt;&#xA;&#xA;&lt;figure&gt;&#xA;      &lt;img class=&#34;my-0 rounded-md&#34; src=&#34;https://zhuoqidev.com/images/posts/llm-inference-engine-selection/three-layer-inference-map-bilingual-v3-4k.png&#34; alt=&#34;2026 年 LLM 推理引擎三层选型地图&#34; /&gt;&#xA;  &#xA;  &lt;figcaption&gt;三层推理地图：L1 追求跑得起与安装简单，L1.5 用内存换显存，L2 追求并发、吞吐和多 GPU 服务。它是分类框架，不是综合排名。&lt;/figcaption&gt;&#xA;  &lt;/figure&gt;&#xA;&lt;hr&gt;&#xA;&#xA;&lt;h2 class=&#34;relative group&#34;&gt;为什么 2026 年「选推理引擎」才是个真问题&#xA;    &lt;div id=&#34;为什么-2026-年选推理引擎才是个真问题&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;&#xA;    &#xA;    &lt;span&#xA;        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none&#34;&gt;&#xA;        &lt;a class=&#34;text-primary-300 dark:text-neutral-700 !no-underline&#34; href=&#34;#%e4%b8%ba%e4%bb%80%e4%b9%88-2026-%e5%b9%b4%e9%80%89%e6%8e%a8%e7%90%86%e5%bc%95%e6%93%8e%e6%89%8d%e6%98%af%e4%b8%aa%e7%9c%9f%e9%97%ae%e9%a2%98&#34; aria-label=&#34;锚点&#34;&gt;#&lt;/a&gt;&#xA;    &lt;/span&gt;&#xA;    &#xA;&lt;/h2&gt;&#xA;&lt;p&gt;三年前不需要纠结这个。那时候能把一个 7B 模型在 GPU 上跑起来、返回还算流畅的 token 流，就已经过关。&lt;/p&gt;</description>
      
    </item>
    
  </channel>
</rss>
