<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>深度调研 on 卓琪的开发笔记</title>
    <link>https://zhuoqidev.com/categories/%E6%B7%B1%E5%BA%A6%E8%B0%83%E7%A0%94/</link>
    <description>Recent content in 深度调研 on 卓琪的开发笔记</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <copyright>© 2026 Liu ZhuoQi</copyright>
    <lastBuildDate>Thu, 30 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://zhuoqidev.com/categories/%E6%B7%B1%E5%BA%A6%E8%B0%83%E7%A0%94/index.xml" rel="self" type="application/rss+xml" />
    
    <item>
      <title>Agent 如何记住你：人脑记忆史与六大开源系统代码审计</title>
      <link>https://zhuoqidev.com/posts/llm-memory-research/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      
      <guid>https://zhuoqidev.com/posts/llm-memory-research/</guid>
      <description>&lt;p&gt;几乎每个 Agent 项目都说自己有「长期记忆」。&lt;/p&gt;&#xA;&lt;p&gt;有的意思是把聊天记录做 embedding，有的意思是维护一份用户画像，有的意思是让模型自己修改 Markdown，还有的已经做到了双时序知识图谱。它们都叫 memory，却不是同一种东西，也不该放在一张跑分榜上直接比较。&lt;/p&gt;&#xA;&#xA;&lt;figure&gt;&#xA;      &lt;img class=&#34;my-0 rounded-md&#34; src=&#34;https://zhuoqidev.com/images/posts/llm-memory-research/agent-memory-cover-v3-4k.png&#34; alt=&#34;从人类记忆痕迹到 Agent 记忆栈&#34; /&gt;&#xA;  &#xA;  &#xA;  &lt;/figure&gt;&#xA;&lt;p&gt;要判断一个系统是不是真的「会记」，我更愿意问三个问题：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;一次经历之后，系统里的什么状态发生了变化？&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;这个状态存在哪里，谁能修改，什么时候失效？&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;下一次行动前，它如何被准确、合规地带回来？&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这篇文章从这三个问题出发。前半段把人类记忆科学与 Agent 记忆技术放在同一条历史轴上；后半段直接读代码，对照 Mem0、Letta、Graphiti、LangMem、Cognee 与 MemoryOS 的宣传卖点、实际数据流、系统边界和对应的记忆范式。&lt;/p&gt;&#xA;&#xA;  &#xA;  &#xA;  &#xA;  &#xA;&#xA;&#xA;&#xA;&lt;div&#xA;  &#xA;    class=&#34;flex px-4 py-3 rounded-md shadow bg-primary-100 dark:bg-primary-900&#34;&#xA;  &#xA;  &gt;&#xA;  &lt;span&#xA;    &#xA;      class=&#34;text-primary-400 pe-3 flex items-center&#34;&#xA;    &#xA;    &gt;&#xA;    &lt;span class=&#34;relative block icon&#34;&gt;&lt;svg xmlns=&#34;http://www.w3.org/2000/svg&#34; viewBox=&#34;0 0 384 512&#34;&gt;&lt;path fill=&#34;currentColor&#34; d=&#34;M112.1 454.3c0 6.297 1.816 12.44 5.284 17.69l17.14 25.69c5.25 7.875 17.17 14.28 26.64 14.28h61.67c9.438 0 21.36-6.401 26.61-14.28l17.08-25.68c2.938-4.438 5.348-12.37 5.348-17.7L272 415.1h-160L112.1 454.3zM191.4 .0132C89.44 .3257 16 82.97 16 175.1c0 44.38 16.44 84.84 43.56 115.8c16.53 18.84 42.34 58.23 52.22 91.45c.0313 .25 .0938 .5166 .125 .7823h160.2c.0313-.2656 .0938-.5166 .125-.7823c9.875-33.22 35.69-72.61 52.22-91.45C351.6 260.8 368 220.4 368 175.1C368 78.61 288.9-.2837 191.4 .0132zM192 96.01c-44.13 0-80 35.89-80 79.1C112 184.8 104.8 192 96 192S80 184.8 80 176c0-61.76 50.25-111.1 112-111.1c8.844 0 16 7.159 16 16S200.8 96.01 192 96.01z&#34;/&gt;&lt;/svg&gt;&#xA;&lt;/span&gt;&#xA;  &lt;/span&gt;&#xA;&#xA;  &lt;span&#xA;    &#xA;      class=&#34;dark:text-neutral-300&#34;&#xA;    &#xA;    &gt;&lt;strong&gt;先给结论：&lt;/strong&gt; 今天主流的 Agent 并没有获得一种像人脑那样的统一「记忆器官」。工程上真正有效的是一条闭环：&lt;strong&gt;经历 → 写入门控 → 表征 → 存储 → 检索 → 上下文组装 → 行动反馈 → 巩固 / 修订 / 遗忘&lt;/strong&gt;。不同开源项目，只是选择接管这条闭环的不同部分。&lt;/span&gt;&#xA;&lt;/div&gt;&#xA;&#xA;&lt;p&gt;下面这张图不是某个产品的组件架构，而是全文共用的&lt;strong&gt;判断坐标系&lt;/strong&gt;。它要回答的不是「数据放在哪」，而是「一次过去的经历如何真正影响下一次行动」。阅读时先沿中间的七步主环看信息如何从经历变成行动；再看左侧三种载体，区分当前任务、跨会话记忆与真实世界状态；右侧说明每一步完成的变换，底部则展示长期运行后必须发生的巩固、修订与遗忘。这样能避免把数据库、Context、缓存和真实状态都笼统地叫作“记忆”。&lt;/p&gt;</description>
      
    </item>
    
    <item>
      <title>LLM 推理引擎怎么选——2026 年从本地单机到 PD 分离的全景选型地图</title>
      <link>https://zhuoqidev.com/posts/llm-inference-engine-selection/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      
      <guid>https://zhuoqidev.com/posts/llm-inference-engine-selection/</guid>
      <description>&lt;p&gt;阿里云 CAP 有一篇讲推理引擎选型的文章，把候选收敛到四个：&lt;strong&gt;Ollama、vLLM、SGLang、Hugging Face Pipeline&lt;/strong&gt;。这个划分在 2024 年是够用的。&lt;/p&gt;&#xA;&lt;p&gt;但到 2026 年，它至少漏掉了半张地图——NVIDIA 的 TensorRT-LLM 完成了「PyTorch 化」转身、SGLang 因为首个开源复现 DeepSeek 大规模部署而封神、Hugging Face 自己给 TGI 挂上了「维护模式」横幅并劝你改用 vLLM，而整个 2025 年推理引擎领域真正的主线，其实是一个字：&lt;strong&gt;拆&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;div class=&#34;lead text-neutral-500 dark:text-neutral-400 !mb-9 text-xl&#34;&gt;&#xA;  这篇文章把这张地图更新到 2026 年年中。它不替你拍板选哪个产品——&lt;strong&gt;它给你一套分层框架、一张决策矩阵和一棵决策树，让你自己把候选收敛到 1–2 个。&lt;/strong&gt;&#xA;&lt;/div&gt;&#xA;&#xA;&lt;p&gt;第一张图先解决最常见的比较错误：Ollama、KTransformers 和 vLLM 并不在解决同一层问题。先按本地运行、异构卸载与高性能服务划层，再在层内比较吞吐、格式和硬件支持，才有意义。&lt;/p&gt;&#xA;&#xA;&lt;figure&gt;&#xA;      &lt;img class=&#34;my-0 rounded-md&#34; src=&#34;https://zhuoqidev.com/images/posts/llm-inference-engine-selection/three-layer-inference-map-bilingual-v3-4k.png&#34; alt=&#34;2026 年 LLM 推理引擎三层选型地图&#34; /&gt;&#xA;  &#xA;  &lt;figcaption&gt;三层推理地图：L1 追求跑得起与安装简单，L1.5 用内存换显存，L2 追求并发、吞吐和多 GPU 服务。它是分类框架，不是综合排名。&lt;/figcaption&gt;&#xA;  &lt;/figure&gt;&#xA;&lt;hr&gt;&#xA;&#xA;&lt;h2 class=&#34;relative group&#34;&gt;为什么 2026 年「选推理引擎」才是个真问题&#xA;    &lt;div id=&#34;为什么-2026-年选推理引擎才是个真问题&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;&#xA;    &#xA;    &lt;span&#xA;        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none&#34;&gt;&#xA;        &lt;a class=&#34;text-primary-300 dark:text-neutral-700 !no-underline&#34; href=&#34;#%e4%b8%ba%e4%bb%80%e4%b9%88-2026-%e5%b9%b4%e9%80%89%e6%8e%a8%e7%90%86%e5%bc%95%e6%93%8e%e6%89%8d%e6%98%af%e4%b8%aa%e7%9c%9f%e9%97%ae%e9%a2%98&#34; aria-label=&#34;锚点&#34;&gt;#&lt;/a&gt;&#xA;    &lt;/span&gt;&#xA;    &#xA;&lt;/h2&gt;&#xA;&lt;p&gt;三年前不需要纠结这个。那时候能把一个 7B 模型在 GPU 上跑起来、返回还算流畅的 token 流，就已经过关。&lt;/p&gt;</description>
      
    </item>
    
  </channel>
</rss>
