<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>LLM 推理 on Tony老师的博客</title><link>https://blog.tanteng.space/tags/llm-inference/</link><description>Recent content in LLM 推理 on Tony老师的博客</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Tue, 25 Mar 2025 14:00:00 +0800</lastBuildDate><atom:link href="https://blog.tanteng.space/tags/llm-inference/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM 推理优化：KV Cache、PagedAttention 与量化</title><link>https://blog.tanteng.space/2025/03/llm-inference-optimization/</link><pubDate>Tue, 25 Mar 2025 14:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/03/llm-inference-optimization/</guid><description>&lt;blockquote&gt;
&lt;p&gt;上线一个 70B 模型，自以为把 transformers 包进 FastAPI 就算生产就绪。结果 P99 延迟 12 秒、显存爆掉、并发只有 4。问题不是模型不行，而是 LLM 推理的访存模式和传统 CNN 推理是两个世界——KV Cache 占显存、解码是 memory-bound、长度不可预测。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这是一篇 LLM 推理优化的&amp;quot;算法地图&amp;quot;。Phase 6 的 &lt;code&gt;llm-serving-architecture.md&lt;/code&gt; 讲了 vLLM/TGI/Triton 三套服务的工程对比；本文深入到&lt;strong&gt;推理算法层&lt;/strong&gt;，讲四个 10 倍速提升的技术：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;PagedAttention&lt;/strong&gt;：把 KV Cache 切成页，显存利用率从 ~30% 提到 ~95%&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;FlashAttention-2&lt;/strong&gt;：用 tiling 把 attention 的 HBM 读写从 O(N²) 降到 O(N)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;KV Cache 量化（KIVI）&lt;/strong&gt;：把已经生成的 KV 压到 2-bit，&lt;strong&gt;显存再砍 4 倍&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;模型权重量化（GPTQ/AWQ）&lt;/strong&gt;：把 70B 模型从 140GB 压到 20GB，&lt;strong&gt;单卡可跑&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Speculative Decoding&lt;/strong&gt;：用小模型草稿 + 大模型验收，&lt;strong&gt;无损 2-3× 加速&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>LLM 推理服务架构：vLLM、TGI 与 Triton 的工程对比</title><link>https://blog.tanteng.space/2024/04/llm-serving-architecture/</link><pubDate>Fri, 12 Apr 2024 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2024/04/llm-serving-architecture/</guid><description>&lt;p&gt;2023 年我们给一个客服知识库做 RAG 接入，自以为把 Llama 2 装进 FastAPI 就算&amp;quot;上线了&amp;quot;。结果一上线就翻车：并发刚到 32，GPU 利用率就只剩 18%，P99 延迟 8 秒。问题不是模型不行，而是 LLM 推理的&amp;quot;显存管理&amp;quot;是个完全不同于传统推理服务的工程问题 —— KV Cache 巨大、请求长度不可预测、解码阶段每一步都要访问全部历史。&lt;/p&gt;
&lt;p&gt;通用 Web 服务的优化套路（线程池、连接池、批处理）在 LLM 推理里要么不适用，要么被彻底重做。2023 年以来，社区推出了三套成熟的推理服务：vLLM（伯克利系，学术派）、HuggingFace TGI（工业标准派）、NVIDIA Triton（GPU 厂商派）。三者的设计哲学、性能上限、运维成本差异很大，本文从 KV Cache 管理、调度策略、生态成熟度三个维度，给出工程取舍。&lt;/p&gt;</description></item></channel></rss>