<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>论文 on Tony老师的博客</title><link>https://blog.tanteng.space/tags/paper/</link><description>Recent content in 论文 on Tony老师的博客</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Fri, 11 Sep 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://blog.tanteng.space/tags/paper/index.xml" rel="self" type="application/rss+xml"/><item><title>GraphRAG：用知识图谱改进大模型检索</title><link>https://blog.tanteng.space/posts/graphrag-introduction/</link><pubDate>Fri, 11 Sep 2026 00:00:00 +0800</pubDate><guid>https://blog.tanteng.space/posts/graphrag-introduction/</guid><description>&lt;p&gt;大模型很强，但有两个老毛病：&lt;strong&gt;幻觉&lt;/strong&gt;（说得头头是道但全是编的）和&lt;strong&gt;知识陈旧&lt;/strong&gt;（训练完之后发生的事它不知道）。RAG（Retrieval-Augmented Generation，检索增强生成）是当下最主流的补救方案：让模型先查资料再回答。但 RAG 这件事本身还有很深的分化——&lt;strong&gt;怎么查&lt;/strong&gt;差别巨大。本文借 Neo4j 那篇 &lt;a href="https://neo4j.com/blog/genai/what-is-graphrag/"&gt;What is GraphRAG?&lt;/a&gt; 的框架，把四种检索范式摆在一起对比，讲清 GraphRAG 解决什么问题，最后用我自己 270 篇博客转出来的知识图谱作为活样本。&lt;/p&gt;</description></item><item><title>知识蒸馏：小模型如何继承大模型的能力</title><link>https://blog.tanteng.space/2026/07/llm-distillation-explained/</link><pubDate>Fri, 10 Jul 2026 00:00:00 +0000</pubDate><guid>https://blog.tanteng.space/2026/07/llm-distillation-explained/</guid><description>&lt;p&gt;2025 年 1 月，DeepSeek 一口气放出 6 个 R1 蒸馏模型。但如果按 Hinton 2014 年那篇论文的定义逐条对照，这些模型一个都不算蒸馏。&lt;/p&gt;
&lt;p&gt;它们的实际训练过程是：用 R1 生成了 80 万条完整解答，然后在 Qwen / Llama 基座上做 2~3 个 epoch 的监督微调。Teacher 的 logits、隐状态、注意力图——一概没有参与训练。&lt;/p&gt;
&lt;p&gt;同一件事被叫成同一个名字，底下其实是三种完全不同的技术：&lt;strong&gt;能看到的 teacher 信息越少，蒸馏的信息密度就越低，需要的算力也就越多&lt;/strong&gt;。这篇文章把这三层拆开讲清楚，以及 2025-2026 年工业界真正在用的是哪一层。&lt;/p&gt;</description></item><item><title>从 CoT 到 ToT：大模型推理的思维进化与剪枝策略</title><link>https://blog.tanteng.space/posts/reasoning-models-cot-tot-pruning/</link><pubDate>Tue, 30 Jun 2026 00:00:00 +0000</pubDate><guid>https://blog.tanteng.space/posts/reasoning-models-cot-tot-pruning/</guid><description>&lt;p&gt;过去一年，推理大模型（OpenAI o 系列、DeepSeek R1 等）让所有人见识到了&amp;quot;慢思考&amp;quot;的威力。但这场革命的源头，要从两条看似独立的技术路线说起：一条让模型学会&lt;strong&gt;调用工具&lt;/strong&gt;，另一条让模型学会&lt;strong&gt;多路线探索&lt;/strong&gt;。两条路线最终在 ToT（Tree of Thoughts）架构下合流，并靠剪枝策略解决了最棘手的组合爆炸问题。&lt;/p&gt;</description></item><item><title>Neo4j《What is GraphRAG?》全文翻译（中英对照）</title><link>https://blog.tanteng.space/2026/03/what-is-graphrag/</link><pubDate>Fri, 06 Mar 2026 08:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2026/03/what-is-graphrag/</guid><description>&lt;p&gt;&lt;img src="https://notes-1303209934.cos.ap-guangzhou.myqcloud.com/2026/09/e665d907328ca38c279f3ee4a411e8c0.png" alt="GraphRAG 概览"&gt;&lt;/p&gt;
&lt;p&gt;向量 RAG 的天花板，从来不是 Embedding 模型不够强，而是&lt;strong&gt;它抓到的是「片段」，丢掉的却是「关系」&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这是 Neo4j 官方那篇被引用最多的 GraphRAG 定义文章。它做的事情很朴素：先把 RAG 拆成三个阶段讲清楚，然后指出纯向量检索的两大软肋（片段化 + 黑盒不可解释），再给出解法——把知识图谱当作 LLM 的「外部记忆」，用&lt;strong&gt;图检索&lt;/strong&gt;补上关系这一层。文章后半段还带了一个完整的 Neo4j 实战：用 &lt;code&gt;SimpleKGPipeline&lt;/code&gt; 从生物医学论文 PDF 里抽出实体和关系，再用 &lt;code&gt;VectorCypherRetriever&lt;/code&gt; 做「向量命中 + 关系跳两跳」，最后和纯向量 RAG 的答案做对比。&lt;/p&gt;</description></item><item><title>RAG 召回率提升的另一条路：HyDE 让问题先伪装成答案</title><link>https://blog.tanteng.space/posts/rag-hyde-hypothetical-documents/</link><pubDate>Tue, 03 Mar 2026 08:00:00 +0800</pubDate><guid>https://blog.tanteng.space/posts/rag-hyde-hypothetical-documents/</guid><description>&lt;p&gt;跑过 RAG 的同学大概都踩过这个坑：用户问&amp;quot;我的订单怎么取消？&amp;quot;，向量库里明明有那段&amp;quot;如需取消订单，请前往&amp;rsquo;我的订单&amp;rsquo;页面……&amp;quot;，但召回就是捞不回来。&lt;/p&gt;
&lt;p&gt;问题出在哪？&lt;strong&gt;问题和答案在向量空间里隔得很远&lt;/strong&gt;——&amp;ldquo;取消&amp;quot;虽然两边都有，但问句的语气、词汇结构、隐含的主语省略，都让它和那段陈述句形态的答案距离不近。BM25 兜不住（关键词只有两个字），向量检索也兜不住（语义结构差太大），怎么解？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;HyDE（Hypothetical Document Embeddings）&lt;/strong&gt; 就是专门处理这道题的。&lt;/p&gt;</description></item><item><title>DSPy：让 Prompt 自动优化而非手调</title><link>https://blog.tanteng.space/2026/02/dspy-prompt-optimization/</link><pubDate>Sun, 08 Feb 2026 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2026/02/dspy-prompt-optimization/</guid><description>&lt;blockquote&gt;
&lt;p&gt;写 prompt 调到怀疑人生？改一个词要测 100 条 case？2025 年开始，&lt;strong&gt;别再手调 prompt 了&lt;/strong&gt;——用 DSPy 这种&amp;quot;prompt 编译器&amp;quot;，让优化器自动搜索最优指令。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;手调 prompt 是 AI 工程里&lt;strong&gt;最反智&lt;/strong&gt;的工作之一：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;改一个词就要重跑全部测试&lt;/li&gt;
&lt;li&gt;一个 prompt 调到 90 分，再也调不上去&lt;/li&gt;
&lt;li&gt;模型升级后又要从头调&lt;/li&gt;
&lt;li&gt;不同任务需要不同 prompt，无法复用经验&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Stanford NLP 提出的 &lt;strong&gt;DSPy&lt;/strong&gt; 把 prompt 变成&amp;quot;&lt;strong&gt;可编译的代码&lt;/strong&gt;&amp;quot;——你定义&amp;quot;想要什么&amp;quot;（signature），DSPy 编译器自动生成最优 prompt。这篇文章讲清楚它的原理、用法、和 2025 年最新的优化器（MIPROv2 / GEPA）。&lt;/p&gt;</description></item><item><title>Fine-tuning 实战：LoRA / QLoRA 原理与工程实践</title><link>https://blog.tanteng.space/2025/12/lora-qlora-fine-tuning/</link><pubDate>Thu, 18 Dec 2025 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/12/lora-qlora-fine-tuning/</guid><description>&lt;blockquote&gt;
&lt;p&gt;Fine-tuning 是 LLM 应用的分水岭——但 90% 的场景其实&lt;strong&gt;不应该 fine-tune&lt;/strong&gt;。这篇文章讲清楚：什么时候 fine-tune、什么时候用 RAG、什么时候用 prompt，以及 fine-tune 时&lt;strong&gt;LoRA / QLoRA 的工程要点&lt;/strong&gt;（2025 年最新）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;很多团队的 LLM 上线流程是：&lt;strong&gt;先 fine-tune 一个&amp;quot;专属模型&amp;quot;&lt;/strong&gt;。但 2025 年的共识已经变了：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;微调 ≠ 提升能力。微调 = &lt;strong&gt;对齐行为到特定场景&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;GPT-4 不会因为你 fine-tune 变聪明，但会变得更&amp;quot;听话&amp;quot;——更稳定地按你的格式输出、更贴合你的语气、更准确地调用你的工具。&lt;strong&gt;这不是能力问题，是行为问题&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这篇文章分两部分：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;决策框架&lt;/strong&gt;：什么时候 fine-tune，什么时候用其他方法&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;工程实践&lt;/strong&gt;：LoRA / QLoRA 怎么调、怎么部署&lt;/li&gt;
&lt;/ol&gt;</description></item><item><title>Transformer 基础对话录：Q/K/V、训练与编解码器</title><link>https://blog.tanteng.space/2025/11/transformer-basics-dialogue/</link><pubDate>Fri, 07 Nov 2025 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/11/transformer-basics-dialogue/</guid><description>&lt;p&gt;下面是我和 ChatGPT 学 Transformer 的一段对话整理。从 Q、K、V 这三个字母开始，一路问到参数怎么训练、编码器和解码器有什么区别，最后停在后训练。&lt;/p&gt;
&lt;p&gt;追问顺序保留原样，措辞做了改写；回答重写过一遍，补上了对话里被跳过的 √d_k、多头注意力和位置编码，数字与结论对回 Attention Is All You Need 原文。&lt;/p&gt;</description></item><item><title>Attention Is All You Need 全文翻译与深度解读（中英对照）</title><link>https://blog.tanteng.space/2025/11/attention-is-all-you-need/</link><pubDate>Wed, 05 Nov 2025 09:30:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/11/attention-is-all-you-need/</guid><description>&lt;p&gt;2017 年 6 月，谷歌的 8 位研究者提交了一篇只有 8 页正文的论文。它没有提出新的训练技巧，没有刷爆某个榜单的绝对数值，甚至标题看起来像一句玩笑。&lt;/p&gt;
&lt;p&gt;但今天你用的每一个大模型——GPT、Claude、Gemini、DeepSeek、Qwen——血管里流的都是这篇论文写下的那行公式：&lt;/p&gt;
&lt;div class="code-block"&gt;
 &lt;button class="code-copy" type="button" hidden aria-label="Copy code to clipboard"&gt;
 &lt;span class="code-copy-label" aria-hidden="true"&gt;Copy&lt;/span&gt;
 &lt;/button&gt;
 &lt;pre tabindex="0"&gt;&lt;code&gt;Attention(Q, K, V) = softmax(QKᵀ / √d_k) V&lt;/code&gt;&lt;/pre&gt;
 &lt;/div&gt;&lt;p&gt;这篇文章做两件事：&lt;strong&gt;第一部分&lt;/strong&gt;是论文正文的完整中英对照翻译；&lt;strong&gt;第二部分&lt;/strong&gt;是我用今天的视角写的解读——那些论文里一笔带过、但后来被证明至关重要的细节。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;翻译体例：每个段落先列英文原文（引用块），紧接中文译文。公式与表格为便于阅读做了重排，专业术语保留英文并附中文。&lt;/p&gt;
&lt;/blockquote&gt;</description></item><item><title>多模态 RAG：ColPali 让 VLM 直接读 PDF</title><link>https://blog.tanteng.space/2025/07/multimodal-rag-and-colpali/</link><pubDate>Tue, 08 Jul 2025 15:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/07/multimodal-rag-and-colpali/</guid><description>&lt;blockquote&gt;
&lt;p&gt;2023 年我们做合同 RAG，要先 OCR 提取文本，再做 layout 分析识别表格，再用 PyMuPDF 切 chunk，最后 embedding 入库。整条管线 6 个组件，每个都可能丢信息——表格合并了、数字 OCR 错了、扫描件直接卡死。&lt;strong&gt;到 2024 年 ColPali 出现，这条管线被彻底推翻&lt;/strong&gt;：把 PDF 当图片扔给 VLM，模型同时理解文字、表格、图表、手写体，&lt;strong&gt;直接出 patch embedding&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这是一篇多模态 RAG 检索架构的文章。Phase 1-6 的 RAG 文章讲了&amp;quot;召回率优化&amp;quot;（BM25 + 向量 + rerank），本文讲的是&lt;strong&gt;当文档本身就是图像时&lt;/strong&gt;的范式跃迁：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;传统 OCR + chunking 管线的 4 个失效场景&lt;/li&gt;
&lt;li&gt;ColPali 的核心思路：&lt;strong&gt;PDF → 图片 → VLM → patch embedding → 检索&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Late Interaction（ColBERT 风格）在视觉空间的延伸&lt;/li&gt;
&lt;li&gt;ColQwen2/2.5、ViDoRe benchmark、工程取舍&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>LLM 推理优化：KV Cache、PagedAttention 与量化</title><link>https://blog.tanteng.space/2025/03/llm-inference-optimization/</link><pubDate>Tue, 25 Mar 2025 14:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/03/llm-inference-optimization/</guid><description>&lt;blockquote&gt;
&lt;p&gt;上线一个 70B 模型，自以为把 transformers 包进 FastAPI 就算生产就绪。结果 P99 延迟 12 秒、显存爆掉、并发只有 4。问题不是模型不行，而是 LLM 推理的访存模式和传统 CNN 推理是两个世界——KV Cache 占显存、解码是 memory-bound、长度不可预测。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这是一篇 LLM 推理优化的&amp;quot;算法地图&amp;quot;。Phase 6 的 &lt;code&gt;llm-serving-architecture.md&lt;/code&gt; 讲了 vLLM/TGI/Triton 三套服务的工程对比；本文深入到&lt;strong&gt;推理算法层&lt;/strong&gt;，讲四个 10 倍速提升的技术：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;PagedAttention&lt;/strong&gt;：把 KV Cache 切成页，显存利用率从 ~30% 提到 ~95%&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;FlashAttention-2&lt;/strong&gt;：用 tiling 把 attention 的 HBM 读写从 O(N²) 降到 O(N)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;KV Cache 量化（KIVI）&lt;/strong&gt;：把已经生成的 KV 压到 2-bit，&lt;strong&gt;显存再砍 4 倍&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;模型权重量化（GPTQ/AWQ）&lt;/strong&gt;：把 70B 模型从 140GB 压到 20GB，&lt;strong&gt;单卡可跑&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Speculative Decoding&lt;/strong&gt;：用小模型草稿 + 大模型验收，&lt;strong&gt;无损 2-3× 加速&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>比特币白皮书对话录：双花、工作量证明与确认数</title><link>https://blog.tanteng.space/2023/12/bitcoin-whitepaper-dialogue/</link><pubDate>Sun, 10 Dec 2023 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2023/12/bitcoin-whitepaper-dialogue/</guid><description>&lt;p&gt;这是另一份学习对话的整理稿，主题是中本聪 2008 年那份 9 页的白皮书。&lt;/p&gt;
&lt;p&gt;问题按原来的追问顺序保留，措辞做了改写；回答重写过，删掉了重复的类比，并把结论对回论文原文。&lt;/p&gt;</description></item><item><title>比特币白皮书中英对照全文翻译（Bitcoin: A Peer-to-Peer Electronic Cash System）</title><link>https://blog.tanteng.space/2015/10/bitcoin-whitepaper-cn-en/</link><pubDate>Sat, 31 Oct 2015 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2015/10/bitcoin-whitepaper-cn-en/</guid><description>&lt;p&gt;这是比特币白皮书的完整中英对照翻译。原文 9 页，正文 12 节，加上 8 条参考文献。&lt;/p&gt;
&lt;p&gt;体例：每段先列英文原文（引用块），紧接中文译文。公式、算法和概率表为便于阅读做了重排，图按原文内容重绘；专业术语保留英文并附中文，原文的引用编号 [1]–[8] 对应文末参考文献。&lt;/p&gt;</description></item><item><title>Bigtable 论文中英对照全文翻译（A Distributed Storage System for Structured Data）</title><link>https://blog.tanteng.space/2014/06/bigtable-paper-cn-en/</link><pubDate>Sun, 22 Jun 2014 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2014/06/bigtable-paper-cn-en/</guid><description>&lt;p&gt;这是 Bigtable 论文的完整中英对照翻译。原文 14 页，正文 11 节，参考文献 38 条。&lt;/p&gt;
&lt;p&gt;体例：每段先列英文原文（引用块），紧接中文译文。图与表格按原文内容重绘；专业术语保留英文并附中文，原文的引用编号 [n] 对应文末参考文献。&lt;/p&gt;</description></item><item><title>MapReduce 论文中英对照全文翻译（Simplified Data Processing on Large Clusters）</title><link>https://blog.tanteng.space/2014/05/mapreduce-paper-cn-en/</link><pubDate>Sun, 18 May 2014 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2014/05/mapreduce-paper-cn-en/</guid><description>&lt;p&gt;这是 MapReduce 论文的完整中英对照翻译。原文 13 页，正文 8 节加附录 A，参考文献 18 条。&lt;/p&gt;
&lt;p&gt;体例：每段先列英文原文（引用块），紧接中文译文。图与表格按原文内容重绘；专业术语保留英文并附中文，原文的引用编号 [n] 对应文末参考文献。&lt;/p&gt;</description></item><item><title>GFS 论文中英对照全文翻译（The Google File System）</title><link>https://blog.tanteng.space/2014/04/gfs-paper-cn-en/</link><pubDate>Sat, 12 Apr 2014 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2014/04/gfs-paper-cn-en/</guid><description>&lt;p&gt;这是 Google File System 论文的完整中英对照翻译。原文 15 页，正文 9 节，参考文献 12 条。&lt;/p&gt;
&lt;p&gt;体例：每段先列英文原文（引用块），紧接中文译文。图与表格按原文内容重绘；专业术语保留英文并附中文，原文的引用编号 [n] 对应文末参考文献。&lt;/p&gt;</description></item></channel></rss>