<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>微调 on Tony老师的博客</title><link>https://blog.tanteng.space/tags/fine-tuning/</link><description>Recent content in 微调 on Tony老师的博客</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Mon, 14 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.tanteng.space/tags/fine-tuning/index.xml" rel="self" type="application/rss+xml"/><item><title>知识蒸馏：小模型如何继承大模型的能力</title><link>https://blog.tanteng.space/2026/07/llm-distillation-explained/</link><pubDate>Fri, 10 Jul 2026 00:00:00 +0000</pubDate><guid>https://blog.tanteng.space/2026/07/llm-distillation-explained/</guid><description>&lt;p&gt;2025 年 1 月，DeepSeek 一口气放出 6 个 R1 蒸馏模型。但如果按 Hinton 2014 年那篇论文的定义逐条对照，这些模型一个都不算蒸馏。&lt;/p&gt;
&lt;p&gt;它们的实际训练过程是：用 R1 生成了 80 万条完整解答，然后在 Qwen / Llama 基座上做 2~3 个 epoch 的监督微调。Teacher 的 logits、隐状态、注意力图——一概没有参与训练。&lt;/p&gt;
&lt;p&gt;同一件事被叫成同一个名字，底下其实是三种完全不同的技术：&lt;strong&gt;能看到的 teacher 信息越少，蒸馏的信息密度就越低，需要的算力也就越多&lt;/strong&gt;。这篇文章把这三层拆开讲清楚，以及 2025-2026 年工业界真正在用的是哪一层。&lt;/p&gt;</description></item><item><title>意图识别：SLM 微调与 LLM Function-calling 的原理、实践与选型</title><link>https://blog.tanteng.space/posts/intent-recognition-slm-vs-function-calling/</link><pubDate>Wed, 08 Jul 2026 09:00:00 +0800</pubDate><guid>https://blog.tanteng.space/posts/intent-recognition-slm-vs-function-calling/</guid><description>&lt;p&gt;「订一张下周三从深圳飞北京的机票」和「刚才那张票能改签吗」，对系统来说是两种完全不同的动作。前者要触发搜索与下单，后者要在已有订单上做修改，而且城市、日期、乘客都得从上一轮继承过来。&lt;/p&gt;
&lt;p&gt;把这类自然语言输入映射到正确的动作上，就是&lt;strong&gt;意图识别（Intent Recognition）&lt;/strong&gt;。它是对话系统唯一的信息入口，也是错误会向下游逐级放大的那一环。&lt;/p&gt;
&lt;p&gt;这篇文章从概念讲起：先说清意图、槽位、对话状态这几个词的确切含义，再说清 SLM 和 LLM 两条路线在数学上其实是同一个问题、工程上却是两套完全不同的系统，最后落到数据构造、训练、约束解码、拒识阈值、多轮处理和分层评测。&lt;/p&gt;</description></item><item><title>Fine-tuning 实战：LoRA / QLoRA 原理与工程实践</title><link>https://blog.tanteng.space/2025/12/lora-qlora-fine-tuning/</link><pubDate>Thu, 18 Dec 2025 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/12/lora-qlora-fine-tuning/</guid><description>&lt;blockquote&gt;
&lt;p&gt;Fine-tuning 是 LLM 应用的分水岭——但 90% 的场景其实&lt;strong&gt;不应该 fine-tune&lt;/strong&gt;。这篇文章讲清楚：什么时候 fine-tune、什么时候用 RAG、什么时候用 prompt，以及 fine-tune 时&lt;strong&gt;LoRA / QLoRA 的工程要点&lt;/strong&gt;（2025 年最新）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;很多团队的 LLM 上线流程是：&lt;strong&gt;先 fine-tune 一个&amp;quot;专属模型&amp;quot;&lt;/strong&gt;。但 2025 年的共识已经变了：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;微调 ≠ 提升能力。微调 = &lt;strong&gt;对齐行为到特定场景&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;GPT-4 不会因为你 fine-tune 变聪明，但会变得更&amp;quot;听话&amp;quot;——更稳定地按你的格式输出、更贴合你的语气、更准确地调用你的工具。&lt;strong&gt;这不是能力问题，是行为问题&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这篇文章分两部分：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;决策框架&lt;/strong&gt;：什么时候 fine-tune，什么时候用其他方法&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;工程实践&lt;/strong&gt;：LoRA / QLoRA 怎么调、怎么部署&lt;/li&gt;
&lt;/ol&gt;</description></item></channel></rss>