如何在不确定的大模型上,构建可靠的系统?——读《Agent 设计模式》
大模型的本质是预测下一个 token,它是概率性的。同样的输入,可能给出不同的输出;它会一本正经地胡说,也会在关键时刻掉链子。可我们偏偏想用它来搭建可靠的系统——能被信任、能上生产、能对结果负责的系统。
这就是横亘在整个 Agent 工程面前的核心命题,也是这篇文章的主线:
如何在不确定的大模型之上,构建确定性的可靠系统?
大模型的本质是预测下一个 token,它是概率性的。同样的输入,可能给出不同的输出;它会一本正经地胡说,也会在关键时刻掉链子。可我们偏偏想用它来搭建可靠的系统——能被信任、能上生产、能对结果负责的系统。
这就是横亘在整个 Agent 工程面前的核心命题,也是这篇文章的主线:
如何在不确定的大模型之上,构建确定性的可靠系统?
在 AI 辅助开发的浪潮中,“Vibe Coding” 虽然听起来很酷,但本质是依靠直觉和 AI 的模糊理解——你在和 AI “对暗号”,能不能跑通全靠运气。
为了让这种开发模式从「玄学」走向「工业级可靠」,SDD(规范驱动开发) 应运而生,而 OpenSpec 正是落地这一理念的开源框架。
如果你熟悉 TDD(测试驱动开发),会发现 SDD 其实是 TDD 思想在 AI 时代的延伸:先定义"什么是正确的",再让 AI 去实现。
让 WorkBuddy 查询埃及的旅行攻略与文明历史,按 GraphRAG 思路抽取实体和关系、生成知识图谱,并渲染成可视化 HTML,可以很清楚直观看到各节点之间的关联。
🔗 分享链接:https://workbuddy.link/p/ZOLI5R1Qs5H2lxyXDZeBkv?source=2
大模型很强,但有两个老毛病:幻觉(说得头头是道但全是编的)和知识陈旧(训练完之后发生的事它不知道)。RAG(Retrieval-Augmented Generation,检索增强生成)是当下最主流的补救方案:让模型先查资料再回答。但 RAG 这件事本身还有很深的分化——怎么查差别巨大。本文借 Neo4j 那篇 What is GraphRAG? 的框架,把四种检索范式摆在一起对比,讲清 GraphRAG 解决什么问题,最后用我自己 270 篇博客转出来的知识图谱作为活样本。
用 OpenClaw 改一个东西,死活改不对;在 Claude Code 里用同样的模型,一次就改好了。这就是 harness。
Pentax 17 半幅胶片机,搭配好的胶卷能显著提升画质,比如 Portra 400,Ektar 100.
为什么同一个 MiniMax-M3,接到 Claude Code 和 Workbuddy 上跑同一个任务,输出会完全不一样——语气不同、结构不同、深度不同、有没有抓到关键风险点都不同?
第一反应大概会怪模型。但模型从来没有变过。
变的是模型外面那一整套"包装"——业内有个正式名字叫 AI Agent Harness。
每种胶卷都有自己的「色彩 DNA」——饱和度倾向、色相偏移、宽容度、颗粒结构,出厂时就定好了,换一卷就是另一种感觉。
这篇按色彩特点梳理现在还能买到的彩色胶卷,并用 Portra 400 的官方特性曲线算清楚宽容度有多少档。
用户点了 👎,反馈"答错了"。接下来该改什么?
这是每个做大模型产品的人每天都会遇到的问题。多数团队第一反应是"换更强的模型"或者"加更多 prompt",但这两条路都偏题。大模型答错是一个链路累积误差问题,工程上要做的是:先归因,再定位,最后在最优的那一层修。
这篇文章不讲玄学技巧,给一套可直接落地的优化框架。
2025 年 GPT-4o、Claude 4、Gemini 2.5 都原生支持多模态——能"看图"的 LLM 已经从前沿技术变成基础设施。但多模态 ≠ 万能:图片理解有 4 个根本限制(幻觉、空间推理、计数、小文本)。这篇文章讲清楚 VLM 的真正能力和工程化路径。
VLM(Vision-Language Model)让 LLM 突破"只能读文本"的边界——能看截图、读 PDF、理解图表、识别人脸、看懂 UI。这是 2025-2026 年 AI 应用最重要的能力扩展。
但很多团队的 VLM 应用踩了同一个坑:直接拿来用,没考虑 VLM 的边界。结果是上线后遇到各种边界 case 才补窟窿。
Sequential Thinking MCP 是 Anthropic 官方 modelcontextprotocol/servers 仓库里的一个示范性 server(现已 archived)。它在 Claude 还没有原生 extended thinking 的窗口期承担了一个关键角色——把"思维链"(Chain-of-Thought, CoT)从 prompt 技巧,外化成了一个可被工具调用协议观察、干预、编排的对象。今天 Claude 的 thinking block、ReAct 循环、Tree-of-Thoughts 这些已经成为标配的设计模式,都和它解决的问题有直接血缘。
2025 年 1 月,DeepSeek 一口气放出 6 个 R1 蒸馏模型。但如果按 Hinton 2014 年那篇论文的定义逐条对照,这些模型一个都不算蒸馏。
它们的实际训练过程是:用 R1 生成了 80 万条完整解答,然后在 Qwen / Llama 基座上做 2~3 个 epoch 的监督微调。Teacher 的 logits、隐状态、注意力图——一概没有参与训练。
同一件事被叫成同一个名字,底下其实是三种完全不同的技术:能看到的 teacher 信息越少,蒸馏的信息密度就越低,需要的算力也就越多。这篇文章把这三层拆开讲清楚,以及 2025-2026 年工业界真正在用的是哪一层。
「订一张下周三从深圳飞北京的机票」和「刚才那张票能改签吗」,对系统来说是两种完全不同的动作。前者要触发搜索与下单,后者要在已有订单上做修改,而且城市、日期、乘客都得从上一轮继承过来。
把这类自然语言输入映射到正确的动作上,就是意图识别(Intent Recognition)。它是对话系统唯一的信息入口,也是错误会向下游逐级放大的那一环。
这篇文章从概念讲起:先说清意图、槽位、对话状态这几个词的确切含义,再说清 SLM 和 LLM 两条路线在数学上其实是同一个问题、工程上却是两套完全不同的系统,最后落到数据构造、训练、约束解码、拒识阈值、多轮处理和分层评测。