标签为“大模型”的页面如下
如何在不确定的大模型上,构建可靠的系统?——读《Agent 设计模式》
大模型的本质是预测下一个 token,它是概率性的。同样的输入,可能给出不同的输出;它会一本正经地胡说,也会在关键时刻掉链子。可我们偏偏想用它来搭建可靠的系统——能被信任、能上生产、能对结果负责的系统。
这就是横亘在整个 Agent 工程面前的核心命题,也是这篇文章的主线:
如何在不确定的大模型之上,构建确定性的可靠系统?
Harness 工程:当大模型变成 CPU,谁来写这个操作系统
为什么同一个 MiniMax-M3,接到 Claude Code 和 Workbuddy 上跑同一个任务,输出会完全不一样——语气不同、结构不同、深度不同、有没有抓到关键风险点都不同?
第一反应大概会怪模型。但模型从来没有变过。
变的是模型外面那一整套"包装"——业内有个正式名字叫 AI Agent Harness。
大模型是如何一步步提升回答质量的
用户点了 👎,反馈"答错了"。接下来该改什么?
这是每个做大模型产品的人每天都会遇到的问题。多数团队第一反应是"换更强的模型"或者"加更多 prompt",但这两条路都偏题。大模型答错是一个链路累积误差问题,工程上要做的是:先归因,再定位,最后在最优的那一层修。
这篇文章不讲玄学技巧,给一套可直接落地的优化框架。
Sequential Thinking MCP:CoT 时代的一个过渡性 MCP Server
Sequential Thinking MCP 是 Anthropic 官方 modelcontextprotocol/servers 仓库里的一个示范性 server(现已 archived)。它在 Claude 还没有原生 extended thinking 的窗口期承担了一个关键角色——把"思维链"(Chain-of-Thought, CoT)从 prompt 技巧,外化成了一个可被工具调用协议观察、干预、编排的对象。今天 Claude 的 thinking block、ReAct 循环、Tree-of-Thoughts 这些已经成为标配的设计模式,都和它解决的问题有直接血缘。
一文读懂大模型蒸馏技术的核心原理
你是一家百年老店的老板。你有一位镇店的老厨师——做菜几十年,火候精准、味觉敏锐,客人赞不绝口。但问题是,他一个月薪要 5 万,切菜慢、脾气大、还时不时请假。
现在你要开分店,需要 10 个能做出 80% 味道的厨师,便宜、听话、能加班。怎么办?
最直接的方法:让他们去新东方烹饪学校重学三年。但太慢了。
更聪明的办法:让老厨师手把手带徒弟。不要求徒弟复制老厨师的一切,只要他们能学到老厨师的"味觉直觉"和"调味逻辑"——几个月后,这些徒弟就能做出味道相近、薪资只需老厨师十分之一的菜。
大模型蒸馏(Knowledge Distillation),就是这个"带徒弟"的过程。
腾讯混元 Hy3 深度解析:295B MoE、快慢思考融合、Agent 能力跃升
2026 年 4 月 23 日,腾讯混元发布并开源 Hy3 preview;7 月 6 日正式版(GA)上线,Agent 任务解决率跃升至 90%,ClawEval pass³ 拿到 68.5,超过 DeepSeek V4 Pro 的 62.4。本文围绕架构、创新点、性能表现和差异化四个维度,做一次系统梳理。
意图识别两条路:SLM 微调与 LLM Function-calling 横评与选型指南
意图识别(Intent Recognition)这件事,在 NLP 圈子里干了十几年,本来快成"已解决"的问题了。结果 2024 年 LLM Function-calling 起来之后,又被翻出来重新讨论——意图的边界变大了:以前只要分到 20 个固定类别,现在每个意图对应一个工具调用、一段 API 参数,甚至一个 Agent 子任务。
更关键的是多轮对话成了主流形态:用户说"查一下我上个月从深圳飞北京的那张机票,能改签到下周三吗?",这一句话里有"查询订单 + 修改订单"两个意图,还要继承上文的"深圳-北京"实体。多轮场景下的意图识别,跟单轮完全是两个问题。
本文从多轮对话视角出发,对比两条主流路线:微调 SLM(小语言模型)与LLM Function-calling + 结构化输出,最后给出选型决策树和混合架构。
从 CoT 到 ToT:大模型推理的思维进化与剪枝策略
过去一年,推理大模型(OpenAI o 系列、DeepSeek R1 等)让所有人见识到了"慢思考"的威力。但这场革命的源头,要从两条看似独立的技术路线说起:一条让模型学会调用工具,另一条让模型学会多路线探索。两条路线最终在 ToT(Tree of Thoughts)架构下合流,并靠剪枝策略解决了最棘手的组合爆炸问题。
一个基于 TradingAgents 框架打造的股票分析 Skill
TradingAgents-CN-Skill 是基于 TradingAgents 框架的中文股票分析 Skill。用户输入股票截图、文字描述或股票代码,Agent 自动完成 4 位分析师 + 2 轮多空辩论 + 风控三方辩论 + 五级评级,输出完整 PDF 报告。
OpenClaw 的 QMD 记忆引擎:从尝鲜到放弃
OpenClaw 有一套内置的 Memory 系统,基于 SQLite 实现,开箱即用。但对于需要更高搜索质量、更广索引范围的场景,OpenClaw 提供了一个更强大的选项——QMD Memory Engine。
本文梳理 QMD 的核心概念、架构原理、配置方法,以及它在 OpenClaw 记忆体系中的实际角色,最后与 OpenViking 方案做对比。
企业知识库问答 RAG:腾讯云原子引擎实战
把 RAG 链路拆开看,每一步(解析、拆分、Embedding、检索、重排)都有可以替换的实现。腾讯云知识引擎原子能力做的事情,本质上是把这些环节单独抽成高质量的 API,让开发者按需组合。
这篇文章不是入门教程,而是面向已经理解 RAG 全流程的 AI 应用开发者,重点聊在企业知识库问答场景下,怎么用这套原子能力,以及几个真实的取舍。
TradingAgents-CN Prompt 总结
TradingAgents-CN 是一个基于 LLM 的多智能体股票交易分析框架,其精心设计的 prompt 体系值得深入研究。本文完整记录该项目中的所有 prompt 设计。
RAG 核心:Embedding、向量检索与 Rerank
什么是 RAG?
RAG(Retrieval-Augmented Generation,检索增强生成)是大模型应用的核心架构。它通过"检索+生成"的两阶段模式,让 AI 能够利用私有知识库回答问题,而不是仅依赖模型内部的训练数据。
ReAct 论文解读:在语言模型中协同推理与行动
ReAct(arXiv 2210.03629)是姚顺雨 2022 年 10 月发表、2023 年 5 月在 Kigali 的 ICLR 2023 Oral(Notable Top 5%)上正式宣读的论文。它解决的问题很朴素:让大语言模型在同一个轨迹里同时"想"和"做"。在此之前,Chain-of-Thought(CoT)和"只行动"(Act-only)是两条互不往来的研究脉络,ReAct 是第一条把它们显式缝合起来的路径。
提升 RAG 召回率的最低成本方案:3 个 Query 改写范式
跑过 RAG 的同学大概率踩过这个坑:Embedding 模型选得很好、向量库也没问题,但召回质量就是不行。
排查一圈下来,原因往往出乎意料——不是 Embedding 不行,而是用户的问题太"糙":
"这个东西怎么用?" ← 缺主语
"为什么我那个又不行了?" ← 全是代词
"性能怎么样?" ← 完全没头没尾
"a 和 b 哪个好?" ← 缺上下文基于 LangChain 的结构化输出实践
在 AI 应用开发中,让大模型稳定地输出我们想要的格式是一个常见需求。本文介绍如何使用 LangChain 的 Golang 版本 langchaingo 实现 Prompt Template,并结合主流 LLM 的 JSON Mode 实现可靠的结构化输出。
什么是 Prompt Template
Prompt Template 是将提示词模板化的技术,通过占位符动态注入变量,让同一套提示词可以处理不同输入。类似于 Web 开发中的模板引擎。