标签为“Agent”的页面如下
如何在不确定的大模型上,构建可靠的系统?——读《Agent 设计模式》
大模型的本质是预测下一个 token,它是概率性的。同样的输入,可能给出不同的输出;它会一本正经地胡说,也会在关键时刻掉链子。可我们偏偏想用它来搭建可靠的系统——能被信任、能上生产、能对结果负责的系统。
这就是横亘在整个 Agent 工程面前的核心命题,也是这篇文章的主线:
如何在不确定的大模型之上,构建确定性的可靠系统?
Harness 工程:当大模型变成 CPU,谁来写这个操作系统
为什么同一个 MiniMax-M3,接到 Claude Code 和 Workbuddy 上跑同一个任务,输出会完全不一样——语气不同、结构不同、深度不同、有没有抓到关键风险点都不同?
第一反应大概会怪模型。但模型从来没有变过。
变的是模型外面那一整套"包装"——业内有个正式名字叫 AI Agent Harness。
Sequential Thinking MCP:CoT 时代的一个过渡性 MCP Server
Sequential Thinking MCP 是 Anthropic 官方 modelcontextprotocol/servers 仓库里的一个示范性 server(现已 archived)。它在 Claude 还没有原生 extended thinking 的窗口期承担了一个关键角色——把"思维链"(Chain-of-Thought, CoT)从 prompt 技巧,外化成了一个可被工具调用协议观察、干预、编排的对象。今天 Claude 的 thinking block、ReAct 循环、Tree-of-Thoughts 这些已经成为标配的设计模式,都和它解决的问题有直接血缘。
腾讯混元 Hy3 深度解析:295B MoE、快慢思考融合、Agent 能力跃升
2026 年 4 月 23 日,腾讯混元发布并开源 Hy3 preview;7 月 6 日正式版(GA)上线,Agent 任务解决率跃升至 90%,ClawEval pass³ 拿到 68.5,超过 DeepSeek V4 Pro 的 62.4。本文围绕架构、创新点、性能表现和差异化四个维度,做一次系统梳理。
意图识别两条路:SLM 微调与 LLM Function-calling 横评与选型指南
意图识别(Intent Recognition)这件事,在 NLP 圈子里干了十几年,本来快成"已解决"的问题了。结果 2024 年 LLM Function-calling 起来之后,又被翻出来重新讨论——意图的边界变大了:以前只要分到 20 个固定类别,现在每个意图对应一个工具调用、一段 API 参数,甚至一个 Agent 子任务。
更关键的是多轮对话成了主流形态:用户说"查一下我上个月从深圳飞北京的那张机票,能改签到下周三吗?",这一句话里有"查询订单 + 修改订单"两个意图,还要继承上文的"深圳-北京"实体。多轮场景下的意图识别,跟单轮完全是两个问题。
本文从多轮对话视角出发,对比两条主流路线:微调 SLM(小语言模型)与LLM Function-calling + 结构化输出,最后给出选型决策树和混合架构。
从 CoT 到 ToT:大模型推理的思维进化与剪枝策略
过去一年,推理大模型(OpenAI o 系列、DeepSeek R1 等)让所有人见识到了"慢思考"的威力。但这场革命的源头,要从两条看似独立的技术路线说起:一条让模型学会调用工具,另一条让模型学会多路线探索。两条路线最终在 ToT(Tree of Thoughts)架构下合流,并靠剪枝策略解决了最棘手的组合爆炸问题。
深度拆解:AI Agent Harness 的构造【译】
本文将深入探讨 Anthropic、OpenAI、Perplexity 和 LangChain 究竟在开发什么。我们将聊聊编排循环、工具、记忆、上下文管理,以及那些将"无状态"的大语言模型(LLM)转变为全能智能体(Agent)的底层机制。
你可能已经开发过聊天机器人,甚至可能用一些工具搭建了一个 ReAct 循环(ReAct:Reason + Act,一种让模型在行动前先进行推理的模式)。跑 Demo 的时候看着挺好,但一旦投入生产环境,系统就会开始掉链子:模型会忘记三步前做了什么,工具调用悄悄报错,上下文窗口(Context Window)里塞满了毫无意义的垃圾信息。
问题其实并不在模型本身,而在模型外围的基础设施。
Hermes Agent 如何实现自进化:一个内置学习闭环的 AI 智能体
在 AI Agent 领域,“自进化”(self-evolution)这个词已经被用滥了。大多数 Agent 框架所谓的"学习"不过是把对话历史塞进上下文窗口,或者用 RAG 检索一下相关文档。真正的自进化,是让 Agent 在不重新训练模型的前提下,从每次交互中沉淀出可复用的知识,并在未来的任务中自动调用它。
Nous Research 在 2026 年开源的 Hermes Agent 是目前少数把这个目标工程化得最系统的开源项目。它没有改模型权重,没有重新做 RLHF,而是用一套纯文本 + 外部状态的机制,把"成长"这件事拆解成四个可观测、可验证、可回滚的子系统。
OpenClaw Dreaming:让AI在睡眠中整理记忆
就像人类会做梦来巩固白天的经历一样,OpenClaw也有自己的"睡眠周期"。
如果你在用 OpenClaw 作为私人AI助手,日复一日的对话会产生大量的短期记忆碎片——哪些任务完成了、用户纠正了哪些错误、下次要注意什么。这些信号如果不做任何处理,要么被遗忘,要么塞进 system prompt 里导致上下文膨胀。
Dreaming 就是来解决这个问题的。
一个基于 TradingAgents 框架打造的股票分析 Skill
TradingAgents-CN-Skill 是基于 TradingAgents 框架的中文股票分析 Skill。用户输入股票截图、文字描述或股票代码,Agent 自动完成 4 位分析师 + 2 轮多空辩论 + 风控三方辩论 + 五级评级,输出完整 PDF 报告。
Superpowers + OpenSpec:AI 编程黄金搭档工作流
AI 编程工具层出不穷,但真正的问题不是"AI 能不能写代码",而是"如何让 AI 按照软件工程的标准流程开发"。2026 年,两个开源项目——Superpowers 和 OpenSpec——形成了一套被业内称为"黄金搭档"的开发范式。
深度解析 OpenViking —— 字节跳动开源的 AI 上下文数据库
在 LLM(大语言模型)应用开发中,如何处理海量的、碎片化的上下文数据是开发者面临的最大挑战。字节跳动火山引擎团队开源了 OpenViking,这是一个专门为 AI Agent 和 RAG 场景设计的上下文数据库。它不仅继承了字节内部支撑抖音、豆包等产品的自研向量检索技术,更针对 AI 原生应用的需求进行了深度优化。
TradingAgents-CN Prompt 总结
TradingAgents-CN 是一个基于 LLM 的多智能体股票交易分析框架,其精心设计的 prompt 体系值得深入研究。本文完整记录该项目中的所有 prompt 设计。
ReAct 论文解读:在语言模型中协同推理与行动
ReAct(arXiv 2210.03629)是姚顺雨 2022 年 10 月发表、2023 年 5 月在 Kigali 的 ICLR 2023 Oral(Notable Top 5%)上正式宣读的论文。它解决的问题很朴素:让大语言模型在同一个轨迹里同时"想"和"做"。在此之前,Chain-of-Thought(CoT)和"只行动"(Act-only)是两条互不往来的研究脉络,ReAct 是第一条把它们显式缝合起来的路径。