如何在不确定的大模型上,构建可靠的系统?——读《Agent 设计模式》
大模型的本质是预测下一个 token,它是概率性的。同样的输入,可能给出不同的输出;它会一本正经地胡说,也会在关键时刻掉链子。可我们偏偏想用它来搭建可靠的系统——能被信任、能上生产、能对结果负责的系统。
这就是横亘在整个 Agent 工程面前的核心命题,也是这篇文章的主线:
如何在不确定的大模型之上,构建确定性的可靠系统?
大模型的本质是预测下一个 token,它是概率性的。同样的输入,可能给出不同的输出;它会一本正经地胡说,也会在关键时刻掉链子。可我们偏偏想用它来搭建可靠的系统——能被信任、能上生产、能对结果负责的系统。
这就是横亘在整个 Agent 工程面前的核心命题,也是这篇文章的主线:
如何在不确定的大模型之上,构建确定性的可靠系统?
在 AI 辅助开发的浪潮中,“Vibe Coding” 虽然听起来很酷,但本质是依靠直觉和 AI 的模糊理解——你在和 AI “对暗号”,能不能跑通全靠运气。
为了让这种开发模式从「玄学」走向「工业级可靠」,SDD(规范驱动开发) 应运而生,而 OpenSpec 正是落地这一理念的开源框架。
如果你熟悉 TDD(测试驱动开发),会发现 SDD 其实是 TDD 思想在 AI 时代的延伸:先定义"什么是正确的",再让 AI 去实现。
为什么同一个 MiniMax-M3,接到 Claude Code 和 Workbuddy 上跑同一个任务,输出会完全不一样——语气不同、结构不同、深度不同、有没有抓到关键风险点都不同?
第一反应大概会怪模型。但模型从来没有变过。
变的是模型外面那一整套"包装"——业内有个正式名字叫 AI Agent Harness。
用户点了 👎,反馈"答错了"。接下来该改什么?
这是每个做大模型产品的人每天都会遇到的问题。多数团队第一反应是"换更强的模型"或者"加更多 prompt",但这两条路都偏题。大模型答错是一个链路累积误差问题,工程上要做的是:先归因,再定位,最后在最优的那一层修。
这篇文章不讲玄学技巧,给一套可直接落地的优化框架。
在期权市场里观察一段时间,你会发现一个反复出现的现象:绝大部分散户期权交易最终都以亏损收场。这不是耸人听闻,而是全球主要期权交易所和学术界长期观察的结论。问题出在哪?不是期权策略本身有问题,而是大多数人从一开始就用错了期权。
在这篇文章里,我从一个期权从业者的角度,把期权最核心的功能讲清楚,然后告诉你:只有这 4 种场景,才真正强烈推荐你动用期权。其他时候,请放下期权,老老实实持有正股或者持有现金。
塔勒布的《非对称风险》(Skin in the Game)于 2018 年英文出版、2019 年中信出版集团推出周洛华译本。它是塔勒布"不确定性五部曲"(Incerto)中的第四部(前作是《随机漫步的傻瓜》《黑天鹅》《反脆弱》,后有技术专著《肥尾分布的统计后果》)。如果说《反脆弱》讲的是"如何从波动中受益",那么《非对称风险》讲的是"为什么必须由受益者承担风险"。一句话提炼:谁受益,谁就要有 skin in the game;没有皮肤入场的人,没有资格坐上牌桌。
你是一家百年老店的老板。你有一位镇店的老厨师——做菜几十年,火候精准、味觉敏锐,客人赞不绝口。但问题是,他一个月薪要 5 万,切菜慢、脾气大、还时不时请假。
现在你要开分店,需要 10 个能做出 80% 味道的厨师,便宜、听话、能加班。怎么办?
最直接的方法:让他们去新东方烹饪学校重学三年。但太慢了。
更聪明的办法:让老厨师手把手带徒弟。不要求徒弟复制老厨师的一切,只要他们能学到老厨师的"味觉直觉"和"调味逻辑"——几个月后,这些徒弟就能做出味道相近、薪资只需老厨师十分之一的菜。
大模型蒸馏(Knowledge Distillation),就是这个"带徒弟"的过程。
2026 年 4 月 23 日,腾讯混元发布并开源 Hy3 preview;7 月 6 日正式版(GA)上线,Agent 任务解决率跃升至 90%,ClawEval pass³ 拿到 68.5,超过 DeepSeek V4 Pro 的 62.4。本文围绕架构、创新点、性能表现和差异化四个维度,做一次系统梳理。
意图识别(Intent Recognition)这件事,在 NLP 圈子里干了十几年,本来快成"已解决"的问题了。结果 2024 年 LLM Function-calling 起来之后,又被翻出来重新讨论——意图的边界变大了:以前只要分到 20 个固定类别,现在每个意图对应一个工具调用、一段 API 参数,甚至一个 Agent 子任务。
更关键的是多轮对话成了主流形态:用户说"查一下我上个月从深圳飞北京的那张机票,能改签到下周三吗?",这一句话里有"查询订单 + 修改订单"两个意图,还要继承上文的"深圳-北京"实体。多轮场景下的意图识别,跟单轮完全是两个问题。
本文从多轮对话视角出发,对比两条主流路线:微调 SLM(小语言模型)与LLM Function-calling + 结构化输出,最后给出选型决策树和混合架构。
过去一年,推理大模型(OpenAI o 系列、DeepSeek R1 等)让所有人见识到了"慢思考"的威力。但这场革命的源头,要从两条看似独立的技术路线说起:一条让模型学会调用工具,另一条让模型学会多路线探索。两条路线最终在 ToT(Tree of Thoughts)架构下合流,并靠剪枝策略解决了最棘手的组合爆炸问题。
2026年6月18日,SK海力士正式宣布已向主要客户(以英伟达为主)交付12层堆叠 HBM4E 工程样品,这是目前已知业界最先进的 HBM4E 产品之一。从 JEDEC 发布 HBM4 标准规范(2025年4月)到工程样品落地,只用了一年出头,节奏远超预期。本文深入解析 HBM 家族的技术演进路径、HBM4E 的核心突破点,以及当前 SK 海力士、三星、美光三家的竞争态势。
本周 Hacker News 热门话题涵盖了 AI 编程工具、太空科技、工程文化、消费电子以及 Web 安全等多个领域,以下是本期精选内容。
回看埃隆·马斯克从电动汽车、火箭发射,一路布局到全球卫星网和深空飞船的整个历程,你会发现这绝不是一个连环创业者"东一榔头西一棒槌"的跨界投机,而是一场长达二十多年、逻辑极其严密的"人类多行星生存"终极闭环战略。
在 Go Monorepo 项目中,引入一个内部 RPC 依赖本该是一件简单的事——加一行 require,配一个 replace,代码编译通过,似乎万事大吉。但服务一启动,直接 panic:
panic: proto: file "validate/validate.proto" is already registered
panic: proto: file "common.proto" has a name conflict over trpc.myservice.common.Team两个 panic,两个不同的 proto namespace 冲突。这是 Go protobuf 生态中一个经典的「传递依赖地狱」问题。
本文记录一次真实问题的根因分析和解决方案:如何通过手写一个本地精简 Stub,以最小代码代价绕过 proto 注册机制,彻底消除冲突。
Pulsar 是 Apache 旗下的分布式消息队列,由 Yahoo 开源,专为云原生时代设计;Kafka 是 LinkedIn 开源的老牌消息队列,以高吞吐量闻名。两者在架构、设计哲学和适用场景上有显著差异。
你有没有想过,让 AI Agent 去调度其他 AI Agent(如 Claude Code、Codex)来协同工作?听起来像是科幻片的设定,其实在 OpenClaw 里已经实现了。
现代 AI 应用越来越复杂,单一 Agent 的能力往往有上限。想象一下:你需要一个 Agent 做代码审查,另一个做性能分析,还有一个负责汇总报告——这时候,Agent 之间的协同工作就成了刚需。
本文将深入探讨 Anthropic、OpenAI、Perplexity 和 LangChain 究竟在开发什么。我们将聊聊编排循环、工具、记忆、上下文管理,以及那些将"无状态"的大语言模型(LLM)转变为全能智能体(Agent)的底层机制。
你可能已经开发过聊天机器人,甚至可能用一些工具搭建了一个 ReAct 循环(ReAct:Reason + Act,一种让模型在行动前先进行推理的模式)。跑 Demo 的时候看着挺好,但一旦投入生产环境,系统就会开始掉链子:模型会忘记三步前做了什么,工具调用悄悄报错,上下文窗口(Context Window)里塞满了毫无意义的垃圾信息。
问题其实并不在模型本身,而在模型外围的基础设施。
在 AI Agent 领域,“自进化”(self-evolution)这个词已经被用滥了。大多数 Agent 框架所谓的"学习"不过是把对话历史塞进上下文窗口,或者用 RAG 检索一下相关文档。真正的自进化,是让 Agent 在不重新训练模型的前提下,从每次交互中沉淀出可复用的知识,并在未来的任务中自动调用它。
Nous Research 在 2026 年开源的 Hermes Agent 是目前少数把这个目标工程化得最系统的开源项目。它没有改模型权重,没有重新做 RLHF,而是用一套纯文本 + 外部状态的机制,把"成长"这件事拆解成四个可观测、可验证、可回滚的子系统。
在 Go 后端开发中,google.protobuf.Value 是一个经常被提及但容易被误用的类型。它属于 Protobuf 的 Well-Known Types(内置类型),设计初衷是解决动态类型问题——即在静态的 message 定义中承载任意的 JSON 兼容数据。
本文从 Go 后端开发者的视角出发,系统讲解 Value 的设计理念、Golang 实战用法,以及常见的最佳实践和避坑指南。
买入一只股票后遭遇浮亏,想要解套通常需要股价涨回成本价——这往往意味着更大的涨幅、更长的时间。但机构投资者有一套成熟的"扭亏为盈"组合拳,叫做 Stock Repair(股票修复策略)。
本文以刚上市的 SpaceX(SPCX) 为案例,详解其核心逻辑与操作方法。
就像人类会做梦来巩固白天的经历一样,OpenClaw也有自己的"睡眠周期"。
如果你在用 OpenClaw 作为私人AI助手,日复一日的对话会产生大量的短期记忆碎片——哪些任务完成了、用户纠正了哪些错误、下次要注意什么。这些信号如果不做任何处理,要么被遗忘,要么塞进 system prompt 里导致上下文膨胀。
Dreaming 就是来解决这个问题的。
TradingAgents-CN-Skill 是基于 TradingAgents 框架的中文股票分析 Skill。用户输入股票截图、文字描述或股票代码,Agent 自动完成 4 位分析师 + 2 轮多空辩论 + 风控三方辩论 + 五级评级,输出完整 PDF 报告。
卖期权本质上是在做时间的朋友——你卖出期权,收取权利金,然后等待时间流逝将这份期权消磨殆尽。但无论是卖 Put 还是卖 Call,裸卖的风险要么理论上无限(裸卖 Call),要么保证金占用极大(裸卖 Put)。因此,组合是期权卖方的必修课。
本文从实战出发,系统梳理卖 Put 和卖 Call 各自最经典的组合方式,以及它们之间的协同关系。
索尼 A7M4(ILCE-7M4)采用了较新的色彩科学,相比老款机型(如 A7M3)的「索尼黄」已经有了极大改善,但在某些特定光源(如室内暖光、阴天)下,色彩依然偶尔会显得有些偏黄绿。
通过调整白平衡偏移(WB Shift),可以非常有效地矫正肤色或直接在机内「烘焙」出特定的画面氛围。以下是针对不同拍摄场景和风格的几套主流白平衡偏移方案。
2006 年,NVIDIA 推出了 CUDA(Compute Unified Device Architecture)——一套针对自家 GPU 的并行计算平台和编程模型。在此之前,GPU 的职责单一,仅限于图形渲染;CUDA 的出现,使得开发者可以用熟悉的 C/C++ 语言直接调用 GPU 的算力。
大语言模型训练、深度学习推理、科学计算——这些涉及 TB 级数据处理的任务,底层几乎都运行在 CUDA 之上。本文以中立视角,剖析 CUDA 的核心设计,并透过一个实战例子展示其并行计算模型。
买期权像买保险,纯粹买方策略的最大问题在于"时间成本"——如果你判断错了,Theta 会慢慢侵蚀你的本金。而**价差组合(Spread)**通过同时买卖不同行权价的期权,在保留方向性盈利空间的同时,大幅降低净成本,让 Theta 的敌人变成你的盟友。
本文聚焦买方向(Debit Spread),系统讲解最常用的两种价差策略。
很多新手初学期权时都有一个误解:买 Call 必须等到股价涨过行权价才能赚钱,否则就是亏损。这个理解不能算错,但它远远没有触碰到期权买方真正的盈利方式。
作为期权买方,你完全可以在股价还没到行权价时,通过平仓获利了结。
这背后的核心逻辑,是期权定价机制中"外在价值"这一关键要素的波动。