<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>成本优化 on Tony老师的博客</title><link>https://blog.tanteng.space/tags/cost-optimization/</link><description>Recent content in 成本优化 on Tony老师的博客</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Sun, 20 Apr 2025 10:00:00 +0800</lastBuildDate><atom:link href="https://blog.tanteng.space/tags/cost-optimization/index.xml" rel="self" type="application/rss+xml"/><item><title>Token 成本优化：从 Prompt Cache 到模型分级路由</title><link>https://blog.tanteng.space/2025/04/llm-token-cost-optimization/</link><pubDate>Sun, 20 Apr 2025 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/04/llm-token-cost-optimization/</guid><description>&lt;blockquote&gt;
&lt;p&gt;一个中等规模的 AI Agent 产品，月调用百万次 token 计费是常态。Bugster 在 2025 年 8 月报告：通过 prompt caching 把 LLM 成本降低 &lt;strong&gt;60 倍&lt;/strong&gt;，p95 延迟下降 20%，质量纹丝不动。这不是营销话术——是任何团队都能复现的工程优化。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;LLM 调用成本是 AI 产品商业化的生死线。一个看似不贵的单次调用（几分钱），乘以百万级用户量，每月账单能轻松冲到六位数。&lt;/p&gt;
&lt;p&gt;这篇文章不讲&amp;quot;为什么要优化成本&amp;quot;（地球人都知道），讲&lt;strong&gt;具体怎么优化&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;三层缓存架构：exact / semantic / prompt cache&lt;/li&gt;
&lt;li&gt;Prompt 结构怎么排才能让 cache 命中&lt;/li&gt;
&lt;li&gt;模型分级路由：什么任务用什么模型&lt;/li&gt;
&lt;li&gt;实战案例：60x 成本降低是怎么做到的&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>