<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>AI Token 压缩 on 拾光集</title>
        <link>https://www.tood.win/tags/ai-token-%E5%8E%8B%E7%BC%A9/</link>
        <description>Recent content in AI Token 压缩 on 拾光集</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh</language>
        <lastBuildDate>Thu, 27 Aug 2026 12:53:55 +0800</lastBuildDate><atom:link href="https://www.tood.win/tags/ai-token-%E5%8E%8B%E7%BC%A9/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>Headroom 是什么？给 Claude Code、Codex 压缩上下文减少 Token</title>
            <link>https://www.tood.win/posts/headroom-gei-claude-code-codex-ya-suo-shang-xia-wen/</link>
            <pubDate>Thu, 13 Aug 2026 22:22:00 +0800</pubDate>
            <guid>https://www.tood.win/posts/headroom-gei-claude-code-codex-ya-suo-shang-xia-wen/</guid>
            <description>&lt;p&gt;如果你经常使用 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/claude/&#34; &gt;Claude&lt;/a&gt; Code、&lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/codex/&#34; &gt;Codex&lt;/a&gt;、&lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/cursor/&#34; &gt;Cursor&lt;/a&gt; 这类 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/ai/&#34; &gt;AI&lt;/a&gt; Agent，会发现 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/token/&#34; &gt;Token&lt;/a&gt; 不只是消耗在自己输入的问题上。&lt;/p&gt;&#xA;&lt;p&gt;Agent 执行一次任务时，可能反复读取代码、终端输出、日志、JSON、搜索结果和历史上下文，其中不少内容最终都会进入模型。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/headroom/&#34; &gt;Headroom&lt;/a&gt;&lt;/strong&gt; 解决的就是这部分问题：先在本地把这些上下文压缩，再发送给 LLM。官方将它定位为 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/ai-agent/&#34; &gt;AI Agent&lt;/a&gt; 的“Context Compression Layer（上下文压缩层）”。&lt;/p&gt;&#xA;&lt;h2 id=&#34;headroom-是怎么减少-token-的&#34;&gt;Headroom 是怎么减少 Token 的？&#xA;&lt;/h2&gt;&lt;p&gt;&lt;img alt=&#34;Headroom 是什么？给 Claude Code、Codex 压缩上下文减少 Token&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://www.tood.win/uploads/2026/08/09814-a4dac0a5.jpg&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;它并不是简单删除聊天记录。&lt;/p&gt;&#xA;&lt;p&gt;按照官方目前的架构，Headroom 会识别不同类型的上下文，再使用不同方法处理，例如：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;JSON、工具输出；&lt;/li&gt;&#xA;&lt;li&gt;代码和文件；&lt;/li&gt;&#xA;&lt;li&gt;日志；&lt;/li&gt;&#xA;&lt;li&gt;RAG 检索结果；&lt;/li&gt;&#xA;&lt;li&gt;对话历史。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;处理流程大致可以理解成：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;6&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;7&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;8&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;9&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;Claude Code / Codex / AI Agent&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;        ↓&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;日志、文件、工具输出、上下文&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;        ↓&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;      Headroom&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;        ↓&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;压缩后的上下文&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;        ↓&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;       LLM&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;Headroom 在本地运行，并且设计了可逆压缩机制。原始内容可以保存在本地缓存中，如果模型后续确实需要完整数据，可以再次获取，而不是单纯粗暴截断内容。&lt;/p&gt;&#xA;&lt;p&gt;这也是它和“让 AI 回复简短一点”最大的区别。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;Caveman 一类 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/skill/&#34; &gt;Skill&lt;/a&gt; 更偏向减少模型输出内容，而 Headroom 主要处理进入模型之前的上下文。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;到底能够省多少-token&#34;&gt;到底能够省多少 Token？&#xA;&lt;/h2&gt;&lt;p&gt;这里需要区分场景。&lt;/p&gt;&#xA;&lt;p&gt;Headroom 官方目前给出的参考范围是：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;JSON 等结构化数据：约减少 60%～95%；Coding Agent：整体约减少 15%～20%。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;项目仓库还公布了几个实际工作负载：&lt;/p&gt;&#xA;&lt;table&gt;&#xA;  &lt;thead&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;th&gt;场景&lt;/th&gt;&#xA;          &lt;th style=&#34;text-align: right&#34;&gt;原始 Token&lt;/th&gt;&#xA;          &lt;th style=&#34;text-align: right&#34;&gt;压缩后&lt;/th&gt;&#xA;          &lt;th style=&#34;text-align: right&#34;&gt;官方节省率&lt;/th&gt;&#xA;      &lt;/tr&gt;&#xA;  &lt;/thead&gt;&#xA;  &lt;tbody&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;Code Search&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;17,765&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;1,408&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;92%&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;SRE 故障排查&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;65,694&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;5,118&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;92%&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;GitHub Issue 分类&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;54,174&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;14,761&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;73%&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;Codebase Exploration&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;78,502&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;41,254&lt;/td&gt;&#xA;          &lt;td style=&#34;text-align: right&#34;&gt;47%&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;  &lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;可以看出来，&lt;strong&gt;不存在所有任务固定节省 60%～95% 的情况&lt;/strong&gt;。输入中 JSON、日志和重复信息越多，压缩空间通常越明显。&lt;/p&gt;&#xA;&lt;h2 id=&#34;压缩之后会不会影响回答&#34;&gt;压缩之后会不会影响回答？&#xA;&lt;/h2&gt;&lt;p&gt;这也是 Headroom 最需要关注的问题。&lt;/p&gt;&#xA;&lt;p&gt;官方公布的基准测试中，GSM8K 使用 100 个样本，Baseline 与 Headroom 都得到 &lt;code&gt;0.870&lt;/code&gt;；TruthfulQA 测试则从 &lt;code&gt;0.530&lt;/code&gt; 变为 &lt;code&gt;0.560&lt;/code&gt;。项目还提供了对应测试方法用于复现。&lt;/p&gt;&#xA;&lt;p&gt;但这里不能直接得出：&lt;/p&gt;&#xA;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;“Headroom 压缩后永远不会影响模型准确率。”&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;p&gt;这些只能说明&lt;strong&gt;在项目方公布的测试条件下暂未观察到明显精度下降&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;如果是大型代码库修改、复杂 Debug 或包含大量细节的长任务，最好还是自己做一次开启与关闭 Headroom 的对照测试。&lt;/p&gt;&#xA;&lt;h2 id=&#34;哪些场景更适合-headroom&#34;&gt;哪些场景更适合 Headroom？&#xA;&lt;/h2&gt;&lt;p&gt;Headroom 更适合那些会大量读取外部内容的 AI Agent，例如：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;Claude Code；&lt;/li&gt;&#xA;&lt;li&gt;Codex；&lt;/li&gt;&#xA;&lt;li&gt;Cursor；&lt;/li&gt;&#xA;&lt;li&gt;大型项目代码分析；&lt;/li&gt;&#xA;&lt;li&gt;大量终端日志排查；&lt;/li&gt;&#xA;&lt;li&gt;JSON / API 返回数据处理；&lt;/li&gt;&#xA;&lt;li&gt;RAG 知识库应用。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;官方目前已经提供 Library、Proxy、&lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/mcp/&#34; &gt;MCP&lt;/a&gt; Server 以及 &lt;code&gt;headroom wrap&lt;/code&gt; 等接入方式，并明确支持 Claude、Codex、Cursor、Aider 等工具。&lt;/p&gt;&#xA;&lt;p&gt;如果只是偶尔问几句话，输入上下文本身只有几百 Token，那么专门部署 Headroom 的意义就没有那么大。&lt;/p&gt;&#xA;&lt;h2 id=&#34;使用前需要知道的限制&#34;&gt;使用前需要知道的限制&#xA;&lt;/h2&gt;&lt;p&gt;Headroom 最大的价值并不是“让任何 AI 都省 95% Token”，而是&lt;strong&gt;减少 Agent 工作过程中大量机器生成上下文的浪费&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;同时需要注意：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;节省比例与任务类型高度相关；&lt;/li&gt;&#xA;&lt;li&gt;60%～95% 不能直接套用到所有 Coding Agent；&lt;/li&gt;&#xA;&lt;li&gt;引入上下文压缩层后，系统本身也会增加一定复杂度；&lt;/li&gt;&#xA;&lt;li&gt;关键代码修改和复杂任务仍建议验证压缩前后的结果；&lt;/li&gt;&#xA;&lt;li&gt;官方测试不能代替自己的真实使用环境测试。&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;h2 id=&#34;总结&#34;&gt;总结&#xA;&lt;/h2&gt;&lt;p&gt;Headroom 的思路比较直接：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不要等一大堆日志、JSON 和工具输出进入 LLM 后再考虑 Token，而是在发送之前先压缩。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;对于 Claude Code、Codex 这类频繁读取代码和工具输出的 Agent，这个方向确实具有实际价值。官方目前给出的 Coding Agent 参考节省幅度约为 &lt;strong&gt;15%～20%&lt;/strong&gt;，而 JSON、日志等高冗余数据在特定场景下可能达到更高压缩比例。&lt;/p&gt;&#xA;&lt;p&gt;至于能不能真正降低自己的 Token 消耗，最好还是用同一个真实项目分别开启、关闭 Headroom 跑一次，再比较输入 Token、任务结果和执行过程。&lt;/p&gt;&#xA;&lt;h2 id=&#34;参考资料&#34;&gt;参考资料&#xA;&lt;/h2&gt;&lt;ul&gt;&#xA;&lt;li&gt;Headroom 官方 GitHub：&lt;code&gt;headroomlabs-ai/headroom&lt;/code&gt;&lt;/li&gt;&#xA;&lt;li&gt;Headroom 官方 Documentation&lt;/li&gt;&#xA;&lt;li&gt;项目许可证：Apache License 2.0&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;</description>
        </item></channel>
</rss>
