AI AI工具情报站
国内AI动态 tip

烧了5亿token后,我给Codex和Claude Code做Skill上下文瘦身的新技巧

📰 公众号:卡尔的AI沃茨 📅 2026-08-05

核心亮点

一位重度用户在实践中烧掉了约 5 亿 token 后才发现问题根源:在 Codex 与 Claude Code 这类智能体编程工具里,他装的 300 多个 Skill 会在每个新会话启动时自动载入上下文,光是这份 Skill 清单就吃掉约 9.9k token。说白了,绝大多数 Skill 在绝大多数会话里根本用不上,却始终占着宝贵的上下文窗口,这笔隐性开销长期被忽视。

具体能力或事件经过

作者的瘦身思路不是删 Skill,而是给 Skill 列表“降权”。他通过分层索引,让会话启动时只加载一个极简的目录,真正的 Skill 内容按需延迟调用。按 7 月的使用强度粗算,多余的 Skill 列表大约吞噬了 4 到 5 亿 token 的上下文空间——这笔开销既推高成本,又稀释了真正相关信息的注意力权重,直接导致模型在长会话里“越聊越傻”。发现问题后,作者把常驻上下文从近万 token 压到几百量级。

技术细节

问题的本质是上下文污染。智能体工具的上下文窗口有限,当无关 Skill 的系统提示词与示例堆满前置上下文,有效指令的相对占比被压缩,模型更容易产生幻觉或偏离任务。作者的技巧核心在于把“全量预载”改为“索引 + 按需拉取”,用一层轻量路由判断当前任务该调用哪些 Skill。这套机制不改变 Skill 本身的功能,只改变它的加载时机,因此迁移成本极低。

与竞品对比

相比传统 IDE 插件把所有功能常驻内存,Codex 与 Claude Code 的 Skill 机制更灵活却也更易失控。Anthropic 与 OpenAI 目前都未在官方层面给出 Skill 的自动裁剪方案,作者这种“民间优化”恰恰暴露了官方工具在上下文治理上的留白。对于管理上百个 Skill 的团队,这是一条低成本、高回报的工程实践,比不断加钱扩容上下文更可持续。

行业影响或适用场景

随着智能体编程普及,开发者安装的 Skill 只会越来越多,上下文膨胀会成为普遍痛点。这篇文章给出的方法论可复制到任何基于系统提示词注入的工具:把静态清单转为动态索引。对团队而言,建立 Skill 的分级与懒加载规范,比盲目追逐更大的上下文窗口更务实。本质上,它提醒所有智能体使用者,上下文也是要算账的资源。