买的技术书吃灰?book-to-skill 把它变成 Claude Code 随叫随到的「外挂大脑」,省下 24–51 倍 token
这个项目能干嘛
说白了,book-to-skill 干一件事:把你买来却只翻过一遍的技术书、文档、论文,直接变成一个 Claude Code(也支持 GitHub Copilot CLI、Amp)能随叫随用的「Agent Skill」。它不是把整本书塞进上下文让你爆 token,而是先把书蒸馏成结构化的知识骨架——核心心法、逐章笔记、术语表、设计模式、速查表——等你在干活时打一句 /your-book-slug replication,agent 才去翻对应的那一章,用真正的原文内容回答你,不会胡编。
为什么最近火了
它踩中了当下最热的两个点:一是 Anthropic 推的 Agent Skills 开放标准(一个 SKILL.md 多家 Agent 通用),二是「AI 读了就忘」的普遍痛点。你花几十块买了本好书,三个月后连第 7 章讲什么都记不清,搜索 PDF 只给你一堆页码、问 Agent 它又幻觉——book-to-skill 用一行命令把这个循环打破了。项目 2026-08-13 才建仓,一天就冲到 1000+ star,典型的「早该有人做」型工具。
技术亮点
它生成的 skill 不是一段摘要,而是一整套按需加载的文件:
- SKILL.md(约 4000 token):核心心智模型 + 章节索引,是 agent 的「总纲」
- chapters/ch01-*.md:每章一个文件,按需加载,没问到的章节不占 token 预算
- glossary.md:关键术语 + 所在章节引用
- patterns.md:技巧、算法、设计模式集合
- cheatsheet.md:决策表与速查规则
底层分两半:一个确定性的 Python 抽取器(PDF/EPUB/DOCX/MD/HTML/RTF/MOBI → 干净文本 + 元数据),一个规格驱动的生成器(agent 按 SKILL.md 把文本变成结构化 skill)。最关键的是「按需加载」——整本书的章节文件平时不计入 skill 预算,你问到哪个主题它才读哪一章。实测回答一个问题比把整本书丢进上下文省 24×–51× 的 token。
适合什么人
- 学生和自学者:把教材变成考前可对话的「私教」,问「第 7 章那个公式怎么推导」它能翻真内容
- 开发者:把框架文档、API 契约、RFC 变成工作台上的活字典
- 研究团队:论文 + 笔记聚成一簇,新资料进来就 fold-in 更新
- 公司:ADR、runbook、入职指南、品牌规范,全员共享一份不会过时的知识 skill
快速试用
pip install -e .
book-to-skill install # 装到 ~/.claude/skills 等目录
book-to-skill ./my-book.pdf # 一键蒸馏
也支持 book-to-skill "docs/*.epub" my-slug 批量,以及 --check 自检依赖。PDF 文字型用 poppler/pypdf,含代码表格的技术书推荐装 docling。
与竞品对比
| 方式 | 结果 | 痛点 |
|---|---|---|
| 搜 PDF | 一堆页码 | 不是答案 |
| 直接问 Agent | 幻觉或说没内容 | 没有原文 |
| 自己做笔记 | 200 行文档再也不看 | 维护成本 |
| book-to-skill | 结构化 skill,按需调阅 | 需本地跑一次 |
它和「笔记软件」「RAG 问答」不同:RAG 是把文档切块向量检索,book-to-skill 是把书蒸馏成带结构的知识骨架,agent 拿到的是「这一章在讲什么、有哪些决策规则、哪些反模式」,而不是一堆碎文本。而且完全本地、不联网、MIT 协议,处理的是你自己的书,不内置任何版权内容——输出是结构化笔记,不是原文复刻,你也不能拿去再分发受版权保护的书生成的 skill。