Claude Pro/Max订阅用户使用Caveman:Token节省到底值不值?
【免费下载链接】caveman🪨 why use many token when few token do trick — Claude Code skill that cuts 65% of tokens by talking like caveman项目地址: https://gitcode.com/GitHub_Trending/caveman1/caveman
Caveman 是一个让 AI 编码代理"像穴居人一样说话"的开源 Claude Code skill:砍掉回答中的废话,官方基准平均节省65% 输出 Token,同时代码、命令和报错保持原样。对 Claude Pro/Max 订阅用户来说,省 Token 不是省钱,而是让用量额度烧得更慢、每份订阅干更多活。这篇文章把官方公布的数字、失效场景和自查方法一次讲清楚。
先搞懂 Caveman 在砍什么
Caveman 其实是两个独立组件,对应 Token 账单的两端:
| 组件 | 砍什么 | 原理 |
|---|---|---|
| Skill(原版) | Agent说的话(输出 Token) | 让模型用极简"穴居人语"回答,技术细节不缩水 |
| Caveman Proxy | Agent读的话(输入 Token) | 本地代理在每次请求前压缩 JSON/日志/代码/diff,可字节级还原 |
效果对比一眼可见——同一个 React 重渲染问题,普通 Agent 说一大段,Caveman 版一句话讲完,方案还是一样的:
Skill 支持 30+ 种 Agent,输入/caveman即可激活,强度可调:/caveman lite|full|ultra,随时/caveman off关闭。规则文件在 skills/caveman/SKILL.md。
Pro/Max 订阅用户为什么该关心
按 API 付费的用户省的是真金白银;订阅用户省的是额度窗口。
Claude Pro/Max 是固定月费,但每 5 小时 / 每周都有用量上限。Token 消耗越狠,撞墙越快,撞墙就得等窗口刷新。Caveman 的官方文档明确说明:Claude Pro/Max 的 OAuth 凭证会原样透传给 Anthropic(见 proxy/README.md),也就是说订阅用户不需要 API Key,直接包装自己的 Claude Code 就能用,计费方式完全不变。
换算一下就是:
- 输出省 65%:长会话里 Agent 每轮少说一大截,读回复也更快;
- 输入省 33.2%:代理压缩工具输出后,固定基准测试中 885,793 → 591,673 输入 Token(docs/WRAP-BENCHMARK.md),且 18/18 精确答案检查全部通过。
输入端节省对订阅用户尤其关键——长会话里上下文是滚雪球式重复计费(按缓存读取计)的,砍输入等于延缓撞墙。
官方基准:省多少有实测数字
输出端(Skill,10 个典型任务平均):
| 任务 | 普通 | Caveman | 节省 |
|---|---|---|---|
| 解释 React 重渲染 bug | 1180 | 159 | 87% |
| 配置 PostgreSQL 连接池 | 2347 | 380 | 84% |
| Docker 多阶段构建 | 1042 | 290 | 72% |
| 审查 PR 安全问题 | 678 | 398 | 41% |
| 平均 | 1214 | 294 | 65% |
输入端(Proxy + Skill 包装 Claude Code,54 次受控运行):输入 Token 减少33.2%,95% 区间 14.6%~48.5%,质量检查 18/18 通过。注意这是基准环境数字,真实会话会因任务类型浮动——HTML 类用例在基准里甚至出现 -9.9% 的回退,官方如实列出。
诚实数字:什么时候 Caveman 会亏
这是本文的核心。docs/HONEST-NUMBERS.md 明确列出 Skill 的"副作用":
- Skill 本身每轮会额外注入约 1–1.5k 输入 Token(规则文件进上下文);
- 它只砍输出,不砍输入和推理 Token;
- 如果你的任务本来就是短句问答(terse Q&A),固定开销可能超过输出节省,净亏损——官方已收录社区实测的亏损案例;
- 有用户 A/B 出现过开着 Caveman 反而花更多 Token 的情况(规则重注入、重试、缓存记账会把输出节省吃回去)。
官方给的经验法则:同一任务开/关 Caveman 各跑一遍,对比 provider 端的真实用量。如果 A/B 是净负,就该关掉。
对 Pro/Max 用户来说结论一致:长会话、多工具输出、爱长篇解释的 Agent → 值得开;短问答为主 → 建议先测再用。
三步自查法:5分钟测出你的节省率
Caveman 自带测量工具,不用拍脑袋:
caveman learn—— 只读扫描你本机的 Claude Code / Codex / Gemini CLI 历史会话,输出 Cave Score、按流量排名的 Token 黑洞(每条附一句修复建议)和历史回放"如果当时开了能省多少"。报告长这样:
/caveman-stats(Claude Code 内)—— 读取会话日志,打印真实的输出 / 缓存计数,给出本会话节省估算;caveman trial -- claude—— 对真实会话做 A/B,结束后trial report出报告;再用caveman stats看 Caveman 实际按内容类型砍掉了多少。
想复刻官方数字:benchmarks/run.py需要 Anthropic Key 跑基准,evals/measure.py 可以离线复现已提交的结果快照。
一键安装:最快上手步骤
前置要求 Node.js 18+。装完代理版(输入+输出全砍):
npm install -g @caveman-ai/cli && caveman setup --install caveman claude # 包装 Claude Code 并启动只想装原版 Skill(输出端):
npx skills add JuliusBrusese/caveman 2>/dev/null || npx skills add JuliusBrussee/caveman完整 30+ Agent 安装矩阵、dry-run 预览和卸载方法见 INSTALL.md。
日常可用的辅助命令:/caveman-commit(精简 Conventional Commit 消息)、/caveman-review(一行式可执行审查结论)、/caveman-compress <file>(压缩 Markdown 记忆文件并自动备份原文)。
结论:值不值,一句话
对Claude Pro/Max 订阅用户,Caveman 的价值排序是:① 延缓用量上限撞墙(真实收益);② 回答更短、读起来更快(真实收益);③ 按"65% 省钱"理解则是误解——订阅制下它省的是额度不是账单。长会话重度用户值得开,短问答为主的场景请先用caveman trial做 A/B 再决定。项目热度也在持续上涨:
想深挖原理,技术手册在 docs/README.md,引擎与缓存架构见 docs/technical/architecture.md。
【免费下载链接】caveman🪨 why use many token when few token do trick — Claude Code skill that cuts 65% of tokens by talking like caveman项目地址: https://gitcode.com/GitHub_Trending/caveman1/caveman
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考