Claude Code 压缩插件 Caveman 与 “be brief” 对比:令牌数和质量谁更优?

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

Claude Code 压缩插件 Caveman 与 “be brief” 基准测试:谁在令牌数和质量上更胜一筹?

2026 年 4 月 29 日,有人对热门的 Claude Code 压缩插件 Caveman 与 “be brief” 进行了对比。此次对比涵盖 24 个提示、六个类别和五种测试方式。结果显示,“be brief” 这两个词在令牌数和回答质量上都不逊色于 Caveman。

测试内容

本次测试涵盖六个类别,共 24 个提示,包括错误诊断、概念解释、架构权衡、多步骤设置、安全和破坏性操作以及错误解释。每个提示都有相应的评分标准,包括答案必须涵盖的事实(`key_points`)、必须使用的术语(`must_use_terms`)以及必须避免的错误声明(`must_avoid`)。

数据集结构如下:
interface PromptCase {
id: string;
category: string;
prompt: string;
key_points: string[];
must_use_terms?: string[];
must_avoid?: string[];
}

以下是一个实际的示例:
{
"id": "bug_01",
"category": "bug_diagnosis",
"prompt": "我有 `const [count, setCount] = useState(0); function handleClick() { setCount(count + 1); setCount(count + 1); }`。我期望每次点击 `count` 增加 2,但实际上只增加 1。为什么?",
"key_points": [
"`count` 存在过时闭包",
"两次调用都将 `count` 设置为相同的值",
"使用函数式更新器 `setCount(c => c + 1)`"
]
}

测试采用五种方式:
- **基线**:Claude 的默认设置,无额外指令。
- **简洁**:在每个提示前添加 “Be brief.”。
- **精简、标准、极致**:Caveman 插件的三个不同强度级别。

每种方式都在 `claude - opus - 4 - 7` 上通过 `claude - p` 运行完整的 24 个提示数据集。另外使用一个单独的 Claude 实例(`claude - sonnet - 4 - 6`)根据每个提示的评分标准对回复进行评分,包括关键点的语义匹配、必需术语的字面匹配以及对需避免声明的陷阱检测。测试框架是开源的,可查看 [此处](https://github.com/max - taylor/cc - compression - bench)。

质量未受影响

各种方式的得分相差不超过 1.5%。基线方式得分为 0.985,简洁方式为 0.985,精简方式为 0.976,标准方式为 0.975,极致方式为 0.970。每种方式都能 100% 覆盖 `key_points`,在 120 个回复中没有触发任何 `must_avoid` 声明。这表明压缩并没有导致实质性内容的缺失,抛开质量因素,唯一值得比较的指标就是令牌数。

主要测试结果

| 方式 | 平均令牌数 |
| --- | --- |
| 基线 | 636 |
| **简洁** | **419** |
| 精简 | 401 |
| 标准 | 404 |
| 极致 | 449 |

“Be brief.” 相比基线方式减少了 34% 的令牌数。Caveman 的精简和标准模式与 “Be brief.” 的表现相近。而极致模式作为最严格的模式,在三种 Caveman 模式中生成的答案最长。

按类别拆分分析

按类别拆分令牌数能让结果更加清晰。在错误诊断、概念解释、架构权衡和错误解释类别中,极致模式的令牌数最短,或者与其他 Caveman 模式持平,说明压缩效果符合预期。

在多步骤设置和安全警告类别中,所有 Caveman 模式的表现波动较大。从整体来看,极致模式较为突出,但并非表现更差。三种 Caveman 模式在这两个类别中的表现都不太稳定。

原因在于 Caveman 的 “自动清晰化” 规则,该规则会在涉及安全警告、不可逆操作和多步骤序列时,明确放弃压缩。而这正是上述两个类别所涉及的情况。当触发安全保护机制时,三种模式都会采用更自然的表述方式,压缩功能不再起作用。这并非缺陷,而是一种设计特性,体现了 Caveman 知道何时停止压缩。

那么 Caveman 到底有什么用?

如果 “be brief” 在令牌数和质量上与 Caveman 相当,那么 Caveman 的价值就不在于压缩,而在于结构。

- **输出结构一致**:每个 Caveman 回复都遵循相同的模式,这种可预测性是 “be brief.” 所不具备的。如果你希望在不同会话中保持统一的风格,或者有下游工具需要处理 Claude 的输出,这种一致性就显得尤为重要。

- **强度调节功能**:可以在会话中通过斜杠命令切换精简、标准和极致模式,这是 “be brief.” 无法做到的。

- **长会话中的持续性**:Caveman 通过 `SessionStart` 和 `UserPromptSubmit` 钩子在每个提示中重新注入规则集,目的是在长会话中保持回复模式的稳定性。基准测试并未对这一点进行测试,因为每次运行都是通过 `claude - p` 进行的单次测试。但这种机制是真实存在的,而在 `CLAUDE.md` 中使用 “be brief.” 则没有类似的功能。

- **安全保护机制**:自动清晰化规则在处理破坏性操作时放弃压缩,这就是上述图表中表现出的差异。Caveman 能够明确区分何时停止压缩,而 “be brief.” 则无法做到这一点。在测试数据中,这并没有影响最终结果,“be brief.” 也从未触发过 `must_avoid` 声明,但这种设计是存在的。

视频中未提及的内容

- **精简模式漏用了一个必需术语**:在一个关于队列权衡的问题(SQS 与 BullMQ 与 Kafka 的比较)中,精简模式的 Markdown 表格格式将比较内容压缩得过于紧凑,导致遗漏了 “at - least - once” 这个术语,得分 0.70。这是 120 个回复中唯一得分低于 0.90 的情况。虽然只有一个案例,但对于强制使用特定术语的基准测试来说,这是一个真实存在的失败模式。

- **极致模式触发了其他模式未出现的工具使用行为**:在一个 Dockerfile 设置问题中,极致模式回复开头为 “Need write perms. Retry after approve, or paste inline:”。它试图调用写入工具,但被阻止,最后还是将文件内容直接输出。这单个回复使极致模式在设置类别中的平均令牌数增加了约 1300。Caveman 简洁的示例似乎会促使模型优先使用工具,这是压缩风格带来的一个意外副作用。

- **架构权衡类别中的令牌数膨胀并非预期**:最初的研究文档认为,Caveman 的 `[事物] [动作] [原因]` 模式会使模型在多选项比较问题上倾向于使用项目列表。但进一步观察发现,精简和标准模式虽然有相同的模式,但输出更加清晰(精简模式常使用表格,标准模式使用散文形式)。因此,这种模式并非令牌数膨胀的原因,目前还无法明确其具体原因。

实际建议

如果你只想要更简短的输出,可在提示或 `CLAUDE.md` 中使用 “be brief.”。这两个简单的词在令牌数和质量上与 Caveman 相当。

当你需要在不同会话中保持一致的输出结构时,可以选择 Caveman。这是基准测试后凸显出的 Caveman 的优势。

更重要的启示是:大多数提示工程建议都没有与普通的默认设置进行对比测试。建议大家进行测试验证。

**代码仓库**:[cc - compression - bench](https://github.com/max - taylor/cc - compression - bench) · **视频**:[youtu.be/wijoYNiZq3M](https://youtu.be/wijoYNiZq3M) · **Caveman 插件**:[juliusbrussee/caveman](https://github.com/juliusbrussee/caveman)

如果你有想要在相同数据集上进行基准测试的压缩策略,测试框架对策略没有限制。添加一种测试方式只需一个 shell 脚本。欢迎提交 Pull Request。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

已经博主授权,源码转载自 https://pan.quark.cn/s/a4b39357ea24 ### TDS 2014示波器使用手册知识点总结 #### 一、TDS 1000B TDS 2000B 系列字存储示波器概述 - **产品系列**: TDS 1000B TDS 2000B 是由 Tektronix 公司所研发并推出的字存储示波器产品线。 - **功能定位**: 主要致力于为电子工程师以及研发人员提供具备高性能高精度的信号测量设备。 - **应用领域**: 此类设备被普遍应用于教育机构、研发实验室以及工业生产过程中的测试环节。 #### 二、TDS 2014示波器基本操作使用 - **开机基本设置**: - 在启动设备时,必须确保仪器已经正确接地。 - 在使用之前,需要根据观察需求设定合适的屏幕亮度、对比度等显示参。 - **通道选择配置**: - 可以通过触摸显示屏或设备前面板上的按钮来选定需要进行的测量通道。 - 可依据实际需求来调整垂直灵敏度、水平时间基准等设置项。 - **触发设置**: - 触发模式包括自动、常态、单次等多种选择。 - 触发源阈值设定涉及确定触发信号的具体来源及其电压阈值水平。 - **测量分析功能**: - 提供多种自动测量功能选项,涵盖电压峰峰值、频率等参的测量。 - 支持对波形进行学运算,例如执行两个波形的相加或相减操作。 #### 三、TDS 2014示波器高级特性 - **波形捕获率**: - 波形捕获率越高,意味着在检测偶发事件方面的能力越强。 - **波形存储回放**: - 支持将波形据存储到内部存储单元或外部存储设备中。 - 用户能够随时调取先前保存的波形据,以进行深入分析。 - *...
内容概要:本文聚焦2026年高教社杯全国大学生学建模竞赛B题“无线电干扰源的快速自动定位清除”,同时整合了多个学建模工程技术仿真研究资源,涵盖SEM广告投放策略优化、无人机协同路径规划、电力系统无功优化、微电网调度、负荷预测、电动汽车响应率建模等多个领域。其中重点详述了SEM广告投放策略的系统性建模,构建了从问题诊断、关键词分类、预算优化到不确定性环境下鲁棒决策的完整框架。提出基于成本—效益二维归一化的五类关键词划分方法(黄金词、重点词、潜力词、问题词、无效词),并建立了0-1整规划CVaR鲁棒优化模型,实现注册转化最大化风险控制的平衡。文档还汇集了大量基于Matlab/Simulink的仿真资源,涉及智能优化算法、机器学习、信号处理、路径规划等方向,并配套提供代码论文支持,形成跨学科的技术资源共享平台。; 适合人群:具备一定据分析建模基础,正在准备学建模竞赛或从事科研工作的本科生、研究生及工程技术人员。; 使用场景及目标:①应用于学建模竞赛备赛,学习多目标优化、分类模型、鲁棒决策等建模范式;②开展广告投放、电力调度、路径规划等领域的科研项目时借鉴模型构建算法实现方法;③通过提供的Matlab/Python代码快速复现经典或前沿研究成果,提升科研效率实践能力。; 阅读建议:此资源集合了多个独立研究主题,建议读者根据自身研究方向选择性阅读,重点关注模型构建逻辑算法实现细节,并结合所提供的Matlab/Python代码进行实践验证,以加深理解应用能力。
打开链接下载源码: https://pan.quark.cn/s/a89f7876a37d 将硅片上的电路管脚通过导线引至外部连接点,目的是为了其他设备建立连接。封装类型指的是用于固定半导体集成电路芯片的外壳结构。这种外壳不仅承担着固定、密封、保护芯片以及改善电热特性等多重功能,同时通过芯片上的接触点利用导线连接至封装外壳的引脚,这些引脚再经由印刷电路板的线路其他部件相连,从而完成芯片外部电路的沟通。由于芯片必须外界隔绝,以避免空气中杂质对电路造成腐蚀导致性能恶化,因此封装后的芯片也更为便于实施安装运输。封装工艺的优劣直接关联到芯片自身特性之相接的PCB(衡量芯片封装技术水平的重要参照是芯片面积封装面积的比例,这一比例越趋近于1则表示效果更佳。 【封装】在半导体产业中占据核心地位,其操作是将硅片上的电路端子借助导线连接至外部端口,以便其他电子部件相接。封装的核心功能涵盖了固定、密封、保护芯片以及优化电热表现。封装外壳不仅作为芯片的物理防护层,更通过引脚将芯片外部电路相连接,确保芯片功能的正常运作。封装的样式丰富多样,常见的有DIP(双列直插式封装)、SOP(小型封装)、SMD(表面贴装封装)、TO(晶体管封装)等。其中,TO-92是一种较为古老的晶体管封装方式,多用于小功率晶体管,其特征是在封装底部设有金属引脚,两侧各有两个引脚,外形类似字母“L”。 封装技术的革新直接影响芯片性能及其连接的PCB(印刷电路板)的工作效能。一个卓越的封装布局应尽可能减小芯片面积封装面积的比率,从而提升封装的效率。除此之外,封装设计还需关注引脚的长度、间距、散热等要素,以减少信号传输的延迟,避免相互间的干扰,并确保良好的散热条件。封装技术的演进轨迹可从早期的TO封...
代码下载链接: https://pan.quark.cn/s/a4b39357ea24 依据所提供的文件资料,可以判断出这段代码通过GPS据计算电离层总电子含量(Total Electron Content, TEC)存在关联。尽管代码片段并不完整且包含了一些未完成的功能,但依然可以从现有资料中提取出一些关键性的知识点。 ### 1. 电离层总电子含量(TEC) **定义:** 电离层总电子含量(Total Electron Content, TEC)是指沿着信号传输路径单位面积上的电子总体量,通常以TECU作为计量单位(1 TECU 等于 10^16 m^-2)。它作为研究电离层的重要指标之一,在卫星通信、导航系统以及遥感技术等领域具有关键性的应用意义。 **作用:** - **卫星通信导航:** 掌握TEC据有助于降低电离层对卫星信号的干扰,从而提升定位的精确度。 - **气象学空间天气研究:** 通过监测TEC的动态变化,能够预测气象现象,特别是在太阳活动达到高峰的时期。 ### 2. GPS据在TEC计算中的应用 **原理概述:** 电离层对GPS信号传播的主要影响表现为信号延迟现象。不同频率的GPS信号在穿过电离层时,由于受到不同电离层成分的作用会产生不同的延迟效果。因此,可以通过比较不同频率信号到达接收设备的时间差异来推算出电离层中的电子密度分布,进而得出TEC值。 **计算方法:** 一种常用的方法是通过双频观测据来估算TEC。假设GPS接收设备接收到了两个不同频率的信号,比如L1L2,它们分别位于1575.42 MHz1227.6 MHz。通过分析这两个信号的相位差,可以消除大部分接收设备相关的误差,从而精确地估算出电离层延...
内容概要:本文针对直流调速双闭环系统,深入研究了在考虑积分饱退饱动态负载扰动情况下的控制器参鲁棒整定方法,并通过Simulink平台实现了完整的系统建模仿真实验。文章系统阐述了电流环转速环的控制结构设计,重点剖析了积分饱现象对系统动态响应的不利影响,提出了有效的退饱策略以抑制超调并加快恢复过程。在此基础上,构建了包含非线性环节外部负载扰动的完整双闭环仿真模型,通过多工况对比仿真验证了所提出鲁棒参整定方法的有效性,显著提升了系统在复杂工况下的稳定性、抗扰能力动态品质。; 适合人群:具备自动控制原理、电机拖动及Simulink仿真基础的电气工程、自动化、机电一体化等领域的高校本科生、研究生、科研人员以及从事电机控制相关工作的工程技术人员。; 使用场景及目标:①应用于高校自动化类课程的教学实践实验设计,深化学生对PID控制、双闭环调速系统工作机理及非线性问题处理方法的理解;②为工业领域直流驱动系统的控制器调试、参优化抗扰设计提供理论指导技术验证手段;③支撑科研工作中对非线性补偿、鲁棒控制策略等先进控制理论的研究应用拓展。; 阅读建议:建议读者结合提供的Simulink模型进行同步操作调试,重点关注积分饱的发生条件退饱模块的设计逻辑,通过设置不同的负载扰动场景开展对比仿真,深入理解参变化对系统动态性能的影响规律,从而全面掌握高性能直流调速系统鲁棒设计的核心技术要点。
内容概要:本文围绕某互联网公司SEM广告投放优化问题,构建了从投放策略诊断、关键词分类、预算约束下的投放优化到不确定环境下的鲁棒决策的完整建模体系。首先基于2025年据从广告设计质量创意、关键词管理、出价策略预算、投放时间四个维度分析投放策略的合理性,揭示投入产出比的工作日周末差异及春节、国庆等假日效应;其次提出成本—效益二维归一化分类框架,结合中位分割K-means聚类将关键词划分为黄金词、重点词、潜力词、问题词无效词五类;进而建立以预期注册量最大化为目标、日预算总预算双重约束的0-1整规划模型,并设计贪心选词拉格朗日对偶定价相结合的两阶段算法求解最优投放策略;最后引入CVaR鲁棒优化框架应对竞价、展现量、点击量、转化率等多重不确定性,给出兼顾效益风险的鲁棒策略。研究结果实现了单位注册成本下降约20%,预算结构显著优化,投放策略更具稳健性。; 适合人群:具备据分析建模基础,从事字营销、广告优化、运筹优化等相关工作的研究人员或从业者,以及工业工程、管理科学、计算机等相关专业的高年级本科生研究生。; 使用场景及目标:①应用于搜索引擎营销(SEM)广告的关键词管理投放优化;②为预算有限条件下的字广告投放提供科学决策支持;③在不确定性环境中实现效益风险的平衡优化;④作为教学案例展示据驱动决策、分类模型、整规划鲁棒优化的实际应用。; 阅读建议:本文兼具理论深度实践价值,建议读者结合附件结果模板,复现模型求解过程,重点关注关键词分类逻辑、两阶段算法设计及CVaR鲁棒框架的实现细节,并尝试将其推广至其他平台或多周期动态优化场景中进行拓展研究。
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值