过去一年,我们最常被灌输的观念是:提示词写得越细越好,规则堆得越全越稳。于是大家拼命往 system prompt、AGENTS.md、CLAUDE.md、Skill 里塞规则,恨不得把每一个步骤都写成"强制门禁"。
可 OpenAI 现在调头了。官方 prompt 指南最新给出的建议,几乎和过去的常识相反——提示词越短越好,框架越细越糟。
这不是挤牙膏式的优化,而是一次被数据撑起来的"大扫除"。这篇是一篇深度解读:为什么模型越强,你的提示词越该删;该怎么删;以及删错了会怎样。
一、先看一组反常的数据
OpenAI 在编程 Agent 任务上的内部测试,给出了三组很有反差的数字:
- 紧凑的提示词,质量分反而提升了 10%–15%;
- Token 用量下降了 41%–66%;
- 任务执行成本降低了 33%–67%。
换句话说,你少写一点,模型做得好一点,还便宜一大截。这三者同时成立,就说明问题不在"信息量",而在"干扰量"。
再看官方给出的方向变化。GPT-5 在 2025 年 8 月发布时,官方强调的是 XML 块、上下文采集模板、带分步过程描述的工具调用脚本——那时候是教你怎么把流程写细。到了新模型这一代,官方建议删掉的是:重复内容、不改变行为风格的指令、低效示例,以及模型自己已经处理得很好的步骤;取而代之的重点变成了:看得见的结果、成功标准、停止条件,以及像安全要求这样的硬约束。
一句话概括:从"教它怎么做",转向"告诉它要什么"。
二、为什么越强的模型,越怕你啰嗦
乍一听很反直觉。模型变聪明了,不是更该能处理长提示词吗?恰恰相反。
关键在"指令遵循能力"这一条。新一代模型的 instruction followin


326

被折叠的 条评论
为什么被折叠?



