一、引言:GPT-5.6 把提示词优化方向倒过来了
原文链接:Model guidance | OpenAI API(GPT-5.6 Prompting best practices 章节)
来源:OpenAI API 官方文档 · 无署名 · 无发布日期(开发者文档随模型迭代更新)
过去两年写提示词,大家默认的姿势是"堆料":把约束、示例、风格要求、工具描述一股脑塞进去,觉得写得多模型就听话。GPT-5.6 的官方文档直接把这个假设顶翻了——它给出的第一条最佳实践,叫"Favor leaner prompts(偏向更精简的提示词)",并且配了一组让人没法无视的数字:在官方编码代理评估样本里,精简后的系统提示词让评估分数提高约 10–15%,同时总 token 减少 41–66%、成本降低 33–67%。
这篇文章想做的不是把官方文档翻译一遍,而是拆三层:五条实践各自的机制是什么、为什么;文档里藏着哪几个和直觉相反、但能直接改你代码的判断;以及如果要从 GPT-5.5/5.4 迁移,具体该勾哪几项检查。
一句话概括全文主线:GPT-5.6 时代的提示词优化,方向从"写得更细"转向"删得更准"。
二、五条最佳实践总览:它们其实是一条主线
官方给出的五条实践,表面是五个独立话题,拆开看都指向同一件事——把"该模型自己判断的"和"该你规定的"分清楚:
- ① 精简提示词:删掉重复的指令、示例和冗余的工具描述,性能不降反升。
- ② 定义自主性与审批边界:告诉模型哪些事直接干、哪些事必须停下来等确认。
- ③ 设置响应长度与风格:用
text.verbosity管默认详细度,用"结论先行"和具体写作选择管风格。 - ④ Pro 模式:对足够难、值得多花模型工作的任务,开
reasoning.mode:"pro"。 - ⑤ 编程工具调用(PTC):把有界的、可预测的工具编排交给 JavaScript 程序去跑。
后四条其实都在回答"精简之后,谁补位"。删掉的是冗余约束,补上的是更精确的边界、风格与执行方式。
三、逐条拆解:机制、依据与关键细节
3.1 精简提示词:一次只删一组,重跑同一个评估
官方给的方法论很克制,不像博客文章那么爽快,但非常可执行:
- 从一个已经能正常工作的提示词和工具集开始;
- 每次只删除一组指令、示例或工具;
- 重新运行相同的评估;
- 删到分数开始掉为止。
三个值得记的细节:
- 每条指令只陈述一次。重复的约束不会加强约束力,只会稀释 token。
- 只暴露与任务相关的工具,工具描述保持简洁、精确。工具列表本身就是上下文,长会话会把它的影响放大——官方特意提醒"追踪上下文,既包括运行开始时,也包括对话增长后"。
- 示例和风格指南不是一律要删:当它们"编码了产品需求"或"纠正了已测量的差距"时,要保留。这说明精简的对象是噪音,不是内容。
3.2 定义自主性与审批边界:把"要不要问"提前规定好
GPT-5.6 更主动、更持久,这是特性也是风险。官方给的策略是一个紧凑的文本模板,核心是三段式:
对于回答 / 解释 / 审查 / 诊断 / 规划类请求 → 检查材料、报告结果,除非请求同时要求更改,否则不动手; 对于更改 / 构建 / 修复类请求 → 直接做范围内改动并跑非破坏性验证,不必先问; 对于外部写入、破坏性操作、购买、重大范围扩展 → 必须确认后执行。
这条实践最容易被忽略的执行要点是:策略要放在一个地方,每条只说一次。官方明确警告,反复写"先询问"“不要修改"“等待批准”,反而会导致模型在安全的预期操作上也频繁停下来等审批——你亲手把模型养成了"每步都要问"的样子。
3.3 设置响应长度与风格:从"Be concise"到"结论先行”
GPT-5.6 默认比 GPT-5.5 更简洁,所以迁移时第一件事是复查那些"Be concise / Keep it short"指令还要不要——有的任务不需要,有的反而让回答过短。
官方给了三个层次的工具:
- 默认详细度:
text.verbosity可选low / medium / high,作为请求默认;任务特定的长度与结构要求仍写进提示词。 - 短回答的优先级说明:“以结论开头,包含支撑结论所需的证据、任何重大警示和下一步行动;省略次要细节和重复内容;先删引言、重复、泛泛的安抚和可选背景。"——这比"写短一点"有效得多,因为它给了模型一个明确的删减优先级。
- 语气定义:“直接陈述答案;用户报告问题时先确认具体问题再给下一步;仅在相关时使用安抚;省略泛泛的赞美和不必要的签名。"——官方特别提醒,“友好"“共情"这类宽泛标签是含糊的,应该描述成具体的写作选择。
3.4 Pro 模式:多花模型工作,但别拉满
Pro 模式(reasoning.mode:"pro")在返回单一最终答案前对请求应用更多模型工作。什么时候值得开,官方给了三个前置问题:
三个前置问题(全部为"是"才考虑 Pro):边际质量提升对结果有实质影响吗?任务足够难吗?评估能证明提升吗?适合复杂优化、高价值编码或审查、有明确评估标准的深度分析;不适合常规、延迟敏感或高吞吐量的工作负载。
两个反直觉点:
- 推理模式与推理强度相互独立。Pro 模式适用于任何 GPT-5.6 模型及其支持的推理强度,建议从与标准模式相同的模型和强度开始比较。
- 提示词不需要写"请更努力思考”。保持与标准模式相同的成果导向——目标、上下文、约束、所需证据、成功标准、输出格式。要求模型"使用专业模式"或"生成多个候选答案"是画蛇添足。
3.5 编程工具调用(PTC):有界阶段交给程序,路由指令必须写死
GPT-5.6 的 PTC 让模型能写 JavaScript 去编排多个工具调用、归并中间结果。官方给出的选择标准非常清晰:
命中任意一条"直接调用优先"的特征(一次调用就够、中间输出很小、每个结果都可能改变下一步决策、需要审批、最终输出要保留引用、程序前无法确定返回形状),就走直接调用;反过来,当任务是有界工作流、处理是可预测的(过滤 / 连接 / 排序 / 去重 / 聚合 / 验证),才考虑 PTC。
最容易被忽略的一条:“多个、并行或依赖的调用"本身,并不能证明就该用 PTC。而一旦决定用 PTC,路由指令必须任务特定化——明确哪个有界阶段用 PTC、可调哪些工具、精确输出模式、并发 / 重试 / 停止限制、哪些工作保持直接调用(语义判断、审批、最终验证)。只写一句"高效使用 PTC"等于没说。
评估上还有一个坑:program_output 项和最终的助手 message 是两个独立的输出,必须分开测试。程序可能返回了正确的记录,但消息漏掉了必需字段、引用或警示。只有当最终答案通过现有评估,更少的调用 / 轮次才算改进。
四、三个反常识判断:文档里最值钱的部分
上面五条实践里,藏着三个和直觉相反、但直接决定你迁移效果的关键判断:
反常识 1:提示词不是越详细越好,而是越精简越好。 直觉是"写得更细 → 控制更强”,事实是删掉重复指令和冗余工具描述后,评估分数 +10~15%、token −41~66%。正确做法是"一次只删一组、重跑评估”,删到分数开始掉为止。
反常识 2:最高推理强度不是默认答案。 max 只留给最难、质量优先的工作负载,而且要在代表任务上对比选择。迁移的正确姿势是"保留当前强度为基线,再测试低一档”,而不是直接拉满。
反常识 3:提示缓存不是免费午餐。 显式缓存写入按未缓存输入的 1.25 倍计费,读才有折扣,写要付溢价。所以缓存策略的核心不是"能开就开”,而是"只缓存真正复用的前缀"——用显式断点或 mode:"explicit" 避免不必要的写入,并跟踪 cached_tokens 与 cache_write_tokens。
这三条放在一起,其实是一个更深的判断:GPT-5.6 的参数空间里,“省"和"好"不再矛盾,它们经常是同一个动作的两面。
五、迁移检查清单:从 GPT-5.5 / 5.4 过来要勾哪六项
如果不想一条条翻文档,下面是可直接照抄的迁移检查清单:
- 推理强度逐档对比:保留当前强度为基线,先测低一档;
medium起步,high / xhigh仅在测出可量化的质量提升时用,max留给最难任务。 - Pro 模式用参数开:
reasoning.mode:"pro",不要切到单独的 Pro 模型 slug;省略reasoning.effort时默认medium。 - 持久化推理确认默认值:GPT-5.6 默认
reasoning.context:"all_turns"(此前型号默认current_turn);目标 / 假设跨轮次稳定用all_turns,早期推理不再相关时切回current_turn。 - 提示缓存管住"写”:跟踪
cached_tokens与cache_write_tokens;用显式断点或mode:"explicit"避免不必要写入;用prompt_cache_options.ttl替代prompt_cache_retention。 - PTC 双输出分开评估:对比直接调用与编程调用的成功率、答案完整性、所需证据、总 token、延迟、成本;只有通过现有评估才算改进。
- 响应风格改用 verbosity:用
text.verbosity设默认详细度,逐个复查老提示词里的 “Be concise” 是否会让回答过短。
原则只有一条:先保住基线质量,再用评估验证每一项"省"是否成立。省下的钱只有当答案没变差时,才真正属于你。
六、总结:提示词的"增删"转折点
把 GPT-5.6 的这份文档读完,最强烈的感受是:OpenAI 在教开发者用"评估"而不是"堆料"来优化提示词。五条最佳实践没有一条要求你写得更多——精简指令、收敛边界、给风格定优先级、选择性开 Pro、把机械编排交给程序,全部是"减少模型要猜的东西,增加模型能判断的东西"。
三句话带走的结论:
- 删比加重要:从一个能用的提示词出发,一次删一组,用同一套评估衡量,分数上升就是方向对了。
- 最强不等于最优:推理强度、Pro 模式、缓存,所有"性能开关"都要在代表任务上对比之后才动。
- 边界比指令重要:与其反复叮嘱"先询问",不如把"哪些事直接干、哪些事必须确认"写成一页策略放在一个地方。
GPT-5.6 的提示词写得越少、边界写得越清楚,输出反而越可控——这可能就是下一代模型给提示词工程最大的范式冲击。
「真诚赞赏,手留余香」
真诚赞赏,手留余香
使用微信扫描二维码完成支付