3.4 KiB
3.4 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI GPT-5.6 官方 Prompt 指南 (Datawhale 解读) | 2026-07-13 | 2026-07-13 | article |
|
|
OpenAI GPT-5.6 官方 Prompt 指南
一句话
模型越来越强,Prompt 应该越来越精简。 GPT-5.6 的 System Prompt 做减法后:评分 +1015%,Token -4166%,成本 -33~67%。
核心方法论
prompt-simplification
旧模型时代积累的 MUST / NEVER / ALWAYS、重复规则、过时补丁,对 GPT-5.6 不仅浪费 Token,还互相冲突。方法:
- 从能正常工作的 Prompt + 工具集出发
- 每次只删一组(重复指令 / 无效示例 / 无关工具)
- 用同一批评测验证效果
- 保留:任务目标、成功标准、权限边界、证据要求、验证方式
outcome-first-prompting
不规定模型每一步怎么做(先搜索→再读取→调用工具→按序输出),而是写清:
- 最终目标
- 可用证据
- 行动边界
- 验收标准
让模型自主选择执行路径。ALWAYS/NEVER/MUST 仅保留给安全限制和硬约束。
stopping-conditions-prompt
- 证据足够 → 交付
- 缺少关键事实 → 说明缺什么,低成本补充
- 减少重复搜索和无效 Token 消耗
tool-authorization-boundaries
| 用户请求 | 权限 |
|---|---|
| 分析、审查、制定计划 | 检查材料 + 报告结论 |
| 修改、构建、修复 | 本地变更 + 非破坏性验证 |
| 外部写入、删除、购买 | 再次确认 |
"能够判断下一步该做什么,不代表已经获得执行这一步的权限。"
verification-before-delivery
模型生成了结果 ≠ 任务完成:
- 代码修改 → 运行测试、类型检查、Lint、构建检查、冒烟测试
- 前端/视觉 → 检查实际渲染结果(布局、裁切、间距、内容完整性)
- 无法验证 → 说明原因 + 给出下一步检查方法
reasoning-effort-tuning
Reasoning Effort 不是越高越好:
- 保留当前档位作为基线
- 测试同档位和更低档位
- 只有评测证明 high/xhigh 带来收益才提升
- max 仅用于难度最高、质量优先的任务
- 提升前先检查 Prompt 是否写清了成功标准、依赖、工具条件
prompt-structure-framework
OpenAI 推荐的 8 段式结构(不是每段都要写长,而是确认每条信息是否真的影响模型行为):
Role → Personality → Goal → Success Criteria → Constraints → Tools → Output → Stop Rules
迁移工作流
- 从当前可工作的 Prompt 开始(基线)
- 逐个删除过时补丁 / 重复指令 / 固定流程
- 每次删除后用同一批评测验证
- 只保留确实影响模型行为的信息
适用场景
- 正在迁移 GPT-5.6 的开发者
- 维护复杂 System Prompt / 工具描述 / Agent 指令的团队
- Prompt 中积累了大量 Always/Never/固定流程的项目