GPT-5.6 时代的 Skill 生死线
哪些 Skill 该删、哪些该留?从模型能力进化到五条价值判断准则,全面理解 Agentic 时代的 Skill 变革
写作背景:2026 年 6 月,OpenAI 发布 GPT-5.6 系列模型(Sol / Terra / Luna),Codex 同步取消使用时限。在社区大规模实测中,一个意外发现浮出水面——大量此前被视为"必备"的 Skills,在新模型上不仅没有帮助,反而成为Token 消耗的黑洞和推理速度的拖累。本文综合 OpenAI 官方提示词指南、Anthropic Skills 设计哲学及社区实践经验,梳理 Skill 的"生死判断标准"。
一、发生了什么:Skill 大清洗
2026 年 7 月,Codex 取消使用时限制后,社区第一个大规模共识不是"爽",而是:
Superpowers、grill、AGENTS.md 等 Skills 现在可以直接删掉了。
由于现在的模型本身已经具有 Agentic 的能力,外部的 Skills 反复调用反而污染了上下文,让思考时间变长,Token 消耗变高。
—— 爱范儿 APPSO 报道,2026 年 7 月
以曾经的"Agent 必备"Skill Superpower 为例:它的核心功能是强制模型在开始每个任务前先做头脑风暴、确定方案、然后通过 Debug 和验证走完整套固定流程。这些能力——自主规划、多步推理、自我验证——在 GPT-5.6 上已经被内化为模型自身的行为模式。继续使用 Superpower 相当于给一个已经会自己走路的人再套上拐杖。
有网友对此有一个极其精准的比喻:
"这些 Skill 跟那种一装就后台常驻还关不掉的流氓软件似的,吃 Token 比吃大米还快。"
核心矛盾在于:Skill 本身也会占用上下文窗口。在 GPT-5.6 动辄百万 Token 上下文的今天,Skill 指令似乎是九牛一毛——但问题不在"能不能放得下",而在于这些指令每轮对话都会被加载、被处理、被推理。一个 2000 Token 的 Skill 在整个长任务中可能被反复读取数十次,累积的 Token 消耗和推理延迟是惊人的。
二、根本原因:模型学会了"怎么做事"
要理解为什么 Skill 需要重新评估,先要理解 GPT-5.6 到底变了什么。这不是简单的"模型更强了"——而是能力的性质发生了变化。
OpenAI 官方提示词指南中给出了一个最核心的建议:
定义目标与边界,让模型选择执行路径。
过去的 Prompt 常规定模型先搜索、再读取文件、接着调用工具、最后按固定顺序输出。但对于 GPT-5.6,OpenAI 建议开发者写清最终目标、可用证据、行动边界和验收标准,让模型根据任务情况自行选择执行路径。
| 维度 | 旧范式(需要 Skill 辅助) | GPT-5.6 原生能力 |
|---|---|---|
| 任务规划 | 需要 Skill 强制"先头脑风暴再执行" | 模型自主拆解任务、选择执行顺序 |
| 工具编排 | Skill 规定何时调用哪个工具 | Programmatic Tool Calling——模型在内存中编写程序协调多个工具 |
| 自我验证 | Skill 要求"重新执行复现步骤" | 模型主动复现、跑测试、确认修复有效 |
| 过程控制 | Skill 规定每一步做什么 | 模型理解交付目标后自主决策路径 |
| 边界判断 | Skill 中的 STEP BY STEP 约束 | 给定边界条件后模型自行推导约束 |
换句话说,旧模型是需要 SOP 的实习生——你必须告诉他每一步怎么做。GPT-5.6 是有判断力的同事——你只需要说清楚要什么结果、有哪些限制、怎样算完成。
三、该删的 Skill:三种典型"伪需求"
根据社区大规模清洗经验,以下三类 Skill 在 GPT-5.6 时代属于应该直接删除的伪需求:
| 类型 | 代表 Skill | 为什么不需要了 |
|---|---|---|
| 过程控制型 | Superpower、grill | 强制模型走"规划→执行→验证"的固定流程。GPT-5.6 已内置 Agentic 能力,这些指令变成重复污染,反而拖慢推理。 |
| 上下文噪音型 | AGENTS.md、冗长的系统指令 | 大量"告诉模型怎么思考"的元指令。模型自己会规划,不需要你规定"先分析、再拆解、后总结"。 |
| 角色扮演型 | "你是一位拥有 20 年经验的 XX 专家" | 角色设定无法真正提升输出质量,反而占用上下文。结果导向的提示词远胜于角色扮演。 |
判断标准很朴素:如果一个 Skill 的核心功能是"教模型怎么思考和做事",那它在 GPT-5.6 时代大概率是多余的。模型已经学会了这些元能力。
四、该留的 Skill:五条价值判断准则
那什么样的 Skill 仍然有存在的必要?不是"所有 Skill 都不需要了",而是判断标准变了——Skill 的价值不再在于"教模型怎么想",而在于提供模型凭自身能力无法获取或无法稳定执行的东西。
如果一个 Skill 不能提供以下至少一条价值,那它就不需要存在:
模型不知道的特有信息
企业内部的品牌规范、产品技术规格、公司特定术语表、团队内部的代码规范——这些是不在模型训练语料中的私有知识,必须通过 Skill 注入。OpenAI 官方指南明确指出,知识文件最适合做参考材料,而规则和行为应放在指令中。
典型场景:品牌色彩与字体规范、公司 API 文档、内部系统数据库 Schema、特定业务的领域术语
模型无法直接访问的工具或数据
模型可以通过 MCP 或 Function Calling 调用外部服务,但"调用哪一个服务、用什么参数、在什么时机调用"的编排逻辑,仍然需要 Skill 来封装。模型知道需要查数据库,但不知道你的数据库叫什么、在哪里、用什么 API。
典型场景:内部 CRM 查询、ERP 订单状态获取、公司 GitLab 仓库操作、企业微信/飞书消息推送
必须稳定执行的复杂确定性流程
当业务要求每次执行结果必须 100% 一致时,模型的"自主规划"反而成为风险。这时需要 Skill 锁定执行路径。GPT-5.6 可以自主选择路径,但有时你需要确定的路径。
典型场景:合规审计报告生成、财务数据汇总流程、药品审批文档生成、安全漏洞响应 SOP
随业务而走的特殊规则
每个企业的规则体系是独特的:审批层级、权限范围、禁止操作列表、合规红线。模型不知道你所在组织的这些边界,而边界决定 AI 闯多大的祸。OpenAI 官方指南反复强调:设定边界是最重要的提示词工作之一。
典型场景:金额审批阈值、"只读不写"权限限定、"不得修改已上线配置"、"涉及 PII 数据时必须确认"
随业务而走的验收标准
模型可以写代码,但不知道你的团队怎样算"完成"。OpenAI 指南明确指出:好的提示词在收尾一行应该写验收——项目更新要确认每项行动都有负责人和截止日期;季度报告要核对两份文件的数据一致;Bug 修复后要重新执行复现步骤。
典型场景:代码审查 Checklist、上线前的回归测试集、文档交付的格式与引用规范、数据报告的交叉验证规则
五、从 OpenAI 到 Anthropic:两家的 Skill 观
有意思的是,当 OpenAI 社区在"大清洗"Skill 时,Anthropic 正在大力推广 Skills 作为 Agent 的核心扩展机制。两者看起来矛盾,实则殊途同归。
OpenAI 的 Skill 观
- 模型已经足够 Agentic,不需要"教它怎么想"
- Skill 指令是上下文污染,要做减法
- 核心保留:目标、边界、验收、私有知识
- 关键词:清理冗余
Anthropic 的 Skill 观
- 通用模型有智能但缺 领域专长
- Skill 封装工作流、最佳实践、脚本工具
- 三层渐进式披露:元数据 → 核心指令 → 参考资源
- 关键词:封装专长
| 对比维度 | OpenAI 要删的 Skill | Anthropic 要建的 Skill |
|---|---|---|
| 核心内容 | 过程控制、角色扮演、冗长元指令 | 领域知识、工具编排、流程 SOP |
| 问题场景 | 告诉模型"怎么思考" | 告诉模型"这个领域有什么规则" |
| 本质 | 替代模型的推理能力 | 补充模型的知识空白 |
| 典型例子 | "先分析、再拆解、后总结" | "Anthropic 品牌色 #141413,用 apply_template.py" |
两家的分歧不在于"Skill 有没有用",而在于 Skill 应该装什么内容。OpenAI 要删的是"替模型思考"的指令型 Skill,Anthropic 要建的是"给模型知识"的专家型 Skill。这恰好和本文的五条准则完全一致——Anthropic 的 Skill 满足的是准则 1(特有信息)和准则 3(确定性流程),而 OpenAI 社区删掉的是连这五条一条都不占的冗余 Skill。
六、实操清单:你的 Skill 该留还是该删?
| Skill 内容 | 判定 | 理由 |
|---|---|---|
| Superpower(强制规划→执行→验证流程) | 删除 | GPT-5.6 已内置 Agentic 能力,重复指令污染上下文 |
| AGENTS.md / 长系统指令(规定思考步骤) | 删除 | 模型自主规划能力强于固定步骤,保留目标/边界/验收即可 |
| "你是一位 XX 专家"角色扮演 | 删除 | 不能实质性改变输出质量,结果导向描述更有效 |
| 公司品牌规范(色彩/字体/语气) | 保留 | 准则 1:模型不知道的私有信息 |
| 内部 API / 数据库调用封装 | 保留 | 准则 2:模型无法直接访问的工具和数据 |
| 合规审计报告生成 SOP | 保留 | 准则 3:必须稳定执行的确定性流程 |
| 权限边界(只读/审批阈值/禁止操作列表) | 保留 | 准则 4:随业务的特殊规则 |
| 代码审查 Checklist / 上线回归测试集 | 保留 | 准则 5:随业务的验收标准 |
| 冗长但无法改变行为的示例 | 删除 | OpenAI 官方建议:只保留能改变结果的上下文 |
| 重复多次的同一规则说明 | 删除 | 模型一次就能理解,重复只会浪费 Token |
七、范式转变:从"写提示词"到"定义完成"
GPT-5.6 时代的真正变化,不是 Skill 本身的存废,而是人机分工边界的重新划定。
旧范式(需要被淘汰)
- 替 AI 安排完整过程
- 写密密麻麻的步骤和角色
- 堆砌大量上下文"以防万一"
- 第一版提示词就要完美
- 用 Skill 强制模型的思考路径
新范式(GPT-5.6 时代)
- 描述结果,过程让模型自主选择
- 只保留目标和边界条件
- 只提供会改变结果的信息
- 先看初稿,再迭代修正
- 用 Skill 补充模型的知识和能力缺口
OpenAI 的官方指南对此有一段精妙的总结:
"提示词最该写的,往往是结果。很多人写提示词时会下意识替 AI 安排完整过程。OpenAI 的建议恰好相反:先描述结果,过程只有在确实影响成品时才需要指定。"
"所谓的提示词高手,越来越像一个会交代工作的同事。AI 心里可能就在想——少教我怎么做事,你只管说清楚你要什么。"
更深层地看,这是从 "执行辅助"到"目标管理" 的范式迁移。旧时代的 Skill(如 Superpower)本质上是给模型装上"拐杖"来弥补它执行复杂任务时的能力不足。当模型自身具备了 Agentic 的规划和执行能力后,Skill 的角色就从"教模型走路"转变为"给模型配备专业领域的弹药"。
八、总结:Skill 生死判断一句话
你的 Skill 该留还是该删?
问自己一个核心问题:
这个 Skill 是在弥补模型的能力不足,还是在补充模型的知识盲区?
| # | 判断维度 | 一句话 | 判定 |
|---|---|---|---|
| 1 | 特有信息 | 这个信息模型的训练数据里有吗? | 没有 → 保留 |
| 2 | 工具/数据访问 | 模型自己就能获取这个数据/调用这个服务吗? | 不能 → 保留 |
| 3 | 确定性流程 | 这个流程每次执行必须得出完全一样的结果吗? | 必须 → 保留 |
| 4 | 业务规则 | 这条规则是你所在组织独有的吗? | 是 → 保留 |
| 5 | 验收标准 | 模型自己知道你的团队"怎样算完成"吗? | 不知道 → 保留 |
| 如果以上五条一条都不满足,那这个 Skill 大概率应该删除 | |||
参考资料:OpenAI 官方 GPT-5.6 提示词指南;爱范儿《Codex 不限时了,我先删掉了一堆 Skills》;虎嗅同题报道;Anthropic 官方博客《Building Agents with Skills》;火山引擎开发者社区《Skills 如何让大模型从"知道"到"会做"》;GPT-5.6 Best Practices (ernie55ernie.github.io)。