写作背景:2026 年 6 月,OpenAI 发布 GPT-5.6 系列模型(Sol / Terra / Luna),Codex 同步取消使用时限。在社区大规模实测中,一个意外发现浮出水面——大量此前被视为"必备"的 Skills,在新模型上不仅没有帮助,反而成为Token 消耗的黑洞和推理速度的拖累。本文综合 OpenAI 官方提示词指南、Anthropic Skills 设计哲学及社区实践经验,梳理 Skill 的"生死判断标准"。

一、发生了什么:Skill 大清洗

2026 年 7 月,Codex 取消使用时限制后,社区第一个大规模共识不是"爽",而是:

Superpowers、grill、AGENTS.md 等 Skills 现在可以直接删掉了。

由于现在的模型本身已经具有 Agentic 的能力,外部的 Skills 反复调用反而污染了上下文,让思考时间变长,Token 消耗变高。

—— 爱范儿 APPSO 报道,2026 年 7 月

以曾经的"Agent 必备"Skill Superpower 为例:它的核心功能是强制模型在开始每个任务前先做头脑风暴、确定方案、然后通过 Debug 和验证走完整套固定流程。这些能力——自主规划、多步推理、自我验证——在 GPT-5.6 上已经被内化为模型自身的行为模式。继续使用 Superpower 相当于给一个已经会自己走路的人再套上拐杖。

有网友对此有一个极其精准的比喻:

"这些 Skill 跟那种一装就后台常驻还关不掉的流氓软件似的,吃 Token 比吃大米还快。"

核心矛盾在于:Skill 本身也会占用上下文窗口。在 GPT-5.6 动辄百万 Token 上下文的今天,Skill 指令似乎是九牛一毛——但问题不在"能不能放得下",而在于这些指令每轮对话都会被加载、被处理、被推理。一个 2000 Token 的 Skill 在整个长任务中可能被反复读取数十次,累积的 Token 消耗和推理延迟是惊人的。

二、根本原因:模型学会了"怎么做事"

要理解为什么 Skill 需要重新评估,先要理解 GPT-5.6 到底变了什么。这不是简单的"模型更强了"——而是能力的性质发生了变化

OpenAI 官方提示词指南中给出了一个最核心的建议:

定义目标与边界,让模型选择执行路径。

过去的 Prompt 常规定模型先搜索、再读取文件、接着调用工具、最后按固定顺序输出。但对于 GPT-5.6,OpenAI 建议开发者写清最终目标、可用证据、行动边界和验收标准,让模型根据任务情况自行选择执行路径。

维度旧范式(需要 Skill 辅助)GPT-5.6 原生能力
任务规划需要 Skill 强制"先头脑风暴再执行"模型自主拆解任务、选择执行顺序
工具编排Skill 规定何时调用哪个工具Programmatic Tool Calling——模型在内存中编写程序协调多个工具
自我验证Skill 要求"重新执行复现步骤"模型主动复现、跑测试、确认修复有效
过程控制Skill 规定每一步做什么模型理解交付目标后自主决策路径
边界判断Skill 中的 STEP BY STEP 约束给定边界条件后模型自行推导约束

换句话说,旧模型是需要 SOP 的实习生——你必须告诉他每一步怎么做。GPT-5.6 是有判断力的同事——你只需要说清楚要什么结果、有哪些限制、怎样算完成。

三、该删的 Skill:三种典型"伪需求"

根据社区大规模清洗经验,以下三类 Skill 在 GPT-5.6 时代属于应该直接删除的伪需求

类型代表 Skill为什么不需要了
过程控制型 Superpower、grill 强制模型走"规划→执行→验证"的固定流程。GPT-5.6 已内置 Agentic 能力,这些指令变成重复污染,反而拖慢推理。
上下文噪音型 AGENTS.md、冗长的系统指令 大量"告诉模型怎么思考"的元指令。模型自己会规划,不需要你规定"先分析、再拆解、后总结"。
角色扮演型 "你是一位拥有 20 年经验的 XX 专家" 角色设定无法真正提升输出质量,反而占用上下文。结果导向的提示词远胜于角色扮演。

判断标准很朴素:如果一个 Skill 的核心功能是"教模型怎么思考和做事",那它在 GPT-5.6 时代大概率是多余的。模型已经学会了这些元能力。

四、该留的 Skill:五条价值判断准则

那什么样的 Skill 仍然有存在的必要?不是"所有 Skill 都不需要了",而是判断标准变了——Skill 的价值不再在于"教模型怎么想",而在于提供模型凭自身能力无法获取或无法稳定执行的东西

如果一个 Skill 不能提供以下至少一条价值,那它就不需要存在:

1

模型不知道的特有信息

企业内部的品牌规范、产品技术规格、公司特定术语表、团队内部的代码规范——这些是不在模型训练语料中的私有知识,必须通过 Skill 注入。OpenAI 官方指南明确指出,知识文件最适合做参考材料,而规则和行为应放在指令中。

典型场景:品牌色彩与字体规范、公司 API 文档、内部系统数据库 Schema、特定业务的领域术语

2

模型无法直接访问的工具或数据

模型可以通过 MCP 或 Function Calling 调用外部服务,但"调用哪一个服务、用什么参数、在什么时机调用"的编排逻辑,仍然需要 Skill 来封装。模型知道需要查数据库,但不知道你的数据库叫什么、在哪里、用什么 API。

典型场景:内部 CRM 查询、ERP 订单状态获取、公司 GitLab 仓库操作、企业微信/飞书消息推送

3

必须稳定执行的复杂确定性流程

当业务要求每次执行结果必须 100% 一致时,模型的"自主规划"反而成为风险。这时需要 Skill 锁定执行路径。GPT-5.6 可以自主选择路径,但有时你需要确定的路径。

典型场景:合规审计报告生成、财务数据汇总流程、药品审批文档生成、安全漏洞响应 SOP

4

随业务而走的特殊规则

每个企业的规则体系是独特的:审批层级、权限范围、禁止操作列表、合规红线。模型不知道你所在组织的这些边界,而边界决定 AI 闯多大的祸。OpenAI 官方指南反复强调:设定边界是最重要的提示词工作之一。

典型场景:金额审批阈值、"只读不写"权限限定、"不得修改已上线配置"、"涉及 PII 数据时必须确认"

5

随业务而走的验收标准

模型可以写代码,但不知道你的团队怎样算"完成"。OpenAI 指南明确指出:好的提示词在收尾一行应该写验收——项目更新要确认每项行动都有负责人和截止日期;季度报告要核对两份文件的数据一致;Bug 修复后要重新执行复现步骤。

典型场景:代码审查 Checklist、上线前的回归测试集、文档交付的格式与引用规范、数据报告的交叉验证规则

五、从 OpenAI 到 Anthropic:两家的 Skill 观

有意思的是,当 OpenAI 社区在"大清洗"Skill 时,Anthropic 正在大力推广 Skills 作为 Agent 的核心扩展机制。两者看起来矛盾,实则殊途同归。

OpenAI 的 Skill 观

  • 模型已经足够 Agentic,不需要"教它怎么想"
  • Skill 指令是上下文污染,要做减法
  • 核心保留:目标、边界、验收、私有知识
  • 关键词:清理冗余

Anthropic 的 Skill 观

  • 通用模型有智能但缺 领域专长
  • Skill 封装工作流、最佳实践、脚本工具
  • 三层渐进式披露:元数据 → 核心指令 → 参考资源
  • 关键词:封装专长
对比维度OpenAI 要删的 SkillAnthropic 要建的 Skill
核心内容过程控制、角色扮演、冗长元指令领域知识、工具编排、流程 SOP
问题场景告诉模型"怎么思考"告诉模型"这个领域有什么规则"
本质替代模型的推理能力补充模型的知识空白
典型例子"先分析、再拆解、后总结""Anthropic 品牌色 #141413,用 apply_template.py"

两家的分歧不在于"Skill 有没有用",而在于 Skill 应该装什么内容。OpenAI 要删的是"替模型思考"的指令型 Skill,Anthropic 要建的是"给模型知识"的专家型 Skill。这恰好和本文的五条准则完全一致——Anthropic 的 Skill 满足的是准则 1(特有信息)和准则 3(确定性流程),而 OpenAI 社区删掉的是连这五条一条都不占的冗余 Skill。

六、实操清单:你的 Skill 该留还是该删?

Skill 内容判定理由
Superpower(强制规划→执行→验证流程) 删除 GPT-5.6 已内置 Agentic 能力,重复指令污染上下文
AGENTS.md / 长系统指令(规定思考步骤) 删除 模型自主规划能力强于固定步骤,保留目标/边界/验收即可
"你是一位 XX 专家"角色扮演 删除 不能实质性改变输出质量,结果导向描述更有效
公司品牌规范(色彩/字体/语气) 保留 准则 1:模型不知道的私有信息
内部 API / 数据库调用封装 保留 准则 2:模型无法直接访问的工具和数据
合规审计报告生成 SOP 保留 准则 3:必须稳定执行的确定性流程
权限边界(只读/审批阈值/禁止操作列表) 保留 准则 4:随业务的特殊规则
代码审查 Checklist / 上线回归测试集 保留 准则 5:随业务的验收标准
冗长但无法改变行为的示例 删除 OpenAI 官方建议:只保留能改变结果的上下文
重复多次的同一规则说明 删除 模型一次就能理解,重复只会浪费 Token

七、范式转变:从"写提示词"到"定义完成"

GPT-5.6 时代的真正变化,不是 Skill 本身的存废,而是人机分工边界的重新划定

旧范式(需要被淘汰)

  • 替 AI 安排完整过程
  • 写密密麻麻的步骤和角色
  • 堆砌大量上下文"以防万一"
  • 第一版提示词就要完美
  • 用 Skill 强制模型的思考路径

新范式(GPT-5.6 时代)

  • 描述结果,过程让模型自主选择
  • 只保留目标和边界条件
  • 只提供会改变结果的信息
  • 先看初稿,再迭代修正
  • 用 Skill 补充模型的知识和能力缺口

OpenAI 的官方指南对此有一段精妙的总结:

"提示词最该写的,往往是结果。很多人写提示词时会下意识替 AI 安排完整过程。OpenAI 的建议恰好相反:先描述结果,过程只有在确实影响成品时才需要指定。"

"所谓的提示词高手,越来越像一个会交代工作的同事。AI 心里可能就在想——少教我怎么做事,你只管说清楚你要什么。"

更深层地看,这是从 "执行辅助"到"目标管理" 的范式迁移。旧时代的 Skill(如 Superpower)本质上是给模型装上"拐杖"来弥补它执行复杂任务时的能力不足。当模型自身具备了 Agentic 的规划和执行能力后,Skill 的角色就从"教模型走路"转变为"给模型配备专业领域的弹药"

八、总结:Skill 生死判断一句话

你的 Skill 该留还是该删?

问自己一个核心问题:
这个 Skill 是在弥补模型的能力不足,还是在补充模型的知识盲区?

弥补能力 → 删除(模型自己会了) 补充知识 → 保留(模型本就不会)
#判断维度一句话判定
1特有信息这个信息模型的训练数据里有吗?没有 → 保留
2工具/数据访问模型自己就能获取这个数据/调用这个服务吗?不能 → 保留
3确定性流程这个流程每次执行必须得出完全一样的结果吗?必须 → 保留
4业务规则这条规则是你所在组织独有的吗?是 → 保留
5验收标准模型自己知道你的团队"怎样算完成"吗?不知道 → 保留
如果以上五条一条都不满足,那这个 Skill 大概率应该删除

参考资料:OpenAI 官方 GPT-5.6 提示词指南;爱范儿《Codex 不限时了,我先删掉了一堆 Skills》;虎嗅同题报道;Anthropic 官方博客《Building Agents with Skills》;火山引擎开发者社区《Skills 如何让大模型从"知道"到"会做"》;GPT-5.6 Best Practices (ernie55ernie.github.io)。