从Gems到Skills:AI能力标准化与MCP协议下的开发者新范式
1. 先搞清楚“Gems”退役和“Skills”上线到底意味着什么
如果你最近在关注 Google 的 Gemini 模型,可能已经注意到一个消息:Gemini Gems 将在十月退役,并转变为“Skills”。对于普通用户或者开发者来说,这个消息听起来可能有点模糊——是功能没了?还是换了个名字?会不会影响我正在用的东西?
简单来说,这不是一个简单的功能下架,而是一次产品形态和开发者生态的整合与升级。你可以把它理解为,Google 正在把原来相对独立、封闭的“Gems”能力,重新打包成更标准化、更开放、更容易被其他工具和平台集成的“Skills”。这背后反映的是整个 AI 应用开发模式的变化:从“使用一个固定的、黑盒的 AI 功能”,转向“组合和调用一系列可插拔的、标准化的 AI 能力模块”。
对于开发者,尤其是那些已经在用或打算用 Gemini API 的人来说,最直接的影响是:
- 接口和调用方式可能会变:原来基于 Gems 的特定调用方式(如果有的话)需要迁移到新的 Skills 接口或标准(如 MCP - Model Context Protocol)。
- 能力获取方式更灵活:Skills 的理念是“即插即用”。你不再需要依赖 Gemini 官方提供的、打包好的“Gems”套件,而是可以从一个更开放的“Skills 市场”或社区,找到针对特定任务(如代码审查、UI设计、学术研究)优化过的能力模块,直接集成到你的工作流中。
- 生态竞争加剧:从热搜词如
claude skills,codex skills,mcp排行榜就能看出,这已经不是一个厂商的游戏。Anthropic 的 Claude、OpenAI 的 Codex 等都在构建自己的 Skills/工具生态。这次转变是 Google 为了在未来的 AI 智能体(Agent)和工具调用生态中保持竞争力。
所以,如果你只是用 Gemini 聊天,这个变化对你几乎无感。但如果你是开发者、研究者,或者在使用像 Cursor、Workbuddy 这类集成了 AI 能力的 IDE/工具,那么你需要开始关注“Skills”的玩法了。这关系到你未来如何更高效地让 AI 帮你写代码、做测试、分析文献。
2. 从“Gems”到“Skills”:不仅仅是改名,是开发范式的迁移
要理解这次变化,我们得先看看“Gems”和“Skills”到底指什么。虽然官方没有给出极其详细的定义,但从社区讨论和现有实践可以勾勒出清晰的轮廓。
Gemini Gems 是什么?你可以把 Gems 理解为 Google 为 Gemini 模型预置的一些“专家模式”或“特定场景优化包”。在概念上,它可能类似于给模型一个强力的系统提示(System Prompt),或者结合了特定微调、检索增强生成(RAG)的知识库,让模型在某个垂直领域(比如代码生成、学术写作、创意文案)表现得更专业、更可控。它的特点是相对封闭、由官方主导、功能集成度高。用户可能是通过一个开关或一个特定入口来启用某个“Gem”。
Skills 又是什么?Skills 则是一个更开放、更通用的概念。它指的是一个 AI 模型(如 Gemini、Claude)可以调用的一项标准化、可描述、可被发现的外部能力或工具。这个能力的背后,可能是一个函数、一个 API、一个命令行工具,或者一套复杂的处理流程。关键在于,它遵循一定的协议(如正在兴起的MCP)来声明自己“能做什么”、“需要什么输入”、“会返回什么输出”。
举个例子:
- 一个“代码审查 Skill”:它声明自己接收一段代码和语言类型作为输入,输出结构化的审查意见(如潜在 bug、风格问题、性能建议)。
- 一个“学术PDF解析 Skill”:它声明自己接收一个 PDF 文件,输出提取的文本、参考文献列表、图表摘要。
- 一个“UI 设计稿转代码 Skill”:它声明自己接收一张设计图(或 Figma 链接),输出前端框架(如 Vue3)的代码。
范式迁移的核心:从“功能调用”到“能力组合”
- Gems 时代:用户说“帮我用学术模式写论文”,模型切换到“学术 Gem”来工作。这个“学术 Gem”内部具体怎么实现的,用户和第三方开发者不太清楚,也难以定制。
- Skills 时代:用户或开发者可以告诉 AI 智能体:“你现在可以调用‘学术数据库检索 Skill’、‘文献总结 Skill’和‘APA格式排版 Skill’”。智能体在回答问题时,会自主判断是否需要、何时需要调用这些 Skills,并按照标准格式交换数据。这些 Skills 可以是 Google 官方的,也可以是社区开发的,甚至是你自己写的。
这种转变的好处是巨大的:
- 解耦与复用:一个写好的“代码审查 Skill”,既可以被 Gemini 调用,也可以被 Claude 调用,只要它们都支持 MCP 这类协议。
- 生态繁荣:开发者可以专注于打造一个精良的、解决特定问题的 Skill,并发布到市场。其他开发者无需重复造轮子,直接集成即可。热搜词里的
skills市场、开源skills正是这个趋势的体现。 - 智能体(Agent)的基石:未来的 AI 应用不会是简单的问答,而是能自主规划、使用工具完成任务智能体。标准化、可发现的 Skills 是智能体感知和操作世界的“手”和“脚”。
所以,Gems 退役转为 Skills,是 Google 将 Gemini 从一个“多才多艺的模型”,推向一个“开放能力平台”的关键一步。对于开发者,学习重点要从“如何用好某个 Gems”,转向“如何发现、集成、甚至开发一个标准的 Skill”。
3. 作为开发者或用户,你现在需要做什么?
面对这个变化,不同角色的人行动优先级不同。我们分情况来看。
情况一:我只是个普通用户,通过 Gemini 网页或 App 聊天
- 行动:几乎不需要做任何事。你感受到的 Gemini 能力不会消失,只会以更流畅的方式整合在对话中。原来可能需要手动选择的“专家模式”,未来可能会变成 AI 自动判断并调用相应的后台 Skill 来服务你。体验可能更无缝。
情况二:我是开发者,正在或计划使用 Gemini API这是受影响最大的群体。你需要开始调整技术栈和认知。
- 关注官方公告和迁移指南:这是第一步。Google 一定会提供从现有 Gems 相关接口(如果存在)到新 Skills 体系的迁移路径和文档。密切留意 Gemini API 的更新日志和官方博客。
- 了解 MCP 等协议:MCP(Model Context Protocol)是目前被 Claude、Cursor 等广泛采纳的,用于定义和调用 Skills/Tools 的开放协议。它由 Anthropic 提出,但旨在成为行业标准。即使 Google 最终推出自己的类似协议或基于 MCP,理解 MCP 的核心概念(Server, Client, Tools, Resources)对你理解整个 Skills 生态至关重要。
- 探索现有的 Skills 生态:不必等 Google。现在就可以去体验 Claude 的
claude skills,或者 Cursor、Windsurf 这类 IDE 中集成的codex skills。看看社区里有哪些好用的 Skills(如热搜词中的qianwen-ai/qianwen-ai,academic research skills,专注于vue3前端生态的skills)。这能让你直观感受 Skills 是如何工作的。 - 评估现有项目:检查你的项目是否直接依赖了可能属于“Gems”范畴的、非标准的 Gemini 调用。如果是,规划在过渡期结束前进行重构。
情况三:我使用集成了 AI 的第三方工具(如 Cursor, Workbuddy)
- 行动:关注你所用工具的更新。这些工具为了保持竞争力,一定会尽快适配包括 Gemini Skills 在内的各大模型 Skills 生态。你的体验可能会得到提升,因为工具能调用的能力更丰富、更标准化了。例如,
cursor能用skills吗这个问题,未来答案很可能是“能,而且支持 Gemini、Claude 等多个来源的 Skills”。
情况四:我想开发自己的 AI 应用或智能体(Agent)
- 行动:这是最好的入场时机。你的学习路径应该是:
- 第一步:学习 MCP。这是目前最实用的起点。尝试为你的某个本地能力(比如一个解析特定日志的脚本)包装成一个 MCP Server。
- 第二步:体验现有 Skills。通过 Claude 或 Cursor,添加并使用一些社区 Skills,理解它们的能力描述(Schema)和交互模式。
- 第三步:设计你的 Skill。思考你要解决什么问题?输入输出是什么?如何让它易于被 AI 理解和使用?参考热搜词
ai skills怎么开发、agents skills原理。 - 第四步:关注 Gemini Skills SDK。等待 Google 发布官方的 Skills 开发工具包,这将让你开发的 Skill 能更深度地集成到 Gemini 模型中。
4. 实战:如何快速体验“Skills”的工作模式(以 MCP 为例)
由于 Gemini 官方的 Skills 体系细节尚未完全公开,我们可以通过目前最成熟的MCP 协议来模拟和体验未来 Skills 的工作方式。这里以在支持 MCP 的客户端(如 Claude Desktop)中运行为例。
核心概念速览:
- MCP Server:提供具体 Skills/Tools 的后端服务。比如,一个“天气预报 Server”,一个“数据库查询 Server”。
- MCP Client:AI 应用本身,如 Claude Desktop、Cursor。它负责与用户对话,并决定何时调用哪个 Server 提供的 Tool。
- Tool:一个可被调用的具体功能,属于一个 Server。
体验步骤:
准备环境:确保你安装了 Node.js 环境。这是运行大多数 JavaScript/TypeScript 编写的 MCP Server 所必需的。
安装 Claude Desktop:这是目前体验 MCP 最方便的平台。从 Anthropic 官网下载安装。
寻找并运行一个简单的 MCP Server:我们以一个最简单的“计算器” Skill 为例。实际上,你可以找到很多有趣的,比如
github.com/modelcontextprotocol/servers仓库里有官方示例。- 创建一个项目目录,初始化并安装依赖:
mkdir mcp-calculator-demo && cd mcp-calculator-demo npm init -y npm install @modelcontextprotocol/sdk - 创建一个
server.js文件,内容如下(这是一个极简示例):const { Server } = require('@modelcontextprotocol/sdk'); const server = new Server( { name: 'calculator', version: '1.0.0', }, { capabilities: { tools: {}, }, } ); // 定义一个加法工具 server.setRequestHandler('tools/list', async () => ({ tools: [ { name: 'add_numbers', description: 'Add two numbers together.', inputSchema: { type: 'object', properties: { a: { type: 'number', description: 'First number' }, b: { type: 'number', description: 'Second number' }, }, required: ['a', 'b'], }, }, ], })); // 处理工具调用 server.setRequestHandler('tools/call', async (request) => { if (request.params.name === 'add_numbers') { const { a, b } = request.params.arguments; return { content: [ { type: 'text', text: `The sum of ${a} and ${b} is ${a + b}.`, }, ], }; } throw new Error('Tool not found'); }); // 启动服务器,使用 stdio 传输(这是 Claude Desktop 连接的方式) server.connectStdio().catch(console.error); - 运行这个 Server:
node server.js。它会保持运行,等待 Client 连接。
- 创建一个项目目录,初始化并安装依赖:
配置 Claude Desktop 连接这个 Server:
- 找到 Claude Desktop 的配置文件夹(macOS 通常在
~/Library/Application Support/Claude,Windows 在%APPDATA%\Claude)。 - 编辑或创建
claude_desktop_config.json文件。 - 添加以下配置,告诉 Claude 去连接我们本地运行的 calculator server:
注意:将{ "mcpServers": { "calculator": { "command": "node", "args": ["/ABSOLUTE/PATH/TO/YOUR/mcp-calculator-demo/server.js"], "env": {} } } }/ABSOLUTE/PATH/TO/YOUR/替换为你server.js文件的绝对路径。
- 找到 Claude Desktop 的配置文件夹(macOS 通常在
重启 Claude Desktop 并体验:
- 重启 Claude Desktop 应用。
- 新建一个对话,直接输入:“请调用加法工具,计算 123 加 456。”
- 如果配置成功,Claude 会识别出可用的
add_numbers工具,并自动调用它,最终返回结果 “The sum of 123 and 456 is 579.”
通过这个流程,你就完成了一个完整的“Skill”从开发到被 AI 调用的过程。未来 Gemini Skills 的体验将会非常类似:你开发或安装一个 Skill,在 Gemini 的开发平台或配置文件中声明它,然后在对话中,Gemini 就能自动使用这个 Skill 来增强它的能力。
5. 技能(Skills)生态的现状与选型思考
从热搜词可以看出,Skills 生态已经非常活跃且多元。面对claude skills、codex skills、开源skills以及即将到来的Gemini Skills,我们该如何选择?这里提供一个选型思路。
首先,按用途对 Skills 进行分类:
编程开发类:这是最丰富的领域。包括:
- 代码生成与补全:针对特定框架(Vue3, React)、语言(Rust, Go)或模式(TDD)的增强。
- 代码审查与分析:安全检查、性能分析、代码风格检查。
- 调试与日志分析:解析特定格式的日志、堆栈跟踪。
- 工具集成:直接调用
git,docker,kubectl等命令行工具。 - 热搜词代表:
专注于vue3前端生态的skills,codebuddy好用java skills,ai 编程 skills 选型清单:需求澄清、tdd、代码审查与 ui 设计。
研究学习类:
- 学术搜索与摘要:连接学术数据库,总结论文。
- 文献管理与引用:自动生成 BibTeX 等引用格式。
- 数据抓取与清洗:从网页或文档中提取结构化数据。
- 热搜词代表:
academic research skills,codex 科研必用skills。
效率与工具类:
- 文件处理:转换文档格式(如 Markdown 转 Word),解析 PDF/Excel。
- 信息查询:天气、股价、汇率、词典。
- 自动化脚本:执行一系列重复的电脑操作。
- 热搜词代表:
superpower skills(一个知名的 Chrome 扩展,提供多种网页操作能力)。
垂直领域类:
- 设计:UI 设计稿生成、色彩分析。
- 测试:为测试工程师生成测试用例、分析测试报告。
- 运维:服务器监控、部署脚本。
- 热搜词代表:
测试工程师用的skills。
选型决策清单:当你要为一个项目或工作流选择 Skills 时,可以按以下顺序思考:
- 协议兼容性优先:这个 Skill 是否遵循开放协议(如 MCP)?如果是,那么它很可能不绑定某个特定模型,未来兼容性更好。优先选择
开源skills和遵循 MCP 的 Skills。 - 评估模型绑定:有些 Skills(如某些
claude skills)可能深度绑定了 Claude 的特定提示工程或微调,迁移到 Gemini 可能效果打折扣。看清描述。 - 关注活跃度:在 GitHub 或 Skills 市场上,查看该 Skill 的更新频率、Star 数、Issue 处理情况。一个几个月没更新的 Skill 可能已经无法使用。
- 安全与隐私:这个 Skill 需要什么权限?它会将你的数据发送到哪里?对于处理敏感代码或数据的 Skill,务必审查其代码或选择可信来源。
- 从简单开始:不要试图一次性安装几十个 Skills。先从解决你当前最痛的一个点开始。例如,如果你是前端开发者,就先找一个
vue3相关的 Skill 体验。 - 组合使用:未来的趋势不是找一个“全能”的 Skill,而是组合多个“专精”的 Skill。例如,你可以让 AI 先调用“需求分析 Skill”澄清问题,再调用“代码生成 Skill”写代码,最后调用“代码审查 Skill”检查。
关于“小模型 vs 大模型”的思考(呼应热搜词4o、claude 3.5、gemini ultra2.3 什么时候该用小模型?): Skills 生态的成熟,恰恰让“大小模型协同”变得可行。未来,一个复杂的任务可能由 AI 智能体来规划,它可能会决定:
- 简单的、模式固定的信息查询(如查天气) → 调用一个本地小模型或专门的 API Skill,快速、低成本。
- 复杂的、需要深度推理的代码生成或设计 → 调用 Gemini Ultra/Claude 3.5 Opus 等大模型 Skill,能力强、质量高。 Skills 作为标准化的能力接口,让智能体可以像调度微服务一样,灵活调度不同规模和成本的“模型能力”。
6. 为 Gemini Skills 时代做好准备:开发者的行动路线图
对于开发者而言,这次转变是挑战更是机遇。以下是一个从现在开始可以执行的行动路线图。
第一阶段:学习与观察(现在 - Gemini Skills 正式发布)
- 掌握核心协议:深入学习MCP。即使 Google 用自家协议,原理也相通。理解 Tool 的定义、Resource 的管理、Server/Client 的通信模式。
- 动手实验:按照第 4 部分的示例,亲手将一个本地脚本(比如一个简单的文件重命名工具、一个查询本地数据库的脚本)包装成 MCP Server,并在 Claude Desktop 中成功调用。这是理解整个流程的关键。
- 扫描生态:定期浏览
github.com/topics/mcp、github.com/modelcontextprotocol以及 Claude、Cursor 的社区,了解有哪些高质量的 Skills 出现。关注热搜词中提到的skills市场动态。 - 关注官方动态:订阅 Gemini API 和 Google AI 的官方博客、更新日志。
第二阶段:规划与设计(Gemini Skills 发布初期)
- 评估官方 SDK:一旦 Google 发布 Gemini Skills SDK,立即评估其与 MCP 的异同、易用性和功能完整性。
- 识别机会点:结合你的专业领域,思考有哪些重复性高、规则明确、但当前 AI 原生对话解决不好的任务?这很可能是一个 Skill 的机会。例如:
- 如果你是测试工程师:能否开发一个“从需求文档自动生成测试用例骨架”的 Skill?
- 如果你是学术研究者:能否开发一个“根据研究方向,自动爬取并格式化最新 arXiv 论文列表”的 Skill?
- 如果你是运维工程师:能否开发一个“解析特定监控系统告警,并给出初步排查建议”的 Skill?
- 设计 Skill 接口:用文档清晰定义你的 Skill:名称、描述、输入参数(类型、说明、是否必填)、输出格式。良好的设计是成功的一半。
第三阶段:开发与部署(技能成熟期)
- 选择实现方式:
- 纯函数/逻辑:如果 Skill 不依赖外部服务,可以用任何语言实现核心逻辑,然后用官方 SDK 或 MCP SDK 包装。
- API 封装:如果你的 Skill 是对现有内部或第三方 API 的封装,重点在于设计适配层和错误处理。
- 复杂流程:对于需要多步操作、状态保持的 Skill,可能需要引入工作流引擎或更复杂的设计。
- 注重健壮性:AI 的输入是不可控的。你的 Skill 必须做好:
- 输入验证:严格检查参数类型、范围、必填项。
- 错误处理:对可能出现的异常(网络超时、API 限流、数据格式错误)有清晰的错误信息返回,帮助 AI 和最终用户理解问题。
- 超时控制:设定合理的执行超时,避免阻塞 AI 智能体的响应。
- 编写清晰文档:除了代码注释,必须提供清晰的用户文档,说明 Skill 的功能、使用示例、限制和常见问题。
- 发布与迭代:将你的 Skill 发布到 Gemini Skills 市场(如果开放)、GitHub 或其他社区。收集反馈,持续迭代。
长期视角:未来的 AI 应用开发,很可能不再是“从头训练一个模型”或“精心设计一个提示词”,而是“如何巧妙地组合和调度一系列高质量的 Skills,来构建一个能解决复杂问题的智能体”。掌握 Skill 的开发、集成和运维能力,将成为 AI 时代开发者的一项核心技能。从“Gems”到“Skills”的转变,正是这个宏大趋势中的一个具体注脚。现在开始投入,正是时候。