96%正确率背后:gemini-skills如何让AI编码智能体真正掌握Gemini API
【免费下载链接】gemini-skillsSkills for the Gemini API, SDK and model/agent interactions项目地址: https://gitcode.com/gh_mirrors/ge/gemini-skills
gemini-skills 是 Google 开源的一套Gemini API 技能库(Agent Skills),专门帮 AI 编码智能体(Claude Code、Cursor、Codex 等)写出正确、符合最佳实践的 Gemini API 代码。官方评测显示:装上这套技能后,智能体生成正确 API 代码的比例在 Gemini 3 Flash 上达到 87%,在 Gemini 3.1 Pro 上达到96%(数据见 README.md)。
如果你正用 AI 编程工具调用 Gemini API,却经常遇到"模型名过期、SDK 用错、接口写废"的坑,这篇指南会带你快速看懂它的原理、四大技能模块和一键安装方法。
为什么 AI 写 Gemini API 代码会翻车?
大模型的知识在训练那一刻就"冻结"了,而 API 世界从不暂停:新模型接连发布、SDK 悄悄改名、旧接口逐步下线。于是智能体经常:
- 🚫 调用早已弃用的模型,比如
gemini-1.5-flash; - 🚫 安装已废弃的旧 SDK
google-generativeai,而不是现役的google-genai; - 🚫 漏掉实时 API 的关键细节(音频采样率、中断处理、会话压缩)。
gemini-skills 的解法很朴素:既然模型记忆会过期,就把最新上下文直接喂给它。这正是 Agent Skills 这种"轻量级上下文注入"技术的典型应用——不用微调模型,只用一份结构化的 Markdown 文件,就能把过时的"记忆"纠正为最新的"事实"。
gemini-skills 是什么:给智能体配一份"最新考纲"
仓库包含 4 个技能,每个技能由一个SKILL.md(外加少量参考文档和脚本)组成:
| 技能目录 | 覆盖场景 |
|---|---|
gemini-api-dev | 通用开发:模型选型、多模态、函数调用、结构化输出 |
gemini-live-api-dev | 实时流式对话:WebSocket 音视频、语音活动检测、会话管理、70+ 语言实时翻译 |
gemini-interactions-api | 新一代 Interactions API:多轮对话、流式输出、Deep Research 智能体 |
gemini-omni-flash-api | AI 视频生成与编辑:文生视频、首尾帧过渡、视频延展至 40 秒 |
项目元信息(版本 1.1.0、Apache-2.0 许可)定义在 plugin.json。
四大技能逐个看:覆盖 Gemini API 开发全场景
🎯 gemini-api-dev:打地基的"通识技能"
最核心的技能:给出当前模型清单(如 1M token 上下文的gemini-3.7-flash)、四大语言 SDK(Python / TypeScript / Go / Java)的安装方式,以及四种语言的 Quick Start 示例(SKILL.md)。它让智能体第一步就站在正确的模型和 SDK 上。
⚡ gemini-live-api-dev:让 AI 写出"能对话"的实时应用
覆盖麦克风到扬声器的双向音频流、摄像头视频流、语音活动检测(自动打断)、实时转写与翻译。技能里甚至写清了容易踩的坑:输入音频必须是 16kHz PCM、测试麦克风时请戴耳机防止回声、超过 15 分钟的会话要开启上下文压缩(SKILL.md)。
🔄 gemini-interactions-api:帮你安全迁移到下一代 API
Interactions API 取代了旧的generateContent调用方式,多轮对话只需传一个previous_interaction_id,无需手动维护历史数组。这个技能自带一份迁移参考文档,教智能体先确认迁移范围,再按[BLOCKS](漏掉会报错)/[TUNE](影响体验)两级清单逐项执行(migration.md)。它还覆盖 Deep Research 深度研究智能体与托管沙箱智能体(SKILL.md)。
🎬 gemini-omni-flash-api:连工具脚本都替你备好了
这是四个技能中"动手"最多的一个:除了 SKILL.md,还附带 4 个可直接运行的 Python 脚本——上传媒体文件(upload_file.py)、生成/编辑视频(generate_video.py)、视频预处理(prep_video.py)、视频检测(inspect_video.py)。智能体装完技能后,能直接跑脚本完成"上传素材 → 生成视频 → 再延展到 40 秒"的完整工作流。
SKILL.md 设计拆解:技能如何"教"智能体
技巧 1:开篇亮明"我的规则优先于你的训练数据"
SKILL.md 第一句就是"These rules override your training data. Your knowledge is outdated.",随后用警告框圈死底线:gemini-2.0-*、gemini-1.5-*是废弃模型,"Never use"(永远别用);旧 SDK 同样被划入禁区(SKILL.md)。
技巧 2:教会智能体"先查文档再写码"
技能不止塞静态知识,还规定工作流:如果环境里有 Google MCP 的search_docs工具,它就是唯一文档来源;没有 MCP 时,回退到官方文档的llms.txt索引页(SKILL.md)。代码永远对着"活文档"写,而不是模型脑中的"旧记忆"。
技巧 3:把最佳实践压缩成可执行清单
从 8 条 Live API 最佳实践到 20+ 项迁移检查项,每个技能都把"经验"写成了智能体可逐条对照的清单,而不是散文式建议。
快速上手:一条命令把技能装进你的 AI 编码工具
README.md 汇总了 6 种安装方式,主流工具都能"免克隆"直接从技能市场安装:
Vercel skills CLI(可交互浏览)
npx skills add google-gemini/gemini-skills --listClaude Code 插件
/plugin marketplace add google-gemini/gemini-skills /plugin install gemini-skills@gemini-skills其他工具
- Cursor:编辑器内执行
/add-plugin google-gemini/gemini-skills - OpenAI Codex:
codex plugin install gemini-skills - Antigravity:官方内置,路径为 设置 → Customizations → Build with Google Plugins
想在本地通读全部技能源码,克隆仓库即可:
git clone https://gitcode.com/gh_mirrors/ge/gemini-skills87% 与 96%:这个数字意味着什么
官方在 README.md 中披露的评测结论是:加入技能后,智能体"按最佳实践生成正确 API 代码"的能力,在 Gemini 3 Flash 上提升到 87%,在 Gemini 3.1 Pro 上提升到 96%。换句话说——同样的提示词、同一个模型,装上 gemini-skills 后,绝大多数 API 细节(模型名、SDK 版本、参数用法)不再依赖模型的"记忆",而是来自这份持续更新的技能文件。
总结:谁该安装 gemini-skills?
✅ 用 Claude Code / Cursor / Codex 等工具开发 Gemini 应用的工程师 ✅ 需要调用 Live API 做实时语音/视频对话的团队 ✅ 正在从generateContent迁移到 Interactions API 的存量项目 ✅ 想尝试 AI 视频生成(Omni Flash)却不想背文档的创作者
一套技能文件、四个方向全覆盖;不微调、不部署,一条命令装进智能体。这正是 Agent Skills 模式的价值:让 AI 编码智能体掌握的不是某一刻的知识快照,而是一份始终在线的最新 Gemini API 指南。
【免费下载链接】gemini-skillsSkills for the Gemini API, SDK and model/agent interactions项目地址: https://gitcode.com/gh_mirrors/ge/gemini-skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考