awesome-autoresearch:SICA、HGM、GEPA、EvoSkill——自改进编码智能体精选清单
【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathy's autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch
awesome-autoresearch 是一个自改进编码智能体(Self-Improving Coding Agent)精选清单,灵感来自 Karpathy 的 autoresearch 项目。它把自主改进循环、研究智能体和各类衍生系统按七大类别做了"高信号"整理,帮你在一篇文档里看懂 SICA、HGM、GEPA、EvoSkill 四条明星路线,以及 80+ 个值得跟进的 AI 自主研究项目。
什么是"自主改进循环"?为什么需要这份精选清单
autoresearch 的核心思路很简单:让编码智能体提出变更 → 运行实验 → 根据可度量指标决定保留(keep)或回滚(revert),如此往复,一夜之间可以跑完上百次实验。
围绕这个模式,社区很快长出了大量"后代项目":有人把循环搬到 Mac、Windows、浏览器,有人用它优化 GPU 内核、交易策略甚至谱系研究。但项目数量爆炸也带来了"找项目难、分不清好坏"的痛点。
awesome-autoresearch 的定位就是只收录强相关的精选条目:直接被 autoresearch 启发、明确引用它作为基础、或在相邻领域有意义地复用了同一套自主改进循环,三类之外的项目一律不收。
📌 清单的完整目录与结构说明见 README.md。
四大明星项目:SICA、HGM、GEPA、EvoSkill 一次看懂
清单中最受关注的四个"自改进编码智能体"方向,各自代表了一条不同的技术路线。
SICA:会修改自己代码库的编码智能体
SICA(Self-Improving Coding Agent)是 ICLR 2025 Workshop 论文项目,让智能体直接编辑自己的脚手架代码(scaffold-level self-improvement),并在编码基准上验证了这种自我修改确实能带来收益。它是"智能体改造自身"路线的标杆。
HGM:面向编码智能体的"哥德尔机"
Huxley-Gödel Machine 把自改进提升到了元层面(meta-level optimization):不直接改任务代码,而是优化"如何让编码智能体变强"这一层,目标指标锁定在 SWE-bench 的解题表现上,是清单中自改进编码智能体的另一种经典实现。
GEPA:用自然语言反思做提示词进化
GEPA(Genetic-Pareto)是 ICLR 2026 Oral 项目,通过反思式提示词进化(reflective prompt evolution)优化任意文本参数:智能体用自然语言复盘失败原因,再变异出更好的提示词。它在多个基准上超越了基于强化学习(GRPO)的方法,并且可以对接 DSPy 等框架直接用于复合 AI 系统。
EvoSkill:从失败轨迹中自动"长"出可复用技能
EvoSkill 的思路是:智能体在基准任务上跑挂后,系统从失败的执行轨迹中自动提炼出可复用的技能与提示词,再演化迭代。它支持 Claude Code、Codex CLI、OpenCode、OpenHands、Goose 等多种编码智能体平台,是"技能自进化"方向的代表。
🔎 这四个项目连同其他自改进智能体条目,集中在清单的"通用型后代"分类中,详见 README.md。
清单如何组织?七大类别总览
整份清单按用途分成七个板块,从"想跑一个实验循环"到"想了解论文"都能直达:
| 类别 | 你会找到什么 | 位置 |
|---|---|---|
| 🛠️ 通用型后代 | keep-or-revert 循环框架、自改进编码智能体、提示词进化 | README.md |
| 🔬 研究智能体系统 | 端到端 AI 科学家、自动文献综述到论文产出流水线 | README.md |
| 💻 平台移植与硬件分叉 | macOS/MLX、Windows/RTX、WebGPU、多 GPU 集群版本 | README.md |
| 🎯 领域专用改造 | GPU 内核优化、语音智能体、交易策略、TPU 性能调优 | README.md |
| 📊 评测与基准 | MLE-bench、MLAgentBench 等衡量智能体能力的标尺 | README.md |
| 📈 明星用例与实录 | Shopify Liquid 优化、GPUMode 内核竞赛复盘等公开案例 | README.md |
| 📚 相关资源 | 智能体论文合集、深度研究智能体清单 | README.md |
💡 新手建议的浏览顺序:通用型后代 → 评测基准 → 明星用例。先搞懂循环本身,再看别人怎么用、如何衡量效果。
快速上手:三步用起来这份自改进智能体清单
克隆仓库,在本地通读清单:
git clone https://gitcode.com/gh_mirrors/aw/awesome-autoresearch按类别挑方向:想搭实验循环就看"通用型后代",想在 Mac/Windows 上跑就看"平台移植",想做完整科研流程就看"研究智能体系统"。
用基准项目校准预期:对照"评测与基准"板块(如 OpenAI 的 mle-bench),理解每个自改进编码智能体项目声称的收益是如何被度量的。
如何贡献?入选标准与投稿格式
这份清单强调"策展(curation)"而非堆量。贡献规范全部写在 CONTRIBUTING.md 中,核心规则包括:
- ✅ 收录条件:项目必须直接受 autoresearch 启发、明确引用它、或在相邻领域有意义地复用了同一套自主改进循环;
- ✅ 条目格式:
- owner/repo - 简短、中性的描述,描述要求简洁、客观、不带推广语气; - ❌ 明确拒绝:营销文案、关键词堆砌、与 autoresearch 关联松散的"AI 研究"项目。
完整投稿规范与"好 PR 长什么样"见 CONTRIBUTING.md。
许可证与适用人群
清单以 CC0-1.0 发布,可自由使用、再分发(见 LICENSE)。
这份精选清单特别适合三类人:想入门自主改进循环的开发者(从通用型后代起步)、选型自改进编码智能体的工程师(重点对比 SICA / HGM / GEPA / EvoSkill 四条路线)、以及关注 AI 科研自动化的研究者(顺着"研究智能体系统"和"相关资源"两条线深入)。
【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathy's autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考