news 2026/10/2 19:06:38

awesome-autoresearch:SICA、HGM、GEPA、EvoSkill——自改进编码智能体精选清单

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
awesome-autoresearch:SICA、HGM、GEPA、EvoSkill——自改进编码智能体精选清单

awesome-autoresearch:SICA、HGM、GEPA、EvoSkill——自改进编码智能体精选清单

【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathy's autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch

awesome-autoresearch 是一个自改进编码智能体(Self-Improving Coding Agent)精选清单,灵感来自 Karpathy 的 autoresearch 项目。它把自主改进循环、研究智能体和各类衍生系统按七大类别做了"高信号"整理,帮你在一篇文档里看懂 SICA、HGM、GEPA、EvoSkill 四条明星路线,以及 80+ 个值得跟进的 AI 自主研究项目。

什么是"自主改进循环"?为什么需要这份精选清单

autoresearch 的核心思路很简单:让编码智能体提出变更 → 运行实验 → 根据可度量指标决定保留(keep)或回滚(revert),如此往复,一夜之间可以跑完上百次实验。

围绕这个模式,社区很快长出了大量"后代项目":有人把循环搬到 Mac、Windows、浏览器,有人用它优化 GPU 内核、交易策略甚至谱系研究。但项目数量爆炸也带来了"找项目难、分不清好坏"的痛点。

awesome-autoresearch 的定位就是只收录强相关的精选条目:直接被 autoresearch 启发、明确引用它作为基础、或在相邻领域有意义地复用了同一套自主改进循环,三类之外的项目一律不收。

📌 清单的完整目录与结构说明见 README.md。

四大明星项目:SICA、HGM、GEPA、EvoSkill 一次看懂

清单中最受关注的四个"自改进编码智能体"方向,各自代表了一条不同的技术路线。

SICA:会修改自己代码库的编码智能体

SICA(Self-Improving Coding Agent)是 ICLR 2025 Workshop 论文项目,让智能体直接编辑自己的脚手架代码(scaffold-level self-improvement),并在编码基准上验证了这种自我修改确实能带来收益。它是"智能体改造自身"路线的标杆。

HGM:面向编码智能体的"哥德尔机"

Huxley-Gödel Machine 把自改进提升到了元层面(meta-level optimization):不直接改任务代码,而是优化"如何让编码智能体变强"这一层,目标指标锁定在 SWE-bench 的解题表现上,是清单中自改进编码智能体的另一种经典实现。

GEPA:用自然语言反思做提示词进化

GEPA(Genetic-Pareto)是 ICLR 2026 Oral 项目,通过反思式提示词进化(reflective prompt evolution)优化任意文本参数:智能体用自然语言复盘失败原因,再变异出更好的提示词。它在多个基准上超越了基于强化学习(GRPO)的方法,并且可以对接 DSPy 等框架直接用于复合 AI 系统。

EvoSkill:从失败轨迹中自动"长"出可复用技能

EvoSkill 的思路是:智能体在基准任务上跑挂后,系统从失败的执行轨迹中自动提炼出可复用的技能与提示词,再演化迭代。它支持 Claude Code、Codex CLI、OpenCode、OpenHands、Goose 等多种编码智能体平台,是"技能自进化"方向的代表。

🔎 这四个项目连同其他自改进智能体条目,集中在清单的"通用型后代"分类中,详见 README.md。

清单如何组织?七大类别总览

整份清单按用途分成七个板块,从"想跑一个实验循环"到"想了解论文"都能直达:

类别你会找到什么位置
🛠️ 通用型后代keep-or-revert 循环框架、自改进编码智能体、提示词进化README.md
🔬 研究智能体系统端到端 AI 科学家、自动文献综述到论文产出流水线README.md
💻 平台移植与硬件分叉macOS/MLX、Windows/RTX、WebGPU、多 GPU 集群版本README.md
🎯 领域专用改造GPU 内核优化、语音智能体、交易策略、TPU 性能调优README.md
📊 评测与基准MLE-bench、MLAgentBench 等衡量智能体能力的标尺README.md
📈 明星用例与实录Shopify Liquid 优化、GPUMode 内核竞赛复盘等公开案例README.md
📚 相关资源智能体论文合集、深度研究智能体清单README.md

💡 新手建议的浏览顺序:通用型后代 → 评测基准 → 明星用例。先搞懂循环本身,再看别人怎么用、如何衡量效果。

快速上手:三步用起来这份自改进智能体清单

  1. 克隆仓库,在本地通读清单:

    git clone https://gitcode.com/gh_mirrors/aw/awesome-autoresearch
  2. 按类别挑方向:想搭实验循环就看"通用型后代",想在 Mac/Windows 上跑就看"平台移植",想做完整科研流程就看"研究智能体系统"。

  3. 用基准项目校准预期:对照"评测与基准"板块(如 OpenAI 的 mle-bench),理解每个自改进编码智能体项目声称的收益是如何被度量的。

如何贡献?入选标准与投稿格式

这份清单强调"策展(curation)"而非堆量。贡献规范全部写在 CONTRIBUTING.md 中,核心规则包括:

  • ✅ 收录条件:项目必须直接受 autoresearch 启发、明确引用它、或在相邻领域有意义地复用了同一套自主改进循环;
  • ✅ 条目格式:- owner/repo - 简短、中性的描述,描述要求简洁、客观、不带推广语气;
  • ❌ 明确拒绝:营销文案、关键词堆砌、与 autoresearch 关联松散的"AI 研究"项目。

完整投稿规范与"好 PR 长什么样"见 CONTRIBUTING.md。

许可证与适用人群

清单以 CC0-1.0 发布,可自由使用、再分发(见 LICENSE)。

这份精选清单特别适合三类人:想入门自主改进循环的开发者(从通用型后代起步)、选型自改进编码智能体的工程师(重点对比 SICA / HGM / GEPA / EvoSkill 四条路线)、以及关注 AI 科研自动化的研究者(顺着"研究智能体系统"和"相关资源"两条线深入)。

【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathy's autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 19:05:20

Codex Cloud执行沙箱:让AI真正操作计算机的底层架构

1. 这不是一次普通升级:Codex Cloud 重构代码生成的底层逻辑最近在几个技术社区刷到“OpenAI 推出新版 Codex Cloud,Agents API 开放预览并支持 computer use”这条消息,不少朋友第一反应是:“又一个API更新?不就是把老…

作者头像 李华
网站建设 2026/10/2 19:04:15

browser-use实战:让AI Agent真正操控浏览器完成自动化任务

这段时间AI Agent的话题特别热,但很多朋友问我:Agent到底能帮我们干什么?说实话,早期接触Agent的时候,我也觉得它有点“纸上谈兵”——能写代码、能回答问题,但真要让它去完成一个实际操作,比如…

作者头像 李华
网站建设 2026/10/2 19:02:11

稀疏奖励下的强化学习困境:Hindsight Experience Replay原理与实战指南

1. hindsight到底解决了一个什么问题 先说个我实际踩过的坑。以前做机械臂抓取任务,reward设计成最朴素的那种——抓到物体给1分,抓不到给0分。训练跑了三百万步,策略纹丝不动,loss曲线像条死鱼。后来我把奖励改成“夹爪离物体越近…

作者头像 李华
网站建设 2026/10/2 19:00:02

Playwright实战指南:从零搭建到自动化测试进阶

1. 前端自动化测试的痛点与Playwright的破局思路1.1 曾经那些让人头大的自动化测试问题做了几年测试开发,前端自动化这条路我是一路踩坑踩过来的。早年团队用的是Selenium WebDriver,配合各种语言绑定和驱动管理,光是环境搭建就能折腾大半天。…

作者头像 李华
网站建设 2026/10/2 18:57:49

CS146S 各节核心内容概要:从 LLM 到编程智能体的上下文工程实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/2 18:57:03

3个综合练习项目:命令行记账本、待办事项应用与FastAPI接口实战

编程练习这件事,我见过太多人卡在同一个地方:语法都懂,小例子都会,一碰到“把功能串起来”就不知道从哪里下手。3个综合练习题目,就是专门用来破这个局的。它不是一个知识点配一个demo,而是把文件操作、数据…

作者头像 李华