项目地址:https://github.com/uditgoenka/autoresearch

2026 年 3 月,Andrej Karpathy 扔出一颗重磅炸弹:一个 630 行的 Python 脚本,在两天内自主跑了 700 次 ML 训练实验,对一段已经高度优化的 GPT 代码又挖出了 11% 的性能提升。项目一周狂揽 26,000 Star,整个 AI 圈炸了锅。

几乎同一时间,Udit Goenka(印度连续创业者、38 家初创公司的天使投资人)上线了同名项目 uditgoenka/autoresearch,把这套"设定目标 → AI 自主迭代 → 醒来收菜"的思路搬到了 Claude Code、OpenCode 和 OpenAI Codex 上。

这个项目没有一行可执行代码。它本质上是 13 个精巧的 Markdown 工作流文件,作为 Claude Code 的 "Skill" 加载。Claude 读取这些文件里写的操作指南,照着改代码、跑命令、写 git commit——整个流程像一份给实习生的 SOP 操作手册。

核心理念:约束 + 机械指标 + 自主迭代 = 复利式增长。
你不需要 AGI,你只需要一个目标、一个量化指标,和一个永不放弃的循环。

核心循环:改 — 验 — 留/弃
Github推荐:Autoresearch / 给AI助手装上自动挡

这个循环说起来不复杂,但魔鬼在细节里:8 条铁律确保 Agent 不乱来——每次只改一处、只用机械验证、失败立刻回滚、修改小而聚焦。作者用大量 Markdown 篇幅精确约束了 Claude 的行为边界。

14 个命令,不止于写代码
Github推荐:Autoresearch / 给AI助手装上自动挡

还内置了 9 个安全钩子:自动拦截读取 .env 和 SSH 密钥、阻止 rm -rf 和 force-push 等危险命令、400 行代码变更警告等。这些细节让"挂着跑一晚"的安全性大大提升。

它能打几分?
Github推荐:Autoresearch / 给AI助手装上自动挡

和 Karpathy 原版(真正在 GPU 上跑训练、2 天 700 次实验、发现人类没发现的优化)相比,这个项目的工程深度不在一个量级。但它足够轻量、足够聚焦——如果你有一个能用一句 shell 命令得出指标的优化任务,睡前敲个命令、醒来查日志,确实是一种很香的用法。

上手只需一行

npx skills add uditgoenka/autoresearch

装好后这样用:

/autoresearch
Goal: 将测试覆盖率从 72% 提高到 90%
Scope: src/**/*.ts
Metric: coverage %(越高越好)
Verify: npm test -- --coverage | grep "All files"
Iterations: 25

一句话总结
Autoresearch 是一个包装精致的 Prompt 工程制品——它没什么黑魔法,但把"AI 自主迭代"这件事的边界约束、安全策略和工作流设计做到了当前开源里最完整的水平。别指望它帮你跑通宵 GPU 训练,但让它改 25 轮 TypeScript 类型、修 20 个 lint 错误、跑一轮安全审计——这些它能干,而且干得不赖。

适合谁?已经习惯在 Claude Code 里干活、想解放双手做批量优化的人。 不适合谁?期望一个开箱即用的独立工具、或者需要处理复杂训练/部署管线的团队。