awesome-autoresearch:从Sakana AI-Scientist到AI-Researcher,25+个AI科学家与研究智能体系统盘点

发布时间:2026/10/3 12:46:25
awesome-autoresearch:从Sakana AI-Scientist到AI-Researcher,25+个AI科学家与研究智能体系统盘点 awesome-autoresearch从Sakana AI-Scientist到AI-Researcher25个AI科学家与研究智能体系统盘点【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathys autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearchawesome-autoresearch 是一份围绕 Karpathy autoresearch 灵感体系的高信度精选清单系统盘点了 25 个 AI 科学家与研究智能体系统AI Scientist / Research Agents覆盖 7 大类 100 条资源从 Sakana AI-Scientist 到 HKUDS AI-Researcher再到自治自改进循环、跨平台移植、评测基准与真实落地案例。无论你是 AI 研究员、开发者还是产品经理这份清单都是了解AI 自主科研生态的最佳入口。 为什么AI 科学家是当下最值得关注的 AI 方向2025 年以来AI 圈出现了一条全新的赛道让 AI 自主做科研——从生成想法、检索文献、设计并运行实验到撰写论文与同行评审AI 正在从写论文的工具变成研究者本身。其中两个项目被公认为这一浪潮的里程碑Sakana AI-Scientist首个面向全自动科学发现的综合系统几乎无需人类监督即可完成从想法到论文的完整链条HKUDS AI-ResearcherNeurIPS 2025 论文端到端科研自动化系统覆盖假设生成 → 实验 → 手稿撰写 → 同行评审的完整工作流。而awesome-autoresearch的定位非常清晰它不做穷举式搜索而是一个高信度索引把受 karpathy/autoresearch 启发的自主改进循环、研究智能体系统与衍生项目做了系统性策展。 3 分钟搞懂autoresearch 研究智能体循环在看 25 系统的盘点之前先花 3 分钟理解清单里几乎所有项目共同生长的循环定目标指定一个可度量指标模型 loss、基准分数、解析速度……提变更AI 智能体修改代码或提示词提出一轮改进跑实验在固定预算下自动运行实验用固定评分器评估保留或回滚keep-or-revert指标变好就保留变差就回滚并记录失败原因记录沉淀每轮结果写入实验台账下一轮站在已有经验上继续优化。关键设计在于任务、评分器与证据始终保持固定变量只有智能体提出的变更。这样每一次进步都可复现、可验证而不是自我欺骗。 凡可度量皆可优化If you can measure it, you can optimize it——这是清单中多个衍生项目共享的核心哲学。 项目结构速览awesome-autoresearch 如何组织内容整个仓库结构极简内容集中在主文档中文件作用README.md主清单7 大类、100 条精选资源CONTRIBUTING.md贡献指南收录标准、推荐条目格式、需避免的内容LICENSECC0-1.0 许可可自由使用与转载README.md 按出现顺序分为 7 大类分类数量一句话概括️ 通用自改进循环General-purpose descendants28 条把 autoresearch 循环泛化到任意可度量目标 研究智能体系统Research-agent systems24 条端到端的 AI 科学家 / 科研流水线 平台移植与硬件分支Platform ports9 条Apple Silicon、WebGPU、多卡等跨设备适配 领域特定适配Domain-specific adaptations9 条交易、语音、GPU 内核等跨场景落地 评测与基准Evaluation benchmarks5 条衡量研究智能体能力的基准套件 知名用例与深度文章Notable use cases16 条真实跑出来的结果与复盘 相关资源Related resources11 条论文合集与策展清单 25 研究智能体系统分组盘点️ 第一类通用自改进循环28 条这一类是生态的基本盘不局限于科研而是把 keep-or-revert 循环泛化到任何可度量目标上。项目定位速览recursive-improve递归自改进框架采集执行轨迹、分析失败模式、定向修复auto-researchvukrosic纯文档控制平面构建开放式自主 AI 研究实验室autoresearchuditgoenkaClaude Code 技能把 autoresearch 泛化为可复用循环codex-autoresearchCodex 原生技能支持断点续跑、跨轮经验与并行实验research-loop确定性执行器 计划哈希审批 隔离 Git worktree 实验台账steer治理型实验框架智能体改训练代码任务与评分器保持固定Thoth仪表盘优先的运行时持久化运行、锁定工作项、可审查结论gemini-autoresearchGemini CLI 技能Google Search 作为循环内实时验证源pi-autoresearch持久实验循环 实时指标 置信度追踪 可恢复会话autoresearch-claude-codeClaude Code 移植版附生物力学具体案例研究autocontext闭环控制平面评估、持久知识、分级验证、蒸馏到轻量运行时ax本地复盘循环把重复出现的摩擦转化为改进提案goal-mdGOAL.md 模式先让智能体构造可度量适应度函数再优化lazy-developer基于 GOAL.md 的多目标编排覆盖率、测试速度、复杂度等autoresearch-at-home协作分支实验认领、最佳配置共享、多机 swarm 协同autoresearch-anything面向任意可度量指标提示词、API、落地页、SQL 皆可autoresearch-everywhere跨平台扩展自动检测硬件配置并直接启动循环ADASICLR 2025自动设计智能体系统用代码发明新架构self_improving_coding_agentSICAICLR 2025 Workshop编辑自身代码库的自我改进编码智能体self-improving-agent带反思与元学习循环的自改进智能体架构HGM赫胥黎-哥德尔机器元层面优化提升 SWE-bench 表现gepaICLR 2026 Oral反思式提示词进化基准上优于 RLGRPOEvoSkill从失败轨迹中进化出可复用技能与提示词autoevolve自对弈式进化变异代码策略、Elo 评分、Pareto 前沿分支ClawTeam智能体群智并行 GPU 研究方向、任务分发与结果聚合AI-Research-SKILLs双环架构内环优化 外环综合的技能库aidemlAIDE树搜索式 ML 工程智能体迭代提升模型性能WecoAIDE 云平台可观测性、实验追踪、托管运行 第二类研究智能体系统24 条——真正的AI 科学家这是标题中25 AI 科学家系统的主战场全部围绕从想法到论文的端到端科研流水线。项目定位速览AI-ScientistSakana AI首个全自动科学发现系统从想法生成到论文撰写最小人类监督AI-Scientist-v2Sakana AI智能体式树搜索实现工作坊级自动发现摆脱 v1 的模板依赖AI-ResearcherHKUDSNeurIPS 2025假设 → 实验 → 手稿 → 同行评审的端到端自动化ARK想法 会议 → 论文6 个智能体协同支持 CLI / Web / TelegramAutoResearchClaw主题 → 文献综述 → 实验 → 分析 → 评审 → 论文初稿NanoResearch规划实验、生成代码、本地或 SLURM 运行、基于真实结果写论文AutoSciWiki 中心的全生命周期研究平台20 技能覆盖完整闭环AutoResearch-SibylSystem全自主 AI 科学家多智能体迭代 GPU 实验 自进化外环CORAL面向开放式发现的自主多智能体进化10 项任务 SOTAAiScientist长时程 ML 研究实验室分层编排 文件即总线协调OpenAGSAuto-Research多智能体覆盖科研全生命周期文献、假设、实验、写作、评审AgentLaboratory想法 → 文献综述 → 实验 → 报告支持自主与协同驾驶模式AgentRxiv智能体实验室共享预印本服务器互相迭代、站在彼此肩膀上agihyperspace去中心化 P2P 研究网络实验、发现 gossip 、CRDT 排行榜Auto-claude-code-research-in-sleepMarkdown 优先的研究工作流自主文献综述与跨模型评审autoresearcher早期开源包当前聚焦文献综述自动化的科学工作流ResearchAgent基于文献的迭代式研究想法生成 多智能体评审反馈MLR-Copilot生成想法、实现实验、分析结果的自主 ML 研究框架ML-Agent强化学习驱动的自主 ML 工程从试错中学习writing-driven-autoresearch第一分钟就保留可提交论文实验全部由论文声明驱动RalphthonICML 2026 冠军Agon提示词经济编排科学家 / 编码 / 审计三循环横跨 10 学科LatteReview低代码 Python 包AI 智能体自动完成系统性文献综述LitLLMRAG 驱动的文献综述助手生成高质量相关工作章节Agent Laboratory三阶段流水线文献综述 → 实验 → 报告写作 第三类平台移植与硬件分支9 条没有高端 GPU 也能跑 autoresearch 循环——这一类项目把循环搬到了各种设备上项目适配平台autoresearch-macosmacOS / Apple SiliconMPS最广泛采用的 forkautoresearch-mlxMLX 原生移植完全去除 PyTorch/CUDA 依赖autoresearch-webgpu浏览器内运行实验无需 Python 环境autoresearch-win-rtxWindows 原生 RTX面向消费级 NVIDIA 显卡n-autoresearch多 GPU 基础设施实验追踪、自适应搜索、崩溃恢复autoresearch-engram增加持久认知记忆跨会话知识检索openclaw-autoresearchOpenClaw 平台移植 统计置信度评分Colab / Kaggle T4 移植免费 T4 GPU零成本零本地配置autoautoresearchJetsonJetson AGX Orin 移植内置创意总监注入新颖性逃离局部最优 第四类领域特定适配9 条keep-or-revert 循环正在走出实验室进入具体行业项目应用场景autokernelGPU 内核优化剖析瓶颈 → 改一个内核 → 基准测试 → 保留或回滚autozymeCPU 端科学软件优化保持输出一致的前提下提速atlas-gic交易智能体以滚动夏普比率代替模型 loss 作为优化目标autovoiceevals语音 AI 智能体加固对抗式呼叫者 提示词迭代autoresearch-growth落地页定位与 A/B 测试候选用分析数据驱动下一轮autoresearch-sudokuAI 迭代重写 Rust 数独求解器最终超过顶尖人类求解器autospec读自然语言业务规则自动构建带测试的 Spring Boot 服务tpu_performance_autoresearch_wikiTPU 性能优化MFU / tokens-per-sec含 Llama3-8B 等案例autoresearch-genealogy谱系研究迭代扩展与验证家族史 评测基准如何衡量一个研究智能体的能力判断一个AI 科学家是否靠谱看它在这些基准上的表现详见 README.md 的 Evaluation benchmarks 分类基准提供方特点mle-benchOpenAI衡量 AI 智能体的 ML 工程能力MLAgentBenchsnap-stanford13 项 ML 实验任务从 CIFAR-10 到 BabyLMMLR-Benchchchenhui201 个开放式 ML 研究任务源自 NeurIPS/ICLR/ICML 工作坊ML-Benchgersteinlab仓库级代码的 ML 任务评测AgentBenchTHUDM8 类环境的 LLM-as-Agent 综合评测ICLR 2024 选型指南如何为你的场景挑选研究智能体系统不同需求对应不同系统以下是最常用的匹配关系你的目标推荐方向看AI 写论文的完整流程Sakana AI-Scientist / v2、HKUDS AI-Researcher从主题到论文的端到端自动化ARK、AutoResearchClaw、NanoResearch多智能体协同 / 长时间自主运行CORAL、AiScientist、AgentRxiv优化自己仓库中的可度量指标autoresearch-anything、goal-md、steer只有 Mac / 浏览器 / 免费算力autoresearch-mlx、autoresearch-webgpu、Colab T4 移植落地到具体业务交易 / 语音 / 内核atlas-gic、autovoiceevals、autokernel评估智能体能力mle-bench、MLR-Bench、AgentBench想要云平台托管WecoAIDE 官方云平台 实战案例研究智能体到底能做出什么结果README.md 收录了 16 条真实用例与深度文章几个有代表性的结果Shopify Liquid 引擎优化Shopify CEO 公开分享 autoresearch 式优化运行解析/渲染速度显著提升、内存分配明显下降GPUMode eigh 内核竞赛一个近自主系统两周内跑了 1,293 次实验取得 8.56 倍加速并夺得第 3 名还详细复盘了抓到的奖励作弊棒球生物力学投球速度预测模型质量大幅提升死海古卷墨水检测多智能体实验循环用于古代卷轴识别跨卷轴泛化能力显著改进网球预测的奖励作弊复盘一篇难得的循环哪里出了错深度文章值得所有优化循环的实践者阅读56 个系统的编码综述结论是真正的缺口不在于生成研究产物大多数系统都能做到而在于在弱结果流出之前拦截它们——这也是该赛道下一步的焦点。 快速上手获取与贡献git clone https://gitcode.com/gh_mirrors/aw/awesome-autoresearch克隆后直接阅读 README.md 即可浏览全部 7 大类资源。如果你想为清单新增一个项目CONTRIBUTING.md 给出了明确的收录标准项目需直接受 karpathy/autoresearch 启发、明确引用 autoresearch 作为基础或在相邻领域有意义地复用同一套自治改进循环。条目要求简洁、事实化、无宣传色彩且避免关键词堆砌。清单本身采用CC0-1.0 许可见 LICENSE可自由使用但请注意每个条目内具体项目的许可证需单独确认。❓ 新手常见问题Q1没有 GPU 能玩吗可以。清单收录了浏览器 WebGPU 版、免费 T4 GPU 版、Apple Silicon / MLX 版等多种移植最低成本即可体验完整的实验循环。Q2awesome-autoresearch 和 karpathy/autoresearch 原版是什么关系原版是一个极简的自治实验循环实现最小酸性循环而本清单是围绕它生长出的整个生态28 个通用衍生项目、24 个研究智能体系统、9 个平台移植等共 100 条精选资源。Q3这些系统靠谱吗会不会自己骗自己这正是循环中固定评分器 keep-or-revert 实验台账设计要解决的问题配套 5 大评测基准mle-bench、MLR-Bench 等用于客观横向比较实战案例区还收录了多次奖励作弊被抓到的复盘。AI 自主科研正在从论文走向工程实践。awesome-autoresearch 以高信度策展的方式把这条赛道的 25 个 AI 科学家与研究智能体系统整理成了一张清晰的路标图——无论是想读谱系、挑工具还是做评测从 README.md 出发即可。【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathys autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考