从单脑到自治团队:AI Agent 架构设计与落地完整指南

发布时间:2026/8/29 9:46:33
从单脑到自治团队:AI Agent 架构设计与落地完整指南 从单脑到自治团队AI Agent 架构设计与落地完整指南【免费下载链接】learn-claude-codeBash is all you need - A nano claude code–like 「agent harness」, built from 0 to 1项目地址: https://gitcode.com/GitHub_Trending/an/learn-claude-codelearn-claude-code 项目对 Claude Code 的开源实现做了逆向工程把工程级 Agent 外壳harness即模型之外的全部运行环境该如何设计拆成一套从零可复现的机制。本文写给想把 AI Agent 架构落到业务里的开发者只讲四个要害任务系统、上下文压缩、多 Agent 协作、自治生命周期。为什么单脑扛不住复杂工程活先看一个高频翻车现场让 Agent把这个模块重构掉它跑着跑着上下文被塞满方案细节被冲掉后半夜开始自相矛盾。问题往往不在模型智商而在缺工程脚手架。learn-claude-code 的立场很明确模型的行动力来自训练本身工程师要造的是车——提供工具、知识、观察与动作接口、权限边界但绝不替模型做决定。单个 Agent 长时间独自干活普遍卡在三个地方上下文无界增长工具输出和中间对话只进不出撑到阈值只能硬砍状态只活在内存里会话重启或压缩后我刚才在干什么就没了没法并行一条慢命令卡住全流程任务也没法分给别人项目用三样东西逐个接住这三个问题一副骨架任务系统、一块记忆压缩与保留、一个团队多 Agent 自治。下文按这三条线展开。给 Agent 一副骨架任务模型、状态机与依赖管理任务状态机怎么设计任务系统的核心思路把要做什么写进磁盘而不是留在上下文里。每个任务就是.tasks/目录下的一个 JSON 文件上下文被压缩、进程被重启进度都不丢。最小任务数据模型完整实现见 任务系统源码dataclass class Task: id: str # task_ 8 位随机串全局唯一 title: str # 一句话标题 detail: str # 执行说明 state: str # pending / in_progress / done assignee: str # 认领人空表示无人认领 blocked_by: list # 前置任务 id全部完成后才能开工状态机只有三态两条边pending被认领后变in_progress交付后变done。刻意不做做了一半这种中间态——要么没做要么做完回滚简单别的 Agent 接手也简单。blocked_by记录的是谁做完我才能开始。每个任务完成后系统把前置条件全部满足的下游任务自动视为可开工。这样整张任务 DAG有向无环图即带先后顺序的任务网络不需要中央调度器每个执行者只回答一个问题我现在有哪些活能领。并发安全同样关键多个 Agent 可能同时想认领同一个任务。实现上用文件级独占锁 flock 把读—认领—写三步串行化保证同一条任务最多一个赢家。这是后面一切多 Agent 协作的前提——看板不安全团队就散了。给 Agent 一块记忆上下文压缩与身份保持上下文压缩阈值如何定压缩不是等到爆掉才动手而是一条四段流水线每次模型调用前都会过一遍机制拆解见 上下文压缩章节结果预算超大的工具输出先落盘上下文里只留引用中段归档较早的中间对话归档到 transcript 文件微压缩把旧的工具结果替换成摘要整体压缩仍超阈值时用模型把历史压成一段总结若 API 返回 prompt_too_long触发一次兜底重试后重发阈值一般取模型上下文窗口的 70%~80%。原则是先压缩、后溢出永远留缓冲而不是贴着天花板赌运气。压缩之后为什么必须补身份压缩有个副作用Agent 会忘了自己是谁。单 Agent 场景顶多算失忆团队场景里是事故——队友可能开始以老板口吻给别人下指令。项目的做法直白但可靠压缩完成后在消息列表头部重新插一段身份声明重申我是谁、属于哪个团队、扮演什么角色if should_compact(history): history compact(history) history.insert(0, { role: user, content: fidentity我是 {name}角色{role}团队{team}/identity, })不到五行代码却是多 Agent 系统长跑不犯浑的保命条款。从一个到一个团队多 Agent 协作与自治生命周期多 Agent 通信怎么实现队友之间不走内存通信走文件每个成员在.mailboxes/下有独立收件箱消息以 JSONL 追加写入发件人不等读回执。队长通过spawn工具创建队友并派活队友则自己扫看板认领未分配的任务——不需要中央调度器轮询分派。还有一个容易忽略的细节队友认领任务时系统会按任务绑定一个独立工作目录worktree该任务的文件操作全部限定在这个目录里。多个任务并行跑互不踩踏对方的代码。自治生命周期怎么管一个队友从出生到退场的完整轨迹可以压成一张表阶段触发条件行为spawn队长创建队友初始化独立消息列表与身份块WORK上一轮 stop_reason模型返回的停止原因信号仍是 tool_use持续调用工具推进任务IDLE不再请求工具调用进入等待每 5 秒轮询收件箱与任务板唤醒收到新消息或看板出现新认领任务回到 WORK 继续干活退出连续 60 秒无任何活动优雅关停释放资源这条干完活就等、来了活就醒的闭环配上第二章的磁盘任务板意味着团队搭好之后人不需要守在旁边按按钮——把新任务挂上看板空闲的队友自己会捞起来可运行的完整样本见 自治团队源码。跑进生产环境并行执行、部署与持续优化慢任务一律转后台规则只有一条命令预期耗时超过容忍线项目默认 120 秒就丢进后台线程执行Agent 继续思考不空转等结果后台任务跑完后把产物作为一条通知消息注回 Agent。等待和思考从此互不阻塞并行能力也由此而来。部署三步走git clone https://gitcode.com/GitHub_Trending/an/learn-claude-code cd learn-claude-code pip install -r requirements.txt再在.env里配好 API 密钥与模型名每一章的机制代码都能独立跑起来。持续优化看什么监控盯三个数——压缩触发次数、后台任务排队时长、任务板积压量任何一个持续上涨都是第一信号调优先调压缩阈值与后台化阈值这两项对吞吐和成本的收益最直接安全所有工具调用先过权限层见 权限系统破坏性操作必须人工审批沙箱隔离是最后一道防线收束从一个循环加一个工具走到会认领任务、会通信、会并行的自治团队工程化 AI Agent 的演进只有一条主线把模型装不下、干不了、记不住的东西不断外化成磁盘上的文件和线程里的并发。【免费下载链接】learn-claude-codeBash is all you need - A nano claude code–like 「agent harness」, built from 0 to 1项目地址: https://gitcode.com/GitHub_Trending/an/learn-claude-code创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考