AtumAI:面向数据中心控制平面策略的规范化智能体生成框架

发布时间:2026/8/5 2:36:44
AtumAI:面向数据中心控制平面策略的规范化智能体生成框架 AtumAI面向数据中心控制平面策略的规范化智能体生成框架论文arXiv编号2608.02569v1 | 发布时间2026-08-03 | 开源协议CC BY-NC-SA 4.0摘要数据中心的运行效率完全依赖控制平面即调度硬件资源的各类管理策略。但人工设计控制平面策略的难度正持续加剧软硬件栈规模扩张速度远超工程师的理解上限优化空间庞大、变量高度耦合专家极易错过性能优化机会单套候选策略的原型验证往往需要数月周期。现有开箱即用的智能体AI系统虽可自动化策略搜索但存在三大核心缺陷非规范化无结构化、可检索的问题描述硬约束无法得到强制保证搜索过程缺少可利用的固定结构无迁移能力每个任务从零求解跨场景学到的经验无法复用非系统化搜索仅依靠大模型生成候选方案探索空间狭窄、存在模型偏见极易收敛到局部最优。本文提出AtumAI框架通过智能体AI自动生成数据中心控制平面策略同时补齐上述三大短板。工程师仅需自然语言描述优化目标AtumAI即可自主完成候选策略生成、仿真测试、迭代调优直至产出满足全部约束的可用方案。框架由两大核心组件协同工作数据中心任务编译器将自然语言需求编译为可机器校验、可检索的形式化规约规约绑定真实业务负载与硬件平台采集数据包含优化目标、决策变量、硬约束、评测方案进化式设计迭代环基于规约开展全域搜索通过扩散模型探索差异化策略结构、进化算法调参、代理模型预过滤低价值候选大幅降低高精度仿真的计算开销。在三类完全不同的控制平面任务负载部署、资源弹性扩缩、功耗管理上完成评测AtumAI生成的策略性能全面超越人工专家基线单套统一流水线可适配所有数据中心优化场景无需针对任务定制开发。现有系统缺失能力带来的问题AtumAI解决方案规范化形式化描述无绑定真实负载的结构化问题定义硬约束无法保证任务编译器生成绑定业务/硬件的标准化可检索中间表示IR知识迁移机制每个任务独立开发经验无法复用统一IR共享优化算子库跨任务蒸馏知识可复用全域系统化搜索仅依赖LLM生成方案搜索范围窄、易陷入局部最优扩散模型结构探索进化算法参数调优代理预过滤三重搜索1 引言数据中心支撑微服务、网页检索、存储、数据分析、大模型训练推理全场景业务其成本、吞吐、稳定性完全由控制平面决定。控制平面包含一系列调度策略通过负载部署、缓存、流量路由榨取硬件算力或直接调控服务器功耗。每类策略都存在多目标权衡服务器利用率、尾延迟、成本、功耗与硬性约束SLA服务指标、硬件容量、功耗上限。随着硬件异构性、业务负载持续迭代策略的优化空间呈组合爆炸式增长。传统专家手工设计、调优模式已跟不上业务迭代速度带来海量资源浪费。智能体AILLM驱动多步执行系统可自主理解目标、调用工具、执行代码正在革新软件工程与科学计算领域。本文提出智能体可大幅提升数据中心控制平面策略研发效率扩充人类可探索的优化空间让工程师聚焦问题定义与结果评判而非手工调参。但直接使用通用智能体解决调度优化存在三大致命短板无形式化规约目标、约束隐式写在Prompt与自定义适应度函数中未绑定真实业务数据优化过程缺少结构化边界生产环境极易出现仿真达标但线上失效的策略无迁移复用每个任务都需要从零搭建脚手架无法复用过往调度经验搜索范围受限全部候选方案由LLM生成继承模型固有偏见仅能探索极小一片设计空间快速收敛局部最优。本文核心工作本文设计AtumAI规范化智能体框架工程师自然语言描述需求框架全自动生成、评测、迭代验证控制平面策略支持负载、硬件持续变化下的数据中心自演化。框架核心两大创新组件数据中心任务编译器将需求编译为标准化、可校验中间表示IR实现问题形式化配套共享优化算子库实现跨任务知识迁移进化式设计迭代环突破LLM单一生成局限扩散模型探索策略结构、进化算法优化参数、代理模型提前筛除劣质方案实现系统化全域搜索。三大评测场景效果负载部署对比人工基线部署成功率提升17%调度吞吐提升8%资源弹性扩缩资源使用成本降低24%SLA违规率仅1.3%功耗管理集群功耗下降21%业务吞吐同步提升17%。三类场景共用同一套Atum流水线无需定制改造策略设计周期从数月压缩至数小时跨领域调度经验可完全复用。本文四大核心贡献提出AtumAI框架实现自然语言需求到可用数据中心控制策略的全自动智能体流水线设计数据中心任务编译器将自然语言意图转化绑定真实负载、硬件的可检索、机器校验IR规约提出进化式设计迭代环融合扩散结构搜索、进化参数调优、代理预过滤突破LLM搜索边界在负载部署、资源扩缩、功耗管理三大典型数据中心任务完成全量实验验证框架通用性与性能优势。2 背景与动机2.1 数据中心控制平面控制平面是管理服务器、CPU、内存、功耗等硬件资源的软件集合由多套独立策略组成每套策略包含决策变量、优化目标、硬约束、业务评测负载四大统一要素。本文全程使用三类典型策略作为示例负载部署策略Borg/Protean等集群调度器决策每个虚拟机/服务运行节点权衡服务器利用率、部署成功率、业务尾延迟、调度器自身吞吐约束为节点CPU/内存容量、服务共存限制。传统方案依赖数十年手工启发式规则负载迭代后性能持续衰减。资源弹性扩缩策略Autopilot自动扩缩容系统动态调整服务CPU、内存配额权衡资源开销与流量峰值下SLA违规风险结合时序预测、反馈控制与人工安全阈值。集群功耗管理Dynamo、Thunderbolt统一分配整机功耗预算通过功耗超配提升硬件利用率约束为单服务精度下限、整机功耗上限。人工策略的固有缺陷软硬件规模持续扩张策略优化空间组合爆炸单套候选策略原型、仿真、上线验证周期长达数月策略上线后随负载、硬件迭代性能持续退化无法自适应变化。亟需自动化方案输入高层优化目标全自动生成适配当前集群调度策略。该方案需要两大能力将自然语言意图转化绑定真实集群硬件、负载的精准数学规约大范围搜索优质策略不局限于人类专家的启发式思路。智能体AI为上述能力提供落地路径。2.2 智能体系统与现有相关工作1传统机器学习调度优化LLM智能体出现前各类独立ML模型被用于单一场景优化分支预测、缓存替换、芯片布局、资源扩缩但每个场景都需要独立定制模型与训练流水线无法跨任务复用。2LLM代码生成、软件智能体MetaGPT、SWE-agent等多智能体框架通过测试反馈完成代码纠错但仅聚焦功能正确性ECO-LLM基于反模式重构代码仅面向狭义性能优化无法处理多约束数据中心调度问题。3内核/算子智能进化框架KernelEvolve、AI CUDA Engineer等工具迭代优化计算内核仅单目标性能调优而数据中心策略存在多冲突目标大量硬性约束无法直接复用。4LLM驱动进化搜索AlphaEvolve、SkyDiscover通过LLM变异代码、适应度筛选迭代但存在两大致命局限所有候选均由LLM生成搜索空间狭窄容易局部最优每个新任务需要人工编写适应度函数、搭建仿真脚手架把自然需求转为约束优化的专家步骤无法自动化。现有方案三大缺失无形式化绑定业务的规约、无跨任务知识迁移、仅LLM单一搜索源本文AtumAI完整补齐三点。3 AtumAI整体架构AtumAI单条完整流水线自然语言需求 → 数据中心任务编译器 → 可执行搜索问题 → 进化式设计迭代环 → 验证通过的最优控制策略两大核心模块前端数据中心任务编译器将非正式意图形式化为统一中间表示IR实现知识可迁移最终输出可执行搜索任务后端进化式设计迭代环系统化全域搜索输出满足全部IR约束的最优策略迭代环输出评测反馈回传编译器形成闭环持续优化。运行示例贯穿全文案例需求在不提升延迟的前提下最小化服务资源占用资源扩缩场景固定服务器硬件、附带历史流量追踪p99延迟≤50ms硬SLA约束编译器自动将模糊需求转化完整形式IR规约迭代环全域搜索扩缩控制器策略。4 数据中心任务编译器现有智能体将问题定义藏在Prompt、手写适应度函数中目标约束隐式表达经验无法复用。编译器通过三大设计解决该问题形式化自然语言意图转为显式IR规约决策变量、目标、约束、评测方法可迁移共享优化算子库单任务学到的调度逻辑跨场景复用系统化搜索前置将IR规约转化结构清晰的可执行优化问题。编译器三阶段执行流程意图提升自然语言需求转为标准化形式IR算子投射从共享库选取适配优化算子绑定当前场景变量下编译IR规约输出完整可执行搜索任务参数空间、生成器、代理模型、高精度仿真器。4.1 意图提升自然语言转形式规约输入工程师文字需求 可选工件负载追踪、部署配置、历史策略输出基础未绑定IR规约分两步执行意图解析智能体识别调度决策、优化目标、隐含硬约束规则校验器非LLM确定性校验规约完整性缺失信息自动反问工程师空白值从领域标准模板填充保证简短需求也能生成完整规约。校验器强制IR类型规范变量定义域、约束可观测、单位统一拒绝非法规约。负载与硬件特征挖掘自动拉取集群真实流量、硬件上限数据绑定IR优化搜索不再基于抽象假设全部贴合真实线上环境。4.2 中间表示IR统一标准规约所有数据中心调度任务共用同一份IR结构作为编译器与迭代环的标准接口包含六大核心字段示例如下task_type:resource scaling# 决策变量控制器可调参数decision_variables:replicas:int in[1,12]cpu_limit:float in[0.5,4.0]# CPU核心数mem_limit:float in[0.5,8.0]# 内存GB# 优化目标支持多目标优先级objectives:minimize allocated_resources# 优先级1.0# 硬性约束绝对不可违反constraints:p99_latency_ms \leq 50 cooldown \geq 1 interval# 评测规范evaluation:simulator autoscaling_evaluator trace mined_load(service) metrics {p99_latency,resources,slo_violation_rate}# 执行预算策略推理时延上限execution_budget:classloose interval30s modefull# 绑定真实集群特征characterization:load profile,latency-vs-alloc curve,platform limits决策变量策略可调整参数与取值空间目标多优化方向优先级不强制合并为单一标量硬约束任何候选策略违反即直接淘汰评测方法固定仿真器、负载追踪、观测指标保证所有方案可复现对比执行预算策略在线推理最大时延约束策略复杂度特征绑定自动挖掘的集群负载、硬件数据。4.3 可迁移控制知识共享优化算子库形式IR描述优化目标但不包含实现调度逻辑的方法编译器维护全局共享优化算子库实现跨任务知识迁移。算子库结构单个优化算子抽象调度逻辑包含4部分适用条件、需满足目标、领域适配投射公式、历史置信度。示例算子突发流量预警防护抽象公式压力 f(流量趋势, 队列深度, SLA风险)适配负载部署场景转化为主机剩余容量打分公式适配资源扩缩场景转化为扩容触发压力指标算子筛选三步流程过滤仅保留匹配IR适用条件算子打分算子描述与IR目标匹配度排序覆盖贪心选择最小算子集合完整覆盖全部IR约束/目标。算子投射机制抽象公式绑定当前场景真实观测指标生成领域专属调度项同一套预警算子无需重新开发直接复用在部署、扩缩两类完全不同任务。Figure3抽象算子跨领域投射示例4.4 下编译IR转为可执行搜索任务输入IR与筛选后的优化算子输出四件套搜索工件参数空间所有算子阈值、变量取值范围候选生成器基于算子库初始化初始策略代理预评估模型低成本预测策略指标减少高精度仿真次数高精度仿真器基于挖掘的真实负载搭建评测环境。评估栈设计代理模型编译器根据IR指标、负载特征自动构建迭代过程持续重训练提前筛除劣质候选仿真器扩展IR所需观测指标完整复刻线上集群环境。完整编译算法算法1输入自然语言需求r目标领域d算子库L 1. ir Raise(r) # 意图提升挖掘负载硬件特征 2. 标准化校验IR空白填充领域模板 3. P SelectPasses(ir, L) # 筛选适配优化算子 4. 遍历所有算子p∈P tp Project(p, d) # 投射为领域专属公式 5. 遍历IR所需但无匹配算子的目标 生成安全DSL原语校验硬件是否支持 6. prob Bind(ir, {tp}) # 绑定生成完整搜索任务 7. 根据IR执行预算裁剪搜索规模 8. 返回可执行搜索任务prob4.5 开放世界扩展机制算子库无法覆盖全部全新调度逻辑时编译器生成安全公式DSL原语仅基础四则运算无可执行代码若仿真器缺少所需观测指标标记能力缺口后续迭代完善。4.6 证据驱动算子库演化每次迭代的评测结果更新算子置信度负收益算子自动降低筛选优先级每完成一类任务新增算子入库后续所有任务均可复用知识持续累积。5 进化式设计迭代环编译器输出搜索任务后迭代环完成全域系统化搜索单LLM仅能探索局部空间迭代环通过结构扩散参数进化双向拓展候选范围搭配代理预过滤降低仿真开销。单次迭代5阶段生成种子 → 结构/参数扩展 → 代理过滤 → 高精度仿真验证 → 反馈迭代。Figure4迭代环五阶段完整流程 ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/b8e2be30c4f242c5a4bd73047584e64c.png)5.1 Generate种子策略生成迭代首轮初始化种子LLM结合算子库、历史成功/失败案例生成基础可行策略不限制单一模型多条种子并行生成错误方案不阻塞流程。5.2 Expand双向全域扩展基于少量种子生成海量差异化候选分两条扩展路径结构扩散离散扩散模型掩码策略局部模块打分逻辑、安全阈值仅重生成掩码区域保留有效逻辑约束编辑边界仅修改指定片段避免破坏已有可行逻辑可融合多条最优策略的优势结构。实现层面用LLM完成掩码重写拒绝越界修改。参数进化算法对同一策略结构高斯扰动阈值、窗口、容量等数值参数搭配模拟退火局部寻优允许临时变差跳出局部最优全部参数调整通过代理模型预打分不占用高精度仿真资源。Figure5种子双向扩展代理过滤流程5.3 Filter代理模型低成本预筛选扩展后候选数量巨大无法全部仿真代理模型快速预测所有指标带置信区间基于探索感知打分筛选高价值方案。打分规则综合预测收益、不确定性奖励、失败修复增益、新颖度淘汰重复劣质方案配额制预留小众、高不确定候选避免最优方案被过滤。代理模型实现高斯过程树集成融合回归器输入策略结构特征、负载场景输出多指标预测每轮仿真数据增量重训练预测精度持续提升。5.4 评估与校验过滤后少量候选送入全量高精度仿真覆盖稳态、突发、碎片多类负载场景避免策略过拟合单一流量强制校验全部IR硬约束只要一项违规直接淘汰持续校验代理预测准确度防止过滤失效。5.5 反馈与迭代仿真结果生成结构化反馈约束违规场景、最优对比样本反馈指导下一轮种子生成、扩散掩码选取本轮最优/最差策略存入算子库作为正负样本跨任务复用经验。单次迭代完整算法算法2输入搜索任务S上轮最优父策略P代理模型M历史反馈B算子库L 1. seeds Generate(S, L, B) # 算子库引导生成种子 2. cand Diffuse(P∪seeds) ∪ Mutate(P∪seeds) ∪ Anneal(P∪seeds) 3. pool P ∪ seeds ∪ cand 4. ranked Rank(pool, M) # 代理不确定性打分排序 5. filter Select(ranked) # 配额筛选少量候选 6. rows Simulate(filter) # 多负载高精度仿真剔除违规方案 7. M Refit(M) # 增量重训练代理模型 8. P ParetoParents(rows) # 帕累托最优作为下轮父策略 9. B Failures(rows) # 记录约束违规反馈 10. 更新算子库存入本轮最优/最差策略 11. 返回本轮验证通过最优策略6 多场景案例实验三大独立数据中心调度任务负载部署、资源弹性扩缩、功耗管理每个场景人工专家基线为线上成熟调度系统评测指标归一化基线分数1.0迭代环默认使用Claude Opus 4.8同时测试多款LLM鲁棒性。6.1 场景1虚拟机负载部署任务定义90台服务器集群Azure真实VM流量追踪优化目标最大化部署成功率、调度吞吐降低CPU热点硬约束CPU/内存容量、服务共存隔离基线为工业界Best-Fit装箱调度器。评测指标VMScore 0.5部署成功率 0.2调度吞吐 0.2 P50热点惩罚 0.1 P99热点惩罚实验结果AtumAI综合得分1.13倍基线部署成功率17%调度吞吐8%热点负载无恶化。核心创新策略谐波CPU/内存剩余容量打分预留未来部署空间拓扑分组筛选主机大幅降低单轮调度计算开销消融结论仅LLM仅1.01倍增加扩散进化至1.05完整反馈闭环提升至1.13反馈是核心增益来源更换Gemini等其他LLM依旧稳定超越基线。Figure6 负载部署实验曲线得分迭代、消融、LLM敏感性6.2 场景2服务资源弹性扩缩任务定义100微服务共享30节点阿里真实多模式流量稳态/突发/趋势目标最小分配资源硬约束p99延迟SLO基线为阈值式被动扩缩控制器。指标0.5 SLA质量 0.5资源成本归一化基线实验结果综合得分1.27倍基线资源开销降低24%SLA违规率仅1.3%。核心创新策略区分扩容/缩容预测窗口高风险服务优先分配资源低压力场景缩容避免震荡。消融纯LLM 1.16扩散进化1.21完整反馈闭环1.27多款大模型均稳定1.20以上鲁棒性强。Figure7 资源扩缩实验图表6.3 场景3LLM推理集群功耗管理任务定义960服务器大模型推理集群Azure线上两周流量目标同等功耗下提升吞吐硬约束单服务精度≥0.9基线为固定大模型高功耗调度策略。指标0.4功耗优化 0.3精度 0.2吞吐实验结果综合得分1.31倍基线功耗下降21%吞吐提升17%所有服务精度达标。核心策略差异化模型尺寸分配低精度负载使用小模型功耗导向流量路由。消融仅LLM等于基线结构扩散提升至1.14完整迭代环1.31轻量化LLM依旧可达1.28倍。Figure8 功耗管理实验图表6.4 数据中心任务编译器价值消融实验设置6组对比仅LLM、手写IR、IR人工提示、无知识迁移完整编译器、单轮编译器、完整Atum编译器。纯LLM无合法满足约束策略得分0手写IR仅82%-93%完整系统性能IR提示92%-96%关闭算子知识迁移性能下降3.6%-4%单轮编译器不迭代优化性能下降1.2%-3.2%结论自动挖掘负载硬件跨任务算子迁移是Atum核心收益来源仅靠LLM或人工规约无法产出线上可用策略。Figure9 编译器消融柱状图7 结论人工设计数据中心控制平面策略难以匹配软硬件迭代速度现有通用智能体存在非形式化、无迁移、搜索范围窄三大缺陷。本文提出AtumAI数据中心任务编译器将自然语言需求转为绑定真实业务的形式化IR实现跨任务调度知识迁移进化式设计迭代环融合扩散结构搜索、进化调参、代理预过滤实现全域系统化策略搜索在负载部署、资源扩缩、功耗管理三类典型数据中心任务验证统一流水线生成策略全面超越人工专家基线将数月策略研发周期压缩至数小时。未来可基于Atum构建持续自适应、全自动演化的数据中心调度系统。论文资源链接论文HTML原文https://arxiv.org/html/2608.02569v1arXiv论文PDFhttps://arxiv.org/pdf/2608.02569v1配套仿真测试工具VLMEvalKit同类数据中心评测框架文中提及实验负载数据集Azure Public Dataset V2、阿里微服务追踪数据集开源下载地址见参考文献