Kubernetes SIG Node 2025 年度报告深度解读:33/32/35 个 KEP 背后的节点技术演进

发布时间:2026/9/16 23:41:48
Kubernetes SIG Node 2025 年度报告深度解读:33/32/35 个 KEP 背后的节点技术演进 Kubernetes SIG Node 2025 年度报告深度解读33/32/35 个 KEP 背后的节点技术演进【免费下载链接】communityKubernetes Community Documentation项目地址: https://gitcode.com/GitHub_Trending/com/community本文基于 Kubernetes Community 仓库中 SIG Node 2025 年度报告 展开系统梳理 SIG Node 在 v1.33、v1.34、v1.35 三个发布周期内的 KEP 成果、子项目与工作组变动、社区运营状态并补充以仓库内治理文档、章程与源码侧资料作为佐证。读完本文你可以掌握 SIG Node 2025 年的整体技术版图DRA、CPU/内存管理器、推理服务等主线并能按阶段检索每一个 Alpha/Beta/Stable 特性的用途与发布版本作为跟踪 Kubernetes 节点侧新功能的速查手册。一、2025 年概览持续刷新纪录的 KEP 数量与项目健康度SIG Node 长期是 Kubernetes 各 SIG 中单版本合并 KEP 数量最多的 SIG。2025 年这一势头不仅延续而且超越了 2024 年的速度发布周期合并 KEP 数v1.3333v1.3432v1.3535作为对比2024 年报告见 sig-node/annual-report-2024.md显示 v1.30/v1.31/v1.32 分别推进了 13/16/17 个 KEP——2025 年几乎翻倍。报告明确指出大量长期处于 Alpha/Beta 的 KEP 在这一年转入 StableGA体现了 SIG 整体收敛 KEP、稳定项目的宏观策略。SIG Node 的工作范围覆盖 Pod 与宿主机资源之间的受控交互包括 kubelet 及其特性、Pod/Node API 行为、节点控制器、节点级资源管理、容器运行时、设备管理、镜像管理等详见 sig-node/charter.md 与 sig-node/README.md 的 Scope 与 Goals 部分。这也是其 KEP 数量常年居高不下的原因——几乎所有涉及节点上发生什么的改动都会落到这里。二、年度工作主线DRA、推理服务与资源管理器报告提炼了 2025 年的几条核心主线DRADynamic Resource Allocation动态资源分配SIG 将大量精力投入 DRA 的成熟化包括结构化参数转 Stable、扩展 PodResources API 暴露 DRA 分配的资源、资源健康状态写入 Pod Status、资源声明的设备状态标准化等对应 KEP 4381、3695、4680、4817。推理inference服务场景多个特性直接服务于大模型推理/训练负载例如 OCI 镜像作为卷源挂载模型文件、节点声明特性、容器停止信号等。CPU 与内存管理器SMT 感知策略、跨 NUMA 分发 CPU 的策略选项、UnCoreCache 拓扑感知拆分、严格 CPU 预留等一批 CPUManager 特性在这一年转 Stable内存管理器相关能力也持续演进。从仓库结构看DRA 与资源管理相关资产集中在resource-management子项目下涉及kubernetes/kubernetes中的 resourceclaim 控制器、调度器 dynamicresources 插件、DRA 相关 staging 库与 e2e 测试等见 sig-node/README.md 的 Subprojects 一节印证了报告所述的工作重心。KEP Wrangler 机制的延续与演进KEP WranglerKEP 协调人机制始于 2024 年用于缓解 SIG Node 因 KEP 数量过多而产生的遗漏与延期问题。2025 年该机制继续运转并被报告认定为 SIG 高产出与高速度的重要支撑之一同时也成为贡献者站出来当 leader的机会——特别致谢 Sreeram Venkitesh 接任 Wrangler Lead 一职。Wrangler 的具体职责、关键时间节点PRR Freeze、Enhancements Freeze、Code/Test Freeze、Docs Freeze、状态汇报模板与每周 KEP 指标模板完整记录在 sig-node/sig-node-kep-wrangler-program.md 中职责引导贡献者走完 KEP 流程、把阻塞问题升级给 SIG 负责人、确保有人对接 release 与 docs 团队关键截止点以 release 团队设定的四个 Freeze 为节点逐项跟进汇报模板按 Deadline 汇报时使用 已跟踪 / 等待外部动作 / 存在风险 / 顺延到下个版本 四种状态每周例会前按阶段Alpha/Beta/Stable/Deprecation与状态Tracked/At risk/Removed发布指标。三、Alpha 阶段新特性v1.33 – v1.352025 年共有 8 个 KEP 进入 Alpha全部落在 v1.33–v1.35 之间KEP 编号特性目标版本4188新的 kubelet gRPC API返回本地 Pod 信息端点v1.354960容器停止信号Container Stop Signalsv1.335328节点声明特性Node Declared Featuresv1.355394基于 PSI 的节点状态Node Conditionsv1.345419Pod 级资源原地扩容In-Place Pod-Level Resources Resizev1.355526Pod 级资源管理器Pod-Level Resource Managersv1.355532容器退出时重启全部容器Restart All Containers on Container Exitsv1.355607允许 HostNetwork Pod 使用 User Namespacesv1.35值得注意的几点4188延续了 2024 年 kubelet Pod readiness API 的工作该 KEP 在 2024 报告中被列为 v1.31 Stable2025 年以新的 gRPC API 形式进入 Alpha为节点上基础负载就绪信号提供更清晰的来源5394 与 4205Beta共同构成了基于 PSIPressure Stall Information的节点压力可观测体系前者把 PSI 数据转化为节点条件后者把 PSI 指标暴露给监控系统5419 与 5526是 Pod 级资源弹性方向的新探索与已转 Stable 的 1287Pod 资源原地更新形成递进关系——先支持原地更新再扩展 Pod 级资源计算与管理的灵活性。四、Beta 阶段特性v1.33 – v1.352025 年有 16 个 KEP 进入 BetaKEP 编号特性目标版本127支持 User Namespacesv1.352033kubelet Rootless 模式v1.352371无 cAdvisor、纯 CRI 的容器与 Pod 统计v1.352535确保镜像使用 Secret 拉取Ensure Secret Pulled Imagesv1.352837Pod 级资源规格KEP Template 主线v1.342862细粒度 kubelet API 授权v1.333695扩展 PodResources API纳入 DRA 分配的资源v1.343721支持 env 文件Support for env filesv1.354205暴露 PSI 指标v1.344265新增 ProcMount 选项v1.334680为 Device Plugin 与 DRA 在 Pod Status 中增加资源健康状态v1.354742通过 Downward API 暴露节点拓扑v1.354800拆分 CPUManager 的 UnCoreCache 拓扑感知v1.345307容器重启策略Container Restart Policyv1.355573移除 cgroup v1 支持v1.355593配置最大 CrashLoopBackOff 延迟v1.35几个值得展开的方向安全隔离主线127/2033/5607User Namespaces 从 2024 年的 v1.30 Alpha 一路走到 v1.35 Betarootless kubelet 也推进到 Beta配合 Alpha 的 HostNetwork User NamespacesKubernetes 的节点与容器隔离边界持续加强可观测性与管理面2371/4205/4742cAdvisor 逐步退出统计链路、PSI 指标外露、节点拓扑经 Downward API 下放说明 SIG Node 正在重构节点数据从哪来、到哪里去的基础管线生命周期控制5307/5593/5532/4960容器重启策略、可配置的 CrashLoopBackOff 上限、容器退出时重启全部容器、容器停止信号共同指向对容器生命周期更细粒度的掌控cgroup v1 退出5573与 2024 年报告提到的cgroup v1 进入维护模式KEP 4569一脉相承2025 年正式进入移除流程。五、Stable 阶段特性v1.33 – v1.3525 个 KEP 转正2025 年最重量级的变化来自 Stable 名单共 25 个 KEP 达到 GAKEP 编号特性目标版本1287Pod 资源原地更新In-place Update of Pod Resourcesv1.352008取证式容器检查点Forensic Container Checkpointingv1.332400节点系统 Swap 支持v1.342625SMT 感知的 CPUManager 策略v1.332902CPUManager 跨 NUMA 分发 CPU 的策略选项v1.353288分离容器 stdout 与 stderr 日志流v1.343619细粒度 SupplementalGroups 控制v1.353673kubelet 并行镜像拉取上限v1.353857递归只读挂载Recursive Read-only Mountsv1.333960Pod 生命周期 Sleep 动作v1.343983kubelet drop-in 配置目录v1.354033从 CRI 发现 cgroup 驱动v1.344176CPUManager 静态策略跨物理 CPU 铺开超线程以利用 CPU 缓存v1.334210kubelet 镜像最大 GC 年龄ImageMaximumGCAgev1.354216按 RuntimeClass 拉取镜像v1.354369允许环境变量中的特殊字符v1.344381DRA 结构化参数v1.344438Pod 终止期间重启 sidecar 容器v1.354540CPUManager 策略选项将 reservedSystemCPUs 限制给系统守护进程与中断处理v1.354622新的 TopologyManager 策略可配置 maxAllowableNUMANodesv1.354639OCI 镜像作为卷源VolumeSourcev1.354817资源声明状态含标准化网络接口数据v1.354818允许 PreStop Hook 的 Sleep 动作取零值v1.345067Pod Generationv1.35753Sidecar 容器v1.33按主题归纳这些 Stable 特性可以看到 2025 年的转正潮集中在四个领域资源调度与拓扑CPU 密集2625、2902、4176、4540、4622、4800Beta覆盖了 CPUManager/TopologyManager 的策略家族——SMT 感知、跨 NUMA 分发、缓存感知铺开、严格 CPU 预留、可调 maxAllowableNUMANodes几乎把节点级 CPU 拓扑优化的主流诉求全部落地DRA 与设备管理4381结构化参数、4817资源声明设备状态与 Beta 的 3695、4680 一起构成 DRA 从分配到状态反馈的闭环AI/推理负载支撑4639OCI 镜像作卷源让模型权重可以独立镜像挂载无需打进业务镜像4216按 RuntimeClass 拉镜像与 3673并行拉取上限优化大规模节点上的镜像分发生命周期与运维体验753sidecar 容器、4438终止时重启 sidecar、3960/4818Sleep 动作、2008容器检查点、2400Swap、3983drop-in 配置、3288日志流分离、3619SupplementalGroups等全面覆盖从 Pod 启动到终止、从取证到配置管理的方方面面。结合仓库资料理解几个代表性 Stable 特性1287Pod 资源原地更新与 Beta 的 2837Pod 级资源规格、Alpha 的 5419Pod 级原地扩容、5526Pod 级资源管理器构成同一能力族。从仓库看该方向与resource-management子项目高度相关涉及kubernetes/kubernetes中 resourceclaim 控制器、调度器 dynamicresources 插件以及 DRA 相关 staging 库见 sig-node/README.md。2008取证式容器检查点检查点/恢复能力由 2025 年新建的 WG Checkpoint Restore 工作组继续推进该 WG 为社区提供 Checkpoint/Restore 集成到 Kubernetes 的集中讨论场所stakeholder 包括 SIG Node、SIG Auth、SIG Scheduling、SIG Apps。3983kubelet drop-in 配置目录简化节点配置管理与 2025 年运营检查中README/sigs.yaml 准确性维护的治理动作相辅相成。六、子项目与工作组变动新子项目node-readiness-controller2025 年 SIG Node 赞助成立了一个全新子项目node-readiness-controller。其背景是为基础节点负载提供更清晰的就绪信号——这类负载需要先表明自己已准备好之后才能开始运行端用户负载。该子项目在 sigs.yaml 中登记Owner 位于kubernetes-sigs/node-readiness-controller。持续运行中的子项目除新成员外以下子项目继续运行完整列表见 sig-node/README.md 的 Subprojects 一节ci-testing、cri-api、cri-client、cri-tools、kernel-module-management、kubelet、node-api、node-feature-discovery、node-problem-detector、resource-management、security-profiles-operator其中ci-testing负责维护 SIG Node 的 e2e 测试健康度、triage 失败用例、提升测试覆盖率与 OS 镜像支持章程见 sig-node/sig-node-ci-testing-group-charter.mdkubelet覆盖kubernetes/kubernetes中cmd/kubelet与pkg/kubelet等核心代码路径是 SIG Node 最核心的代码子项目node-problem-detector对应节点可靠性问题检测与修复这一章程范围内的职责。工作组新增两个、退役一个2025 年新增WG Node Lifecycle探索并改进节点与 Pod 生命周期目标是统一的节点 drain/维护支持与更好的 Pod 中断/终止体验。其 章程 明确了三大优先收敛目标——Declarative Node MaintenanceKEP 4212、EvictionRequest APIKEP 4563、Graceful Node ShutdownKEP 2000并计划提供参考实现控制器、API 校验、核心组件集成与扩展点及 E2E/Conformance 测试WG Checkpoint Restore围绕 Checkpoint/Restore 与 Kubernetes 的集成提供集中讨论平台stakeholder 包括 SIG Node、SIG Auth、SIG Scheduling、SIG Apps。2025 年退役Policy即 archive 目录下的 wg-policy2025 年正式结束运营。持续运行WG Batch、WG Device Management、WG Serving、WG Structured Logging七、社区活动与对外交流2025 年 SIG Node 在两次 KubeCon 上都设有 maintainers track 演讲SIG Node intro and deep diveKubeCon EU 2025maintainers track演讲者包括 Sergey KanzhelevGoogle、Francesco RomaniRed Hat、Peter HuntRed HatKubeCon NA 2025maintainers track演讲者包括 Peter HuntRed Hat、Sergey KanzhelevGoogle、Mrunal PatelRed Hat。SIG 每周例会周二主会议、周三 CI/Triage 会议的议程与纪要、会议录播链接均维护在 sig-node/README.md 的 Meetings 一节是持续跟踪 SIG 动态的入口。八、运营健康检查治理任务的年度闭环报告末尾的 Operational 部分展示了 SIG Node 依照 sig-governance.md 完成的年度治理任务全部勾选完成复核并更新 README.md 的准确性复核并更新 CONTRIBUTING.md复核并更新其他贡献文档如 devel 目录或 contributor guide入口见 contributors/devel/README.md复核并更新 sigs.yaml 中的子项目列表与关联 OWNERS 文件复核 sigs.yaml 中 SIG 领导者chairs、tech leads、子项目 leads的有效性确保 2025 年会议纪要与录播已从 README.md 链接并上传。这套机制保证了高 KEP 产出与治理文档同步并行不悖sigs.yaml 作为社区结构的单一事实来源每次报告周期都会同步刷新sigs.yaml 中可见node-readiness-controller子项目条目即为 2025 年新增。九、总结2025 年 SIG Node 的坐标把 2025 年放在更长的时间轴上看数量层面SIG Node 以 33/32/35 个 KEP 连续三个版本刷新自身纪录继续稳坐单版本合并 KEP 最多 SIG的位置质量层面25 个 KEP 转 Stable、16 个进入 Beta大量长期特性完成收敛项目整体向稳定化倾斜方向层面DRA、推理服务支撑、CPU/内存管理器三条主线清晰且与新建的 WG Node Lifecycle、WG Checkpoint Restore 形成核心 SIG 出能力、工作组聚场景的协同结构组织层面KEP Wrangler 机制从实验走向常规成为贡献者成长与 SIG 效率的双重杠杆。对于希望深入了解或参与 SIG Node 的读者仓库内可直接查阅的资料包括sig-node/README.md会议、领导层、子项目全览、sig-node/charter.md范围与治理、sig-node/sig-node-kep-wrangler-program.mdWrangler 流程、sig-node/sig-node-contributor-ladder.md贡献者成长路径以及本文依据的 sig-node/annual-report-2025.md 原始报告与 2024 年对照报告 sig-node/annual-report-2024.md。各 KEP 的完整设计文档均按编号归档于 kubernetes/enhancements 仓库的keps/sig-node目录可按上文表格中的编号逐一检索。【免费下载链接】communityKubernetes Community Documentation项目地址: https://gitcode.com/GitHub_Trending/com/community创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考