
北京时间 2026 年 8 月 26 日,Kubernetes 社区正式发布 Kubernetes v1.37,版本代号为Garhwal。
本次版本共包含67 项增强:
16 项功能升级至 Stable; 23 项功能升级至 Beta; 27 项功能进入 Alpha; 1 项弃用或移除变更。
Kubernetes v1.37 的重点集中在 AI/机器学习工作负载、资源调度、集群稳定性、安全隔离、存储管理和运维体验等方向。
一、HPA 支持工作负载缩容至零
在 Kubernetes v1.37 中,HorizontalPodAutoscaler(HPA)缩容至零的能力升级至 Beta,并默认启用。
对于队列消费者、批处理任务和 GPU 工作负载,当系统处于空闲状态时,HPA 可以将 Pod 数量缩减到 0;当外部指标或对象指标再次出现工作负载时,再自动恢复 Pod。
该能力适用于:
消息队列消费者; 定时或批量处理任务; AI 推理服务; 低频访问的后台服务; 按需运行的计算任务。
需要注意的是,基于 CPU 和内存指标无法实现缩容至零,因为这些指标依赖正在运行的 Pod。该功能主要面向外部指标和对象指标场景。
二、Gang Scheduling 升级至 Beta
随着 Kubernetes 承载越来越多 AI/ML 训练任务和 HPC 作业,多个 Pod 必须同时获得资源才能运行的场景越来越普遍。
传统调度方式会逐个调度 Pod,可能出现部分 Pod 已经运行、剩余 Pod 一直等待资源的情况,最终导致任务无法取得进展。
Kubernetes v1.37 将 Gang Scheduling,也就是组调度能力升级至 Beta。它采用“全部调度或全部等待”的策略,确保一个工作负载所需的 Pod 能够整体获得资源。
该能力可以改善:
分布式 AI 训练; 大规模模型推理; HPC 科学计算; 分布式批处理; 多 Pod 紧密协作的工作负载。
同时,v1.37 还引入了面向工作负载的抢占和 PodGroup 排队机制,减少无效抢占和多个任务之间反复争抢资源的问题。
三、DRA 能力进一步成熟
Dynamic Resource Allocation(DRA)是 Kubernetes 面向 GPU、NPU、网络设备和其他专用硬件的资源分配机制。
v1.37 中,多项 DRA 能力升级至 Stable,包括:
ResourceClaim 设备状态; 通过 DRA 驱动处理扩展资源请求; 设备 Taint 和 Toleration; 设备 NUMA 节点属性。
这意味着 Kubernetes 可以更细致地管理异构硬件资源。
例如,Pod 可以继续使用传统扩展资源方式请求设备:
resources: limits: example.com/gpu: 3
同时由 DRA 驱动完成设备分配,而不一定需要单独部署传统 Device Plugin。
对于 AI 基础设施团队而言,这将有助于实现更灵活的 GPU 调度、设备隔离和 NUMA 感知调度。
四、metrics.k8s.io API 正式进入 Stable
经过近九年的 Beta 阶段,metrics.k8s.io API 在 Kubernetes v1.37 中升级至 Stable。
该 API 为 Kubernetes 提供 Pod 和节点的 CPU、内存使用指标,广泛用于:
kubectl top;HorizontalPodAutoscaler; 集群资源监控; 基础资源利用率分析。
v1.37 不会立即移除 v1beta1,现有工作流可以继续使用。未来 Kubernetes 将逐步以稳定版 v1 API 为主要接口。
这对监控系统、自动扩缩容组件和第三方控制器来说,是一个重要的稳定性信号。
五、API Server 启动和恢复更加稳定
Kubernetes v1.37 完成了 Watch Cache 初始化增强,进一步降低 API Server 启动或恢复期间对 etcd 造成的压力。
在大型集群中,Watch Cache 初始化可能触发大量 List 和 Watch 请求。如果请求同时涌入 etcd,可能导致控制平面出现延迟甚至服务不可用。
v1.37 会对这类请求进行更合理的限制:
避免请求集中冲击 etcd; 控制 API Priority and Fairness 压力; 对无法立即处理的请求返回 HTTP 429; 通过 Retry-After引导客户端重试。
因此,自定义 Controller 和 Operator 应正确处理 HTTP 429,并实现指数退避重试。
六、SELinuxMount 与 SELinuxChangePolicy 升级至 Stable
Kubernetes v1.37 将 SELinuxMount 和 SELinuxChangePolicy 升级至 Stable,并默认启用相关行为。
符合条件的 CSI 驱动可以使用挂载上下文:
-o context=<label>
这种方式可以避免传统的递归重新标记,从而改善部分存储卷挂载场景的性能。
不过,单个挂载只能携带一个 SELinux 上下文。如果多个使用不同 SELinux 标签的 Pod 共享同一个存储卷,升级后可能出现 Pod 无法启动的情况。
启用了 SELinux 的生产集群,升级前应检查:
CSI 驱动是否支持 SELinuxMount; 不同安全标签的 Pod 是否共享存储卷; 存储卷挂载和卸载是否正常; 是否需要为特定工作负载设置 seLinuxChangePolicy: Recursive。
未启用 SELinux 的集群通常不会受到影响。
七、StorageVersionMigration API 升级至 Stable
Kubernetes v1.37 将 StorageVersionMigration API 升级至 Stable,并默认启用。
当 API 版本发生变化,或者存储加密配置需要更新时,集群中的历史资源可能需要重新写入。
过去,管理员通常需要使用脚本执行大量 kubectl get 和 kubectl replace 操作。现在,可以通过声明式的 StorageVersionMigration 对象触发资源迁移,由 Kubernetes 控制器自动完成。
该能力适用于:
API 存储版本升级; CRD 版本迁移; 加密配置更新; 大规模资源重新写入。
这将降低集群升级和 API 演进过程中的运维复杂度。
八、Pod 证书与集群信任包升级至 Stable
Pod Certificates 和 ClusterTrustBundles 在 Kubernetes v1.37 中升级至 Stable。
这为 Pod 提供了更加标准化的证书和信任根分发机制,支持向工作负载提供:
私钥; X.509 证书; 集群信任包; 自动刷新后的身份凭据。
该能力可以用于服务间双向 TLS、工作负载身份认证和集群内部安全通信,减少应用自行管理证书的复杂度。
九、KYAML 正式进入 Stable
KYAML 是 Kubernetes 面向 YAML 配置推出的更加严格、明确的格式子集。
它不是 YAML 的替代品,而是 YAML 的一种更安全、更少歧义的写法。所有 KYAML 文件仍然是合法 YAML,因此现有 kubectl 和大多数 YAML 工具无需改变即可继续使用。
在 v1.37 中:
kubectl get -o kyaml
正式进入 Stable。
对于配置规模较大的团队,KYAML 有助于降低 YAML 隐式类型和格式歧义带来的问题。
十、需要关注的兼容性变化
kube-proxy 的 IPVS 模式进入弃用阶段
Kubernetes v1.37 开始对 kube-proxy 的 IPVS 模式发出弃用警告。
官方后续计划是:
v1.37:开始弃用提示; 预计 v1.40:默认禁用; 预计 v1.43:完全移除。
正在使用 IPVS 模式的集群,应提前评估 nftables 或其他网络方案。
可以通过以下命令检查当前配置:
kubectl -n kube-system get configmap kube-proxy \ -o jsonpath='{.data.config\.conf}' | grep 'mode:'此外,Static Pod 不再允许引用 Secret 或 ConfigMap,仍使用 cgroup v1 的节点也应尽快迁移到 cgroup v2。
Docker 用户如何看待 Kubernetes v1.37?
Docker 负责容器镜像构建、开发环境运行和本地调试,Kubernetes 则负责生产环境中的容器编排、调度、扩缩容和故障自愈。
一个常见工作流是:
使用 Docker 构建应用镜像; 在 Docker 环境中完成容器测试; 使用 Kubernetes 清单或 Helm 部署应用; 通过 Kubernetes 管理生产工作负载; 使用监控、日志和策略系统完成持续运维。
Kubernetes v1.37 对 Docker 用户最直接的影响包括:
更好地支持 AI 和 GPU 工作负载; HPA 可以将部分服务缩容到零; metrics.k8s.io API 更加稳定; 存储和安全能力进一步增强; 集群升级时需要关注 IPVS、SELinux 和 cgroup v2。
升级建议
生产环境升级 Kubernetes v1.37 前,建议重点检查:
容器运行时和 CNI、CSI 插件的兼容性; kube-proxy 是否使用 IPVS; 节点是否仍依赖 cgroup v1; Static Pod 是否引用 Secret 或 ConfigMap; SELinux 与 CSI 存储卷行为; 自定义 Controller 是否能够处理 HTTP 429; 监控系统是否兼容稳定版 metrics API; GPU、NPU 和其他设备插件是否支持 DRA。
建议先在测试集群验证,再采用分批、灰度方式升级生产环境。
结语
Kubernetes v1.37 的正式发布,标志着 Kubernetes 在 AI 工作负载、异构资源调度、集群稳定性和安全隔离方面继续向前推进。
其中,HPA 缩容至零、Gang Scheduling、DRA 稳定化、metrics.k8s.io API GA、StorageVersionMigration GA,以及 Pod 证书能力,都是值得平台工程团队重点关注的变化。
对于 Docker 用户来说,Kubernetes v1.37 不只是一次版本升级,更是从容器运行走向智能调度、统一资源管理和平台化交付的重要一步。
官方参考资料:
Kubernetes v1.37 正式发布公告 https://kubernetes.io/blog/2026/08/26/kubernetes-v1-37-release/
Kubernetes v1.37 官方版本页面 https://kubernetes.io/releases/1.37/
Kubernetes v1.37 CHANGELOG https://github.com/kubernetes/kubernetes/blob/master/CHANGELOG/CHANGELOG-1.37.md
Kubernetes 官方博客 https://kubernetes.io/blog/
免责声明:本文部分内容来源于网络,所载内容仅供参考。转载仅为学习和交流之目的,如无意中侵犯您的合法权益,请及时联系Docker中文社区!


发表评论