Kubernetes v1.37 正式发布:67 项增强,AI 调度与平台安全再升级

 Docker君   2026-08-28 18:28   4 人阅读  0 条评论
Kubernetes v1.37 正式发布:67 项增强,AI 调度与平台安全再升级  第1张

北京时间 2026 年 8 月 26 日,Kubernetes 社区正式发布 Kubernetes v1.37,版本代号为Garhwal

本次版本共包含67 项增强

  • 16 项功能升级至 Stable;
  • 23 项功能升级至 Beta;
  • 27 项功能进入 Alpha;
  • 1 项弃用或移除变更。

Kubernetes v1.37 的重点集中在 AI/机器学习工作负载、资源调度、集群稳定性、安全隔离、存储管理和运维体验等方向。

一、HPA 支持工作负载缩容至零

在 Kubernetes v1.37 中,HorizontalPodAutoscaler(HPA)缩容至零的能力升级至 Beta,并默认启用。

对于队列消费者、批处理任务和 GPU 工作负载,当系统处于空闲状态时,HPA 可以将 Pod 数量缩减到 0;当外部指标或对象指标再次出现工作负载时,再自动恢复 Pod。

该能力适用于:

  • 消息队列消费者;
  • 定时或批量处理任务;
  • AI 推理服务;
  • 低频访问的后台服务;
  • 按需运行的计算任务。


需要注意的是,基于 CPU 和内存指标无法实现缩容至零,因为这些指标依赖正在运行的 Pod。该功能主要面向外部指标和对象指标场景。

二、Gang Scheduling 升级至 Beta

随着 Kubernetes 承载越来越多 AI/ML 训练任务和 HPC 作业,多个 Pod 必须同时获得资源才能运行的场景越来越普遍。

传统调度方式会逐个调度 Pod,可能出现部分 Pod 已经运行、剩余 Pod 一直等待资源的情况,最终导致任务无法取得进展。

Kubernetes v1.37 将 Gang Scheduling,也就是组调度能力升级至 Beta。它采用“全部调度或全部等待”的策略,确保一个工作负载所需的 Pod 能够整体获得资源。

该能力可以改善:

  • 分布式 AI 训练;
  • 大规模模型推理;
  • HPC 科学计算;
  • 分布式批处理;
  • 多 Pod 紧密协作的工作负载。

同时,v1.37 还引入了面向工作负载的抢占和 PodGroup 排队机制,减少无效抢占和多个任务之间反复争抢资源的问题。

三、DRA 能力进一步成熟

Dynamic Resource Allocation(DRA)是 Kubernetes 面向 GPU、NPU、网络设备和其他专用硬件的资源分配机制。

v1.37 中,多项 DRA 能力升级至 Stable,包括:

  • ResourceClaim 设备状态;
  • 通过 DRA 驱动处理扩展资源请求;
  • 设备 Taint 和 Toleration;
  • 设备 NUMA 节点属性。

这意味着 Kubernetes 可以更细致地管理异构硬件资源。

例如,Pod 可以继续使用传统扩展资源方式请求设备:

resources:  limits:    example.com/gpu: 3

同时由 DRA 驱动完成设备分配,而不一定需要单独部署传统 Device Plugin。

对于 AI 基础设施团队而言,这将有助于实现更灵活的 GPU 调度、设备隔离和 NUMA 感知调度。

四、metrics.k8s.io API 正式进入 Stable

经过近九年的 Beta 阶段,metrics.k8s.io API 在 Kubernetes v1.37 中升级至 Stable。

该 API 为 Kubernetes 提供 Pod 和节点的 CPU、内存使用指标,广泛用于:

  • kubectl top;

  • HorizontalPodAutoscaler;
  • 集群资源监控;
  • 基础资源利用率分析。

v1.37 不会立即移除 v1beta1,现有工作流可以继续使用。未来 Kubernetes 将逐步以稳定版 v1 API 为主要接口。

这对监控系统、自动扩缩容组件和第三方控制器来说,是一个重要的稳定性信号。

五、API Server 启动和恢复更加稳定

Kubernetes v1.37 完成了 Watch Cache 初始化增强,进一步降低 API Server 启动或恢复期间对 etcd 造成的压力。

在大型集群中,Watch Cache 初始化可能触发大量 List 和 Watch 请求。如果请求同时涌入 etcd,可能导致控制平面出现延迟甚至服务不可用。

v1.37 会对这类请求进行更合理的限制:

  • 避免请求集中冲击 etcd;
  • 控制 API Priority and Fairness 压力;
  • 对无法立即处理的请求返回 HTTP 429;
  • 通过 Retry-After 引导客户端重试。

因此,自定义 Controller 和 Operator 应正确处理 HTTP 429,并实现指数退避重试。

六、SELinuxMount 与 SELinuxChangePolicy 升级至 Stable

Kubernetes v1.37 将 SELinuxMount 和 SELinuxChangePolicy 升级至 Stable,并默认启用相关行为。

符合条件的 CSI 驱动可以使用挂载上下文:

-o context=<label>

这种方式可以避免传统的递归重新标记,从而改善部分存储卷挂载场景的性能。

不过,单个挂载只能携带一个 SELinux 上下文。如果多个使用不同 SELinux 标签的 Pod 共享同一个存储卷,升级后可能出现 Pod 无法启动的情况。

启用了 SELinux 的生产集群,升级前应检查:

  • CSI 驱动是否支持 SELinuxMount;
  • 不同安全标签的 Pod 是否共享存储卷;
  • 存储卷挂载和卸载是否正常;
  • 是否需要为特定工作负载设置 seLinuxChangePolicy: Recursive

未启用 SELinux 的集群通常不会受到影响。

七、StorageVersionMigration API 升级至 Stable

Kubernetes v1.37 将 StorageVersionMigration API 升级至 Stable,并默认启用。

当 API 版本发生变化,或者存储加密配置需要更新时,集群中的历史资源可能需要重新写入。

过去,管理员通常需要使用脚本执行大量 kubectl get 和 kubectl replace 操作。现在,可以通过声明式的 StorageVersionMigration 对象触发资源迁移,由 Kubernetes 控制器自动完成。

该能力适用于:

  • API 存储版本升级;
  • CRD 版本迁移;
  • 加密配置更新;
  • 大规模资源重新写入。

这将降低集群升级和 API 演进过程中的运维复杂度。

八、Pod 证书与集群信任包升级至 Stable

Pod Certificates 和 ClusterTrustBundles 在 Kubernetes v1.37 中升级至 Stable。

这为 Pod 提供了更加标准化的证书和信任根分发机制,支持向工作负载提供:

  • 私钥;
  • X.509 证书;
  • 集群信任包;
  • 自动刷新后的身份凭据。

该能力可以用于服务间双向 TLS、工作负载身份认证和集群内部安全通信,减少应用自行管理证书的复杂度。

九、KYAML 正式进入 Stable

KYAML 是 Kubernetes 面向 YAML 配置推出的更加严格、明确的格式子集。

它不是 YAML 的替代品,而是 YAML 的一种更安全、更少歧义的写法。所有 KYAML 文件仍然是合法 YAML,因此现有 kubectl 和大多数 YAML 工具无需改变即可继续使用。

在 v1.37 中:

kubectl get -o kyaml

正式进入 Stable。

对于配置规模较大的团队,KYAML 有助于降低 YAML 隐式类型和格式歧义带来的问题。

十、需要关注的兼容性变化

kube-proxy 的 IPVS 模式进入弃用阶段

Kubernetes v1.37 开始对 kube-proxy 的 IPVS 模式发出弃用警告。

官方后续计划是:

  • v1.37:开始弃用提示;
  • 预计 v1.40:默认禁用;
  • 预计 v1.43:完全移除。

正在使用 IPVS 模式的集群,应提前评估 nftables 或其他网络方案。

可以通过以下命令检查当前配置:

kubectl -n kube-system get configmap kube-proxy \  -o jsonpath='{.data.config\.conf}' | grep 'mode:'

此外,Static Pod 不再允许引用 Secret 或 ConfigMap,仍使用 cgroup v1 的节点也应尽快迁移到 cgroup v2。

Docker 用户如何看待 Kubernetes v1.37?

Docker 负责容器镜像构建、开发环境运行和本地调试,Kubernetes 则负责生产环境中的容器编排、调度、扩缩容和故障自愈。

一个常见工作流是:

  1. 使用 Docker 构建应用镜像;
  2. 在 Docker 环境中完成容器测试;
  3. 使用 Kubernetes 清单或 Helm 部署应用;
  4. 通过 Kubernetes 管理生产工作负载;
  5. 使用监控、日志和策略系统完成持续运维。

Kubernetes v1.37 对 Docker 用户最直接的影响包括:

  • 更好地支持 AI 和 GPU 工作负载;
  • HPA 可以将部分服务缩容到零;
  • metrics.k8s.io API 更加稳定;
  • 存储和安全能力进一步增强;
  • 集群升级时需要关注 IPVS、SELinux 和 cgroup v2。

升级建议

生产环境升级 Kubernetes v1.37 前,建议重点检查:

  • 容器运行时和 CNI、CSI 插件的兼容性;
  • kube-proxy 是否使用 IPVS;
  • 节点是否仍依赖 cgroup v1;
  • Static Pod 是否引用 Secret 或 ConfigMap;
  • SELinux 与 CSI 存储卷行为;
  • 自定义 Controller 是否能够处理 HTTP 429;
  • 监控系统是否兼容稳定版 metrics API;
  • GPU、NPU 和其他设备插件是否支持 DRA。

建议先在测试集群验证,再采用分批、灰度方式升级生产环境。

结语

Kubernetes v1.37 的正式发布,标志着 Kubernetes 在 AI 工作负载、异构资源调度、集群稳定性和安全隔离方面继续向前推进。

其中,HPA 缩容至零、Gang Scheduling、DRA 稳定化、metrics.k8s.io API GA、StorageVersionMigration GA,以及 Pod 证书能力,都是值得平台工程团队重点关注的变化。


对于 Docker 用户来说,Kubernetes v1.37 不只是一次版本升级,更是从容器运行走向智能调度、统一资源管理和平台化交付的重要一步。

官方参考资料:

  • Kubernetes v1.37 正式发布公告

    https://kubernetes.io/blog/2026/08/26/kubernetes-v1-37-release/

  • Kubernetes v1.37 官方版本页面

    https://kubernetes.io/releases/1.37/

  • Kubernetes v1.37 CHANGELOG

    https://github.com/kubernetes/kubernetes/blob/master/CHANGELOG/CHANGELOG-1.37.md

  • Kubernetes 官方博客

    https://kubernetes.io/blog/


免责声明:本文部分内容来源于网络,所载内容仅供参考。转载仅为学习和交流之目的,如无意中侵犯您的合法权益,请及时联系Docker中文社区!



Kubernetes v1.37 正式发布:67 项增强,AI 调度与平台安全再升级  第2张
本文地址:https://kubernetes.top/?id=465
版权声明:本文为原创文章,版权归 Docker君 所有,欢迎分享本文,转载请保留出处!
NEXT:已经是最新一篇了

 发表评论


表情

还没有留言,还不快点抢沙发?