引言

已经上了多云管理平台(CMP)的企业,最近往往会遇到同一个问题:平台把云主机、云盘、VPC 管得很好,但容器集群归容器团队自己管、GPU 归算法团队自己排、账单依旧各算各的。CMP 上线了,割裂却没有真正消除。

原因不在平台没做好,而在过去两三年企业 IT 的资源构成变了。除了 IaaS 资源,现在还有 K8s 集群、容器化应用、中间件与数据库服务,以及一批 GPU 和跑在上面的模型服务。一个只管得住 IaaS 的多云管理平台,管的其实只是企业资源的一部分。

本文讨论的是:当治理对象从 IaaS 扩展到 PaaS 和 AI 算力之后,多云管理平台的能力边界该怎么划、选型该看什么。

一、CMP 的治理对象已经变成三层

今天企业需要统一治理的资源,实际分三层:

三层的共同需求是一致的:统一视图、统一权限、统一计量。差别在于治理粒度——IaaS 管的是“实例”,PaaS 管的是“服务和应用”,AI 层管的是“算力和调用量”。

只覆盖 IaaS 的平台,在后两层会留下治理空白:容器集群谁在用、中间件申请要不要走审批、GPU 算力按什么口径分摊成本——这些问题都需要另建一套机制,多云管理的初衷(消除割裂)就落空了一半。

二、PaaS 层该管什么

PaaS 治理的核心,是把基础服务从“项目式部署”变成“平台化服务”。具体包括:

集群管理:能否一键创建自建 K8s 集群、纳管已有的外部标准 K8s 集群,并做多云多集群的统一管理。企业往往既有自建集群,也有公有云托管集群,统一纳管才谈得上统一治理。

中间件与数据库服务化:数据库、缓存、消息队列这类基础服务,如果每个项目单独部署一套,运维成本会随项目数线性增长。平台化的做法是用 Operator 模式做标准化模板、自动化编排、统一运维,实现按需开通、一键交付。这一项更能体现平台的 PaaS 成熟度。

应用交付:CI/CD 覆盖研发测试全生命周期、应用市场与 Helm 一键部署、灰度发布与回滚。

微服务治理:通过服务网格提供微服务的全生命周期管控。

存储衔接:有状态应用需要稳定的持久化存储,平台要能通过 CSI 对接分布式存储,而不是让容器团队自己解决。

三、AI 算力层该管什么

AI 算力进入企业 IT 后,带来了一类新的治理对象。它和传统资源的差别在于:贵、稀缺、且使用方式不透明。治理要点包括:

算力配额与调度:GPU 能否按部门/项目分配配额,能否按优先级弹性调度,避免少数任务长期占满整卡。

切分与共享:能否把一张物理卡切给多个业务使用(硬件 vGPU 与容器级显存切分两条路径),提升算力使用充分度。

调用计量:这是 AI 治理与传统资源治理差别显眼的一点。传统资源按“实例×时长”计费,AI 服务的实际消耗要看 Token 调用量。没有 Token 级计量,多团队共用模型服务时就无法核算成本。

模型服务治理:哪些模型在线上、版本如何管理、调用是否需要限流熔断、调用日志与内容合规如何留痕。

异构与国产算力:不同品牌 GPU(含国产卡)能否在同一管理面下纳管与监控。

四、统一治理的三条主线

无论治理对象在哪一层,真正把多云管起来靠的是三条贯穿性的能力:

统一视图:资源与容量的统一大屏、运营看板、多 Region 视图——管理者要能一眼看清全局,而不是在多个控制台之间来回切。

统一权限与审计:分权分域、权限委派、操作审计。跨云、跨层的权限如果各成一套,合规留痕就不完整。这一项在事后补齐的成本偏高,建议在选型阶段就压测。

统一计量计费:跨云的成本归集、按部门/项目的预算管控与超额预警、以及计费口径的统一。IaaS 按实例、PaaS 按服务、AI 按 Token,三种口径能否汇总到同一套成本报表,决定了成本治理能不能真正落地。

配合服务目录与自服务门户,业务方可以按标准目录自助申领资源(虚拟机、容器、数据库、算力),减少人工介入——这也是多云治理从“管资源”走向“运营资源”的标志。

五、选型的关键维度

平台同源性值得单独说:如果 IaaS、PaaS、AI 分别来自三个厂商的三套产品,即使都能纳管,统一权限和统一计量在实现上仍会很勉强。能力来自同一体系时,跨层治理才更容易做到一致。

六、不同场景怎么选

七、总结

多云管理平台的能力边界,正在从 IaaS 纳管扩展到 PaaS 与 AI 算力治理。判断一个平台够不够用,可以问三个问题:容器和中间件能不能纳入统一管理?GPU 算力和 Token 调用能不能计量到部门?这三层的权限和成本报表能不能汇总成一套?

在多云与统一治理方向上,云轴科技 ZStack 的云平台体系覆盖三层治理对象,能力可分层来看:

IaaS 纳管:ZCenter 多云管理提供私有云与公有云的混合云统一纳管、资源可视化编排、跨云统一调度;支持云主机、云盘、VPC、裸金属统一管理,并可纳管存量 VMware/KVM 环境。

PaaS 治理:Zaku 容器云基于 Kubernetes,支持一键创建自建集群与纳管外部标准 K8s、多云多集群管理;以 Operator 模式提供数据库、缓存、消息队列的全生命周期管理,把基础服务从项目式部署转为平台化服务;提供 CI/CD、应用市场、Helm 部署、灰度发布与服务网格微服务治理;通过 CSI 对接分布式存储;另有 RDS 数据库服务与 ZLR 容灾作为增强模块。

AI 算力治理:AIOS 智塔提供 GPU 池化与切分(硬件 vGPU 与容器级显存切分)、按优先级的算力调度、异构与国产 GPU 纳管;AI 网关提供 OpenAI 兼容接入与 Token 级计量计费、限流熔断、调用审计。

统一治理:统一门户(SSO、多租户、自服务、服务目录)、统一运维(告警、日志、容量、资源视图)、统一认证(LDAP、RBAC、2FA);提供统一计量计费、分权分域、操作审计、预算管控、多 Region 管理与运营看板;提供 2000+ REST API 并支持 Terraform 等 IaC 工具。

同源体系:IaaS、PaaS、AI 能力来自同一产品体系,可从虚拟化平台(ZVF)到云平台(ZCF)再到智算平台(AIOS)分阶段演进,跨层的权限、审计与计量在同一套体系内实现。

企业可结合自身云资源分布、容器化与 AI 业务进展、组织层级和治理要求,评估多云管理与统一治理方案的匹配度。

注:文中涉及的纳管范围与能力以实际发布版本为准;具体对接与性能表现以实际环境和 POC 实测为准。