
RunPod
提供按需GPU Pods、自动扩缩容Serverless Endpoints、公共模型API、网络存储和容器化AI运行环境的GPU云。
Kubernetes原生模型Serving平台,通过InferenceService提供多框架部署、自动扩缩、OpenAI规范、Canary、InferenceGraph与监控。
直接结论:KServe适合在Kubernetes上统一部署传统机器学习、深度学习和生成式模型;集群网络、存储、GPU调度和CRD升级需要平台团队维护。
资料说明:本文根据该产品截至2026年8月5日的官方页面、官方文档与官方代码仓库整理,不包含虚构的统一条件实测。功能、版本、API、价格和授权规则可能调整,使用前请再次核验官网。
KServe是一套Kubernetes原生模型Serving平台,通过InferenceService等自定义资源封装自动扩缩、网络、健康检查和模型服务器配置。它支持多框架、生成式模型、OpenAI规范、Canary与A/B、InferenceGraph、解释和监控。
| 功能 | 说明 |
|---|---|
| InferenceService CRD | 用标准Kubernetes资源描述模型部署。 |
| 多框架Serving | 支持TensorFlow、PyTorch、XGBoost、ONNX、Hugging Face等。 |
| 生成式AI支持 | 为LLM提供OpenAI规范和当前Serving Runtime。 |
| 自动扩缩容 | 按流量扩展,并支持部分Scale-to-zero场景。 |
| Canary与A/B | 管理模型Revision、渐进发布和实验流量。 |
| InferenceGraph与监控 | 编排预处理、模型、解释和多模型Pipeline。 |
支持生成式模型和OpenAI规范相关能力,具体Runtime以当前版本为准。
支持模型Revision、Canary和A/B Testing等高级部署方式。
资料核验日期:2026年8月5日






