Ray Serve

2个月前更新 0 0 0

可扩展Python模型服务库,支持框架无关部署、模型组合、自动扩缩容、LLM Serving、FastAPI、gRPC和Kubernetes。

收录时间:
2026-08-05
Ray ServeRay Serve

直接结论:Ray Serve适合用Python部署由多个模型和业务步骤组成的在线推理服务,并独立扩缩不同组件;集群、容错和资源配置仍需专业运维。

资料说明:本文根据该产品截至2026年8月5日的官方页面、官方文档与官方代码仓库整理,不包含虚构的统一条件实测。功能、版本、API、价格和授权规则可能调整,使用前请再次核验官网。

工具是什么

Ray Serve是Ray生态中的可扩展模型服务库,用于构建在线推理API。它与模型框架无关,可把预处理、模型推理、后处理和业务逻辑拆成独立Deployment,并支持自动扩缩容、动态批处理、模型组合、LLM服务和Kubernetes部署。

核心功能

功能说明
Framework-agnostic Serving部署PyTorch、TensorFlow、scikit-learn、LLM及自定义Python逻辑。
Deployment组合让多个独立服务互相调用并组成完整推理应用。
独立自动扩缩容按每个Deployment负载调整Replica数量和资源。
LLM Serving支持vLLM、SGLang兼容、并行、KV Cache和多LoRA等场景。
HTTP、FastAPI与gRPC通过不同协议和Web框架公开服务接口。
KubeRay与生产能力提供配置部署、监控、容错和滚动更新路径。

适合哪些用户

  • 需要部署复杂在线推理和业务逻辑的Python团队。
  • 已经使用Ray进行训练、数据和分布式计算的组织。
  • 需要独立扩缩不同模型组件的平台团队。

不太适合哪些情况

  • 只需要在单机启动一个简单模型API的轻量项目。
  • 没有分布式系统与Kubernetes运维能力的大型部署。

主要优势

  • 模型和普通Python业务逻辑可以统一编排。
  • 每个组件可单独分配资源和扩缩。
  • 与Ray Data、Train和KubeRay生态结合。

需要注意的限制

  • Ray集群和生产配置具有学习门槛。
  • 复杂模型组合会增加网络和调试成本。
  • 错误的资源配置可能导致GPU利用率低或排队延迟。

常见问题

Ray Serve只能部署LLM吗?

不是。它支持传统机器学习、深度学习、LLM和任意Python业务逻辑。

Ray Serve支持模型组合吗?

支持把预处理、多个模型和后处理拆成独立Deployment后组成应用。

官方来源

  1. Ray Serve官方文档
  2. Ray Serve模型组合
  3. Ray官网

资料核验日期:2026年8月5日

数据统计

相关导航