AIBrix 引擎运行时#
AI 引擎运行时是推理容器的统一管理层。它是一个多功能边车,可实现指标标准化、模型下载和本地模型管理。AI 运行时隐藏了推理引擎侧的各种实现细节,提供了一种通用的方法来指导模型下载和管理,以及公开推理监控指标。
目前,此组件主要设计用于 lora 模型部署和多引擎支持。在大多数情况下,您不一定需要安装运行时。随着我们对更多推理引擎的支持以及对冷启动管理等功能的丰富,运行时将变得更加有用。
简介#
AI 引擎运行时是 AIBrix 控制平面和推理引擎 Pod 之间的重要桥梁,可实现模型管理、引擎配置、可观测性和与供应商无关的引擎支持。
控制平面集成 API:它确保了控制平面和推理 Pod 之间的无缝通信。这使得 LoRA 适配器控制器、自动扩缩器和冷启动管理器等组件能够与推理容器动态交互,以云原生方式管理资源。
抽象供应商特定的推理引擎:AI 引擎运行时旨在与各种推理引擎配合使用,包括最流行的引擎。然而,引擎 API 各不相同。AIRuntime 没有与任何特定引擎紧密耦合,而是抽象了模型加载/卸载、适配器配置和性能监控等关键操作,从而以最小的摩擦集成新的推理后端。
可观测性:它为不同推理引擎的监控提供统一接口,允许一致的性能跟踪和故障排除。
注意
此运行时与 Istio 边车不同。数据平面流量不会通过此运行时,它仅为控制平面交互提供一些管理功能。