尊时凯时企业级大模型训练与治理平台-灵炼(英文名 H-AI TrainHub,,,,,,,以下简称灵炼),,,,,,,是尊时凯时 AI Factory 融合解决规划的企业级一站式模型训练与治理平台,,,,,,,覆盖数据集治理、精调、推理部署与评测等端到端能力,,,,,,,专一机能与安全保险,,,,,,,全面支持企业 AI 模型开发与落地。。。。。。。 本文将带您急剧把握灵炼模型部署的推理新能力:在现有 vLLM 推理引擎基础上,,,,,,,集成 NVIDIA NIM 与 NVIDIA Dynamo 推理框架,,,,,,,构建统一、高效且可扩大的推理平台。。。。。。。从镜像守护、模型版本配置,,,,,,,到部署选择、服务监控,,,,,,,再到一键对接灵猿 AI 中台,,,,,,,援手您为分歧业务场景选择最相宜的推理规划。。。。。。。 为什么要引入 新的推理能力 做过大模型私有化落地的团队应该都有体味:模型部署这件事,,,,,,,难的从来不是“跑起来”,,,,,,,而是“跑得稳、跑得快、管得住”。。。。。。。统一个模型,,,,,,,换个引擎、换套参数,,,,,,,吞吐和时延可能差出一倍。。。。。。。 在推理侧,,,,,,,灵炼此前一向以 vLLM 作为默认引擎。。。。。。。vLLM 足够优良,,,,,,,但随着企业 AI 利用从“试点验证”走向“规模;;;;;;;霾,,,,,,,单一引擎的局限逐步显露: 💢场景在分化 有的客户钻营开箱即用与企业级支持保险,,,,,,,有的客户在多机多卡集群上钻营极致吞吐,,,,,,,一把尺子量不了所有场景;;;;;;;; 💢算力驱动营收 GPU 算力是企业级AI部署的主题资源,,,,,,,推理规划 每提升一分吞吐,,,,,,,就意味着处置一样工作负载时 所需的 GPU 数量更少 ——规划选择将直接影响 企业拓展营收规模与降低总体占有成本(TCO)的能力;;;;;;;; 💢生态在演进 基于 NVIDIA 构建的推理软件栈(TensorRT-LLM、NIM、Dynamo)持续优化 ,,,,,,,企业必要一条能持续吸纳新推理能力盈利的蹊径,,,,,,,而不是被锁死在某一代规划上。。。。。。。 因而,,,,,,,灵炼这次升级的意思不只是“多了两个选项”,,,,,,,而是让平台具备了多能力栈治理的系统化能力——容器镜像、模型适配、部署选择、参数实际、监控运维一条链路买通。。。。。。。企业只管按场景选用,,,,,,,把“换推理规划”的成本压缩到一次下拉选择。。。。。。。 灵炼模型部署融合 NVIDIA NIM & Dynamo 部署再升级!灵炼模型部署正式接入 NVIDIA NIM 与 NVIDIA Dynamo,,,,,,,形成 vLLM、NIM、Dynamo 三大推理技术协同的架构,,,,,,,进一步提升模型服务的机能、不变性与运维效能。。。。。。。 推理规划自由选 在现有 vLLM 基础上,,,,,,,新增对 NVIDIA NIM 与 NVIDIA Dynamo 的支持。。。。。。。部署时可凭据模型配置按需选择推理规划,,,,,,,通过一套尺度化流程实现多种推理技术的统一部署与治理。。。。。。。 镜像有章法 底层配置支持守护通用镜像;;;;;;;;针对 NIM 模型专用镜像的特点,,,,,,,支持在模型仓库对应版本上守护 NIM 专用镜像,,,,,,,镜像随着模型版本走,,,,,,,部署自动带出。。。。。。。 参数不用猜 平台内置各推理规划可配置的内置参数与最佳实际,,,,,,,部署时给出推荐配置,,,,,,,无需从零翻阅引擎文档调参。。。。。。。 监控开箱即用 NIM、Dynamo 服务指标同步支吃旖台监控,,,,,,,与 vLLM 维持一致的可观测履历。。。。。。。 生态一键贯通 部署实现后支持一键对接灵猿 AI 中台的模型账号守护与模型账号组合配置,,,,,,,推理服务直达上层利用。。。。。。。 意识两位新成员 先看它们地点的大图景 AI Factory 与 NVIDIA AI Enterprise 在正式介绍这两位新成员之前,,,,,,,有必要先理解它们从何而来。。。。。。。 AI Factory(AI工厂) 这是一套软硬件协同设计的齐整系统,,,,,,,指标是让企业可能规模;;;;;;;⒖沙中匕阉懔Ω咝У亍傲丁背 AI 出产力——这也正是 AI 推理进入出产环节后,,,,,,,对吞吐、时延与成本提出的现实要求。。。。。。。 要把这座“工厂」劓正跑起来,,,,,,,除了底层硬件,,,,,,,还必要一整套经过验证、可持久守护的软件栈,,,,,,,这就是 NVIDIA AI Enterprise。。。。。。。 NVIDIA AI Enterprise 将面向 AI 开发的微服务、框架和库与先进的 GPU 编排和基础设施治理相集成,,,,,,,打造出全面受支持的出产就绪型贸易软件套件。。。。。。。助力企业自负部署当先的开源工具和AI模型,,,,,,,提逾越产力,,,,,,,加快价值实现,,,,,,,同时以优化的资源利用率大规模运行 AI 工作负载。。。。。。。 能够把 NVIDIA AI Enterprise 理解为 AI Factory 的软件操作系统:AI Factory 描述了指标状态,,,,,,,NVIDIA AI Enterprise 则提供了让这套系统真正落地运行的尺度化软件基座。。。。。。。 而本次要介绍的 NIM 与 Dynamo,,,,,,,正是 AI Factory 软件栈中两个关键组件:一个掌管让单个推理服务开箱即用、跑得又快又省心;;;;;;;;另一个掌管在大规模 GPU 集群上把散布式推理编排到极致。。。。。。。 理解了这层归属关系,,,,,,,再来看它们各自的能力,,,,,,,就更容易把握它们在整个 AI 工厂里所表演的角色。。。。。。。 NVIDIA NIM 官方预优化的“开箱即用” NVIDIA NIM 是一套易于使用的预构建容器工具,,,,,,,主张是援试祗业客户在云,,,,,,,数据中心和工作站上安全,,,,,,,靠得住的部署高机能的 AI 模型推理。。。。。。。 它由 Model-Free NIM,,,,,,,Day0 NIM 和 Refresh NIM 组成 ,,,,,,,它把推理框架(vLLM/SGLang),,,,,,,最幼运行时依赖,,,,,,,最佳推理实际统一打包为容器镜像 ,,,,,,,启动即为尺度 API 服务。。。。。。。它的价值重要在三点: ? 开箱即用:无需自行处置复杂的推理框架部署和配置 ,,,,,,,容器启动时自动匹配当前 GPU 的最优 profile。。。。。。。其中: ○ Model-Free NIM 允许用户以最新的推理框架版本加载肆意模型,,,,,,,同时两全合规和企业级 feature;;;;;;;; ○ Day0 NIM 允许用户在第一功夫获取最新的验证过的开箱即用模型;;;;;;;; ○ Refresh NIM 允许用户获得对于特定模型的最佳机能。。。。。。。 ? 机能有保险:若是用户使用的是 Refresh NIM,,,,,,,底层是深杜着化的推理蹊径,,,,,,,在 NVIDIA GPU 上通??????苫竦糜庞谕ㄓ霉婊耐掏掠胧 Token 时延。。。。。。。同时用户还可针对特定需要天生自界说优化规划,,,,,,,并将其无缝集成到 NIM;;;;;;;; ? 企业级支持:具备官方的版本守护与安全更新,,,,,,, 没有 高危代码缝隙风险,,,,,,,符合合规要求高的企业客户。。。。。。。 必要把稳的是,,,,,,,NIM 镜像是“多档次” 的——每个模型和框架版本对应各自的 NIM 镜像,,,,,,,这对平台的镜像治理能力提出了更高要求,,,,,,,也是灵炼本次在产品设计上沉点解决的问题。。。。。。。 NVIDIA Dynamo 数据中心级的散布式推理框架 若是说 NVIDIA NIM 解决的是“单个服务若何跑得又快又省心”,,,,,,,Dynamo 对准的则是另一个维度:大规模散布式场景下,,,,,,,GPU 集群若何协同把推理跑到极致。。。。。。。Dynamo 是一个开源的数据中心级散布式推理框架,,,,,,,主题能力蕴含: ? P/D 分离(Disaggregated Serving):将推理的 Prefill(提醒词推算)与 Decode(逐 Token 天生)拆到分歧 GPU 组别离调度——前者吃算力、后者吃显存带宽,,,,,,,分隔后各用其长,,,,,,,在长高低文、高并发场景下集群整体吞吐提升非??????晒郏;;;;;;; ? KV Cache 感知路由:智能路由器把握各节点的 KV Cache 散布,,,,,,,将要求调度到缓存射中率最高的节点,,,,,,,削减大量沉复推算;;;;;;;; ? 多级 KV 缓存治理:KV Cache可在显存、内存、本地皮之间分层流转,,,,,,,用更经济的存储扛住更大的缓存量;;;;;;;; ? 引擎无关:底层可对接 TensorRT-LLM、vLLM、SGLang 等推理内核,,,,,,,Dynamo 掌管上层调杜纂编排。。。。。。。 若何选择相宜的推理规划?????? 一个求实的选型参考:日??????⒀橹び vLLM;;;;;;;;NVIDIA GPU 上的尺度化高机能出产部署优先 NVIDIA NIM;;;;;;;;当业务量大到必要跨节点扩大推理集群时,,,,,,,就是 NVIDIA Dynamo 的主场。。。。。。。 急剧入门 - 配置守护 守护推理规划通用镜像 模型部署/配置守护:为各推理规划守护通用镜像。。。。。。。 vLLM、Dynamo 等选取“一个镜像服务所有模型”的通用镜像模式,,,,,,,在配置中统一登记镜像地址与版本,,,,,,,部署时直接引用,,,,,,,镜像升级只需守护一处,,,,,,,不再必要在各个环境里口口相传“该用哪个 tag”。。。。。。。 ? 推理规划:vLLM / NVIDIA NIM / NVIDIA Dynamo;;;;;;;; ? 通用镜像:守护对应的镜像地址与版本,,,,,,,针对 NVIDIA NIM 的渠路类型,,,,,,,平台内置了 Model-Free NIM。。。。。。。 模型仓库 守护 NIM 专用镜像 模型仓库/模型版本:为模型版本守护 NVIDIA NIM 模型专用镜像。。。。。。。 与通用引擎分歧,,,,,,,NIM 模型专用镜像与模型逐一对应。。。。。。。灵炼将 NIM 专用镜像的守护入口设计在模型仓库的对应模型版本上,,,,,,,镜像与模型版本强绑定,,,,,,,部署时自动带出,,,,,,,若是官方没有颁布模型专属 NIM,,,,,,,会默认使用 Model-Free NIM。。。。。。。 在模型版本上配置该版本支持的推理清单。。。。。。。分歧模型对推理底层的适配情况分歧,,,,,,,通过版本级的配置,,,,,,,部署环节只展示合法选项,,,,,,,从源头预防“用错引擎起不来服务”的低技误。。。。。。。 模型部署 选择推理规划 模型部署:新建部署工作,,,,,,,选择推理规划。。。。。。。 ? 模型及版本:选择指标模型;;;;;;;; ? 推理规划:从该模型版本配置的规划当选择 vLLM / NVIDIA NIM / NVIDIA Dynamo;;;;;;;; ? 参数配置:平台预置各引擎默认参数与最佳实际推荐值—— vLLM 的显存利用率与最大序列长度、NVIDIA NIM 的 profile 选择、NVIDIA Dynamo 的散布式拓扑等,,,,,,,均给出参数注明与推荐配置,,,,,,,同时支持关键参数自界说调优。。。。。。。 统一个模型,,,,,,,开发环境用 vLLM 急剧验证,,,,,,,出产环境切换NVIDIA NIM 或NVIDIA Dynamo 上强度,,,,,,,切换成本被压缩到一次下拉选择。。。。。。。 服务监控 新技术栈不能是“监控盲区”。。。。。。。部署实现后,,,,,,, NVIDIA NIM 与 NVIDIA Dynamo 服务的运行状态与推理指标已同步接入平台监控,,,,,,,与原有 vLLM 服务维持一致的运维履历,,,,,,,服务健全度、推理指标了如指掌,,,,,,,问题急剧定位。。。。。。。 一键对接 灵猿 AI 中台 推理服务就绪后,,,,,,,支持一键对接灵猿 AI 中台,,,,,,,自动实现模型账号守护与模型账号组合配置,,,,,,,无需在两个平台间手工复造接入信息,,,,,,,推理服务直达上层 AI 利用,,,,,,,买通从模型部署到利用消费的最后一公里。。。。。。。 推理世界迭代很快,,,,,,,平台的价值不在于押注某一个引擎,,,,,,,而在于把“换推理规划」剽件事件得足够便宜。。。。。。。 以上内容重要解说了灵炼模型部署接入 NVIDIA NIM 与 NVIDIA Dynamo 后的推理规划镜像守护、推理规划选择、部署参数最佳实际、服务监控、灵猿一键对接有关能力——从镜像、参数、监控到上层利用对接的整条链路都是现成的,,,,,,,企业只需按场景选择最相宜的推理规划。。。。。。。 更多职能细节可参阅盛开平台文档,,,,,,,或随时联系研发团队:openhand@vip.hand-china.com。。。。。。。 将来我们将持续迭代,,,,,,,为您带来更多 AI 模型开发与落地履历,,,,,,,等待与您互换!欢迎在评论区留言,,,,,,,一路探求 AI 模型推理部署在您业务中的利用潜力~ 携手尊时凯时,,,,,,,共铸硬核竞争力!


