lmdeploy v0.17.0发布:DeepEPv2、Kimi K2.6、Mooncake Store齐聚,推理性能与接口能力全面升级

网易专栏5小时前发布 nxnqh
1 0 0

🤖 AI总结

主题

lmdeploy v0.17.0版本发布,涵盖新功能、性能优化、问题修复和工程维护。

摘要

lmdeploy v0.17.0发布,新增多项功能并优化性能,修复若干问题,提升模型部署和推理的稳定性与效率。

关键信息

  • 1 新增DeepEPv2、Kimi K2.6、Mooncake Store支持。
  • 2 优化GLM-5.2服务、Paged Attention、FP8 MoE、推测解码等性能。
  • 3 修复多项兼容性和稳定性问题。

lmdeploy v0.17.0发布:DeepEPv2、Kimi K2.6、Mooncake Store齐聚,推理性能与接口能力全面升级

lmdeploy v0.17.0发布:DeepEPv2、Kimi K2.6、Mooncake Store齐聚,推理性能与接口能力全面升级

lmdeploy v0.17.0发布:DeepEPv2、Kimi K2.6、Mooncake Store齐聚,推理性能与接口能力全面升级

2026年9月1日,lmdeploy 发布 v0.17.0 版本。本次更新覆盖功能集成、推理性能优化、接口能力完善、模型兼容性修复、构建流程调整、文档与自动化测试改进等多个方向。

从更新内容来看,v0.17.0 的重点十分明确:一方面继续增强推理引擎能力,加入 DeepEPv2、Kimi K2.6、Mooncake Store 等支持;另一方面围绕 GLM-5.2 服务、Paged Attention、V4 Prefill、FP8 MoE、推测解码等关键路径持续优化。同时,版本也修复了 FP8 权重回退、视觉数据 URL、Anthropic API 系统消息、GLM 工具调用、Triton 编译等一批问题。

对于关注大模型部署、推理服务、模型兼容性以及 API 接口稳定性的开发者而言,lmdeploy v0.17.0 是一次覆盖面较广的版本更新。

一、版本信息速览

• 版本:v0.17.0

  • • 发布时间:2026年9月1日

  • • 更新范围:功能、性能、兼容性、接口、构建、文档、测试与版本维护

  • • 核心关键词:DeepEPv2、Kimi K2.6、Mooncake Store、服务端多候选输出、GLM-5.2、Paged Attention、V4 Prefill、FP8 MoE、推测解码、结构化响应格式

    本次版本中的变更可以概括为四个层面:

    1. 新能力接入,包括 DeepEPv2、Kimi K2.6 与 Mooncake Store。

  • 2. 推理链路持续优化,包括 GLM-5.2 服务、CUDA Attention、FP8 MoE 和推测解码。

  • 3. 接口与响应格式扩展,包括 Chat Completions 的多候选输出,以及结构化标签响应格式。

  • 4. 稳定性修复与工程维护,包括模型转换、API、构建链接、Markdown 链接校验、测试工作流与依赖要求调整。

    二、新功能:DeepEPv2、Kimi K2.6、Mooncake Store正式接入

    1. 集成 DeepEPv2

    v0.17.0 集成了 DeepEPv2。

    DeepEPv2 的加入,是本版本功能更新中的重要内容之一。此次更新明确将 DeepEPv2 纳入 lmdeploy 的支持范围,进一步扩展了项目所覆盖的能力与组件。

    对于使用 lmdeploy 的用户来说,版本升级后可关注 DeepEPv2 相关能力的接入情况。该项变更对应更新编号 4783。

    2. PyTorch 引擎支持 Kimi K2.6

    本次更新中,PyTorch 引擎新增支持 Kimi K2.6。

    模型兼容性始终是推理部署框架的重要组成部分。v0.17.0 明确增加了 Kimi K2.6 支持,并且该支持位于 PyTorch 引擎范围内。

    这意味着,在 lmdeploy 的 PyTorch 路径中,Kimi K2.6 成为本次版本新增覆盖的模型之一。对于关注该模型部署与推理支持的用户而言,这项更新值得重点关注。

    该项变更对应更新编号 4846。

    3. kv_connector 支持 Mooncake Store

    v0.17.0 在 kv_connector 中新增 Mooncake Store 支持。

    kv_connector 是本次功能更新的重要切入点。随着 Mooncake Store 的支持加入,lmdeploy 在相关存储能力支持方面进一步扩展。

    此次更新明确指出支持对象为 Mooncake Store,所属模块为 kv_connector。该项变更对应更新编号 4903。

    三、性能与能力改进:从多候选输出到推理关键路径优化

    除了新增支持外,v0.17.0 的大量更新集中在性能和服务能力改进上。涉及 Chat Completions、GLM-5.2、CUDA Attention、Ascend Attention 后端、FP8 MoE、推测解码、页面大小与结构化响应格式。

    1. Chat Completions 支持服务端多候选输出

    本次更新为 Chat Completions 增加服务端 fan-out 能力,用于支持n > 1的 choices。

    在 Chat Completions 场景中,当请求需要返回多个候选结果时,v0.17.0 新增了服务端侧的 fan-out 支持。这项更新聚焦于n > 1的 choices,也就是单次请求中需要获得多个候选响应的情况。

    该能力的加入,使 Chat Completions 接口在多候选输出处理方面获得了新的服务端支持。

    该项变更对应更新编号 4841。

    2. 进一步优化 GLM-5.2 服务性能

    v0.17.0 对 GLM-5.2 serving 进行了进一步性能优化。

    更新内容中明确使用了“进一步优化”,说明 GLM-5.2 服务链路仍是持续优化的重点。本次版本继续围绕 GLM-5.2 的服务表现进行改进。

    该项变更对应更新编号 4853。

    3. CUDA 路径使用 PDL 优化 Paged Attention 与 V4 Prefill

    本次更新在 CUDA 路径中,使用 PDL 处理 Paged Attention 和 V4 Prefill。

    Paged Attention 与 Prefill 都是推理过程中的重要环节。v0.17.0 明确引入 PDL,用于 Paged Attention 和 V4 Prefill 的相关优化。

    该项更新体现了对 CUDA 推理路径的持续打磨,涉及两个明确对象:

    • Paged Attention

  • • V4 Prefill

    该项变更对应更新编号 4861。

    4. Ascend 更新 Attention 算子后端

    v0.17.0 对 Ascend 平台的 Attention 算子后端进行了更新。

    此次修改的重点是 Attention 的 op_backend,也就是 Attention 算子的后端实现选择或相关配置。更新记录明确指出该项内容位于 Ascend 相关路径中。

    该项变更对应更新编号 4900。

    5. 优化紧凑分块 FP8 MoE与路由准备过程

    在 PyTorch 路径中,v0.17.0 优化了 compact blocked FP8 MoE,并优化了 route preparation。

    本次性能优化涵盖两个直接对象:

    • 紧凑分块 FP8 MoE

  • • 路由准备过程

    FP8 MoE 和路由准备都属于相关推理流程中的关键部分。此次更新针对 compact blocked FP8 MoE 以及 route preparation 进行优化,体现出 lmdeploy 对相关路径的持续调整。

    该项变更对应更新编号 4857。

    6. 降低推测解码前后处理开销

    v0.17.0 对推测解码的 pre-processing 和 post-processing 开销进行了降低。

    推测解码不仅涉及实际解码过程,也包括前处理与后处理步骤。本次更新针对这两部分的开销进行优化,目标是减少 speculative decoding 的前后处理成本。

    更新内容明确涵盖:

    • 推测解码前处理开销

  • • 推测解码后处理开销

    该项变更对应更新编号 4877。

    7. 支持非二次幂页面大小

    本版本新增支持非二次幂的 page size。

    此前在页面大小使用上可能存在特定约束,而 v0.17.0 明确支持不属于二次幂的 page size。该项能力扩展了页面大小的可支持范围。

    需要注意的是,更新内容的重点在于“支持非二次幂页面大小”,并未给出具体可选页面大小列表。因此,使用时应以实际版本配置与运行环境为准。

    该项变更对应更新编号 4854。

    8. TurboMind 与 PyTorch 引擎支持 structural_tag 响应格式

    v0.17.0 新增 structural_tag response_format 支持,覆盖 TurboMind 和 PyTorch 两类引擎。

    这项更新属于响应格式能力扩展。新增的格式为 structural_tag,并且明确支持以下推理引擎:

    • TurboMind 引擎

  • • PyTorch 引擎

    对于需要使用结构化标签响应格式的场景,该版本增加了对应能力支持。

    该项变更对应更新编号 4906。

    四、问题修复:模型、接口、工具调用、编译与数据处理全面加固

    v0.17.0 修复内容覆盖 TurboMind、视觉输入、API、原生 Transformers 预热、Anthropic API、DSA Prefill、构建链接、GLM 工具调用、Triton 编译以及模型转换等多个部分。

    这些修复共同提升了版本的兼容性与稳定性。

    1. 恢复 pre-sm90 GPU 上 FP8 权重仅量化回退能力

    本次更新修复 TurboMind 相关问题,恢复 pre-sm90 GPU 上的 FP8 weight-only fallback。

    更新内容明确指出,此次修复针对 pre-sm90 GPU,也就是 SM90 之前的 GPU 架构环境,恢复 FP8 权重仅量化模式下的回退能力。

    该问题位于 TurboMind 路径中,修复后相关环境下的 FP8 weight-only fallback 得到恢复。

    该项变更对应更新编号 4871。

    2. 视觉模块对格式异常的数据 URL 提供清晰报错

    v0.17.0 修复了视觉模块对 malformed data URLs 的处理问题。

    此前,当视觉输入中的数据 URL 格式异常时,系统现在会抛出更清晰的错误信息。更新的重点并非改变数据 URL 的格式要求,而是让格式不合法时的报错更加明确。

    这能够帮助使用者在遇到错误数据 URL 时,更容易定位问题。

    该项变更对应更新编号 4837。

    3. 修复 API 中的 reponses 接口问题

    本版本修复了 API 中的 reponses interface 问题。

    更新记录中使用的是 reponses interface 表述,本次版本对此接口问题进行了修复。该项变更属于 API 层面的稳定性修正。

    该项变更对应更新编号 4893。

    4. 修复 DSV4 原生 Transformers 预热问题

    v0.17.0 修复了 DSV4 native Transformers warmup 相关问题。

    此次修复涉及 DSV4、原生 Transformers 与 warmup 三个关键点。更新内容明确表明,DSV4 的 native Transformers 预热流程获得修复。

    该项变更对应更新编号 4878。

    5. Anthropic API 支持内联系统消息

    本版本修复 Anthropic API 中内联 system messages 的支持问题。

    系统消息是接口调用中的重要组成部分。v0.17.0 明确支持 inline system messages,也就是内联系统消息的处理。

    该项修复位于 Anthropic API 路径中。

    该项变更对应更新编号 4882。

    6. 限制 DSA Prefill 分数内存占用

    v0.17.0 修复 DSA Prefill score memory 问题,对其内存使用进行限制。

    更新内容明确为 bound DSA prefill score memory,即对 DSA Prefill 分数相关内存进行边界控制。该修复聚焦于内存占用管理。

    该项变更对应更新编号 4896。

    7. 修正 GEMM 内核归档链接顺序

    本次版本修复构建问题,修正 GEMM kernel archive 的链接顺序。

    GEMM 内核归档文件在构建链接时,其链接顺序得到修正。该项更新位于 build 相关内容中,属于工程构建层面的修复。

    该项变更对应更新编号 4910。

    8. 拒绝不可用的 GLM 工具调用

    v0.17.0 修复 GLM tool calls 处理问题,拒绝不可用的工具调用。

    更新内容明确指出,对于 unavailable GLM tool calls,系统将进行拒绝处理。该项修复聚焦于 GLM 工具调用的可用性判断。

    该项变更对应更新编号 4901。

    9. 避免 Triton 在 Paged Attention Reduction 中错误编译

    本版本修复 PyTorch 路径中的 Triton 错误编译问题。

    具体来说,修复目标是避免 Triton 在 paged attention reduction 中发生 miscompile。该项修复同时涉及:

    • PyTorch

  • • Triton

  • • Paged Attention Reduction

    该项变更对应更新编号 4920。

    10. 修复 Intern-S2-Preview-FP8 转换问题

    v0.17.0 修复 Intern-S2-Preview-FP8 的转换问题。

    该问题位于模型转换相关流程中,本版本对 Intern-S2-Preview-FP8 convert 进行了修复。

    该项变更对应更新编号 4923。

    五、工程、文档与测试更新:链接校验、依赖调整、评测工作流同步推进

    除功能、性能与修复外,v0.17.0 也在文档、自动化测试、构建依赖和版本维护方面进行了更新。

    这些内容虽然不直接体现为模型或推理能力的新增,但对于项目的持续维护同样重要。

    1. 校验跨文件 Markdown 链接目标

    本次更新修复并增加了跨文件 Markdown 链接目标校验。

    更新内容明确指出,项目对 cross-file Markdown link targets 进行验证。也就是说,当 Markdown 文档中的链接指向其他文件时,会对目标进行校验。

    该项变更对应更新编号 4868。

    2. README 更新以反映 EuroSys 2027 论文接收信息

    v0.17.0 更新 README,以反映 EuroSys 2027 论文接收信息。

    此次修改属于 README 内容更新,明确涉及 EuroSys 2027 论文接收相关信息。

    该项变更对应更新编号 4891。

    3. 修复 README 中的语法问题

    本次版本还对 README 中的语法进行了修复。

    这是文档质量维护的一部分,更新内容明确为修复 README grammar。

    该项变更对应更新编号 4866。

    4. 自动化测试移除未使用模型配置,并在 YAML 中控制 routed_experts

    v0.17.0 改进 autotest,移除了未使用的模型配置,并通过 YAML 对 routed_experts 进行控制。

    此次自动化测试改动包括两部分:

    • 精简未使用的模型配置

  • • 在 YAML 中对 routed_experts 进行门控控制

    该项变更对应更新编号 4885。

    5. CUDA 运行时依赖中移除 flashinfer

    本版本调整构建依赖,从 CUDA runtime requirements 中移除 flashinfer。

    更新内容的表达十分直接:flashinfer 不再位于 CUDA 运行时依赖要求中。

    该项变更对应更新编号 4902。

    6. 新增基础 API 评测测试工作流

    v0.17.0 在持续集成中新增 base API eval test workflow。

    该项更新为 CI 增加基础 API 评测测试工作流,属于自动化测试与持续集成能力维护的一部分。

    该项变更对应更新编号 4874。

    7. 版本号升级至 v0.17.0

    本次发布完成版本号更新,正式升级至 v0.17.0。

    该项变更对应更新编号 4914。

    六、lmdeploy v0.17.0更新内容完整汇总

    为了便于快速查看,以下对本次版本全部更新进行汇总。

    新增功能

    • 集成 DeepEPv2。

  • • PyTorch 引擎支持 Kimi K2.6。

  • • kv_connector 支持 Mooncake Store。

    性能与能力改进

    • Chat Completions 支持服务端 fan-out,以支持n > 1的 choices。

  • • 进一步优化 GLM-5.2 serving。

  • • CUDA 路径使用 PDL 优化 Paged Attention 和 V4 Prefill。

  • • Ascend 更新 Attention 算子后端。

  • • PyTorch 优化 compact blocked FP8 MoE 和路由准备过程。

  • • 降低推测解码前处理与后处理开销。

  • • 支持非二次幂页面大小。

  • • TurboMind 和 PyTorch 引擎支持 structural_tag response_format。

    问题修复

    • 恢复 pre-sm90 GPU 上 FP8 权重仅量化回退能力。

  • • 视觉模块对格式异常的数据 URL 提供清晰错误信息。

  • • 修复 API 中的 reponses 接口问题。

  • • 修复 DSV4 原生 Transformers 预热问题。

  • • 修复 Anthropic API 内联系统消息支持。

  • • 限制 DSA Prefill 分数相关内存。

  • • 修正 GEMM 内核归档链接顺序。

  • • 拒绝不可用的 GLM 工具调用。

  • • 避免 Triton 在 Paged Attention Reduction 中发生错误编译。

  • • 修复 Intern-S2-Preview-FP8 转换问题。

    其他更新

    • 校验跨文件 Markdown 链接目标。

  • • README 更新以反映 EuroSys 2027 论文接收信息。

  • • 修复 README 语法。

  • • 自动化测试移除未使用模型配置,并通过 YAML 控制 routed_experts。

  • • CUDA 运行时依赖移除 flashinfer。

  • • 新增基础 API 评测测试工作流。

  • • 版本号升级至 v0.17.0。

    七、结语

    代码地址:github.com/InternLM/lmdeploy

    lmdeploy v0.17.0 是一次内容覆盖广泛的版本更新。

    在功能层面,版本集成 DeepEPv2,增加 Kimi K2.6 支持,并让 kv_connector 支持 Mooncake Store。在服务和性能层面,Chat Completions 获得服务端多候选输出能力,GLM-5.2 serving 持续优化,CUDA 中的 Paged Attention 与 V4 Prefill 引入 PDL,FP8 MoE、路由准备和推测解码前后处理也得到优化。

    在兼容性和稳定性层面,v0.17.0 修复了 TurboMind FP8 权重回退、视觉数据 URL 报错、API 接口、DSV4 预热、Anthropic API 系统消息、DSA Prefill 内存、GLM 工具调用、Triton 编译与模型转换等问题。

    同时,项目还完成了 Markdown 链接校验、README 更新、自动化测试精简、CUDA 依赖调整、基础 API 评测工作流新增与版本号升级等维护工作。

    整体来看,lmdeploy v0.17.0 围绕“能力扩展、性能优化、稳定性修复、工程维护”四个方向完成了一次集中更新。

    我们相信人工智能为普通人提供了一种“增强工具”,并致力于分享全方位的AI知识。在这里,您可以找到最新的AI科普文章、工具评测、提升效率的秘籍以及行业洞察。 欢迎关注“福大大架构师每日一题”,发消息可获得面试资料,让AI助力您的未来发展。

    © 版权声明

    相关文章