LTX发布免费开放世界模型LTX-2.5,支持视频生成与物理AI

网易专栏19小时前发布 nxnqh
2 0 0

🤖 AI总结

主题

LTX发布开放权重世界模型LTX-2.5,聚焦视频生成、实时应用和物理AI。

摘要

LTX推出开放权重世界模型LTX-2.5,显著提升视频生成、实时应用和物理AI能力,支持本地部署,并已与英伟达等合作优化性能。

关键信息

  • 1 LTX-2.5重构架构,支持原生多镜头生成和复杂提示词理解。
  • 2 针对物理AI和机器人应用提供预训练检查点,与英伟达合作优化本地推理。
  • 3 模型通过Hugging Face和ComfyUI开放,支持本地部署,并扩展了生态合作。

LTX发布免费开放世界模型LTX-2.5,支持视频生成与物理AI

LTX发布了其开放权重世界模型的最新版本LTX-2.5,在视频生成、实时应用和物理AI方面引入了全新能力。

LTX表示,新模型在视觉质量、提示词理解、生成速度和效率方面均有显著提升,同时允许开发者和企业在自有硬件上运行和定制模型。

LTX-2.5已通过Hugging Face以开放权重形式发布,原生支持ComfyUI,并可通过LTX API进行托管部署。

LTX表示,其世界模型的累计下载量已超过3300万次,应用场景涵盖电影制作、机器人技术和实时渲染等领域。

该公司将LTX-2.5定位为基础模型,不仅用于视频生成,还适用于需要对环境随时间变化进行建模的系统——这一能力在机器人技术和物理AI领域的重要性日益凸显。

LTX联合创始人兼CEO Zeev Farbman表示:”世界模型面临着大语言模型从未遇到的挑战,例如在时间维度上保持运动、空间和声音的一致性,这正是效率与可控性如此重要的原因。通过保持LTX的开放性,我们让团队能够掌控自己的硬件、知识产权和模型。LTX-2.5是迄今为止能力最强的版本,而与ComfyUI等基于共同开放理念建立的合作关系,正是模型触达那些同时需要行业领先质量和完全控制权的团队的关键所在。”

架构重构而非功能叠加

LTX表示,LTX-2.5对生成流程进行了大幅重构,而非仅在原有架构上叠加新功能。

重要新增能力之一是原生多镜头生成,使模型能够在生成完整序列的同时,保持不同剪辑片段之间角色、场景和声音的一致性。

提示词理解能力也得到升级,采用了定制化的Gemma 4语言骨干网络,并配备专用的提示词增强器,可解析涉及多个主体的复杂提示词。

在视觉输出方面,LTX引入了新的扩散视频解码器,旨在减少高运动序列中的伪影问题,同时保持模型的高压缩比。

公司还开发了名为”扩散保真渲染”(Diffusion Fidelity Rendering)的技术方案。该方法在8倍时间压缩的潜空间中构建运动与结构,同时生成高保真关键帧以保留重要视觉细节。

关键帧数量可根据场景复杂度和可用计算资源动态调整,使系统能够将处理资源集中于序列中需要更多细节的部分。

LTX表示,对蒸馏模型的改进还使其在较低计算需求和更快推理速度下,能够达到接近完整模型的质量水平。

面向物理AI与机器人的专项支持

LTX新版本重点布局的领域之一是物理AI。世界模型在这一领域具有潜在价值,可帮助机器人学习环境行为规律,预测动作对周围环境的影响。

LTX-2.5专门提供了针对物理AI和机器人应用进行调优的预训练检查点。开发者可以此为基础,利用自身领域专属数据对模型进行微调。

Markov Robotics是与LTX合作开展机器人应用研发的企业之一。

Markov Robotics联合创始人兼CEO Atharva Gundawar表示:”训练机器人意味着教会它们物理世界的实际运行方式,而不仅仅是外观。LTX-2.5是最接近这一目标的开放模型,能够在自有硬件上运行和微调,这使它真正适用于实际的机器人工作。我们尚未找到其他开放模型能够以同样的方式满足我们的需求。”

世界模型正在机器人领域引发越来越广泛的关注,因为它们能够为系统提供关于物体、环境及其他智能体随时间演变行为的预测能力。

与大语言模型预测下一个Token不同,世界模型尝试预测环境中的下一个状态或”时刻”。这使该技术在仿真、机器人训练和规划领域具有应用价值,同时也适用于电影制作、广告和游戏等传统场景。

英伟达合作优化本地推理性能

LTX还与英伟达合作,针对英伟达RTX GPU和DGX Spark系统对LTX-2.5的本地推理性能进行了优化。

双方表示,此次优化降低了内存需求,使更多开发者和企业能够在本地运行该模型,而无需完全依赖云端基础设施。

英伟达本地AI产品高级总监Gerardo Delgado Cabrera表示:”本地模型让创作者和开发者借助本地GPU自由探索创意。通过与LTX的深度协作,对LTX-2.5进行优化并将其集成至ComfyUI等主流框架,搭载英伟达RTX GPU和DGX Spark的用户可以在显著降低显存占用的同时获得最佳性能。”

本地部署还允许企业将专有数据和知识产权保留在自有基础设施上,并针对特定应用场景对模型进行定制。LTX表示,LTX-2.5可在从数据中心GPU到Mac的各类硬件上运行。

生态合作伙伴持续扩展

LTX与ComfyUI建立合作,使新模型在发布之初即可原生集成于这一基于节点的开发环境中。

该集成旨在帮助开发者从实验阶段平滑过渡到生产工作流,无需将工作内容迁移至独立的专有平台。

ComfyUI联合创始人兼CEO Yoland Yan表示:”ComfyUI与LTX秉持同一理念——开放模型能够更快地构建出更好的工具。LTX-2.5在ComfyUI中原生运行后,开发者可以在一个下午内从一个想法搭建出可运行的世界模型流程,企业也可以将同样的流程直接部署到自有硬件上进行生产。开放性正是社区快速迭代、企业稳健建设的根本所在。”

LTX还与实时生成式视频开发平台Reactor展开合作。Reactor正在其低延迟推理基础设施上运行LTX-2.5,应用场景包括交互式数字人、实时生成环境和机器人实时工作负载。

Reactor联合创始人兼CEO Alberto Taiuti表示:”媒体的未来是实时的,而这一切能够实现的前提,是底层模型足够快速、可控且归你所有。与LTX的合作意味着我们可以针对自有基础设施对模型进行调优,向全球用户呈现实时响应的数字人。”

LTX表示,Asteria也正在将其技术用于电影和视频制作领域。

该公司预计,世界模型最终将成为横跨媒体、仿真、交互应用和物理机器的基础设施层。

LTX-2.5现已通过Hugging Face和ComfyUI发布,同时可经由LTX API访问。LTX表示,年度经常性收入低于1000万美元的组织可免费使用该模型。

Q&A

Q1:LTX-2.5世界模型和普通视频生成模型有什么区别?

A:LTX-2.5不仅能生成视频,还能对环境随时间变化的状态进行建模预测。与大语言模型预测下一个Token不同,世界模型尝试预测环境中的下一个”状态或时刻”,因此更适合机器人训练、仿真和规划等需要理解物理世界行为的场景,而不仅限于电影、广告等传统视频生成应用。

Q2:LTX-2.5在机器人和物理AI领域具体怎么用?

A:LTX-2.5提供了专门针对物理AI和机器人应用调优的预训练检查点,开发者可以此为基础,使用自身领域数据进行微调。Markov Robotics已在使用该模型帮助机器人学习物理世界的实际运行规律。世界模型可让机器人系统预测物体、环境及其他智能体随时间的行为变化,从而用于机器人的训练与规划。

Q3:LTX-2.5对硬件有什么要求?普通开发者能用吗?

A:LTX-2.5支持从数据中心GPU到Mac的多种硬件,并与英伟达合作优化了RTX GPU和DGX Spark系统上的本地推理性能,显著降低了显存占用。该模型通过Hugging Face和ComfyUI免费开放获取,年度经常性收入低于1000万美元的组织可免费使用,普通开发者的使用门槛相对较低。

© 版权声明

相关文章