LTX-2.3:220亿参数开源视频模型,能同时生成画面和声音

上周 Lightricks 开源了 LTX-2.3,一个 220 亿参数的视频生成模型。让我感兴趣的是两点:它能同时生成画面和声音,而且本地就能跑。

这是什么

LTX-2.3 是 Lightricks 在 2026 年 3 月发布的开源视频生成模型。支持三种输入方式:文字生成视频、图片生成视频、音频驱动视频。最高能输出 4K 分辨率,原生支持 9:16 竖屏格式。

关键是音视频同步生成——画面和声音是在同一个模型里一起出来的,不是先生成画面再配音。

为什么我觉得值得发

开源 + 本地可跑。 模型权重完全开放,支持商业使用。通过 FP8 + GGUF 量化,8G 显存的设备也能跑。不想折腾的可以直接用 LTX Studio 在线版。

竖屏原生支持。 大多数视频模型还是横屏优先,这个直接支持 9:16,做短视频内容的可以省去后期裁切。

LoRA 微调。 官方说 1 小时内能完成风格或动作的定制化训练。我没实测,但这个方向对独立创作者挺友好的。

适合谁

  • 做短视频内容,想试试 AI 生成素材的人
  • 有显卡资源,想本地部署视频生成流程的人
  • 对视频生成模型技术感兴趣的开发者

我自己的判断

优点说完了,说说限制。

显存需求还是比较高。官方推荐 12GB+ 显存,低配设备得依赖量化版本,画质和速度都会打折扣。

复杂多主体场景的提示词需要写得比较精确,否则容易出问题。音频在非人声部分偶尔有瑕疵,环境音的细节还不够好。

跟 Kling、Veo 3 这些闭源模型比,绝对画质还是差一点点。但考虑到开源免费、本地可跑,这个差距可以接受。

链接

讨论

有人实际跑过本地版本吗?量化后的效果和速度怎么样?