上周 Lightricks 开源了 LTX-2.3,一个 220 亿参数的视频生成模型。让我感兴趣的是两点:它能同时生成画面和声音,而且本地就能跑。
这是什么
LTX-2.3 是 Lightricks 在 2026 年 3 月发布的开源视频生成模型。支持三种输入方式:文字生成视频、图片生成视频、音频驱动视频。最高能输出 4K 分辨率,原生支持 9:16 竖屏格式。
关键是音视频同步生成——画面和声音是在同一个模型里一起出来的,不是先生成画面再配音。
为什么我觉得值得发
开源 + 本地可跑。 模型权重完全开放,支持商业使用。通过 FP8 + GGUF 量化,8G 显存的设备也能跑。不想折腾的可以直接用 LTX Studio 在线版。
竖屏原生支持。 大多数视频模型还是横屏优先,这个直接支持 9:16,做短视频内容的可以省去后期裁切。
LoRA 微调。 官方说 1 小时内能完成风格或动作的定制化训练。我没实测,但这个方向对独立创作者挺友好的。
适合谁
- 做短视频内容,想试试 AI 生成素材的人
- 有显卡资源,想本地部署视频生成流程的人
- 对视频生成模型技术感兴趣的开发者
我自己的判断
优点说完了,说说限制。
显存需求还是比较高。官方推荐 12GB+ 显存,低配设备得依赖量化版本,画质和速度都会打折扣。
复杂多主体场景的提示词需要写得比较精确,否则容易出问题。音频在非人声部分偶尔有瑕疵,环境音的细节还不够好。
跟 Kling、Veo 3 这些闭源模型比,绝对画质还是差一点点。但考虑到开源免费、本地可跑,这个差距可以接受。
链接
- 官网:LTX-2.3: Introducing LTX's Latest AI Video Model | LTX Model
- Hugging Face:Lightricks/LTX-2.3 · Hugging Face
- GitHub:GitHub - Lightricks/LTX-2: Official Python inference and LoRA trainer package for the LTX-2 audio–video generative model. · GitHub
- 技术论文:[2601.03233] LTX-2: Efficient Joint Audio-Visual Foundation Model
讨论
有人实际跑过本地版本吗?量化后的效果和速度怎么样?