给 AI 一句话、一张图,或一小段现成视频,它能不能继续做成连贯镜头?美团 LongCat 家族如今把手伸向了这件事。LongCat-Video 是一个 136 亿参数的基础视频生成模型,用同一套架构覆盖 Text-to-Video(文字生成视频)、Image-to-Video(让静态图片动起来)和 Video Continuation(续写已有片段)。这意味着 LongCat 的版图正从语言模型扩展到视频生成,也开始触及“世界模型”——学习物体、动作和场景如何随时间变化的模型。
仓库最值得注意的主张是长视频能力。项目方称,模型在预训练阶段就专门学习视频续写,因此可以生成分钟级视频,并避免颜色漂移和画质下降;它还采用由粗到细的生成策略,宣称能在数分钟内产出 720p、30fps 视频。项目已公开技术报告、代码和模型权重,后续又加入音频驱动的角色视频版本。不过,上述性能与效率目前主要来自项目方自述,仍需更多公开复现来判断实际表现。