文本生成视频
Mochi 1 是 Genmo 的开源文本生成视频模型,可将文字提示转化为生成的视频。
Genmo 是一家专注于开放视频生成模型的研究实验室。其主要公开产品是 Mochi 1,一个通过托管试玩区和开源仓库提供的开源文本生成视频模型。
该网站将 Mochi 1 定位为可根据书面提示生成短视频的模型,重点强调运动质量和提示遵循能力。Genmo 还表示,用户可以在本地运行、按需自定义,或使用 ComfyUI;同时,该预览版依据 Apache 2.0 许可发布,可用于个人和商业用途。
Mochi 1 是 Genmo 的开源文本生成视频模型,可将文字提示转化为生成的视频。
该模型旨在紧密遵循详细提示,博客将其描述为在角色、场景和动作方面具有较强的提示遵循能力。
Genmo 表示,该预览版可生成 30 帧每秒的流畅视频,单段最长 5.4 秒,并注重连贯的运动效果。
开源仓库可在本地运行,Genmo 也表示 Mochi 可通过 ComfyUI 使用。
产品包含一个托管试玩区,用户可以直接在浏览器中测试 Mochi 1。
该版本以 Apache 2.0 开放,开发者可获取开源权重和源代码。
当你希望先在试玩区获得基于浏览器的起点,再转向本地运行或自定义时,可根据文本创建简短的提示驱动视频。
在本地运行开源仓库,以便将模型适配到你的工作流、实验或研究工作中。
如果你更喜欢基于节点的创作工作流,可使用 ComfyUI 支持来测试 Mochi 1 的输出。
评估模型是否适合注重运动质量和提示遵循能力的应用,例如研究预览或产品实验。
在考虑当前 480p 和短时长限制的前提下,依据预览版的 Apache 2.0 许可生成个人或商业视频片段。
Genmo 的试玩区是体验 Mochi 1 最简单的方式,无需先配置开源仓库。网站也提供了开源版本,适合希望在本地运行或进行自定义的用户。
博客文章说明,Mochi 1 的初始研究预览版可在 Apache 2.0 许可下用于个人和商业用途。
首个版本是一个 480p 的基础模型。博客提到 Mochi 1 HD 计划在后续推出,但不包含在初始版本中。
Genmo 说明 Mochi 1 可以从开源仓库中在本地运行,也可以通过 ComfyUI 使用。博客还提到 HuggingFace 上的开源权重以及 API 合作伙伴。