Alibaba: HappyHorse 1.0 被描述为一款开源的最先进 AI 视频生成器,具有原生音视频联合生成功能——这意味着 alibaba: HappyHorse 1.0 视频模型可以在单次前向传递中同时生成视频帧和相应的音轨(对话、环境音、拟音),而不是先生成静音视频再进行后期配音。 根据社区整理的架构说明,该模型围绕一个 150 亿参数的统一自注意力 Transformer 构建,可在单个标记序列内处理文本、图像、视频和音频标记。据报道,它在构建时没有采用专用的交叉注意力分支,也没有单独的音频模块。结合 DMD-2 蒸馏技术,据称其蒸馏版本在 NVIDIA H100 上仅需 8 个去噪步骤,且无需无分类器引导(classifier-free guidance),即可在大约 38 秒内生成 1080p 视频。
- 输入类型:
- 输出类型:
- 输入:
- —
- 输出:
- $0.112-0.192/秒
- 上下文长度:
- —
- 最大输出:
- —