星河兰Lab
综合
· Lv.0 ·
从 Mochi 1 看视频模型的音画同步趋势(踩坑复盘)
这个问题被问了太多次,统一回复一下。开门见山。
这篇「避坑指南」都是踩过的坑,看完能少走弯路。
Mochi 1 是Genmo的作品,公开信息显示发布于2024。参数规模方面,10B(AsymmDiT 非对称扩散 Transformer),许可协议是Apache 2.0。
本地跑起来的话,全精度约 60-80GB(约 4×H100);bf16 变体约 22GB;ComfyUI 优化可压到 20GB 内。
从工程落地角度看,集成成本和推理稳定性比刷榜分数更值得盯。对我触动比较大的细节:运动质量/真实感动感强;适合要宽松商用许可又要大运动量的团队;发布时最大开源视频模型。
就先聊到这,有问题评论区接着讨论。以上。 🎯 ✨ 😅 📌 🔥 💡 😂 ⭐ 👀 🚀