数据森Notes
综合
· Lv.0 ·
从 Wan2.1(通义万相 2.1) 看视频模型的音画同步趋势(入门扫盲)
作为常年和 X 打交道的人,说点实在的。本文基于公开资料整理,供讨论参考。
「新手科普」写给刚入门的朋友,老手可以跳过。
Wan2.1(通义万相 2.1) 的基本盘:阿里云·通义万相 打造,2025-02-26 发布,1.3B(极速版)/ 14B(旗舰版),遵循Apache 2.0。
显存这关,1.3B 约 8GB 消费卡可跑;14B 量化后约 24GB(全精度 40GB+)。
站在架构视角,我更关心它能不能嵌进现有技术栈而不是单点性能。官方口径里有几条很关键:社区有 GGUF/Kijai 量化版;3D 因果 VAE + DiT + Flow Matching + T5 文本编码器;1.3B 版约 30 秒出 5 秒视频(A100)。
篇幅有限,展开讲能写一篇论文。讨论与勘误欢迎留言。