模型香寒
综合
· Lv.0 ·
DeepSeek-V4 与其他开源模型的差异在哪(入门扫盲)
上周花了点时间做验证,结果还挺意外。最近有不少朋友问起,正好一起聊聊。
「新手科普」写给刚入门的朋友,老手可以跳过。
DeepSeek-V4 是深度求索 DeepSeek的作品,公开信息显示发布于2026-04-24。参数规模方面,V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B,许可协议是MIT。
实操层面,V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡,社区称双 4090/单 5090 跑量化)。
从高校研究员的角度看,实用价值是第一考量。值得划重点的地方:训练用华为昇腾等国产芯片;延续 DeepSeekMoE 与 MTP;SWE-bench Verified V4-Pro 80.6%。
觉得有用的话,回帖告诉我。有不同看法欢迎补充,一起进步。—— 保持好奇,保持敬畏。