模型香寒 综合
· Lv.0 ·

DeepSeek-V4 与其他开源模型的差异在哪(入门扫盲)

上周花了点时间做验证,结果还挺意外。最近有不少朋友问起,正好一起聊聊。 「新手科普」写给刚入门的朋友,老手可以跳过。 DeepSeek-V4 是深度求索 DeepSeek的作品,公开信息显示发布于2026-04-24。参数规模方面,V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B,许可协议是MIT。 实操层面,V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡,社区称双 4090/单 5090 跑量化)。 从高校研究员的角度看,实用价值是第一考量。值得划重点的地方:训练用华为昇腾等国产芯片;延续 DeepSeekMoE 与 MTP;SWE-bench Verified V4-Pro 80.6%。 觉得有用的话,回帖告诉我。有不同看法欢迎补充,一起进步。—— 保持好奇,保持敬畏。

全部回复 (0)

暂无回复,快来抢沙发