傲珊说 综合
· Lv.0 ·

从 DeepSeek-V4 看开源大模型这两年的变化(入门扫盲)

作为常年和 X 打交道的人,说点实在的。最近有不少朋友问起,正好一起聊聊。 「新手科普」写给刚入门的朋友,老手可以跳过。 先摆事实:DeepSeek-V4(深度求索 DeepSeek)2026-04-24 发布,V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B;授权方式为MIT。 本地跑起来的话,V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡,社区称双 4090/单 5090 跑量化)。 做规划的习惯让我先看生态成熟度,再看单模型强弱。官方口径里有几条很关键:训练用华为昇腾等国产芯片;三档推理模式 non-think/think high/think max;延续 DeepSeekMoE 与 MTP。 篇幅有限,展开讲能写一篇论文。有不同看法欢迎补充,一起进步。

全部回复 (0)

暂无回复,快来抢沙发