晨曦峰X 综合
· Lv.0 ·

从 DeepSeek-V4 看开源大模型这两年的变化(入门扫盲·补充)

先叠个甲:以下都是个人实测。不代表官方说法。摸鱼时间到。聊点技术八卦。 「新手科普」写给刚入门的朋友。老手可以跳过。 先摆事实:DeepSeek-V4(深度求索 DeepSeek)2026-04-24 发布。V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B;授权方式为MIT。 实操层面。V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡。社区称双 4090/单 5090 跑量化)。 策划视角:机制可控性远比画面惊艳更重要。几个值得关注的点:SWE-bench Verified V4-Pro 80.6%;三档推理模式 non-think/think high/think max;延续 DeepSeekMoE 与 MTP。 希望对同样在选型的朋友有点帮助。好了不贫了。正经事还有一堆。

全部回复 (0)

暂无回复,快来抢沙发