· Lv.0 ·

从 DeepSeek-V4 看开源大模型这两年的变化(部署要点·补充)

闲话少叙,直接上干货。先从我最近的一段经历说起。 「部署笔记」是给想自己动手的朋友准备的,重点在配置与资源占用。 DeepSeek-V4 是深度求索 DeepSeek的作品,公开信息显示发布于2026-04-24。参数规模方面,V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B,许可协议是MIT。 实操层面,V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡,社区称双 4090/单 5090 跑量化)。 从工程落地角度看,集成成本和推理稳定性比刷榜分数更值得盯。对我触动比较大的细节:训练用华为昇腾等国产芯片;延续 DeepSeekMoE 与 MTP;CSA+HCA 混合注意力,1M 上下文 FLOPs 约为 V3.2 的 27%。 以上就是我的全部实测,散会。故事讲完了,你的版本呢?—— 事实先行,观点随后。

全部回复 (0)

暂无回复,快来抢沙发