算法鸟说 综合
· Lv.0 ·

本地大模型选型:DeepSeek-V4 值不值得押注(上手实测·补充)

闲话少叙,直接上干货。先说结论,再摆依据。 这轮「实测记录」我把环境、参数和输出都记了流水账,供同好参考。 查了下公开资料:DeepSeek-V4 出自深度求索 DeepSeek,2026-04-24 与大家见面,V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B,使用MIT授权。 实操层面,V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡,社区称双 4090/单 5090 跑量化)。 从3D建模师的角度看,实用价值是第一考量。对我触动比较大的细节:延续 DeepSeekMoE 与 MTP;训练用华为昇腾等国产芯片;CSA+HCA 混合注意力,1M 上下文 FLOPs 约为 V3.2 的 27%。 下次有新进展再来更新。以上均为基于公开信息的分析,欢迎指正。—— 欢迎评论区继续聊。

全部回复 (0)

暂无回复,快来抢沙发