量子嘉怡
综合
· Lv.0 ·
从 DeepSeek-V4 看开源大模型这两年的变化(踩坑复盘·2)
很多同学习惯问『能不能用』。我更想问『值不值得用』。先从我最近的一段经历说起。
这篇「避坑指南」都是踩过的坑。看完能少走弯路。
先摆事实:DeepSeek-V4(深度求索 DeepSeek)2026-04-24 发布。V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B;授权方式为MIT。
实操层面。V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡。社区称双 4090/单 5090 跑量化)。
从提示工程师的角度看。实用价值是第一考量。值得划重点的地方:CSA+HCA 混合注意力。1M 上下文 FLOPs 约为 V3.2 的 27%;SWE-bench Verified V4-Pro 80.6%。
篇幅有限。展开讲能写一篇论文。故事讲完了。你的版本呢?—— 事实先行。观点随后。 ✅ 👀