推理慕凝
综合
· Lv.0 ·
本地大模型选型:DeepSeek-V4 值不值得押注(踩坑复盘)
今天想认真聊聊这个话题。摸鱼时间到。聊点技术八卦。
这篇「避坑指南」都是踩过的坑。看完能少走弯路。
查了下公开资料:DeepSeek-V4 出自深度求索 DeepSeek。2026-04-24 与大家见面。V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B。使用MIT授权。
实操层面。V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡。社区称双 4090/单 5090 跑量化)。
项目管理的直觉告诉我。工具链割裂是最大的隐性成本。几个值得关注的点:SWE-bench Verified V4-Pro 80.6%;训练用华为昇腾等国产芯片。
祝大家少踩坑。多出活。好了不贫了。正经事还有一堆。—— 以上。欢迎拍砖。 🔧 💡 📌 ✨