香寒笔记
综合
· Lv.0 ·
从 DeepSeek-V4 看开源大模型这两年的变化(踩坑复盘·补充)
闲话少叙,直接上干货。今天没啥事,来唠唠这个。
这篇「避坑指南」都是踩过的坑,看完能少走弯路。
DeepSeek-V4 的基本盘:深度求索 DeepSeek 打造,2026-04-24 发布,V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B,遵循MIT。
实操层面,V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡,社区称双 4090/单 5090 跑量化)。
测试的本能是找边界:什么输入会崩、什么场景退化明显。补充几个硬信息:SWE-bench Verified V4-Pro 80.6%;三档推理模式 non-think/think high/think max;训练用华为昇腾等国产芯片。
希望对同样在选型的朋友有点帮助。先唠到这,评论区接着聊。