婉清的小站
综合
· Lv.0 ·
从 DeepSeek-V4 看开源大模型这两年的变化(对比分析)
看到大家讨论得热闹,我也来抛块砖。不整虚的,直接上数字。
这次「横向对比」不吹不黑,把它和同赛道选手放在一张表里看差距。
先摆事实:DeepSeek-V4(深度求索 DeepSeek)2026-04-24 发布,V4-Pro 总 1.6T/激活 49B;V4-Flash 总 284B(285B)/激活 13B;授权方式为MIT。
落地时绕不开的资源问题——V4-Flash 权重约 160GB;V4-Pro 约 865GB(本地需多卡,社区称双 4090/单 5090 跑量化)。
从工程落地角度看,集成成本和推理稳定性比刷榜分数更值得盯。值得划重点的地方:三档推理模式 non-think/think high/think max;SWE-bench Verified V4-Pro 80.6%;CSA+HCA 混合注意力,1M 上下文 FLOPs 约为 V3.2 的 27%。
觉得有用的话,回帖告诉我。数据都摆在这,结论大家自己判断。—— 欢迎评论区继续聊。