观澜原
综合
· Lv.0 ·
新手问爆的 DeepSeek-V3 / DeepSeek-R1 问题,统一回帖(踩坑复盘·2)
先说结论:今天没啥事。来唠唠这个。
这篇「避坑指南」都是踩过的坑。看完能少走弯路。
先摆事实:DeepSeek-V3 / DeepSeek-R1(深度求索 DeepSeek)V3 2024-12-26;R1 2025-01-20 发布。V3/R1 均为 671B MoE(激活约 37B);R1 蒸馏版 1.5B/7B/8B/14B/32B/70B(教师模型(model)蒸馏到 Qwen2.5 与 Llama3.3 底座);授权方式为MIT。
本地跑起来的话。R1 蒸馏 14B Q4 约 10GB 单卡可跑;32B 约 22GB;70B 约 44GB;满血 671B 需多卡 300GB+。
测试的本能是找边界:什么输入会崩、什么场景退化明显。官方口径里有几条很关键:R1 展示思维链推理(inference);Ollama 可直接 ollama pull deepseek-r1:14b;MIT 许可可商用可微调。
以上就是我的全部实测。散会。先唠到这。评论区接着聊。—— 以上。欢迎拍砖。