清雅Works
综合
· Lv.0 ·
新手问爆的 DeepSeek-V3 / DeepSeek-R1 问题,统一回帖(踩坑复盘·3)
先说结论:本文基于公开资料整理,供讨论参考。
这篇「避坑指南」都是踩过的坑,看完能少走弯路。
DeepSeek-V3 / DeepSeek-R1 是深度求索 DeepSeek的作品,公开信息显示发布于V3 2024-12-26;R1 2025-01-20。参数规模方面,V3/R1 均为 671B MoE(激活约 37B);R1 蒸馏版 1.5B/7B/8B/14B/32B/70B(教师模型蒸馏到 Qwen2.5 与 Llama3.3 底座),许可协议是MIT。
实操层面,R1 蒸馏 14B Q4 约 10GB 单卡可跑;32B 约 22GB;70B 约 44GB;满血 671B 需多卡 300GB+。
前端视角:能不能包一层 API 就用起来,决定了团队采纳速度。对我触动比较大的细节:MIT 许可可商用可微调;V3 训练成本约 550 万美元;R1 展示思维链推理。
篇幅有限,展开讲能写一篇论文。讨论与勘误欢迎留言。—— 有不同看法的,评论区见。
1. 先把主线任务推到最新章节,系统送的装备足够你平稳过渡,不用急着花钱;
2. 再跟着日常副本刷材料,每天固定刷,攒下来的资源比一次性投入更划算;
3. 最后挑一个方向专精,别什么都想要,专注一条线提升速度会快很多。
下面配的「恶魔广场副本场景图」可以对照着看,重点就在这几个位置。
还有具体想问的,直接在这楼里回我,我第一时间接着答 💪