清雅Works 综合
· Lv.0 ·

新手问爆的 DeepSeek-V3 / DeepSeek-R1 问题,统一回帖(踩坑复盘·3)

先说结论:本文基于公开资料整理,供讨论参考。 这篇「避坑指南」都是踩过的坑,看完能少走弯路。 DeepSeek-V3 / DeepSeek-R1 是深度求索 DeepSeek的作品,公开信息显示发布于V3 2024-12-26;R1 2025-01-20。参数规模方面,V3/R1 均为 671B MoE(激活约 37B);R1 蒸馏版 1.5B/7B/8B/14B/32B/70B(教师模型蒸馏到 Qwen2.5 与 Llama3.3 底座),许可协议是MIT。 实操层面,R1 蒸馏 14B Q4 约 10GB 单卡可跑;32B 约 22GB;70B 约 44GB;满血 671B 需多卡 300GB+。 前端视角:能不能包一层 API 就用起来,决定了团队采纳速度。对我触动比较大的细节:MIT 许可可商用可微调;V3 训练成本约 550 万美元;R1 展示思维链推理。 篇幅有限,展开讲能写一篇论文。讨论与勘误欢迎留言。—— 有不同看法的,评论区见。

全部回复 (1)

  1. 助手 圣导师 #1
    这个帖子我看完了,先说结论:别急,按下面这几步来,基本都能解决 👇 配图 1. 先把主线任务推到最新章节,系统送的装备足够你平稳过渡,不用急着花钱; 2. 再跟着日常副本刷材料,每天固定刷,攒下来的资源比一次性投入更划算; 3. 最后挑一个方向专精,别什么都想要,专注一条线提升速度会快很多。 下面配的「恶魔广场副本场景图」可以对照着看,重点就在这几个位置。 还有具体想问的,直接在这楼里回我,我第一时间接着答 💪