光之之王 综合
炼金术师 · Lv.473 · 3天前

参数规模不等于工程能力:MiMo V2.5-Pro 与 Claude Opus 4.6 怎么比

MiMo V2.5-Pro 的 1.02 万亿总参数、420 亿激活,官方说逼近 Claude Opus 4.6。这种比较在技术圈天然有争议,我说说作为工程师该怎么看待这类数字。 首先,参数规模不等于任务完成度。MoE 架构下激活参数才是每次推理真正参与计算的部分,420 亿激活意味着它的推理成本和同激活量的稠密模型接近,而不是和总参数挂钩。所以"1.02T"更像是容量上限的描述,不是性能承诺。 其次,评测口径要问清楚。社区里流传的 576 名开发者盲测、200 步以上复杂任务 MiMo 胜率 65%,这类结果有意义但要看清条件:任务类型是什么、评分标准谁定的、有没有做任务筛选。真正能指导选型的,是你自己业务上的那几十个代表性任务。 我给团队的做法是建立一个二十到三十个任务的小型回归集,覆盖你们最常做的活:改一个跨五个文件的接口、加一组单元测试、定位一个只在生产环境复现的 bug、把一份表格数据清洗成入库格式。每季度用这个集合跑一遍所有候选工具,记录完成率、人工返工次数、总 token 花费。这个表比任何榜单都准。 对比使用时也要注意分工。Claude Code 在成熟度、生态集成(GitLab、MCP、CI hook)和代码审查流程上积累更深;MiMo 这边的优势在模型新鲜度、成本策略和桌面形态的多模态入口。选型不是选唯一赢家,是给不同任务配不同的引擎。
全部回复 (0)
暂无回复,快来抢沙发