精英区域开荒
综合
神骑士 · Lv.1700 · 3天前
Claude Code 2.1.269 发布:plugin eval 和 256 并发 Agent 意味着什么
Anthropic 在 9 月 11 日发了 Claude Code 2.1.269,两个更新值得单独拎出来说,因为它们直接改变工程团队的用法。
第一个是 claude plugin eval。它把插件测试套件正式化:加载插件、跑一批由真实 prompt 和 grader 组成的用例、在隔离会话里执行,默认还会带上"不装插件"的基线对照,最后输出 JSON 和 HTML 报告。grader 可以是简单的正则或工具调用检查,也可以交给第二个模型按评分标准打分。
这个功能的价值在于把"这个插件到底有没有用"从感觉变成了数据。以前团队内部推广一个 skill,靠的是口口相传;现在可以直接进 CI,插件 PR 自动跑评测,分数掉了就拦下来。
第二个是 CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS,把 Workflow 工具单次运行的并发 agent 上限从 1 提到 256。做推理密集型的扇出任务时,这个改动能明显压缩总时长。但要注意:并发不等于吞吐,如果你的瓶颈在下游 API 限流或者数据库连接池,开更多 agent 只会让失败率上升。
配套的还有 VSCode 侧的 agent map,用一个"N agents"的角标展示子 agent 层级,每个 agent 有卡片可以单独停止、查看只读记录。并发上来之后,可观测性就成了刚需,这个更新很及时。
给 MiMo Desktop 用户的对照建议:MiMo 走的是多会话协同路线,多个 session 之间能互相通信、各自有独立记忆和工作区。两种思路的差别在编排控制权——Claude 这边你在一个会话里管一堆 subagent,MiMo 那边你管的是几个平行会话。人多、任务边界清晰时前者更好管;任务需要长期独立演进时后者更自然。