Cognition 发布 SWE-2 编码 Agent 模型:性能逼近 Fable 5.1,成本降 81% 却遭 benchmark 质疑

发布时间:2026/9/11 19:40:00
Cognition 发布 SWE-2 编码 Agent 模型:性能逼近 Fable 5.1,成本降 81% 却遭 benchmark 质疑 Cognition 昨日发布 SWE-2 编码 Agent 模型由 Kimi K3 通过 RL 后训练而来。它在多项评测中表现出色成本大幅降低但在新基准测试中分数不佳引发社区对 benchmark 策略的讨论。模型性能表现SWE-2 在 FrontierCode 1.1 Main 上得分 50.0%距 Fable 5.1 仅差不到 1 个百分点比 GPT-5.6 Sol 高 2.5 分价格还比 Fable 5.1 便宜 64%。在 DeepSWE 1.1 上超 Fable 5.1 和 Grok 4.6略高于 GPT-5.6 SolTerminal-Bench 2.1 更是达 92.8%。新基准测试落差不过在新发布的 Terminal-Bench 4 上SWE-2 仅 27.3%远低于 Opus 5 和 Astra。这种新旧基准分数落差成了“benchmaxxing”讨论焦点。RL 训练方案亮点RL 训练方案是技术看点让训练任务覆盖所有推理努力级别奖励函数 R S − λₑC把 λₑ 设成基座模型在该努力级别的帕累托前沿斜率逻辑严谨。行为指标与成本优化行为指标上SWE-2 medium 平均每轮步数从 127 降到 53首次真实编辑中位步数从 48 降到 18成本降了 81%。社区争议与回应Hacker News 社区讨论集中在 benchmark 策略有人质疑融资估值也有人为其辩护。还有用户反馈使用摩擦Cognition 员工给出回复。编辑观点SWE-2 性能有亮点且成本降低但新基准测试表现不佳引争议。未来需平衡 benchmark 策略与模型实际应用才能在竞争中站稳脚跟。