Cognition拿Kimi K3炼出SWE-2:逼近Astra,成本仅1/4
发布时间:2026-09-11
动察 Beating AI 快讯,Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。它直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测又提高约 5 到 6 个百分点。在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。它距离 Fable 5.1 的 50.9% 只差 0.9 个百分点,但成本低 64%。GPT-6 Astra 得分 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为四分之一。SWE-2 也比上一代少走很多弯路。中等推理强度下,它完成任务的交互轮数减少 58%,平均成本下降 81%。不过在更难的 Terminal-Bench 4 上,SWE-2 只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,还谈不上全面追平前沿模型。SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考----------交流群:https://t.me/dunwangyuanhuiwang

动察 Beating AI 快讯,Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。它直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测又提高约 5 到 6 个百分点。


在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。它距离 Fable 5.1 的 50.9% 只差 0.9 个百分点,但成本低 64%。GPT-6 Astra 得分 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为四分之一。


SWE-2 也比上一代少走很多弯路。中等推理强度下,它完成任务的交互轮数减少 58%,平均成本下降 81%。不过在更难的 Terminal-Bench 4 上,SWE-2 只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,还谈不上全面追平前沿模型。


SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。

----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang