Cognition launches new SWE-2 model(Cognition 发布软件工程模型 SWE-2)
2026/9/10大约 3 分钟
Cognition launches new SWE-2 model(Cognition 发布软件工程模型 SWE-2)
📅 2026-09-10 | 🏷️ 模型发布 & 行业动态 | ⭐ HN 343 分/140 评论
🔗 原文:https://cognition.com/blog/swe-2
是什么
做 AI 编程智能体 Devin 的公司 Cognition 通过官方博客发布新的软件工程模型 SWE-2,官方口径称其表现可与 Fable 5.1 和 GPT-Astra 比肩。第三方模型追踪站另报其在 Terminal-Bench 2.1 上取得 92.8 分。HN 讨论热度 343 分/140 评论。
🔍 小白解读
先说几个词
- Cognition:AI 编程智能体 Devin 的开发公司,「AI 当程序员」赛道的头部玩家。
- SWE(Software Engineering)模型:专为真实软件工程任务(读代码库、改代码、跑测试、提交修复)优化的模型,不是通用聊天模型。
- Terminal-Bench:考察模型在真实终端环境里干活能力的基准测试——不是答题,而是真的去操作命令行完成任务,2.1 是其版本号。
- Fable 5.1 / GPT-Astra:本次发布中被官方拿来对标的两个前沿模型(对标对象名称来自官方博客标题)。
这篇到底在说什么
打个比方:原本卖「AI 员工」的公司,突然宣布自己开始造「AI 员工的大脑」了。Cognition 此前主要把别家模型装进 Devin 这个自动化编程产品里,现在推出自研的 SWE-2,等于把产品核心的上游能力收归自家。官方称它已能与两大前沿模型掰手腕,第三方追踪的 Terminal-Bench 2.1 高分(92.8)给了外部参照。HN 上 343 分、140 条评论——工程社区对「谁来给编码智能体供脑」这件事的敏感度可见一斑。
这跟普通人有什么关系
AI 编码工具的竞争越激烈,开发者能白嫖或低价用到的能力就越强;而对购买 AI 编码服务的企业,多一个强势供给方意味着议价空间。
为什么值得架构师关注
- 垂直模型 vs 通用模型的分野加深:专攻软件工程的模型在专项基准上冲高,意味着「编码智能体选型」要从「选哪家通用大模型」细化为「通用底座 + 垂直 SWE 模型」的双层决策。
- 产品公司自研模型:下游 Agent 产品向上游模型延伸,可能改变现有采购结构(使用 Devin 等产品的团队需关注技术栈与定价变化)。
- 基准的参考价值与局限:Terminal-Bench 2.1 的 92.8 分来自第三方追踪口径(缓存数据:tokenstead 页面),内部验收仍应以自有代码库任务集实测为准。
核心内容
- Cognition 官方博客发布 SWE-2,标题口径:对标 Fable 5.1 与 GPT-Astra(缓存数据:cognition.com 博客标题)。
- 第三方追踪:Terminal-Bench 2.1 得分 92.8(缓存数据:tokenstead.ai 页面标题,HN 56 分/25 评论)。
- HN 主讨论 343 分/140 评论(缓存数据:hn.json)。
- 开源/闭源与定价:缓存未含许可证信息;Cognition 为产品型公司,模型大概率随其产品体系提供,以官方博客为准。
行动建议
要不要更新选型:编码智能体重度使用的团队,值得在一两周内用内部真实任务集(修 bug、写测试、跨文件重构)对比 SWE-2 与现役组合;关注其对 Devin 产品线定价与模型透明度的影响。轻量使用者了解即可,等生态价格信号明朗再动。