Cline 在 SWE-bench Verified 自主模式下跑到了 59.8%,Augment 的 Auggie CLI 在 SWE-bench Pro 打出 51.80%,Devin 2026 版在同一榜单超过了 50%。
跑分是真实的,但"跑分高"不等于"能独立干活"。
能从 GitHub Issue 到 PR 全链路自己走完的,和你每天用来补全代码的 AI 助手,是两种完全不同的东西。这篇横评只聊前者。
站内另一篇文章 Cursor、Claude Code、Copilot、Kiro 横评 侧重主流 IDE 体验。这篇换上 7 款更注重 Agent 自主性的工具,把自主级别和 SWE-bench 跑分拼进同一张表里比。
定价速查:谁收钱、谁 BYOK、谁值得算账
先回答最实际的问题。
BYOK 指 Bring Your Own Key,工具本身免费,你只付给 OpenAI 或 Anthropic 的 API 费用。
| 工具 | 免费版 | 付费起步 | 计费方式 | 是否开源 |
|---|---|---|---|---|
| Aider | 是 | 无(纯 BYOK) | API 用多少付多少 | Apache-2.0 |
| Cline | 是 | 无(纯 BYOK) | API 用多少付多少 | MIT |
| Continue | 是 | $10 / 开发者 / 月(Team) | BYOK + 可选托管 | Apache-2.0 |
| Cody | 否(2025 年 7 月已退) | $59 / 用户 / 月(Enterprise) | 按席位,仅企业版 | 部分开源 |
| Windsurf | 是(配额有限) | Pro $20 / 月 | 按日周配额 | 否 |
| Devin | 是(功能受限) | Pro $20 / 座位 / 月 | 按席位,Max 版 $200 | 否 |
| Augment | 否 | Indie $20 / 月(40K credits) | 按积分,Developer $50 / 月 | 否 |
三个细节不能跳过。
Cody 的免费版已经死了。 Sourcegraph 在 2025 年 7 月 23 日正式下架了 Free 和 Pro 套餐。据 buildfastwithai.com 的 2026 年评测,2026 年的 Cody 是纯企业产品,起步价 $59 / 用户 / 月。如果你不是要大批量采购席位的公司,Cody 就不在你的选项里了。
Windsurf 背后是 Devin 的团队。 Cognition(Devin 的开发商)在 2025 年 7 月正式完成了对 Windsurf 的收购。OpenAI 曾谈判以 30 亿美元收购 Windsurf,但因 Microsoft 的合同权利问题最终谈崩,由 Cognition 接手。被收购后,Windsurf 获得了 SWE-1.5 和 SWE-1.6 两个自研 Agent 模型,以及 Devin 的 Cloud Sessions 后台执行能力。从某种意义上说,$20 的 Windsurf Pro 是一个更轻量的 Devin。
BYOK 的真实成本需要你自己算。 Aider、Cline、Continue 表面上是 $0,但用 Claude Opus 4 跑一次中等复杂度的 Agent 任务,API 消耗轻松达到 $2 到 $5。如果你每天密集使用,BYOK 的月度成本完全可能超过 $20 的订阅价。建议在选择之前,先估一下日均 token 消耗量。
功能与自主性矩阵:L1 到 L4 的差距
“支持 Agent 模式"这句话,7 款工具都能说出口。但它们的 Agent,根本不是同一回事。
用四个级别来区分:
- L1 补全/聊天:AI 帮你写代码,你控制一切。
- L2 多文件编辑:AI 跨文件修改,但每一步需要你确认。
- L3 任务级自主:给 AI 一个任务描述,它自己规划步骤、执行改动,中途偶尔 check-in。
- L4 项目级全自主:给 AI 一个 GitHub Issue URL,它克隆仓库、写修复、跑测试、开 PR,基本不需要你盯着。
| 工具 | 最高自主级别 | 终端执行 | 跑测试 | 多模型支持 | GitHub 对接 | IDE 集成 |
|---|---|---|---|---|---|---|
| Aider | L3 | 是 | 是 | 是(BYOK 任意模型) | 是(git 原生) | 否(终端为主) |
| Cline | L3 | 是 | 是 | 是(BYOK 任意模型) | 部分 | VS Code |
| Continue | L3 | 是(2026 新增) | 有限 | 是(含本地 Ollama) | 否 | VS Code / JetBrains |
| Cody | L2 | 否 | 否 | 有限(企业配置) | 是(Sourcegraph) | VS Code / JetBrains |
| Windsurf | L4 | 是 | 是 | 部分(自研+标准) | 是 | Windsurf IDE |
| Devin | L4 | 是 | 是 | 否(自研模型) | 是(Issue 直转 PR) | 独立 Web UI |
| Augment | L3-L4 | 是 | 是 | Claude 为主 | 是 | VS Code / JetBrains |
逐款说几句实质性的话。
Aider:Git 原生是它的核心特性。改完代码自动 commit,提交信息还写得像样。据 morphllm.com 2026 年数据,Aider 的 GitHub Star 已达约 45,945。它的强项是"你告诉我改哪里,我改好提交”。让它从一个 Issue 出发完全自主完成,需要额外的脚本组装。适合已经把 git 工作流打磨得很熟的终端党。
Cline:目前开源阵营里自主性最强的选手。据 morphllm.com 数据,GitHub Star 约 62,996,是开源 Agent 里的头部。VS Code 插件形态,autonomous 模式下可以连续执行:读文件、写代码、跑命令、看输出、再改,整个过程可以设为"不打扰我"。主要成本是 API 费用和偶发幻觉的人工修复。
Continue:定位是"可定制的 AI 编程框架",不是"自主 Agent"。2026 年加了 Agent 执行模式,GitHub Star 超过 35,000。它最大的优势是支持本地 Ollama 模型和完全自定义的 LLM 配置。如果你的需求是零 API 费用、完全本地跑、自由切换模型,Continue 基本上是唯一选项。
Cody:Sourcegraph 的后端能同时检索 10 个代码库的上下文,这在微服务架构下有真实价值。但它不跑自主任务,不执行终端命令,更像一个"超强上下文聊天工具"。2026 年已经是纯企业产品,不在个人开发者的预算范围里。
Windsurf:被 Cognition 收购后,SWE-1.5 和 SWE-1.6 两个自研模型让它的 Agent 能力显著提升。Cloud Sessions 可以在后台异步执行任务,你不用一直盯着进度。它要求你切换到 Windsurf 自己的 IDE,这对已有完整 VS Code 配置的人是一个摩擦成本。
Devin:2024 年作为"世界首个完全自主的 AI 软件工程师"登场。你扔给它一个 GitHub Issue URL,它能独立克隆仓库、写代码、跑测试、开 PR。2025 年降价到 $20 / 月后大幅扩大了用户基数。2026 年版在 SWE-bench Pro 超过了 50%,据 automationatlas.io 的工具档案记录。它的自主性在 7 款工具里最高,但你几乎无法在中途插手或调整方向。
Augment:Auggie 是它的 CLI Agent,主打的是在真实工程团队里落地,支持 VS Code 和 JetBrains,上下文窗口可以覆盖 50 万行代码的仓库。据 onmine.io 报道,Auggie CLI 在 Scale AI 2026 年 4 月发布的 SWE-bench Pro 测试中拿到了 51.80%,是当时所有被测 Agent 中最高的。
SWE-bench 实测:跑分说明什么
SWE-bench 是目前最权威的 AI 编程 Agent 基准。做法是从真实 GitHub 仓库里取出已解决的 Bug Issue,让 Agent 在没有人类帮助的情况下,独立写出能通过测试的补丁。
SWE-bench Verified 是人工核实的 500 个任务子集,比原版更可信。SWE-bench Pro 是 Scale AI 推出的升级版,包含更新的、更接近真实生产场景的 Issue,通过率整体比 Verified 低 10 到 20 个百分点。
| 工具 | SWE-bench Verified | SWE-bench Pro | 备注 |
|---|---|---|---|
| Cline | 59.8% | 未公开 | autonomous 模式 + Claude Sonnet 4.6,据 benchlm.ai 2026 年 7 月榜单 |
| Augment (Auggie) | >68% | 51.80% | Verified 用 Claude Opus 4.6;Pro 数据来自 Scale AI 2026 年 4 月,onmine.io 报道 |
| Devin | 未单独公开 | >50% | 2026 年版,据 automationatlas.io 工具档案 |
| Windsurf | 未公开 | 未公开 | SWE-1.6 Preview 自述"比 SWE-1.5 在 SWE-bench Pro 上提升 10%+",绝对值未披露 |
| Aider | 未进前榜 | 未进前榜 | 旧版 SWE-bench Lite 测试:26.3%;工具侧重人机协作,非纯自主基准 |
| Continue | 未公开 | 未公开 | 框架工具,无独立基准记录 |
| Cody | 未公开 | 未公开 | 企业工具,厂商未参与公开 benchmark |
几点必须说清楚。
Augment 的 68% 是"模型加持"的结果,不完全是 Agent 脚手架的功劳。 当底层模型换成 Claude Opus 4.6,几乎所有工具的跑分都会上台阶。Augment 和 Cline 在 Verified 上的差距,有相当一部分来自 Opus 对比 Sonnet 的模型差距,而不是 Agent 设计本身。
Devin 最初的 13.86% 已经是历史。 2024 年那个数字当时确实颠覆了行业认知,因为之前所有 Agent 都在 5% 以下。2026 年同一产品超过 50%,底层模型的整体提升是主要驱动力。
Windsurf 不公开跑分是策略选择,不是不行。 SWE-1.6 是 Cognition 的商业资产,公开基准意味着竞争对手可以做针对性优化。但这也意味着你在选 Windsurf 时,手上没有独立验证的数字。
一个值得记住的判断标准:SWE-bench 测的是受控环境下的 Bug 修复能力。你的生产代码库比 SWE-bench 仓库更复杂,有更多隐式约定、内部 API 和历史债务。跑分是一个信号,不是在你代码库里的性能保证。
谁该用谁:4 种场景的选择逻辑
数据看完了,说点实际的。
场景一:独立开发者,想控住 API 成本
Cline 是目前开源阵营里最值得押注的。62,996 颗 Star 的社区活跃度保证了持续迭代。用 Claude Sonnet 4.6(比 Opus 便宜约 5 倍)跑 autonomous 模式,是性价比最高的 L3 组合。
Aider 适合不想依赖 VS Code 扩展、偏好终端工作流的人。它的 git 集成是所有工具里最干净的,提交历史清晰可读。
推荐:Cline(首选)或 Aider(终端党 + 极简流)
场景二:想要最省事的全自主,预算可以接受
Devin Pro $20 / 月和 Augment Indie $20 / 月都在入门门槛以内。Devin 适合"把 GitHub Issue URL 粘进去然后去做别的事"这种工作方式,自主程度最高。Augment 适合你想保留 VS Code 操作习惯、同时让 Agent 处理大型仓库上下文的情况,Auggie CLI 的 SWE-bench Pro 跑分也是公开数据里最高的。
推荐:Devin(最高自主性)或 Augment(团队集成更顺滑)
场景三:重度 IDE 用户,不想切换环境
Cline(VS Code)、Continue(VS Code + JetBrains)、Augment(两者都有)都不需要你换 IDE。Continue 是你想完全掌控模型选择时最灵活的方案,包括接本地 Ollama 模型、本地 LM Studio。Windsurf 要求切到它自己的 IDE,摩擦成本不小。
推荐:Continue(最灵活,尤其是本地模型场景)或 Augment(最完整的 Agent 体验)
场景四:企业,大型仓库,有合规要求
Cody 和 Augment 是认真对待这个市场的两个选手。Cody 的核心是 Sourcegraph 的跨仓库检索,能同时理解 10 个代码库的上下文,在微服务架构下有实际价值。Augment 有 SOC 2 和 ISO 42001 认证,支持 on-prem 部署,SWE-bench 跑分是公开数字里最高的。
推荐:Augment(性能 + 合规双到位)或 Cody(超大仓库跨库检索)
写在最后
Agent 自主性这场仗打了两年,2026 年终于有真实的跑分可以横向比较。Cline 的 59.8%、Augment 的 51.80%,都是能拿出来说事的数字,不是营销。
开源阵营(Aider、Cline、Continue)的优势是透明,你知道 Agent 在跑什么,出了问题可以追。闭源阵营(Windsurf、Devin、Augment)的优势是体验更完整,SWE-bench 跑分通常更高。Cody 走出了一条企业专属路线,不在同一个评分维度里。
下一个关键节点是多 Agent 协作。Devin 现在跑的是单 Agent 模式。当多个 Agent 能分工处理同一仓库的不同模块时,这张表会重新洗牌。
参考资料
- Best AI Coding Agents (June 2026): Scored Leaderboard - morphllm.com
- SWE-bench Verified Leaderboard (July 2026) - benchlm.ai
- Augment Code debuts AI agent with 70% win rate, record-breaking SWE-bench score - onmine.io
- Devin 2026: Autonomous AI Engineer - automationatlas.io
- Windsurf Pricing 2026 - nocode.mba
- OpenAI Acquires Windsurf for $3 Billion (deal later completed by Cognition) - devops.com
- Sourcegraph Cody Review 2026 - buildfastwithai.com
- Continue.dev Review 2026 - aicoderscope.com
- Augment Code Review 2026 - weavai.app