Newsroom
AIEII

AI 编码 Agent 横评:Aider、Cline、OpenHands、Devin、Augment、Goose 六强实测对决

避开 Cursor 和 Copilot 的主流叙事,这次横评六款走终端派与开源自托管路线的 AI 编码 Agent,从 SWE-bench 跑分、真实项目实测、私有部署成本到团队合规,逐项给出定价速查表与选型决策建议。

2026年08月10日

AI 编码 Agent 横评:Aider、Cline、OpenHands、Devin、Augment、Goose 六强实测对决

Augment Code 的 Max 套餐一个月 200 美元,一年就是 2400 美元。Aider、Cline、Goose 三款开源工具,订阅费是 0,你只为调用的模型 token 掏钱。同样是"AI 帮你写代码",价格差出十倍不止,而且这个差距和好不好用没什么关系。

真正决定一个团队能不能用某款 Agent 的,往往不是它在演示视频里跑得多流畅,而是三个更朴素的问题:能不能部署在自己的服务器上,敢不敢把公司代码喂给它的模型后端,出了问题能不能追责审计。这些问题,市面上大多数横评压根不问,因为它们比的都是 IDE 派选手,Cursor、Windsurf、Copilot 排排坐,谁的自动补全更丝滑。

这篇横评换个赛道,只看终端派和开源自托管路线:Aider、Cline、OpenHands、Devin、Augment Code、Block Goose。六款工具,六种部署哲学,逐项核实跑分和价格再往下写。


为什么终端派和自托管值得单独拎出来看

IDE 插件类工具的护城河是体验,自托管类工具的护城河是控制权。一个金融公司的合规团队不会关心自动补全延迟多少毫秒,他们关心的是代码有没有离开内网、模型调用日志能不能审计、出了幻觉性代码谁负责。

这六款工具刚好覆盖了从"完全开源可自托管"到"闭源但按需付费"的整个光谱:

  • AiderClineGoose 是纯开源、BYOK(Bring Your Own Key)模式,工具本身免费,你接自己的模型 API Key,甚至可以接本地 Ollama
  • OpenHands 同样开源可自托管,但定位更偏"完整 Agent 运行时"而不是轻量 CLI
  • DevinAugment Code 是闭源商业产品,前者主打全自主任务执行,后者主打大代码库上下文与企业合规

一个容易被忽略的事实:SWE-bench 跑分很大程度上取决于你接的是哪个底层模型,而不是 Agent 框架本身。Cline 官方并不公布固定的 SWE-bench 分数,因为同一个 Cline,接 Claude Opus 4.8 能到 88.6%,接开源小模型可能腰斩。看跑分表之前,先看清楚这个分数是"工具+模型"组合分,还是工具自己的能力分。

SWE-bench 跑分怎么看

SWE-bench Verified 是目前业界公认最接近真实工作场景的编码 Agent 基准,题目来自真实 GitHub issue,要求 Agent 独立定位、修复、通过测试。但六款工具的跑分性质并不统一,直接摆在一张表里比较容易误导人,所以先拆开说清楚每个数字的来源。

工具跑分分数性质来源
Aider未见官方公布固定分数与所接模型强绑定,官方更常用 Exercism 225 题集多方横评站点交叉检索无统一数字
Cline88.6%(接 Claude Opus 4.8 时)工具+模型组合分,非 Cline 固有能力Morph 对 Cursor 替代品的横评
OpenHands72%官方 Index 报告分数,作为多篇研究论文的参考实现OpenHands 官方博客 2026-01-29
DevinSWE-bench Pro 超过 50%(2026);原始 SWE-bench 13.86%(2024 首发)Cognition 自测,非第三方独立验证Cognition 公开资料及多家评测站汇总
Augment Code70.6%(官方口径);Auggie CLI 在 SWE-bench Pro 上 51.80%(2026-04)两套不同基准,不能直接对比Augment Code 官网与第三方横评
Goose67.3%(接 Claude Sonnet 4.6 时)社区实测,非官方固定分数第三方 AI 工具评测站汇总

看这张表要留一个心眼:Devin 13.86% 和后来的"超过 50%“根本不是同一套基准,前者是 2024 年 3 月首发时的原始 SWE-bench,后者是难度更高的 SWE-bench Pro,两个数字放一起容易让人误以为 Devin 在同一把尺子上进步了 3 倍,其实不是。真实情况是,Devin 底层模型换了几轮,评测集也换了。

Cognition 自己也承认,Devin 的这些分数是在自家测试环境里跑出来的,没有经过第三方独立复现。这不代表数字造假,但意味着你不能拿它和 SWE-bench Verified 官方榜单上其他模型的分数直接排名比较。

六款工具逐个看

Aider:终端派的老牌选手,没有自己的模型立场

Aider 是最早一批把"聊天式改代码"做进终端的工具,GitHub Star 数在 4.6 万左右。它的定位很干脆:不做花哨界面,专注 git diff 式的代码修改流程,每次改动自动生成 commit,出问题一条命令回滚。

它是彻底的模型中立方,接哪个模型的 API Key 就用哪个模型的能力,本身不参与推理,所以严格意义上没有一个"Aider 专属"的 SWE-bench 分数。这也是它至今没有被主流跑分榜单单独列出来的原因之一,它更像一层薄薄的工作流封装,而不是一个独立的智能体。

pip install aider-chat
aider --model claude-opus-4-6 --api-key anthropic=sk-xxx

Cline:VS Code 里长出来的开源怪兽

Cline 装机量超过 500 万,GitHub Star 从 6.4 万涨到 6.5 万只用了很短时间,是这次横评里增长最快的项目。它本质是 VS Code 扩展,Apache 2.0 协议,同样走 BYOK 路线。

它和 Aider 的差异在于交互深度:Cline 有完整的文件系统读写权限确认机制、浏览器操作能力、MCP 协议支持,更接近一个能在编辑器里跑的完整 Agent,而不只是命令行改代码工具。有第三方测算,接不同模型跑 Cline 一个月的 API 开销在 8 到 150 美元之间浮动,取决于你用便宜模型还是旗舰模型。

OpenHands:研究界最爱用的开源底座

OpenHands 前身是 OpenDevin,是这六款里"血统"最特别的一个,它不只是一个工具,更像整个学术界研究 Agentic Coding 的默认实验平台。2026 年 1 月的官方博客给出 72% 的 SWE-bench Verified 分数,这个数字之所以有分量,是因为大量 2025 到 2026 年的 Agent 研究论文都拿 OpenHands 当参考实现来对照自己的方法。

它完全免费自托管,你只需要付底层模型的 API 费用。有测算显示,如果把 OpenHands 接到自己部署的开源模型上,单个任务成本能压到 Devin 的 5% 左右,这对预算有限但任务量大的团队很有吸引力。

Devin:从 500 美元砍到 20 美元的自主 Agent

Cognition Labs 的 Devin 曾经是"自主软件工程师"这个概念的代名词,早期定价高到每月 500 美元。2025 年 4 月,Devin 2.0 把入门价砍到每月 20 美元,直接把这类工具从企业专属拉进个人开发者能负担的区间。

Devin 的核心卖点是全流程自主:拿到一个任务描述,自己规划、写代码、跑测试、开 PR,中间尽量不需要人盯着。这也是它和其他五款最大的不同,其他工具更多是"人在回路里"的协作模式,Devin 想做的是"人只看结果”。代价是可控性更低,出错时排查链路更长。

Augment Code:大代码库和企业合规是主战场

Augment Code 拿到过 2.27 亿美元融资,定价体系是这六款里最规整的:Indie 20 美元/月(4 万积分)、Standard 60 美元/月(13 万积分)、Max 200 美元/月(45 万积分),再往上是需要联系销售的定制企业方案。

它真正的差异化不在跑分,而在企业级合规,Enterprise 套餐自带 SOC 2 Type II 和 ISO 42001 认证,这两个认证是很多企业采购 RFP 里的硬门槛,没有就直接出局,跟功能好不好没关系。如果你的团队要过安全审计,这一条比任何跑分数字都重要。

Goose:被 Linux 基金会收编的野生开源项目

Goose 最早是金融科技公司 Block(原 Square)内部孵化的项目,2026 年捐给了 Linux 基金会旗下新成立的 Agentic AI Foundation,这个动作本身释放的信号很清楚:这不再是一家公司的商业筹码,而是想成为行业公共基础设施。

Goose 用 Rust 写成,Apache 2.0 协议,支持 15 家以上模型供应商,本地 Ollama 也能直接接。GitHub Star 数不同统计口径差异不小,从 2.7 万到 5 万不等,但增长趋势是一致的。典型月度 API 开销在 5 到 50 美元,是这六款里对预算最友好的开源选项之一。

定价速查表

工具基础方案高阶/企业方案计费模式是否开源
Aider免费纯 BYOK,只付模型 token 费
Cline免费纯 BYOK,月度 API 开销约 8-150 美元是(Apache 2.0)
OpenHands免费自托管无官方付费层只付模型 API/算力费用
Devin20 美元/月起(Core)更高用量套餐 + 企业定制订阅制
Augment Code20 美元/月(Indie)Standard 60 / Max 200 美元/月,企业定制订阅+积分制
Goose免费纯 BYOK,月度 API 开销约 5-50 美元是(Apache 2.0,Linux 基金会托管)

功能矩阵表

工具自托管本地模型(Ollama等)多模型后端SOC2/合规认证最近动态
Aider支持(本地运行)支持是,模型中立持续维护,社区活跃
Cline支持(本地运行)支持是,MCP 生态丰富无官方认证装机量 500 万+,增速最快
OpenHands完全自托管为主支持无官方认证,学术界广泛复现2026-01 发布 Index 评测报告
Devin不支持,托管服务不支持否,绑定 Cognition 自研模型链未公开明确认证2025-04 大幅降价至 20 美元/月
Augment Code部分企业私有化部署选项有限支持多模型路由SOC 2 Type II + ISO 42001(企业版)2026 Auggie CLI 更新 SWE-bench Pro 分数
Goose支持(本地运行)支持是,15+ 供应商2026 捐赠给 Linux 基金会 AAIF

表格里最值得停下来看的一格是 Devin 的"自托管"和"本地模型"两列,全是不支持。这不是产品缺陷,是商业模式的必然选择,Devin 卖的是全自主执行的托管服务,自主性越高,对模型链路的掌控要求越严,开放出去反而会拖累它的核心卖点。想要"自主执行"就得接受"不能自托管",这是个权衡,不是免费午餐。

什么人适合用谁

个人独立开发者,预算敏感、想要模型自由切换的,Aider 或 Cline 是起点。两者都零订阅费,Cline 因为在 VS Code 里跑,学习成本更低;Aider 更适合已经习惯终端和 git 工作流的人。手头有本地显卡想跑开源模型,Goose 的多供应商支持和 Rust 性能会更贴合需求。

小团队(3 到 15 人),如果代码库不算特别庞大、预算有限,OpenHands 自托管 + 团队共享算力池是性价比最高的组合,前提是团队里有人愿意维护部署。如果团队更想要开箱即用、不折腾运维,Augment Code 的 Standard 套餐(60 美元/月/人)性价比也说得过去,毕竟它在大代码库理解上的投入是专门优化过的。

有合规要求的企业,比如金融、医疗、政府相关行业,答案基本锁定在 Augment Code 的 Enterprise 方案,SOC 2 Type II 加 ISO 42001 是绕不开的门槛,跑分高低反而是次要考虑因素。如果企业能接受完全自建运维团队,OpenHands 私有化部署也是一条路,但要清楚这意味着安全责任全部自己扛。

纯离线或强隔离环境(涉密项目、内网无法访问外部 API 的场景),能选的其实只剩下接本地模型的 Aider、Cline、Goose、OpenHands 这四个开源方案,Devin 和 Augment Code 目前的商业模式都依赖云端 API 调用,做不到彻底离线。

写在最后

这次横评刻意避开了 Cursor、Windsurf 这些 IDE 派热门选手,是因为它们已经被写烂了。终端派和自托管路线的六款工具代表的是另一种更朴素的诉求:我要知道我的代码去了哪里,我要能审计模型调用记录,我要在出问题时有能力自己排查而不是等客服回复。

跑分只能告诉你一个模型在标准化测试集上的表现,告诉不了你它接不接受你公司的安全审计,也告诉不了你半夜部署失败时能不能自己重启一个容器解决。Aider 和 Cline 把选择权完全交还给使用者,OpenHands 把整个运行时开源出来任你改造,Goose 干脆被捐给了非营利基金会,这条路线的共同点是,它们都在赌"控制权"比"开箱即用"更值钱。而 Devin 和 Augment Code 赌的是相反的方向:把复杂度封装起来,用合规认证和自主执行力换取企业客户愿意为省心买单。

两条路线没有孰优孰劣,只有合不合适。

参考来源

广告合作联系
立即联系 →
加入会员申请
了解详情 →
← Agent 产品周报:Cursor 秘密造 … 38 万星的 openclaw:一个跨系统的个人 AI 助理 … →
💬 Comments
9 min read