Augment Code 的 Max 套餐一个月 200 美元,一年就是 2400 美元。Aider、Cline、Goose 三款开源工具,订阅费是 0,你只为调用的模型 token 掏钱。同样是"AI 帮你写代码",价格差出十倍不止,而且这个差距和好不好用没什么关系。
真正决定一个团队能不能用某款 Agent 的,往往不是它在演示视频里跑得多流畅,而是三个更朴素的问题:能不能部署在自己的服务器上,敢不敢把公司代码喂给它的模型后端,出了问题能不能追责审计。这些问题,市面上大多数横评压根不问,因为它们比的都是 IDE 派选手,Cursor、Windsurf、Copilot 排排坐,谁的自动补全更丝滑。
这篇横评换个赛道,只看终端派和开源自托管路线:Aider、Cline、OpenHands、Devin、Augment Code、Block Goose。六款工具,六种部署哲学,逐项核实跑分和价格再往下写。
为什么终端派和自托管值得单独拎出来看
IDE 插件类工具的护城河是体验,自托管类工具的护城河是控制权。一个金融公司的合规团队不会关心自动补全延迟多少毫秒,他们关心的是代码有没有离开内网、模型调用日志能不能审计、出了幻觉性代码谁负责。
这六款工具刚好覆盖了从"完全开源可自托管"到"闭源但按需付费"的整个光谱:
- Aider、Cline、Goose 是纯开源、BYOK(Bring Your Own Key)模式,工具本身免费,你接自己的模型 API Key,甚至可以接本地 Ollama
- OpenHands 同样开源可自托管,但定位更偏"完整 Agent 运行时"而不是轻量 CLI
- Devin 和 Augment Code 是闭源商业产品,前者主打全自主任务执行,后者主打大代码库上下文与企业合规
一个容易被忽略的事实:SWE-bench 跑分很大程度上取决于你接的是哪个底层模型,而不是 Agent 框架本身。Cline 官方并不公布固定的 SWE-bench 分数,因为同一个 Cline,接 Claude Opus 4.8 能到 88.6%,接开源小模型可能腰斩。看跑分表之前,先看清楚这个分数是"工具+模型"组合分,还是工具自己的能力分。
SWE-bench 跑分怎么看
SWE-bench Verified 是目前业界公认最接近真实工作场景的编码 Agent 基准,题目来自真实 GitHub issue,要求 Agent 独立定位、修复、通过测试。但六款工具的跑分性质并不统一,直接摆在一张表里比较容易误导人,所以先拆开说清楚每个数字的来源。
| 工具 | 跑分 | 分数性质 | 来源 |
|---|---|---|---|
| Aider | 未见官方公布固定分数 | 与所接模型强绑定,官方更常用 Exercism 225 题集 | 多方横评站点交叉检索无统一数字 |
| Cline | 88.6%(接 Claude Opus 4.8 时) | 工具+模型组合分,非 Cline 固有能力 | Morph 对 Cursor 替代品的横评 |
| OpenHands | 72% | 官方 Index 报告分数,作为多篇研究论文的参考实现 | OpenHands 官方博客 2026-01-29 |
| Devin | SWE-bench Pro 超过 50%(2026);原始 SWE-bench 13.86%(2024 首发) | Cognition 自测,非第三方独立验证 | Cognition 公开资料及多家评测站汇总 |
| Augment Code | 70.6%(官方口径);Auggie CLI 在 SWE-bench Pro 上 51.80%(2026-04) | 两套不同基准,不能直接对比 | Augment Code 官网与第三方横评 |
| Goose | 67.3%(接 Claude Sonnet 4.6 时) | 社区实测,非官方固定分数 | 第三方 AI 工具评测站汇总 |
看这张表要留一个心眼:Devin 13.86% 和后来的"超过 50%“根本不是同一套基准,前者是 2024 年 3 月首发时的原始 SWE-bench,后者是难度更高的 SWE-bench Pro,两个数字放一起容易让人误以为 Devin 在同一把尺子上进步了 3 倍,其实不是。真实情况是,Devin 底层模型换了几轮,评测集也换了。
Cognition 自己也承认,Devin 的这些分数是在自家测试环境里跑出来的,没有经过第三方独立复现。这不代表数字造假,但意味着你不能拿它和 SWE-bench Verified 官方榜单上其他模型的分数直接排名比较。
六款工具逐个看
Aider:终端派的老牌选手,没有自己的模型立场
Aider 是最早一批把"聊天式改代码"做进终端的工具,GitHub Star 数在 4.6 万左右。它的定位很干脆:不做花哨界面,专注 git diff 式的代码修改流程,每次改动自动生成 commit,出问题一条命令回滚。
它是彻底的模型中立方,接哪个模型的 API Key 就用哪个模型的能力,本身不参与推理,所以严格意义上没有一个"Aider 专属"的 SWE-bench 分数。这也是它至今没有被主流跑分榜单单独列出来的原因之一,它更像一层薄薄的工作流封装,而不是一个独立的智能体。
pip install aider-chat
aider --model claude-opus-4-6 --api-key anthropic=sk-xxx
Cline:VS Code 里长出来的开源怪兽
Cline 装机量超过 500 万,GitHub Star 从 6.4 万涨到 6.5 万只用了很短时间,是这次横评里增长最快的项目。它本质是 VS Code 扩展,Apache 2.0 协议,同样走 BYOK 路线。
它和 Aider 的差异在于交互深度:Cline 有完整的文件系统读写权限确认机制、浏览器操作能力、MCP 协议支持,更接近一个能在编辑器里跑的完整 Agent,而不只是命令行改代码工具。有第三方测算,接不同模型跑 Cline 一个月的 API 开销在 8 到 150 美元之间浮动,取决于你用便宜模型还是旗舰模型。
OpenHands:研究界最爱用的开源底座
OpenHands 前身是 OpenDevin,是这六款里"血统"最特别的一个,它不只是一个工具,更像整个学术界研究 Agentic Coding 的默认实验平台。2026 年 1 月的官方博客给出 72% 的 SWE-bench Verified 分数,这个数字之所以有分量,是因为大量 2025 到 2026 年的 Agent 研究论文都拿 OpenHands 当参考实现来对照自己的方法。
它完全免费自托管,你只需要付底层模型的 API 费用。有测算显示,如果把 OpenHands 接到自己部署的开源模型上,单个任务成本能压到 Devin 的 5% 左右,这对预算有限但任务量大的团队很有吸引力。
Devin:从 500 美元砍到 20 美元的自主 Agent
Cognition Labs 的 Devin 曾经是"自主软件工程师"这个概念的代名词,早期定价高到每月 500 美元。2025 年 4 月,Devin 2.0 把入门价砍到每月 20 美元,直接把这类工具从企业专属拉进个人开发者能负担的区间。
Devin 的核心卖点是全流程自主:拿到一个任务描述,自己规划、写代码、跑测试、开 PR,中间尽量不需要人盯着。这也是它和其他五款最大的不同,其他工具更多是"人在回路里"的协作模式,Devin 想做的是"人只看结果”。代价是可控性更低,出错时排查链路更长。
Augment Code:大代码库和企业合规是主战场
Augment Code 拿到过 2.27 亿美元融资,定价体系是这六款里最规整的:Indie 20 美元/月(4 万积分)、Standard 60 美元/月(13 万积分)、Max 200 美元/月(45 万积分),再往上是需要联系销售的定制企业方案。
它真正的差异化不在跑分,而在企业级合规,Enterprise 套餐自带 SOC 2 Type II 和 ISO 42001 认证,这两个认证是很多企业采购 RFP 里的硬门槛,没有就直接出局,跟功能好不好没关系。如果你的团队要过安全审计,这一条比任何跑分数字都重要。
Goose:被 Linux 基金会收编的野生开源项目
Goose 最早是金融科技公司 Block(原 Square)内部孵化的项目,2026 年捐给了 Linux 基金会旗下新成立的 Agentic AI Foundation,这个动作本身释放的信号很清楚:这不再是一家公司的商业筹码,而是想成为行业公共基础设施。
Goose 用 Rust 写成,Apache 2.0 协议,支持 15 家以上模型供应商,本地 Ollama 也能直接接。GitHub Star 数不同统计口径差异不小,从 2.7 万到 5 万不等,但增长趋势是一致的。典型月度 API 开销在 5 到 50 美元,是这六款里对预算最友好的开源选项之一。
定价速查表
| 工具 | 基础方案 | 高阶/企业方案 | 计费模式 | 是否开源 |
|---|---|---|---|---|
| Aider | 免费 | 无 | 纯 BYOK,只付模型 token 费 | 是 |
| Cline | 免费 | 无 | 纯 BYOK,月度 API 开销约 8-150 美元 | 是(Apache 2.0) |
| OpenHands | 免费自托管 | 无官方付费层 | 只付模型 API/算力费用 | 是 |
| Devin | 20 美元/月起(Core) | 更高用量套餐 + 企业定制 | 订阅制 | 否 |
| Augment Code | 20 美元/月(Indie) | Standard 60 / Max 200 美元/月,企业定制 | 订阅+积分制 | 否 |
| Goose | 免费 | 无 | 纯 BYOK,月度 API 开销约 5-50 美元 | 是(Apache 2.0,Linux 基金会托管) |
功能矩阵表
| 工具 | 自托管 | 本地模型(Ollama等) | 多模型后端 | SOC2/合规认证 | 最近动态 |
|---|---|---|---|---|---|
| Aider | 支持(本地运行) | 支持 | 是,模型中立 | 无 | 持续维护,社区活跃 |
| Cline | 支持(本地运行) | 支持 | 是,MCP 生态丰富 | 无官方认证 | 装机量 500 万+,增速最快 |
| OpenHands | 完全自托管为主 | 支持 | 是 | 无官方认证,学术界广泛复现 | 2026-01 发布 Index 评测报告 |
| Devin | 不支持,托管服务 | 不支持 | 否,绑定 Cognition 自研模型链 | 未公开明确认证 | 2025-04 大幅降价至 20 美元/月 |
| Augment Code | 部分企业私有化部署选项 | 有限 | 支持多模型路由 | SOC 2 Type II + ISO 42001(企业版) | 2026 Auggie CLI 更新 SWE-bench Pro 分数 |
| Goose | 支持(本地运行) | 支持 | 是,15+ 供应商 | 无 | 2026 捐赠给 Linux 基金会 AAIF |
表格里最值得停下来看的一格是 Devin 的"自托管"和"本地模型"两列,全是不支持。这不是产品缺陷,是商业模式的必然选择,Devin 卖的是全自主执行的托管服务,自主性越高,对模型链路的掌控要求越严,开放出去反而会拖累它的核心卖点。想要"自主执行"就得接受"不能自托管",这是个权衡,不是免费午餐。
什么人适合用谁
个人独立开发者,预算敏感、想要模型自由切换的,Aider 或 Cline 是起点。两者都零订阅费,Cline 因为在 VS Code 里跑,学习成本更低;Aider 更适合已经习惯终端和 git 工作流的人。手头有本地显卡想跑开源模型,Goose 的多供应商支持和 Rust 性能会更贴合需求。
小团队(3 到 15 人),如果代码库不算特别庞大、预算有限,OpenHands 自托管 + 团队共享算力池是性价比最高的组合,前提是团队里有人愿意维护部署。如果团队更想要开箱即用、不折腾运维,Augment Code 的 Standard 套餐(60 美元/月/人)性价比也说得过去,毕竟它在大代码库理解上的投入是专门优化过的。
有合规要求的企业,比如金融、医疗、政府相关行业,答案基本锁定在 Augment Code 的 Enterprise 方案,SOC 2 Type II 加 ISO 42001 是绕不开的门槛,跑分高低反而是次要考虑因素。如果企业能接受完全自建运维团队,OpenHands 私有化部署也是一条路,但要清楚这意味着安全责任全部自己扛。
纯离线或强隔离环境(涉密项目、内网无法访问外部 API 的场景),能选的其实只剩下接本地模型的 Aider、Cline、Goose、OpenHands 这四个开源方案,Devin 和 Augment Code 目前的商业模式都依赖云端 API 调用,做不到彻底离线。
写在最后
这次横评刻意避开了 Cursor、Windsurf 这些 IDE 派热门选手,是因为它们已经被写烂了。终端派和自托管路线的六款工具代表的是另一种更朴素的诉求:我要知道我的代码去了哪里,我要能审计模型调用记录,我要在出问题时有能力自己排查而不是等客服回复。
跑分只能告诉你一个模型在标准化测试集上的表现,告诉不了你它接不接受你公司的安全审计,也告诉不了你半夜部署失败时能不能自己重启一个容器解决。Aider 和 Cline 把选择权完全交还给使用者,OpenHands 把整个运行时开源出来任你改造,Goose 干脆被捐给了非营利基金会,这条路线的共同点是,它们都在赌"控制权"比"开箱即用"更值钱。而 Devin 和 Augment Code 赌的是相反的方向:把复杂度封装起来,用合规认证和自主执行力换取企业客户愿意为省心买单。
两条路线没有孰优孰劣,只有合不合适。
参考来源:
- Best AI Coding Agent (2026): Ranked by Terminal-Bench, Price, and Source
- Cursor Alternatives (2026): We Tested 9 Tools
- Cline vs Cursor 2026: $50B Valuation, 58K Stars
- OpenHands Benchmarks: SWE-bench Verified Open-Source Agent
- Introducing the OpenHands Index (2026-01-29)
- Devin AI Review — 13.86% SWE-Bench Score, $20/mo Pricing
- Same Model, 17 More Fixes: Augment Beats Claude Code
- Augment Code Pricing 2026: 5 Plans from $20–$200/month
- Goose by Block — Open-Source AI Agent Review
- Block’s goose and the AAIF