7 月 9 日,The Information 甩出一条独家消息:Cursor 正在内部秘密开发一个代号「Sand」的项目。
不是新的代码补全模型,不是又一个 IDE 插件。是一个通用 AI Agent,用来处理邮件、文档、表格。换句话说,Cursor 要做一款不写代码的产品。
这条消息发出的同一个月,Claude Code 桌面版悄悄多了一个开关:让 Claude 自己打开 iOS 模拟器,跑你的 App,点几下界面,截几张图。再过几天,Claude 的语音模式也解锁了 Opus 和 Sonnet,不再默认那个说车轱辘话的 Haiku。
三件事分开看都是产品更新。放在一起看,方向只有一个:写代码的工具,正在争着变成能替你干活的工具。
一、Sand 是什么,为什么偏偏现在做
先说清楚 Sand 目前是什么状态:一个还没公开发布、连发布时间都没确定的内部项目。
据 The Information 报道,Sand 在 6 月底就开始了内部灰度,Cursor 员工已经在自己用。定位很明确:不是给程序员用的,是给所有需要处理邮件、文档、表格的普通办公用户用的。这是 Cursor 成立以来第一次正面做一款面向非工程师的产品。
一家靠「让程序员写代码更快」建立全部声誉的公司,突然要去抢行政助理和运营的活。这个转向本身,比 Sand 具体能干什么更值得琢磨。
为什么是现在。答案摆在桌面上:Anthropic 的 Claude Cowork 已经在 4 月 9 日 GA,直接跑在你的桌面文件系统上,能连续无人值守地跑定时任务;OpenAI 的 ChatGPT Work 也在 7 月 9 日上线,走浏览器虚拟环境路线,自带图像生成和把任务一键变成可分享网页的 Sites 功能。
一个是从 Claude Code 往外扩,一个是从 ChatGPT 往外扩。两边都在把「聊天机器人」升级成「能替你把活干完的助手」。Cursor 手里握着的,是全球编程 Agent 里心智占有率最高的产品,眼看着两个邻居在自己家门口把院子扩大了一圈,不跟进就是眼睁睁看着增长天花板被划走。
这笔账不难算。据多家媒体综合 2026 年融资与营收数据,Cursor 母公司 Anysphere 的年化收入从 2025 年初的 1 亿美元一路冲到 2026 年 2 月的 20 亿美元,内部预期年底做到 60 亿美元 ARR。SpaceX 在 6 月 16 日敲定以 600 亿美元收购 Anysphere,交易预计三季度完成。
| 时间节点 | 事件 | 数据 |
|---|---|---|
| 2025 年 1 月 | ARR 破 1 亿美元 | — |
| 2025 年 6 月 | ARR 破 5 亿美元 | — |
| 2025 年 11 月 | ARR 破 10 亿美元 | — |
| 2026 年 2 月 | ARR 破 20 亿美元 | — |
| 2026 年 6 月 16 日 | SpaceX 敲定收购 Anysphere | 600 亿美元估值,Q3 交割 |
| 2026 年 6 月底 | Sand 开始内部灰度 | 面向非工程师办公场景 |
| 2026 年 7 月 9 日 | The Information 首次曝光 Sand | 尚无公开发布时间 |
这条曲线陡得吓人,但恰恰是这条曲线,让 Sand 的命运变得不那么确定。The Information 的报道里有个细节很关键:Cursor 没有承诺过 Sand 一定会公开发布,而 SpaceX 那笔 600 亿美元的收购一旦交割,完全可能重写 Anysphere 的整条产品路线图。一个专注造飞船和卫星互联网的公司,会不会容忍旗下 AI 公司分心去做办公助理,这本身就是个问号。
说白了,Sand 现在的状态更像是「先占坑再说」。哪怕最后不上线,光是被曝出「Cursor 也在做通用 Agent」这条新闻,就足够让 Claude Cowork 和 ChatGPT Work 在做叙事对比时多一个假想敌。这门生意里,占位有时候比落地更划算,估值故事需要的是「想象空间」,不是急着把产品推出去接受用户挑剔。
二、Claude Code 伸手到模拟器,意味着什么
如果说 Sand 是一次战略级的越界,那 Claude Code 桌面版接入 iOS 模拟器就是一次战术级的越界,但方向是一致的:从「写代码」走向「验证代码真的能用」。
TestingCatalog 在 7 月下旬曝光了这个功能,随后被 9to5Mac、MacRumors、MacStories 陆续报道确认。目前它是 macOS 上 Claude Code Desktop 的公测功能,Pro、Max、Team 三档付费用户可用,Enterprise 计划暂不支持。
用法很直接:把 iOS 项目文件夹作为工作目录打开一个会话,然后跟 Claude 说一句类似「把这个功能跑起来,检查一下新用户引导流程」。只要项目本身能在 iOS 模拟器里编译运行,Claude 就会自己完成编译、安装、启动这一整套动作,模拟器画面会实时投射在侧边栏,你能看着它一步步点过去,也可以在它跑的同时自己伸手戳一戳界面。
这里有个容易被忽略但很重要的设计:每次要动用一台设备,Claude 都会先问一句,用户可以在设置里彻底关掉这项能力。TestingCatalog 披露的一段官方描述写得很直白,Claude 会在这台 Mac 的安卓模拟器里帮你验证改动,跑你的 App,带你走一遍流程,截图录屏都算上,但每次用设备前都会先问过你。Android 模拟器的支持已经在路上,只是还没正式放出来。
这条功能线放在两年前的编程工具语境里,几乎不可想象。写代码的工具管代码,测试是测试工程师或者 CI 流水线的事。Claude Code 现在把这条边界抹掉了:它不满足于「帮你写出能编译的代码」,它要亲眼确认这段代码在真实运行环境里长什么样、走不走得通。
| 维度 | 传统开发调试流程 | Claude Code + iOS 模拟器 |
|---|---|---|
| 验证方式 | 开发者手动编译、启动、点击走查 | Claude 自动编译、安装、启动、走查 |
| 反馈路径 | 开发者看完效果再回头改代码 | 同一个会话里边跑边改边看 |
| 记录留存 | 靠开发者手动截图 | 自动截图、录屏 |
| 平台覆盖 | 因人而异 | iOS 已公测,Android 开发中 |
| 权限颗粒度 | 无 | 每次用设备前询问,可整体关闭 |
这件事的分量不在「省了几分钟手动操作」,而在验证闭环被收进了同一个对话里。过去 AI 写代码和人工验证之间隔着一道墙,AI 交完活就撒手,人拿回来自己编译自己点。现在这道墙被拆掉一半,Claude 自己就能看到它写的代码运行起来是什么样子,这意味着它下一步修复问题时,参照的不再只是错误信息,而是真实的界面反馈。
这也是为什么它值得和 Sand 放在同一篇周报里说。两者本质上是同一个动作在两个方向上的延伸:Sand 是把 Agent 的手伸到「非代码的日常办公」,模拟器功能是把 Agent 的手伸到「代码之外的真实设备」。编程工具不再满足于只活在代码编辑器那一小块地盘。
三、语音不再是玩具:模型选择器的分量
第三条动态看起来最不起眼,但其实最说明问题。
Claude 的语音模式一直存在一个尴尬:不管你在界面上选了什么模型,回复它的永远是速度最快、能力最弱的 Haiku。这不是秘密,是很多重度用户吐槽过的事,语音交互图的就是快,用强模型会拖慢响应,Anthropic 干脆把选择器锁死。
TestingCatalog 在 7 月下旬发现,这个隐藏了大约三周的模型选择器突然生效了,选 Opus 或 Sonnet 真的会切换到对应模型作答,不再是摆设。几天后 TestingCatalog 又跟进确认,正式版本对应的是 Opus 4.8 和 Sonnet 5,同时新增了西班牙语、法语、印地语、日语等多语种支持,新版体验已经在网页端和移动端逐步铺开。
语音模式解锁 Opus 和 Sonnet 之后,能处理需要调用工具和 Connectors 的复杂任务了。它接入的工具范围比 ChatGPT 语音模式广得多,这才是真正的差距所在,而不是谁的语音听起来更自然。
这句话点出了关键。过去评价一个语音助手好不好用,比的是延迟、语气、打断能不能接得住。现在这套评价体系正在失效,因为语音模式的角色变了,它不再只是一张会说话的嘴,而是一个可以调动 Connectors、执行复杂多步任务的入口。你用嘴说一句「帮我查一下这周的日程冲突,然后把邮件回了」,背后跑的可能是 Opus 在做推理规划,再调用几个工具真的把事办掉。
选 Haiku 还是 Opus,本质上是在语音场景里选「快问快答」还是「愿意等几秒换一个真正会办事的大脑」。这个选择权交还给用户,说明 Anthropic 判断语音正在从边缘的便利功能,变成 Agent 能力矩阵里一个正经的入口,值得配上旗舰模型和完整的工具调用权限。
三件事串起来看会更清楚一条隐藏的时间线。语音模式解锁强模型,意味着输入端的门槛在降低,说话就能触发复杂任务。iOS 模拟器接入,意味着执行端的验证闭环在收紧,AI 写完能自己确认跑得通。Sand 的曝光,意味着覆盖范围在从代码往办公全场景铺开。三条线合在一起,指向的不是某一个功能升级,而是「编程工具」这个物种正在整体进化成「通用工作 Agent」。
四、编程工具越界之后,谁会先掉队
把这三件事放在一起复盘,能看出几层博弈。
第一层是 Cursor 和 Anthropic 的正面对撞。Cursor 靠编程 Agent 起家,估值冲到 600 亿美元,但它自己心里清楚,编程这个赛道天花板就在那儿,全球程序员数量是有限的。Sand 要抢的是行政、运营、内容这些体量大得多的办公人群,这块地盘目前是 Claude Cowork 和 ChatGPT Work 在分。Cursor 选在这个时间点做 Sand,与其说是产品野心,不如说是被同行倒逼出来的防御动作,眼看着 Anthropic 一边巩固编程优势一边往外扩张办公场景,Cursor 如果只守着代码这一亩三分地,增长曲线迟早会撞到天花板。
第二层是 Anthropic 内部的自我强化。Claude Code 接入 iOS 模拟器,语音模式解锁 Opus,这两件事看起来是两条产品线各自的升级,实际上都在服务同一个目标:让 Claude 系产品之间的边界越来越模糊。你在 Claude Code 里写代码,它自己帮你在模拟器里跑起来;你用语音跟 Claude 说话,它能调用 Connectors 真的把事办掉。写代码和办公室日常两条线,正在被同一套底层能力焊接起来,这恰恰是 Cursor 最想复制、但目前复制不了的地方,Anthropic 手里同时握着最强的编程模型和最广的工具生态,这是护城河,不是单点功能。
第三层是留给普通开发者和小团队的机会窗口。当巨头都在往「通用 Agent」这个大而全的方向挤,垂直场景反而会出现缝隙。比如专门给某个细分行业做验证闭环的小工具,比如只服务某一类 Connectors 的轻量集成商。巨头忙着扩边界的时候,往往会漏掉那些体量小但粘性高的细分需求,这些缝隙不需要跟 Anthropic 或 Cursor 拼模型,拼的是对某个具体场景的理解深度。
谁会先掉队?我的判断是,那些还在把自己定义成「单一功能工具」的产品会先掉队,不管是纯代码补全,还是纯语音转文字。用户的心智正在被重新训练,习惯了一句话触发一整套多步骤任务之后,再回头用只会做一件事的工具,会觉得别扭。至于 Sand 到底会不会真的公开发布,600 亿美元的 SpaceX 交易会不会把它扼杀在摇篮里,这个问题现在没人能给出确定答案,包括 Cursor 自己。
不过有一点是确定的:编程工具的边界正在被集体推倒,这件事不会因为某一个具体产品的成败而逆转。
写在最后
三条新闻,一条逻辑。Sand 想从代码伸向办公桌,模拟器功能想从代码伸向真实设备,语音模式想从快问快答伸向复杂任务执行。方向都是同一个:把自己从「写代码的助手」升级成「能替你把事办完的助手」。
这场竞赛没有终点线,只有不断被重新划定的边界。下一次曝光,大概率还是某个巨头又往外挪了一步。
参考资料
- The Information: Cursor is developing a general-purpose AI agent
- TestingCatalog: Claude Code desktop iOS simulator
- TestingCatalog: Claude Voice Mode model selector
- TechTimes: Cursor’s ‘Sand’ Agent Eyes Claude Cowork Market Before SpaceX Rewrites Its Roadmap
- MacRumors: Claude Code Can Now Build and Test iOS Apps in Apple’s Simulator
- MacRumors: Claude Voice Mode Gains Opus and Sonnet Model Support