Grok 4.5 vs SWE-1.7:当编程智能体走向两极,7 月这一周发生了什么
2026 年 7 月 8 日,SpaceXAI 发布 Grok 4.5,Cognition 发布 SWE-1.7。一边是 1.5 万亿参数的巨兽,一条是用 1000 tok/s 把每一个 PR 都打便宜的精益路线。同期 Meta Muse Spark 1.1 上线付费 API、OpenAI GPT-5.6 商用、Anthropic Sonnet 5 复刻 Opus 体验……编程智能体不再是单一赛道,而是分化出截然不同的几类物种。
同一周,三个完全不同的方向
2026 年 7 月 8 日那天,如果你只看新闻头条,会以为整个 LLM 行业都约好了同一天开发布会。
- SpaceXAI Grok 4.5:1.5 万亿参数的 MoE,与 Cursor 合作训练,端上来就要在 Terminal-Bench 2.1 跑 83.3%。
- Cognition SWE-1.7:基于 Moonshot Kimi K2.7 微调,每任务 $1.97,靠 1000 tok/s 的吞吐把单位 PR 成本压到极限。
- OpenAI GPT-5.6(Sol/Terra/Luna):三档分层,Sol 第一次在 ARC-AGI-3 跑赢公开游戏,Cerebras 上同权重跑到 700+ tok/s。
一周之后,Meta 跟了一步——Muse Spark 1.1 成了 Meta 第一个付费 Model API,1M 上下文窗口,一口气在 MCP Atlas、JobBench、Humanity's Last Exam、Finance Agent V2 拿了第一。
这不再是「谁家模型又大了」的故事了。编程智能体正分化成几种完全不同的物种。我把 7 月这一周的几个关键发布拆开聊聊,看看你做项目选型的时候,哪条路线更值得押注。
Grok 4.5:参数巨兽 + 训练数据特权
Grok 4.5 是 SpaceXAI(也就是 xAI 改名并入 SpaceX 之后那个统一品牌)整合后放出的第一款旗舰。它跑在全新的 V9 基座上,总参数 1.5 万亿,MoE 架构。最有意思的不是参数规模,而是训练数据。
官方说,他们用了「trillions of tokens of real Cursor agent-interaction data」来训练它。换句话说,Grok 4.5 见过 Cursor 内部大量的真实 IDE 交互轨迹——Agent 怎么读代码、怎么跑命令、怎么回滚、怎么在多文件之间跳转。
这跟过去那种「在 GitHub 公开代码上预训练」的路线完全不同。它是「在 IDE 里实际看到 Agent 是怎么干活的」那种训练。听起来有点像 RLHF,但是 RLHF 关注的是「这个回答好不好」,这里关注的是「这个工具调用序列对不对」。
数据特权直接反映在价格上:$2/$6 per 1M tokens(输入/输出),比 Opus 4.8 在 SWE-Bench Pro 上每个任务消耗的输出 token 少大约 75%。
但 SpaceXAI 自己承认了一个尴尬的事实:Grok 4.5 的 CursorBench 分数被污染了。因为训练集里混进了 Cursor 自己的代码库快照,那个榜单的成绩被高估了。
这件事说明两件事:
- 「训练数据 = 产品壁垒」这条路是可行的,但代价是「对训练数据来源要非常谨慎」。
- 行业需要更多抗污染的评测基准——Terminal-Bench 2.1 之所以被信任,是因为它是隔离的运行环境。
SWE-1.7:另一个极端,把单位任务成本打到地板
跟 Grok 4.5 几乎是同一天,Cognition 推出了 SWE-1.7。它的故事完全相反。
基础模型是 Moonshot 开源的 Kimi K2.7(这次他们大方地公开了,不像 SWE-1.5 当时藏着 GLM 基座),用强化学习在四个数据中心做了微调。结果是 FrontierCode 1.1 从基座的 30.1% 拉到 42.3%——和 GPT-5.5 持平,但还是略输 Opus 4.8。
性能不是故事的全部。重点是经济性:
- 通过 Cerebras 部署 Lightning 跑出 1000 tok/s 的吞吐
- 每个 FrontierCode 任务约 $1.97
- 付费 Devin 用户免费一个月
它不卖公共 API,只服务 Devin 和 Windsurf。这是 Cognition 自己的判断:编程智能体的价值不应该在 API 那一层被卖,而是要嵌进「能交付 PR」的产品里。
这跟 Grok 4.5 形成了鲜明对比:
- Grok 4.5 卖「更聪明的大脑」
- SWE-1.7 卖「更便宜地交付一个 PR」
两者并不冲突,但客户会分成两群人:要的是模型能力 vs 要的是单任务成本。
背景板:GPT-5.6、Meta Muse Spark、Anthropic Sonnet 5
这一周不只有这两家。
OpenAI GPT-5.6 拆成三档:Sol(旗舰)、Terra(5.5 智能水平,价格砍半)、Luna(轻快)。Sol 在 ARC-AGI-3 跑出 7.8%,是第一个在公开游戏上击败人类的模型。METR 后来拒绝发布自己那份预部署评估——因为测到了有史以来最高的「基准作弊率」。OpenAI 的 system card 也披露了大约 0.25% 的「未授权动作」事件。
值得记住的是:GPT-5.6 Sol 用了和 GPT-5.5 一样的 ~4T 参数 Spud 预训练基座。也就是说 4 万亿这个量级可能就是一段时间内的「上限」了,再往上扩的红利开始递减,分档和产品形态的优化会更重要。
Meta Muse Spark 1.1 是 Meta 的转折点——第一款付费 Model API(公开预览,$20 免费额度,初期仅限美国)。1M 上下文窗口,桌面 / 浏览器 / 移动端 Computer Use,并行 subagent 委派。在 Vals AI 的 Harvey Legal Agent 基准上跑出 20%,比 Fable 高出近一倍。但和 Muse Image 一样没有开放权重。
Anthropic Claude Sonnet 5 走「小杯接 Opus」的路线:intro pricing $2/$10(8 月 31 日前),表现逼近 Opus 4.8。新分词器被吐槽会增加最多 35% 的 token 消耗——这等于变相涨价。
这一周给开发者选型的几个信号
把这些放在一起看,几个趋势已经比较清晰:
1. 「数据特异性」比「参数堆砌」更重要
Grok 4.5 胜在「见过真实 Cursor Agent 怎么干活」,SWE-1.7 胜在「在 RL 训练里被强化过 PR 完成路径」。两者都不是靠「更大」赢的。下一阶段真正分胜负的是训练数据的「特异性和真实性」。
2. 单位经济性正在重塑商业模型
1000 tok/s、Cerebras Lightning、$1.97 一个任务、$0.038 每百万 token(美团 LongCat-2.0)——这些数字共同指向一件事:当 token 成本跌到一定程度,「按 token 卖」的商业模式会瓦解。Cognition 不开公共 API 是这个判断的极端表达。
3. 评测污染是新战场
SpaceXAI 自己披露 CursorBench 污染、METR 拒绝发布预部署评估、OpenAI 公布「未授权动作」频率——行业正在被迫建立「可信基准 + 透明披露」的规范。这件事比单点模型的发布更重要。
4. 1M 上下文成为标配
Muse Spark 1.1 的 1M 上下文、OpenAI 在 GPT-5.5 早就推到 1M、Anthropic 也在 Sonnet 系列扩大。长上下文 + 真实 IDE 训练正在成为编程智能体的入场券。
写在最后
如果你是独立开发者,做项目选型的时候:
- 需要「模型自己推理能力更强」 → 盯着 Grok 4.5、GPT-5.6 Sol、Opus 4.8 这一档;
- 需要「大量 PR 的单位成本更便宜」 → 看 SWE-1.7、LongCat-2.0、或者用 Cerebras 部署的开源模型;
- 需要「能跑桌面 / 浏览器 / 移动端」 → Muse Spark 1.1、ChatGPT Work、GitHub Copilot 桌面 app 这一类已经全平台铺开。
7 月这一周,编程智能体没有出现「统一的最强者」,反而是分化出了「更强 vs 更便宜 vs 更广覆盖」的三条明确路线。这未必是坏事。开发者能选,模型供应商就必须做得更专,对整个生态是好事。
下次有值得拆开看的新发布,我再写一篇。