MLog
返回文章列表
Tech#agentic-engineering#ai-coding#vibe-coding#developer-tools

从 Vibe Coding 到 Agentic Engineering:AI 编程的真正转折

发布于: 2026年7月22日阅读时长: 8 min

Karpathy 在红杉 Ascent 峰会上提出 Agentic Engineering 取代 Vibe Coding,本文深度解读其核心洞察:你可以外包思考但外包不了理解、LLM 是鬼魂而非动物、CPU 将沦为配角,以及这对开发者的真正意义。

一句让全场沉默的话

2026 年 5 月,红杉 Ascent 峰会上,Andrej Karpathy 说了一句让在场所有人沉默的话:"我从未像现在这样,感觉自己落后于编程。"

说这话的人,是 OpenAI 联合创始人、前特斯拉 Autopilot 负责人,也是去年发明了 "Vibe Coding" 这个词的人。当他承认自己跟不上编程的速度时,这不是谦虚——这是一个信号:软件工程正在经历一场比我们想象中更彻底的重新定义。

Vibe Coding 的遗产

去年此时,"Vibe Coding" 席卷了整个技术圈。这个概念描述了一种全新的编程方式:与 AI 对话、描述需求、让模型生成代码。门槛骤降,从未写过代码的人也能做出能用的产品。

但 Karpathy 在峰会上直言:Vibe Coding 只适合做 Demo。

他做了明确的区分。Vibe Coding 提高的是所有人的编程下限,让没有技术背景的人也能做出东西。但它的产物往往脆弱、不可维护、经不起生产环境的考验。而 Agentic Engineering 的目标完全不同——在不降低专业软件质量标准的前提下,用这些易出错、随机、能力不均匀的 Agent 把开发速度拉起来。

Agentic Engineering:新范式的轮廓

Agentic Engineering 不是简单地"用 AI 写代码"。它代表了一种全新的工作结构。

Karpathy 描述了这种模式的核心循环:定义上下文 → 定义工具 → 定义反馈循环 → 定义护栏 → 让 Agent 工作 → 保留人类的理解。

这个循环里的每个环节都在重新定义软件工程师的角色。你不是在写代码,你是在设计一个让代码自己生成、自己测试、自己部署的系统。

他举了一个震撼的数据:过去业界讨论的是"10 倍工程师",而现在做得好的 Agentic Engineer,产出倍数远超十倍。在招聘时,他不再考算法题,而是给候选人一个完整的大项目——比如做一个面向 Agent 的 Twitter 克隆——然后用多个高级 Agent 去攻击它,观察候选人如何用工具、架构和判断力守住质量。

三个值得反复琢磨的洞察

1. "你可以外包思考,但外包不了理解"

Karpathy 引用了一条反复回味的推文来解释人的价值到底还剩什么。他举例:自己已经完全记不住 PyTorch 里 keepdimkeepdims 还是 keep_dimreshapepermute 的细微差别——这些 Agent 记得住。但你必须理解底层有 viewstorage 的区别,否则在高性能场景里会无谓拷贝内存。

他在自己的产品 MenuGen 里踩过坑:Agent 曾经拿 Stripe 邮箱和 Google 登录邮箱交叉匹配账户资金。任何有经验的工程师都知道这两个邮箱不能当用户 ID 用。这类设计决策、边界判断和审美,目前仍然完全在人身上。

2. "我们不是在造动物,是在召唤鬼魂"

这是整场对话最核心的比喻。Karpathy 指出,现在的主流叙事容易把这些模型想象成动物——有意图、有动机。但实际上它们更像鬼魂:由预训练的统计模拟回路作为基座,上面再叠加强化学习。没有情绪,不会因为你态度好就表现更好,只是数据和奖励函数召唤出来的锯齿状智能体。

理解这一点对 Agentic Engineer 至关重要——你不是在跟一个有意识的东西合作,你是在驾驭一种被大量数据训练出来的、能力极不均匀的统计模式。

3. "CPU 将沦为配角"

Karpathy 认为大模型正处在和汽车、互联网、智能手机刚出现时一样的被误判阶段——被理解为旧事物的加速器,而不是新物种。当计算的重心从传统 CPU 转向 GPU 集群和专用 AI 芯片,整个软件栈和基础设施都要跟着变。

当下的工具图景

这些洞察在工具层已经有了清晰的映射。

截至 2026 年 7 月,AI 编程工具的竞争已经白热化。OpenAI Codex 在 GPT-5.5 驱动下以 83.4% 的 Terminal-Bench 2.1 得分领先,Claude Code 基于 Opus 4.8 紧随其后。Cursor 的 Composer 2.5 支持全仓库感知和自动调度,被 Jensen Huang 公开背书——NVIDIA 四万名工程师都在用。GitHub Copilot 将付费计划全面转向用量计费。Google 的 Jules 结束 Beta 测试正式入局。

但 Levelop 的 90 天实测排名强调了一个关键事实:基准测试分数只能作为起点。 真正决定工具价值的,是它处理复杂多文件任务的能力、融入现有工作流的自然程度,以及定价是否合理。

留给开发者的真正问题

Agentic Engineering 不是让你失业,而是让你重新定义自己的价值。

Karpathy 承认有时看 Agent 写的代码会"心里咯噔一下":功能跑得通但特别臃肿、充满复制粘贴、抽象层又丑又脆。他试过反复让模型把代码简化再简化,效果极差,感觉"就像在拔牙"。因为这已经走到了模型 RL 回路的边缘——它不知道什么是优雅,只知道什么是概率上正确的。

所以 Agentic Engineering 真正考验的,不是你多会用 AI。是你作为一个工程师,到底有没有独立判断什么是好代码、好架构和好的设计决策的能力。 这个能力,在 Agent 时代不是变弱了,是变得更关键了。