计算机自动化能写清的,LLM 自动化能验证的
前沿实验室用强化学习训练模型,奖励来自可验证的结果。因此模型在数学、代码等可验证领域能力冲上尖峰,在此之外则粗糙毛边。

DEPTH PROFILE
Andrej Karpathy
AI 教育者、研究者
Eureka Labs 创始人,前 OpenAI 创始成员、前特斯拉 AI 总监
EDITOR'S SELECTION
7 条经过五问筛选的核心判断
前沿实验室用强化学习训练模型,奖励来自可验证的结果。因此模型在数学、代码等可验证领域能力冲上尖峰,在此之外则粗糙毛边。
他亲手写的菜单识别应用被一句 prompt 加图像模型整体取代,让他断言那些旧范式代码本不该存在。别只问什么变快了,要问什么第一次变得可能。
前者让所有人都能做出软件,后者是一门工程学科:协调强大但易错、带随机性的 agent 去加速交付,同时不许引入漏洞。你仍为你的软件负全责。
能重构十万行代码的模型会建议你步行去 50 米外的洗车店。GPT-4 象棋水平暴涨,只是因为大量棋谱进了预训练集。可验证、加上实验室在乎,共同决定能力的峰与谷。
做 microGPT 时他反复要求模型简化、再简化,模型就是做不到,因为简化不在 RL 的奖励电路里。审美与克制暂时仍是人的领地。
他最大的不满是各种框架文档仍默认由人来操作:去这个网址、点这个设置。agent 原生的世界里,安装说明就是一段复制粘贴给 agent 的技能文本。
他转引一条令他每隔一天就想起的推文并深表认同:人已成为整个环节的瓶颈,不理解就无法判断该做什么,也无法指挥 agent。转述注:此句原为他人推文,经他引用并展开。
ALL INSIGHTS
按当前资料入库顺序排列
前沿实验室用强化学习训练模型,奖励来自可验证的结果。因此模型在数学、代码等可验证领域能力冲上尖峰,在此之外则粗糙毛边。
他亲手写的菜单识别应用被一句 prompt 加图像模型整体取代,让他断言那些旧范式代码本不该存在。别只问什么变快了,要问什么第一次变得可能。
前者让所有人都能做出软件,后者是一门工程学科:协调强大但易错、带随机性的 agent 去加速交付,同时不许引入漏洞。你仍为你的软件负全责。
能重构十万行代码的模型会建议你步行去 50 米外的洗车店。GPT-4 象棋水平暴涨,只是因为大量棋谱进了预训练集。可验证、加上实验室在乎,共同决定能力的峰与谷。
做 microGPT 时他反复要求模型简化、再简化,模型就是做不到,因为简化不在 RL 的奖励电路里。审美与克制暂时仍是人的领地。
他最大的不满是各种框架文档仍默认由人来操作:去这个网址、点这个设置。agent 原生的世界里,安装说明就是一段复制粘贴给 agent 的技能文本。
他转引一条令他每隔一天就想起的推文并深表认同:人已成为整个环节的瓶颈,不理解就无法判断该做什么,也无法指挥 agent。转述注:此句原为他人推文,经他引用并展开。
假期里他发现最新模型产出的代码块不再需要修改,要多少来多少,信任逐步累积,自己就滑进了 vibe coding,副业项目文件夹从此爆满。
在电路内你飞速前进,在电路外寸步难行。模型没有说明书,只能自己探索边界;落在电路外,就该考虑构建自己的可验证环境去做微调,别指望开箱即用。
多数公司还没为 agent 时代重构招聘。他建议的考法:造一个给 agent 用的 Twitter 克隆并做到安全,然后派十个顶配 agent 去攻破它。考察的是协调 agent 的真实能力,不是解题。
他的应用曾用邮箱地址跨系统关联付款,这种人不会犯的诡异设计导致漏账。agent 极其强大却会犯怪错,顶层设计与验收必须由人把持。
他已经不记得是 keepdim 还是 dim,这些细节交给记性极好的 agent。但张量的 view 与 storage 必须懂,否则连内存被白白复制都看不出来。
写 MenuGen 最痛苦的不是代码,是在各家服务后台点菜单、配 DNS。当一句话就能让应用建成并上线、全程不碰人手,基础设施才算真正为 agent 而生。
他把读过的文章喂进自己的 wiki,不断向它提问、要求换角度重组。对固定资料做不同投影是他强化理解的工具,呼应他那句理解不可外包。
连写作这类主观产出,也能靠一组 LLM 评审团给出足够合理的验证信号。差别只在难易与先后,不在能不能。
他预计 agent 之间将直接协商会议与合作细节,我的 agent 和你的 agent 谈。agent 代表制是世界走向 agent 原生的自然结果。
旧时代谈 10x 工程师。他观察到擅长 agentic engineering 的人,峰值放大倍数已远超十倍,而且这个天花板还在升高。
EVIDENCE
观点所依赖的证据层
2026-04-29 · 30 分钟 · EN