当研发不再贵:别再盯着怎么写,盯住怎么验

image

中国高超音速技术领先全球的核心在于拥有以 JF-12 和 JF-22 为代表的尖端超高速风洞群,实现了高马赫数(可达30倍以上)与长实验时间(百毫秒级)的复合能力。通过“爆炸驱动”等创新技术,==这些风洞能够真实复现极高空、极高速的飞行环境,使得高超音速飞行器不仅研制快,且成功率高==。

核心结论

  1. 写代码正在变得极其便宜,但判定代码对不对的成本没有同步下降。

  2. 研发流程应该从“控制实现过程”转向“定义交付结果和验收标准”。

  3. 两个 AI 落地抓手:代码找得到、结果看得到。

已经发生的事

2026 年 2 月,Cloudflare 一名工程师用 AI 在 Vite 上重新实现了 Next.js 94% 的 API——路由、SSR、RSC、Server Actions、缓存、中间件,全部从零写。一个人,800 多次编程会话,一周,约 1100 美元 token 费。项目叫 vinext,已开源,带 1700 多个单测和 380 个端到端测试。

他怎么做到的:对着 Next.js 的 API 行为规范,让 AI 反复实现、测试、修正,直到行为一致。

既然 AI 只需要验收标准就能实现目标,那我们花在设计、评审上的过程时间,还有多大价值?

AI 不能一枪必中,人也不能。

但人会多开几枪。

本文的三个前提

前提一:符号处理成本在快速下降

以 Claude 为例。24 年 3 月,Opus 3 定价每百万 Token 15/75 美元。三个月后 Sonnet 3.5 多数基准超过 Opus,价格只有20%。到 26 年初,Opus 4.6 定价 5/25 美元,Sonnet 4.6 只要 3/15 美元。

仅两年,同等能力的成本下降了一个数量级,上下文也从 200K 扩到了 1M。蒸馏、量化、KV缓存、专家网络、专有芯片也都在持续降低推理成本。

前提二:研发的大部分产物是符号

代码、配置、接口定义、测试用例、文档、日志、SQL、页面结构——都是符号。

前提三:研发的目标是结果,不是过程

代码不是目的,技术方案不是目的,过程文档不是目的。

目的是:在给定约束下,稳定产出符合预期的结果。

软件系统是实现目标的手段;研发流程又是实现软件系统的手段;过程文档是实现研发流程的手段…

瓶颈转移:从“写”到“验”

软件开发的核心就两件事:。AI 让前者成本急剧下降。

软件成本 = 编码 + 测试

推理成本在快速下降。但工具调用(备环境、跑测试、取日志)成本没降。涉及物理世界的(硬件联调、用户实验、网络环境)更是。

数据很清楚。Faros AI 对 1 万多名开发者、1255 个团队的遥测数据:高 AI 采用率的团队任务量多 21%,PR 合并多 98%——但审查时间多 91%,PR 体积大 154%,bug 率升 9%。更要命的是,同一批团队的 DORA 指标(部署频率、交付周期、变更失败率、恢复时间)几乎没变。代码多了,交付没快。工作没消失,从“写”挪到了“验”。 Sonar 2026 全球开发者调查(1100+ 人):96% 的开发者不完全信任 AI 代码的功能正确性,59% 认为审查 AI 代码要花“中等”或“大量”额外精力。Anthropic 自己也碰到了——工程团队代码产出过去一年涨了 200%,2026 年 3 月专门推出 Claude Code Review 来解决审查瓶颈。GitHub Octoverse 数据:约 41% 的新代码由 AI 辅助生成,月推送超 8200 万次。

过去:想法多,写出来贵 现在:写出来便宜,不知道哪个是对的

有人问:AI 代码不是越来越准了吗?确实,但要看这个“准”是哪层。

AI 能写出语法正确的代码,很大程度上靠 Compiler 和 Linter。在 Agent 循环,它们能提供毫秒级的反馈——变量不存在、类型不对、导入缺失,眨眼 AI 就能改正。

但难的是第二层:业务逻辑对不对、运行行为符不符合预期、场景覆盖全不全。这些必须让代码真正跑起来,获得真实世界的反馈。

静态验证(类型、语法)已经趋近于零,动态验证(业务)依然昂贵

深一点,孤立系统的熵不会自发减小。完全封闭在符号世界里的推理,产出的只能是“阴阳五行”般自洽但无用的符号闭环。

如今的 Agent 的幻觉降低,很大程度来自我们教会了它去使用 Bash、Python、WebSearch 获得真实世界的负熵。

验证,是把 AI 拉回现实的锚。

实践是检验真理的唯一标准。

流程变革:从“先拍板再实现”到“先实现再筛选”

==过去的生产流程是围绕“研发很贵”设计的==,都是尽可能用评审时间,去保护昂贵的研发时间。

image

但 AI 大幅降低开发成本后,人的评审、测试验收反而变最贵的环节。与其花时间争论哪个方案好,不如让 AI 先干再说。

评审只需一个:需求评审——本质就是“验收标准评审”。明确定义业务的输入、输出,要什么结果。

image

这里有一个关键:验收标准应当是可自动执行的量化的标准,而不是架构、规范之类的散弹枪许愿——全看 AI 道德。

代码越来越像可再生资源,验证体系越来越像稀缺资产。

开头提到的 vinext,关键不在“AI 能写代码”,在于 AI 是对着行为规范搜索兼容实现的。没有明确的行为标准,这事做不成。真正的资产不是 Next.js 的源代码,而是它定义了“什么行为算正确”。 SQLite 代码完全开源,但核心测试框架 TH3 闭源,需要授权。核心代码 15 万行,测试代码 9200 万行——比例约 600:1,100% MC/DC 覆盖。 代码开源,测试闭源。没有完整测试套件,你没法保证数据库不丢数据。护城河不是代码,是验证体系。 2026 年 2 月,开源绘图工具 tldraw 在 GitHub 提出把测试套件(约 327 个文件)从开源仓库迁到闭源仓库(Issue #8082)。理由直接:vinext 证明一套完整测试就够 AI 从零重建整个项目,测试正在成为开源项目最需要保护的资产。提案在 Hacker News 引发大量讨论。这不是个别现象,是趋势。

两个基建:代码找得到 + 结果看得到

做 AI 落地,顺着直觉就是做知识库、写规范…

但它们真的提供信息了吗?

基建一:代码找得到

代码有最全的信息。

微服务架构下,每个服务仓库只有自己一小片的上下文。AI 在一个服务里排查问题,爬到边界就断了,然后人去找另一个服务的人,那边人再问 AI… 本来能在代码里顺着调用链就能爬通的事,变成了:AI → 人 → 人沟通拉会 → 人 → AI。

建立统一仓库(monorepo)就是最简单的手段,让完整的信息对 AI 来说像本地文件一样简单、直接、可访问。

顺着这个思路,很多过程文档的价值也在变。所有的信息,比如 SPEC 文档、设计文档、架构说明里描述的约束、数据流和交互细节,最终都会实现在代码里;代码仓库也就自然成了唯一持续更新的信息,代码之外的文档都会随着迭代逐渐过时不可信。

事实上,大家现在也不怎么搜文档了:都是直接对着仓库问,然后 AI 根据问题追查代码生成“一次性文档”。“现炒”便宜方便,谁还吃“预制”?

所以,代码仓库是唯一的 source of truth,索引和目录文档都只是它的视图,只负责指路,不承载事实本身。

基建二:结果看得到

运行结果产生纠偏信息。

现在的 AI 编程瓶颈不在写代码,在于写完之后:谁来跑、谁来看结果、谁来判断对不对。大多数时候是人——人启动服务,人点页面,人查日志,人看监控。AI 写完代码就停下来等,等人告诉它结果,它再改,再等。一轮几秒钟的代码修改,卡在几分钟甚至几小时的人工验证上。在工厂里,人可以停,但机器不能停——现在 AI 是那台机器,人的验证速度成了产线瓶颈。

要让 AI 自己闭环,两件事要通:

代码找得到,让 AI 有了完整的符号世界;结果看得到,让它有了闭环修正的反馈机制。两个一接通,AI 就能在符号空间里持续闭环优化——因为优化本身也是符号操作。

有些场景看起来难测——分布式故障、安全攻击、硬件交互——但本质上也是同一问题:怎么把现实世界建模到符号世界。

AI 是符号世界的神,是人类发明的通用符号变换器,只要能把智力任务建模成符号变换,AI 就能闭环。

就像通用动力源蒸汽机:只要能把生产过程分解为往复、旋转、推拉等周期性物理运动,蒸汽机就能取代人力。

在这之后:从“造出来”到“搜出来”

一旦有了验证标准,软件研发就可以从“构造问题”变成“搜索问题”。

以前:人一步步把程序写出来。 以后:人定义目标和约束,AI 在符号空间里搜索满足约束的程序。

就像做一个不定积分,C 取多少都对。软件也一样——通过所有测试的实现可能有好几种,每种都“正确”,但可读性、复杂度各不相同。

AI 负责找出所有满足约束的解,人根据自己的品位和工程判断,挑一个最合适的。

最终,可能就在一年后

image

人类下午讨论、AI 半夜干、人类上午验收反馈、AI 中午修正、人类下午体验讨论、AI 凌晨继续干…

人类和 AI 在不同的时区两班倒,产线以半天为单位高速迭代。


附录

核心论断