文 | 字母 AI
经常拿 AI 写代码的人都知道,写出能跑的程序不难,但你稍不留神,文件就莫名大了好几倍。
我曾经心血来潮让 AI 帮我写个网站,虽然用几句话就生成了,但打眼一看,它硬生生给我写了两千多行屎山。
在 AI 编程普及之前,写代码是最耗时的事情,但 AI 现在太厉害了,以前需要几个小时甚至几天才能完成的代码,现在分分钟就能整出来。
但问题是,代码是堆起来了,那些屎里淘金的脏活也堆了起来。
AI 可以一分钟写出几百行代码,但公司不可能因为它勉强能跑,就把这些代码直接扔给几百万用户。
一家给 AI 生成的代码 " 冲厕所 " 的公司,因此贵了近十倍。
8 月 12 日,据 TechCrunch 报道,为 GitHub Actions 提供持续集成(Continuous Integration,CI)基础设施的 Blacksmith 完成 4500 万美元 B 轮融资,估值达到 5.5 亿美元。而不到一年前,它的估值还只有约 6000 万美元。

让它身价暴涨的不是测试本身,是那些需要处理的代码,正在变得越来越多。
AI 写的代码,人类已经看不过来了
Blacksmith 很早就发现,代码变得有点太多了。
2025 年 9 月,公司在宣布 A 轮融资时披露,过去一年,在排除开发者人数增长的影响后,其现有客户运行的持续集成任务量,平均每个季度增长 60%。
Blacksmith 把这种变化归因于 AI 编程工具的爆发——毕竟人一天只有 24 个小时,能够生产的代码有限,后面的测试、构建和代码审查自然也有一个上限。
但 Coding Agent 的爆发改变了这个局面。
现在的多数编程 Agent 都可以读取代码库、修改多个文件、运行测试,再把结果交给人类,而不只是帮程序员补几行代码。更为重要的是,Agent 不仅不需要下班,不需要睡觉,还可以调度多个 Subagent,把一个复杂任务拆开,同时处理多个不同工作。
于是,代码生产开始摆脱 " 有多少程序员,就有多少双手 " 的限制,从手工作坊迈向工业时代。
Claude Code 负责人 Boris Cherny 的工作方式,已经有点像一座小型代码工厂。
今年 6 月,Boris Cherny 在 Fortune Brainstorm Tech 大会上说,自己已经 8 个月没有手写过一行代码。
取而代之的是,他开始管理一支越来越庞大的 Agent 队伍。Boris 表示,大会当天早上,他同时管理着 " 几百个 "Agent;有些时候,这个数字会变成几千,甚至几万个。

2025 年 8 月底,OpenAI 一个最初只有 3 名工程师的团队,从一个空白代码库开始,用 Codex 开发一款内部软件。
规则很简单:人类不直接写代码,应用逻辑、测试、CI 配置、文档、可观测性和内部工具,全部由 Codex 生成。
五个月后,这个代码库已经膨胀到约 100 万行,期间完成了约 1500 个代码合并请求(Pull Request,PR)。OpenAI 估算,同样的工作,如果全部由人类手写代码,大约需要十倍的时间。

代码生产的上限,就这样开始脱离人类的工作时间。
但很快,新的问题出现了:代码写得太快,人开始看不过来了。
OpenAI 在这次实验中直接写道:随着代码吞吐量增加,他们遇到的新瓶颈变成了 " 人类 QA 能力 "。
因为不管 Agent 能写多少代码,人类的时间和精力毕竟是有限的。
这个团队每周五都要拿出整整一天,专门清理所谓的 "AI slop",也就是 AI 写出的那些屎山代码。它们通常来自 Agent 在快速生成代码时带来的副作用:比如重复或错误的实现模式、不一致的代码风格,以及在系统中不断累积的技术债。
但很快,这事儿也有点干不过来了。
于是 OpenAI 又把 " 擦屁股 " 的工作交给了 Agent:让后台 Codex 任务定期扫描代码库,发现问题,自动提交重构 PR。甚至连大量代码 Review,也开始交给 Agent 之间互相检查,人类只在需要判断的时候介入。
也就是说,AI 开始同时出现在生产线两端:一边疯狂生产代码,另一边帮人寻找这些代码里的问题。
但中间那些必须实际跑完的测试、构建和 CI 任务,并没有消失。
Blacksmith 写了一句很直白的话:如果每一次代码修改仍然需要一个小时才能测试完,那么一个比人类快 100 倍的 Coding Agent,也没有太大意义。
AI 没有消灭软件开发的瓶颈。
它只是把瓶颈,从 " 这个代码到底怎么写 ",推到了 " 这么多代码到底怎么验 "。
AI 代码过剩后,给代码 " 冲厕所 " 的公司贵了十倍
要理解 Blacksmith 为什么能在不到一年的时间里从 6000 万美元涨到 5.5 亿美元,得先弄清楚这家公司的主要业务。
一段代码从程序员手里写出来,到真正出现在用户手机或者电脑上,中间还有很长一段路。
比如你给一个购物网站增加了新的支付按钮,代码写完以后,首先得确认它能不能正常编译;然后跑一遍自动测试,看看按钮能不能用;再跑更多测试,确认这次修改没有顺手把登录、购物车或者退款功能搞坏。
这些事情通常会被组织成一套自动流水线:程序员每提交一次代码,机器就自动把代码拉下来,重新构建软件、运行测试、检查结果。发现问题就打回去,全部通过以后,代码才有资格继续往下走。
而这个流水线,就叫作持续集成(Continuous Integration,CI)。
GitHub 自己的 GitHub Actions,就是最常见的 CI 工具之一。
而 Blacksmith 真正做的,是这套流水线下面的 " 执行层 "。
GitHub Actions 负责规定 " 要跑哪些测试、按什么顺序跑 ",Blacksmith 则提供真正执行这些任务的计算环境。
换句话说,Blacksmith 并不帮你写测试规则,而是提供机器,把构建、测试和部署这些任务真正跑完。
它最初的卖点也很直接:让 GitHub Actions 跑得更快、更便宜。
按照 Blacksmith 的说法,它使用高单核性能 CPU、本地缓存和 NVMe 存储来运行这些任务,大部分 CI 任务速度可以达到 GitHub 托管服务器的约 2 倍;一些 Docker 构建在缓存生效后可以获得更大的加速。对于开发者来说,迁移可能只需要修改一行 GitHub Actions 配置。

但 AI 编程恰好把它最不起眼的地方,变成了优势:过去程序员一天提交几次代码,CI 就跑几次;现在 Agent 可以持续改代码、反复尝试,还能并行调用 Subagent,每一次修改都会触发新一轮构建、测试和验证。
Blacksmith 在 A 轮融资时就提到,随着 AI 代码生成工具的发展,代码数量的快速增加正在把 CI 推向新的瓶颈。为此,Blacksmith 没有简单依赖通用云计算资源,而是针对 CI 任务优化自己的硬件和软件栈,提供更快的执行速度、更高的并发能力,以及更适合测试流程的计算环境。
AI 越会写代码,Blacksmith 需要跑的机器反而越多,这门过去藏在软件开发后台的 " 脏活 ",就这样被 AI 放大了。
2025 年 9 月,Blacksmith 已经服务约 800 家组织;不到一年后,这个数字增长到 5000 多家。
公司的员工数量从约 10 人增加到 30 人左右,年化收入则从 1000 万美元进入 " 数千万美元 " 区间,据 TechCrunch 报道,一些最大的客户每年在 Blacksmith 上的支出已经超过 100 万美元。
今天的 Blacksmith,已经不满足于只做一个更快的 CI 执行层,它也开始把 AI 能力往上叠。
比如 Codesmith 可以读取代码仓库、修改代码并创建 PR,也可以根据 CI 失败信息辅助定位和修复问题;Test Analytics 负责整理测试失败信息;Testboxes 则会给 Agent 临时创建一个虚拟测试环境,让它把刚改完的代码真正跑一遍,如果失败,结果再返回给 Agent 继续修改。

于是,代码生产和代码验证,都开始变得越来越自动化、Agent 化。
但这里有一个关键区别。
AI 可以自己找 Bug、改代码,但最后那句 " 这段代码真的能用 ",不能靠它自己说,必须真跑一遍。
而只要真的运行,就会消耗真实的计算资源。模型可以把写代码的边际成本不断压低,但服务器不会因为代码是 AI 写的就少跑一次测试,量大再凑个满减。
Blacksmith 赚的,本质上是这最后一笔省不掉的钱。
AI 写代码的终点,是一个更大的验收产业
事实上,过去一年,几乎所有主流 AI 公司都开始往代码生产线的后半段走。
Codex 刚推出时,OpenAI 还专门提醒用户:即使 Agent 已经可以自己修改代码、运行测试,在真正集成和执行之前,AI 生成的代码仍然需要人工 Review 和验证。
但很快,Codex 自己也开始做 Review。2025 年 9 月,OpenAI 披露,Codex 已经 Review 了公司内部绝大多数 PR,每天可以发现数百个问题,很多问题甚至在人类开始 Review 之前就被找出来。
Anthropic 也在做类似的事情。
Claude Code 在今年 3 月加入了自动安全审查能力,可以直接检查 PR 里的 SQL 注入、跨站脚本攻击(XSS)、身份验证漏洞、不安全的数据处理和依赖漏洞,并通过 GitHub Actions 自动运行。
但 Anthropic 同时强调,这套功能并不能取代既有的安全流程和人工 Review。

AI 正在加速代码产出,而 Code Quality 负责帮助团队交付 " 可以信任的代码 "。
这套产品会在 PR 阶段检查代码的可靠性和可维护性问题,并结合 Copilot Autofix 给出修复建议。GitHub 披露,其内部团队会在代码合并前解决 67.3% 的 Code Quality 问题。
过去几年,AI 编程最激烈的竞争发生在代码生成端:谁能写得更快,谁能处理更大的代码库,谁能完成更复杂的任务。
但当代码真的开始过剩,下一场竞争已经悄悄往后移动。测试、持续集成、代码 Review、安全检查,这些过去散落在软件开发流程里的环节,正在被重新拉到台前。
这甚至形成了一种和很多 "AI 替代软件 " 的故事完全相反的关系:模型越强,代码生成的成本越低;代码生成的成本越低,代码产量越大;代码产量越大,后面的测试、Review 和安全审查需求反而越多。
但 Blacksmith 和这些 AI 公司的位置又不太一样。
如果说 Code Review 是在给 AI 生成的代码 " 擦屁股 ",Blacksmith 做的,就是给 AI 生成的那些代码 " 冲厕所 "。
OpenAI、Anthropic 和 GitHub 正在争谁更会 Review 代码,而 Blacksmith 押注的,是这些判断最终都绕不开的一层基础设施。
Coding Agent 可以换,但验证基础设施不能省。不管代码是 Codex 写的、Claude Code 写的,还是人写的;也不管最后是谁负责 Review,只要想知道这段代码到底能不能跑,测试就必须真正执行。
这也是 Blacksmith 最早选择自建 CI 基础设施的原因,它没有简单地在 AWS 等公有云上租机器,而是针对编译、构建和测试这些 CI 任务,自己优化 CPU、存储、缓存和虚拟机调度。
Blacksmith 可以往上做 Agent 和测试环境,但它最难替代的资产,仍然是下面那层让所有代码真正跑起来的 CI 基础设施。
换句话说,别人争的是谁更会看代码,Blacksmith 赚的是代码最后必须跑一遍的钱。