AI代码过剩后,给代码“冲厕所”的公司贵了十倍

字母榜
Aug 18

经常拿AI写代码的人都知道,写出能跑的程序不难,但你稍不留神,文件就莫名大了好几倍。

我曾经心血来潮让AI帮我写个网站,虽然用几句话就生成了,但打眼一看,它硬生生给我写了两千多行屎山。

在AI编程普及之前,写代码是最耗时的事情,但AI现在太厉害了,以前需要几个小时甚至几天才能完成的代码,现在分分钟就能整出来。

但问题是,代码是堆起来了,那些屎里淘金的脏活也堆了起来。

AI可以一分钟写出几百行代码,但公司不可能因为它勉强能跑,就把这些代码直接扔给几百万用户。

一家给AI生成的代码“冲厕所”的公司,因此贵了近十倍。

8月12日,据TechCrunch报道,为GitHub Actions提供持续集成(Continuous Integration,CI)基础设施的Blacksmith完成4500万美元B轮融资,估值达到5.5亿美元。而不到一年前,它的估值还只有约6000万美元。

Blacksmith没有发明更聪明的AI,也不负责帮程序员写代码。它做的是AI把代码写出来以后剩下的事情:跑测试、做构建,确认这些AI生成的代码,到底能不能安全地进入真正的软件。

让它身价暴涨的不是测试本身,是那些需要处理的代码,正在变得越来越多。

AI写的代码,人类已经看不过来了

Blacksmith很早就发现,代码变得有点太多了。

2025年9月,公司在宣布A轮融资时披露,过去一年,在排除开发者人数增长的影响后,其现有客户运行的持续集成任务量,平均每个季度增长60%。

Blacksmith把这种变化归因于AI编程工具的爆发——毕竟人一天只有24个小时,能够生产的代码有限,后面的测试、构建和代码审查自然也有一个上限。

但Coding Agent的爆发改变了这个局面。

现在的多数编程Agent都可以读取代码库、修改多个文件、运行测试,再把结果交给人类,而不只是帮程序员补几行代码。更为重要的是,Agent不仅不需要下班,不需要睡觉,还可以调度多个Subagent,把一个复杂任务拆开,同时处理多个不同工作。

于是,代码生产开始摆脱“有多少程序员,就有多少双手”的限制,从手工作坊迈向工业时代。

Claude Code负责人Boris Cherny的工作方式,已经有点像一座小型代码工厂。

今年6月,Boris Cherny在Fortune Brainstorm Tech大会上说,自己已经8个月没有手写过一行代码。

取而代之的是,他开始管理一支越来越庞大的Agent队伍。Boris表示,大会当天早上,他同时管理着“几百个”Agent;有些时候,这个数字会变成几千,甚至几万个。

这种变化到底能把代码生产推到什么程度,OpenAI也做过一个颇为极端的实验。

2025年8月底,OpenAI一个最初只有3名工程师的团队,从一个空白代码库开始,用Codex开发一款内部软件。

规则很简单:人类不直接写代码,应用逻辑、测试、CI配置、文档、可观测性和内部工具,全部由Codex生成。

五个月后,这个代码库已经膨胀到约100万行,期间完成了约1500个代码合并请求(Pull Request,PR)。OpenAI估算,同样的工作,如果全部由人类手写代码,大约需要十倍的时间。

有意思的是,OpenAI称,他们经常看到单次Codex任务连续工作超过6个小时,很多时候,人已经睡了,Agent还在继续干活。

代码生产的上限,就这样开始脱离人类的工作时间。

但很快,新的问题出现了:代码写得太快,人开始看不过来了。

OpenAI在这次实验中直接写道:随着代码吞吐量增加,他们遇到的新瓶颈变成了“人类QA能力”。

因为不管Agent能写多少代码,人类的时间和精力毕竟是有限的。

这个团队每周五都要拿出整整一天,专门清理所谓的“AI slop”,也就是AI写出的那些屎山代码。它们通常来自Agent在快速生成代码时带来的副作用:比如重复或错误的实现模式、不一致的代码风格,以及在系统中不断累积的技术债。

但很快,这事儿也有点干不过来了。

于是OpenAI又把“擦屁股”的工作交给了Agent:让后台Codex任务定期扫描代码库,发现问题,自动提交重构PR。甚至连大量代码Review,也开始交给Agent之间互相检查,人类只在需要判断的时候介入。

也就是说,AI开始同时出现在生产线两端:一边疯狂生产代码,另一边帮人寻找这些代码里的问题。

但中间那些必须实际跑完的测试、构建和CI任务,并没有消失。

Blacksmith写了一句很直白的话:如果每一次代码修改仍然需要一个小时才能测试完,那么一个比人类快100倍的Coding Agent,也没有太大意义。

AI没有消灭软件开发的瓶颈。

它只是把瓶颈,从“这个代码到底怎么写”,推到了“这么多代码到底怎么验”。

AI代码过剩后,给代码

“冲厕所”的公司贵了十倍

要理解Blacksmith为什么能在不到一年的时间里从6000万美元涨到5.5亿美元,得先弄清楚这家公司的主要业务。

一段代码从程序员手里写出来,到真正出现在用户手机或者电脑上,中间还有很长一段路。

比如你给一个购物网站增加了新的支付按钮,代码写完以后,首先得确认它能不能正常编译;然后跑一遍自动测试,看看按钮能不能用;再跑更多测试,确认这次修改没有顺手把登录、购物车或者退款功能搞坏。

这些事情通常会被组织成一套自动流水线:程序员每提交一次代码,机器就自动把代码拉下来,重新构建软件、运行测试、检查结果。发现问题就打回去,全部通过以后,代码才有资格继续往下走。

而这个流水线,就叫作持续集成(Continuous Integration,CI)。

GitHub自己的GitHub Actions,就是最常见的CI工具之一。

而Blacksmith真正做的,是这套流水线下面的“执行层”。

GitHub Actions负责规定“要跑哪些测试、按什么顺序跑”,Blacksmith则提供真正执行这些任务的计算环境。

换句话说,Blacksmith并不帮你写测试规则,而是提供机器,把构建、测试和部署这些任务真正跑完。

它最初的卖点也很直接:让GitHub Actions跑得更快、更便宜。

按照Blacksmith的说法,它使用高单核性能CPU、本地缓存和NVMe存储来运行这些任务,大部分CI任务速度可以达到GitHub托管服务器的约2倍;一些Docker构建在缓存生效后可以获得更大的加速。对于开发者来说,迁移可能只需要修改一行GitHub Actions配置。

Blacksmith创始人后来形容,CI本质上就是“开发者的管道工程”。他们甚至开玩笑说,想让CI“至少这一次变得性感一点”。

但AI编程恰好把它最不起眼的地方,变成了优势:过去程序员一天提交几次代码,CI就跑几次;现在Agent可以持续改代码、反复尝试,还能并行调用Subagent,每一次修改都会触发新一轮构建、测试和验证。

Blacksmith在A轮融资时就提到,随着AI代码生成工具的发展,代码数量的快速增加正在把CI推向新的瓶颈。为此,Blacksmith没有简单依赖通用云计算资源,而是针对CI任务优化自己的硬件和软件栈,提供更快的执行速度、更高的并发能力,以及更适合测试流程的计算环境。

AI越会写代码,Blacksmith需要跑的机器反而越多,这门过去藏在软件开发后台的“脏活”,就这样被AI放大了。

2025年9月,Blacksmith已经服务约800家组织;不到一年后,这个数字增长到5000多家。

公司的员工数量从约10人增加到30人左右,年化收入则从1000万美元进入“数千万美元”区间,据TechCrunch报道,一些最大的客户每年在Blacksmith上的支出已经超过100万美元。

今天的Blacksmith,已经不满足于只做一个更快的CI执行层,它也开始把AI能力往上叠。

比如Codesmith可以读取代码仓库、修改代码并创建PR,也可以根据CI失败信息辅助定位和修复问题;Test Analytics负责整理测试失败信息;Testboxes则会给Agent临时创建一个虚拟测试环境,让它把刚改完的代码真正跑一遍,如果失败,结果再返回给Agent继续修改。

一条新的软件生产线开始出现:Agent写代码,Blacksmith跑测试;测试失败,AI总结问题;Codesmith修改代码,再扔回Testbox重新测试。

于是,代码生产和代码验证,都开始变得越来越自动化、Agent化。

但这里有一个关键区别。

AI可以自己找Bug、改代码,但最后那句“这段代码真的能用”,不能靠它自己说,必须真跑一遍。

而只要真的运行,就会消耗真实的计算资源。模型可以把写代码的边际成本不断压低,但服务器不会因为代码是AI写的就少跑一次测试,量大再凑个满减。

Blacksmith赚的,本质上是这最后一笔省不掉的钱。

AI写代码的终点,

是一个更大的验收产业

事实上,过去一年,几乎所有主流AI公司都开始往代码生产线的后半段走。

Codex刚推出时,OpenAI还专门提醒用户:即使Agent已经可以自己修改代码、运行测试,在真正集成和执行之前,AI生成的代码仍然需要人工Review和验证。

但很快,Codex自己也开始做Review。2025年9月,OpenAI披露,Codex已经Review了公司内部绝大多数PR,每天可以发现数百个问题,很多问题甚至在人类开始Review之前就被找出来。

Anthropic也在做类似的事情。

Claude Code在今年3月加入了自动安全审查能力,可以直接检查PR里的SQL注入、跨站脚本攻击(XSS)、身份验证漏洞、不安全的数据处理和依赖漏洞,并通过GitHub Actions自动运行。

但Anthropic同时强调,这套功能并不能取代既有的安全流程和人工Review。

GitHub的动作更加直接。今年7月GitHub Code Quality正式上线时,GitHub在官方公告里甚至用了这样一句话:“AI accelerates code output, and Code Quality helps teams ship code they trust.”

AI正在加速代码产出,而Code Quality负责帮助团队交付“可以信任的代码”。

这套产品会在PR阶段检查代码的可靠性和可维护性问题,并结合Copilot Autofix给出修复建议。GitHub披露,其内部团队会在代码合并前解决67.3%的Code Quality问题。

过去几年,AI编程最激烈的竞争发生在代码生成端:谁能写得更快,谁能处理更大的代码库,谁能完成更复杂的任务。

但当代码真的开始过剩,下一场竞争已经悄悄往后移动。测试、持续集成、代码Review、安全检查,这些过去散落在软件开发流程里的环节,正在被重新拉到台前。

这甚至形成了一种和很多“AI替代软件”的故事完全相反的关系:模型越强,代码生成的成本越低;代码生成的成本越低,代码产量越大;代码产量越大,后面的测试、Review和安全审查需求反而越多。

但Blacksmith和这些AI公司的位置又不太一样。

如果说Code Review是在给AI生成的代码“擦屁股”,Blacksmith做的,就是给AI生成的那些代码“冲厕所”。

OpenAI、Anthropic和GitHub正在争谁更会Review代码,而Blacksmith押注的,是这些判断最终都绕不开的一层基础设施。

Coding Agent可以换,但验证基础设施不能省。不管代码是Codex写的、Claude Code写的,还是人写的;也不管最后是谁负责Review,只要想知道这段代码到底能不能跑,测试就必须真正执行。

这也是Blacksmith最早选择自建CI基础设施的原因,它没有简单地在AWS等公有云上租机器,而是针对编译、构建和测试这些CI任务,自己优化CPU、存储、缓存和虚拟机调度。

Blacksmith可以往上做Agent和测试环境,但它最难替代的资产,仍然是下面那层让所有代码真正跑起来的CI基础设施。

换句话说,别人争的是谁更会看代码,Blacksmith赚的是代码最后必须跑一遍的钱。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10