公司倒闭后,如何靠卖员工数据赚钱

虎嗅APP
Aug 20

本文来自微信公众号: 动察Beating ,作者:动察Beating,题图来自:视觉中国

AI时代催生了一条新产业链,专门收购死去公司留下的内部数据。

邮件、聊天记录、项目文档、工单,过去只是公司关停后等待清理的数字遗产。现在,它们开始被重新估价,打包,出售,送进AI公司的训练管线。

入殓师替死人保住最后的体面。企业死后的体面,则是证明自己留下的东西还有价值。谁在囤积真实工作数据?

8月17日,一场破产资产拍卖上,Google出价1000万美元,买下Spirit Airlines的全部企业数据。竞标的还有一家,叫Mercor,出价750万,差250万输掉了。

拍品分三块。第一块,约1亿封员工电子邮件。第二块,5亿条Microsoft Teams消息。两块合计6亿条。第三块,日历、表格、财务数据库、项目文件、运营记录,加一批内部软件。乘客档案、常旅客信息等不包含在内。

6亿条,一个人一天说100句话,要不停地说16000多年。

算下来一条消息卖了1.67美分。美国人把1美分硬币叫penny,掉地上都懒得捡。也就是说,Spirit员工在Teams里说的一句话,值一个半penny。

时间回到1980年,Spirit Airlines出生在底特律,前身是家卡车公司,叫Charter One,后来改行开飞机。1992年改名Spirit,灵魂的意思。此后34年,它把美国超低成本航空的模式做到全行业模仿的标杆。

它的底子曾经不薄,205架清一色的空客,一天约300个航班,2024年营收约50亿美元。但是同年净亏约12亿,申请破产时背着约90亿债务。

2026年5月的一个深夜,公司宣布停飞。第二天,约17000名员工从新闻里知道自己失业了。

事情还在走程序,交易要等破产法官批准。Spirit走的是Chapter 11下的清算式关停,没有破产托管人接手,公司仍在法院监督下,自己把剩下的资产一件件卖掉。涉及员工邮件、Teams消息等敏感数据,还要先交给独立机构处理,删掉姓名、邮箱等能够识别个人身份的信息;这家机构由Google挑选,费用也由Google承担。

另外,翻遍公开报道,破产公司把内部数据卖给AI公司,此前找不到先例。这一单,很可能就是历史第一例。

美国老牌科技媒体Gizmodo给这桩交易起的标题是,Spirit死了,但它的数据会在Google的服务器里阴魂不散,飘荡几代人。

 一门新生意 

给死公司收尸的人一直都有。律师、清算人、拍卖行,干了几十年。飞机、桌椅、商标、专利,能卖的早就卖了。

真正新的是从今年开始,连公司的内部员工数据也被摆上了货架。

这门生意冒出来,背后有两个原因。

第一件事,死掉的公司变多了。

2024年第一季度,美国初创公司的失败率同比涨了58%,活跃的风险投资机构数量比高峰期少了62%。

钱其实没有变少,只是越来越集中地流向AI。2024年,美国AI初创公司拿走了970亿美元融资,创下历史纪录。资本市场依然有钱,只是越来越不愿意把钱花在AI之外。

结果就是,一批原本还能继续靠融资活下去的公司,开始更早撞上墙。2024年8月,a16z投资的金融科技公司Tally宣布关停。它累计融资1.72亿美元,最高估值8.55亿美元,已经走到D轮,最后还是没能拿到下一笔钱。

第二件事,数据变贵了。

大模型训练对数据的消耗已经到了非常夸张的量级。GPT-4的训练数据约为13万亿个token。作为参照,Google Books四十多年扫描了约4000万本书,折算下来大约4万亿个token。也就是说,GPT-4一次训练使用的数据量,相当于三个多Google Books。

Epoch AI算了笔账,高质量的语言数据,书、新闻、维基,2026年前后就会耗尽。公开互联网里能够用于训练的高质量文本正在迅速见底,合成数据的占比越来越高。接下来,AI公司要找的新数据,只能更多地往公开互联网之外走。企业内部积累了多年的邮件、聊天记录和工作文档,就这样进入了视野。

而AI训练数据集这个市场,研究机构预测2030年能做到97亿美元。算上各类授权,盘子的总规模估计能达到675亿美元。

一边是越来越多的公司进入关停和清算,留下大量过去没有被定价的内部数据;另一边,AI公司对公开互联网之外的数据需求越来越大。两边同时出现,这才让企业内部数据第一次具备了被规模化交易的条件。

真正让这类数据变得更有价值的,是企业Agent的发展。Gartner预测,到2026年,40%的企业应用将内置任务型AI Agent,而前一年这一比例还不到5%。内部数据会成Agent壁垒吗?

企业Agent需要的训练材料,和普通大模型并不完全一样。公开网页可以提供知识、语言和成品内容,但很难还原一家公司真实的工作过程。沟通与合作,落实到具体有很多真实的细节,比如一个需求怎样被提出,几个人怎么讨论,任务如何分配,出了问题怎样修改,最后又是怎么交付的。

这些过程,大量保存在企业内部的邮件、聊天记录、工单和项目文档里。

当这类数据开始有明确的买家和用途,原本在公司关停时被直接删除的东西,也就有了单独拿出来交易的价值。

 收尸人 

以前干这活的是清算律师,现在多了三种人。

第一种叫解散服务商,代表是SimpleClosure。

这家公司只做一件事,帮创业公司体面地死。2023年公司刚起步,pre-seed轮拿了150万美元,2025年5月又拿了1500万美元A轮,领投的是TTV Capital。连给大量美国初创公司管理股权和公司事务的Carta,也停掉了自己的关停服务,转而投资SimpleClosure,并把这部分客户需求交给它。

到2025年10月,SimpleClosure已经办完了一千多家公司的葬礼。Crunchbase给它起了个名字,“A Better Way To Fail”,一种更好的失败方式。美国创业者爱说fail fast,快速失败。SimpleClosure说,快速失败不够,还得体面。官网上甚至挂着一个定价计算器,输入公司情况,就能算出死一次要花多少钱。

葬礼都不白办。2026年4月,SimpleClosure上线了Asset Hub,专门处理公司关停后留下的无形资产。品牌、软件、客户名单之外,第一次被明确摆上货架的还有Slack记录、邮件、Jira工单这类内部工作数据。

这说明在Spirit之前,市场已经开始尝试给死公司的内部数据定价,只不过当时还是创业公司、小额交易和私下撮合。

有一个现成的案例。转录和字幕公司cielo24关停的时候,通过SimpleClosure出售了过去13年积累下来的Slack消息、内部邮件和Jira工单。CEO Shanna Johnson后来告诉Forbes,这批数据最终卖出了数十万美元。

对一家已经决定关门的公司来说,这原本是一批需要清理的数据,最后却成了清算时能够回收的一笔资产。

卖数据这个环节,SimpleClosure交给了Protege。这是一家数据交易市场,专做AI训练数据授权,2026年1月刚拿了a16z领投的3000万美元,创始人叫Bobby Samuels。Protege最早的切入点是医疗影像,30天时间里给买方凑齐了数百万张影像做预训练。

现在,Protege开始把这套数据授权和交易能力用到关停公司的内部通信数据上。SimpleClosure负责公司关停和资产整理,Protege负责寻找买家、完成数据授权和交易。

第二类参与者,是破产法庭和清算律师。几十年来,他们清点的是飞机、桌椅、商标和专利。现在,清单里开始多出邮箱、Slack记录和其他内部数据。

按照美国破产法,这些数据可以作为无形资产纳入破产财产,并在法院监督下出售。相关律所也开始设立专门团队,处理破产案件里的数据保存、取证和整理。Redgrave LLP就有这样的重组与取证业务。

第三类,是负责技术执行的e-discovery服务商。KLDiscovery、Epiq、Consilio这类公司,平时就在做企业数据的采集、整理、托管和审阅。邮箱、Teams、SharePoint里的内容,需要先由他们导出、归档,再整理成可以进入交易流程的数据包。

这个行业本身已经有一套成熟的收费方式。EDRM会定期发布定价调查,常见的计费单位包括数据采集每GB、托管每GB每月,以及文档审阅费用。

Spirit的6亿条消息最后能变成一件拍品,中间靠的就是这类基础工作。只是和法庭文件、拍卖报价相比,这部分很少出现在公开报道里,具体由谁处理、怎么处理,外界通常看不见。

 尸检清单 

对企业Agent来说,它需要学习的不只是知识和标准答案,还包括真实工作环境里的判断、协作、纠错和执行过程。

成品告诉模型最后做成了什么,内部记录告诉它这件事到底是怎么做成的。

这种变化已经反映在Agent训练数据上。过去一条代码训练样本可能只是几百个token,内容是修改几行代码;现在,一条Agent训练样本往往要包含需求理解、文件定位、代码修改和测试验证的完整过程。

训练数据开始从单一的答案,转向完整的任务执行记录。对Agent来说,最终结果当然重要,但更有训练价值的,是完成任务过程中留下的判断、操作和反馈。

相比正常经营的公司,关停企业的数据更容易进入交易流程。公司还在运营时,出售内部通信会牵涉商业机密、员工隐私、竞业风险和客户关系,法务和管理层通常都会非常谨慎。进入清算以后,公司的主要目标变成尽可能回收剩余资产,为债权人争取更多价值。

这也是为什么,同样一批内部数据,在公司活着的时候很难出售,到了关停阶段,却可能被重新当作资产评估。

企业内部数据的价值,行业其实早就意识到了。Salesforce一直把Slack中积累的企业通信视作重要的数据资产,微软CEO Satya Nadella也多次强调,企业使用AI时,真正有价值的一部分正是自己的专有数据和工作上下文。

过去,这些数据主要服务于公司自己。现在,随着AI公司开始主动寻找企业内部数据,它们第一次有了更明确的外部买家。

 定价的艺术 

这门生意虽然刚开始形成,但市场上已经出现了一些可以参考的价格。

SimpleClosure和Protege处理的关停创业公司数据,单笔交易通常在1万到10万美元之间。Mercor给被收购初创公司的员工聊天记录和邮件开出的报价,最高可以到30万美元。

Spirit把价格一下推到了千万美元级。Mercor出价750万美元,Google最后出到1000万美元,争的是约6亿条内部通信和其他企业数据。只按这6亿条消息计算,平均每条大约1.67美分。

这个单价并不高。路透社2024年报道,Photobucket曾拿着约130亿张照片和视频与AI公司谈授权,照片报价大约每张5美分到1美元,视频则在每条1美元以上。B2B数据市场里,一条联系人信息根据完整度和准确度不同,也可以卖几美分到几美元。

但这些价格还不足以形成一套统一的标准。关停企业的内部数据到底值多少钱,目前主要还是一单一议。数据量、行业、时间跨度、完整度、独特性,以及买家准备用它做什么,都会影响最终报价。Spirit的1000万美元,更像是目前少数公开可见的大型样本。

如果再和成熟的数据授权市场相比,差距更明显。Reddit把用户帖子和评论授权给Google,合同金额约为每年6000万美元;News Corp与OpenAI的内容授权协议五年约2.5亿美元;xAI与Telegram的合作金额达到3亿美元;苹果购买Shutterstock图片授权,报价则在2500万到5000万美元之间。

这些市场已经有稳定的买家、授权方式和定价经验。关停企业内部数据的交易才刚起步,什么数据最值钱、该按条、按容量还是按整包估值,目前都没有明确规则。

Spirit的1000万美元放到公司自己的体量里看,又是另一回事。2024年Spirit全年营收接近50亿美元,平均每天约1370万美元。Google买下这批数据花的钱,还不到它正常经营时一天的收入。

对破产清算来说,这只是剩余资产里的一笔回收;对AI公司来说,买到的却是一批长期没有公开、包含真实企业运转过程的数据。

 清理与移交 

数据成交之后,还不能直接交给买方。正式移交之前,通常要经过导出、去身份化、整理打包、法院批准和最终交割几个步骤。

第一步是导出。Slack的企业数据通常以ZIP文件导出,包括按频道整理的JSON文件、成员信息和附件。

Microsoft 365则可以通过取证工具导出邮件和Teams消息。Spirit涉及约6亿条内部通信,数据量很大,实际操作中需要分批处理。具体由e-discovery服务商还是买方工程团队执行,公开文件目前没有披露。

接下来是去身份化,也就是尽可能删除能够指向具体员工的信息。常见方法包括识别并遮盖姓名、电话、地址等个人信息,或者将敏感字段替换成无法直接对应个人的编号。在部分统计和训练场景中,还会通过增加随机扰动进一步降低重新识别个人的可能性。

但去身份化并不等于绝对匿名。即使姓名和邮箱已经删除,只要文本中保留了足够多的职业、时间、地点或行为特征,仍然存在通过其他信息重新锁定个人的可能。

所以Spirit这笔交易里,谁负责这一步很重要。按照目前的交易安排,数据将由一家独立第三方负责去身份化,但这家机构由Google选择,费用也由Google承担。Google同时承诺,不会利用这批数据重新识别个人。

破产公司出售数据并没有那么新。过去二十多年里,从Toysmart、Borders、RadioShack到23andMe,都出现过破产过程中处理或出售客户数据的案例。这类交易涉及消费者隐私,通常会受到法院、监管机构和州政府更严格的审查。

Spirit的不同之处在于,这次出售的核心并不是乘客名单,而是员工邮件、Teams消息和其他内部工作数据。现有破产程序对这类数据的处理并没有像消费者信息那样形成成熟的规则。

争议也已经出现。Spirit的空乘工会对交易提出异议,法院因此推迟了审批。原本作为破产资产出售的一批企业数据,开始牵涉到员工权益和AI使用边界。

如果交易最终获得批准,数据才会进入最后的交割环节。但从整理完成的数据包到Google的系统之间,公开文件披露得很少。数据如何传输、是否还会继续清洗、最终以什么形式进入产品开发或模型训练,目前都无法确认。

程序走到这里,数据才真正完成从破产资产到AI资产的转换。

 买家 

这类数据目前最明确的买家,是Google这样的模型公司,以及Mercor这样的训练数据服务商。

Google对Spirit这笔交易给出的官方说法,是用于产品改进和AI开发。对Google来说,这批数据的价值在于,它记录了一家大型企业真实的运营过程,比如排班、协作、内部沟通、项目推进、问题处理和管理决策。

这些内容很难从公开网页获得。尤其对企业Agent来说,最终结果之外,更重要的是任务在真实组织里究竟怎样被推进和完成。Spirit留下的内部记录,恰好包含了大量这样的过程数据。

另一个竞标者Mercor,更能说明这门生意正在往哪个方向发展。

Mercor成立于2023年,三个创始人Brendan Foody、Adarsh Hiremath和Surya Midha从高中起就是辩论队队友。公司最早做AI招聘,用模型帮助企业筛选和面试候选人。到2024年9月,Mercor已经评估约30万名求职者,估值达到2.5亿美元。

此后,公司的重心逐渐转向AI训练数据。2025年11月,三位创始人都只有22岁,随着公司估值上升,成为当时全球最年轻的一批白手起家亿万富翁。2026年上半年,Mercor营收超过6.14亿美元,其中约九成来自OpenAI等头部AI实验室。到7月,公司正在寻求约200亿美元估值,并收购了专门为AI Agent构建训练环境的Deeptune。

Mercor获取训练数据主要有两条路径。

一条是直接购买企业内部记录。它曾向被收购或关停的初创公司报价,购买员工聊天记录和电子邮件,单家公司最高报价约30万美元。

另一条是雇佣有实际工作经验的人。TechCrunch 2025年10月报道,AI实验室通过Mercor招募企业前员工,让他们把工作经验转化成训练任务和反馈,时薪大约200美元。Mercor CEO曾表示,公司每天向参与AI训练的人支付的报酬超过150万美元。

一边购买公司留下的工作记录,一边购买员工掌握的工作经验。Mercor的核心资产,本质上都是现实世界里的工作过程。

这也解释了为什么它会出现在Spirit的拍卖场上。对Mercor来说,6亿条内部通信是另一种规模更大的训练数据来源。

这类业务同样伴随着风险。2025年,Scale AI曾起诉Mercor,指控前员工带走商业秘密;此后,公司也遭遇过训练相关信息泄露和合作暂停。数据既是Mercor的生意,也是它最需要防守的资产。

最后有一个数字上的反差。Spirit以这个名字经营了34年,而参与竞拍它内部数据的Mercor,三个创始人当时都只有22岁。

 碎掉的长凳 

Spirit的交易还没有完成,法院还没有签字,Google也没有拿到那批数据。接下来还有工会异议,还有听证,还有很多程序要走。

但这场拍卖已经让一件以前很少被讨论的事情变得具体。

过去,一家公司关门以后,很多东西是真的会消失。财务报表留下来,商标留下来,专利留下来。可一家公司的日常经验通常不会留下来。一个部门怎么开会,一个经理怎么做判断,一次延误发生以后几十个人如何协调,一套流程为什么最后改成今天这样,这些东西很少被正式记录。

公司解散,人走掉,邮箱停用,聊天群关闭,它们也就跟着消失。

所以公司一直是一种很奇怪的组织。

它可以活几十年,积累几万个人的经验,但真正能被继承下来的,往往只是其中很薄的一部分。下一家公司还得重新招人,重新犯错,重新把很多事情学一遍。

AI改变的可能就是这一点。如果邮件、会议、工单、代码修改和内部讨论真的能够被整理成训练数据,那么一家公司过去只有靠人才能带走的经验,第一次有了另一种保存方式。

这件事最后会走到哪里,现在还很难判断。也许未来企业会主动保存这些数据,也许员工合同会重新写,也许破产法会增加新的限制,也许公司在融资和并购时,连内部工作记录都会被单独估值。

Spirit提前把这个问题摆了出来。

破产这个词有个流传很广的词源解释。中世纪意大利商人坐在长凳后做生意。资不抵债,长凳被当众砸掉。banca rotta,碎掉的长凳。

几百年来,长凳碎了,事情就结束了。

Spirit的长凳已经碎了。它留下的6亿条消息,正在重新定价。

一条一个半penny。

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。

 End

想涨知识 关注虎嗅视频号!

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10