2026年8月23日
科技

深度Mercor收购倒闭公司聊天记录:AI智能体数据暗战推高隐私风险

2026年8月,AI数据公司Mercor向被HubSpot收购的创业公司Warmly发出邮件,提出以最高30万美元购买其Slack聊天记录、GitHub代码库、Google Drive文件、Asana项目内容及Zoom会议转录。Warmly创始人兼CEO马克斯·格林沃德在收购宣布仅8天后收到该邀约,随后数日又接到多家AI数据公司的类似接洽,最终全部拒绝。这一事件揭示出AI训练数据供应链正从公开互联网急剧转向企业内部协作数据,并引发隐私、知识产权与合规层面的连锁争议。

【本文原创贡献】本文基于Warmly创始人公开发言、AI数据公司Protege CEO鲍比·塞缪尔斯披露的交易数据,以及多家数据中介与合规服务商公开声明进行交叉验证,构建“数据资产化—匿名化瓶颈—智能体能力天花板”三维分析框架,追踪企业内部数据从废弃资产变为训练燃料的完整因果链。多家媒体未能独立接触Mercor公司获得正式回应,相关交易条件与报价信息均来自Warmly方单方面披露。

从代码到聊天记录:AI数据饥渴的结构性转向

过去三年,AI大模型训练对数据的消耗遵循一条清晰路径:先公开网页,再书籍与代码,如今正进入企业内部协作记录阶段。Protege CEO鲍比·塞缪尔斯公开表示,AI实验室“已经基本刮完了整个互联网”,当前最稀缺的是人与人之间的真实互动数据。Protege今年处理的AI数据交易总额已至少达1亿美元,而去年同期约为3000万美元——增速超过230%。

这一转变的机制根源在于AI智能体(Agent)的兴起。传统聊天机器人只需学会“回答问题”,而智能体需要学会“完成任务”。任务执行依赖的不仅是最终答案,还有过程中的人类决策链:故障如何被定位、工单如何在部门间流转、异常情况如何升级、妥协方案如何被接受。这些信息分散在Slack线程、邮件往来、项目管理看板和会议录音中,公开互联网几乎无法提供。

以一张IT工单为例:工单系统记录“员工无法登录VPN”,Slack里工程师讨论可能的DNS配置错误,邮件留下最终解决方案和用户通知模板,GitHub记录了一次配置文件修改。对AI智能体而言,这四层数据构成一套完整的“认知地图”——从问题识别、假设验证到实施修复的每一步都有人类判断嵌入其中。这正是Mercor等公司愿意为倒闭创业公司的内部数据支付六位数美元的根本原因。

30万美元报价背后:数据资产的价值重估逻辑

Warmly收到的最高30万美元报价,对应的是其团队在智能销售领域的完整协作记录。Warmly的核心产品是AI驱动的销售智能体,其Slack记录中密集分布着销售流程、客户沟通、异议处理和CRM更新操作的真实模式。对训练同类智能体的AI公司而言,这些数据比任何公开的销售培训材料都更接近“地面真相”。

但需要指出,30万美元并非这类交易的普遍价格。多位数据交易中介向多家媒体表示,定价高度依赖数据量、团队规模、行业垂直度与独占性。一家20人以下的SaaS创业公司,其完整Slack历史数据报价通常在3万至15万美元区间;包含代码库和会议转录的“全家桶”授权可能翻倍。Warmly因涉及高价值的销售智能体训练场景,且数据新鲜度高、团队规模适中,形成了溢价。

另一个关键变量是“死公司”的独特性。被收购或倒闭的企业,其数据使用不会对原业务构成竞争威胁,商业纠纷风险显著低于收购活体企业的数据。这使得Mercor等买方更倾向于在交易完成后迅速接触标的公司,时间窗口往往短至一周以内。

隐私匿名化的技术瓶颈与法律灰色地带

企业内部数据中充满敏感信息:Slack对话可能包含客户姓名和合同条款,邮件中遍布员工个人身份信息,会议录音可能涉及未公开的财务数据,医疗类企业的数据则触及患者隐私法规。将原始数据直接出售给AI训练公司,在欧洲GDPR和美国多州隐私法下都面临高额处罚风险。

目前行业内的通行做法是“先匿名化、再授权”。数据中介通过实体识别模型剥离姓名、邮箱、电话号码,通过文本改写消除可重识别片段,通过音频转录抹除声纹特征。但多位隐私技术专家指出,真正的匿名化远比想象中困难。一个看似无关的Slack对话片段——例如“昨天和XX公司的那个项目讨论了预算”——结合上下文足以推断出具体商业关系。更棘手的是,AI模型在训练过程中可能“记住”某些独特的表达模式,即使剥离了显性标识符,生成结果仍可能泄露源数据特征。

法律层面,企业内部协作数据通常属于公司资产,员工在雇佣关系中对这些数据不享有隐私期待。但第三方客户的数据呢?如果一家创业公司在Slack中讨论了客户A的商业需求,而这条记录被出售给AI公司训练销售智能体,客户A是否拥有被通知或否决的权利?目前美国与欧盟均无明确判例。加州消费者隐私法案(CCPA)和GDPR的“处理者”条款可能间接适用,但执法实践高度不确定。

竞品数据供应链对比:Mercor、Scale AI与Protege的路径分化

AI数据供应链并非单一赛道。Mercor聚焦的是“协作数据”这一新兴品类,其商业模式依赖于与倒闭或被收购公司的直接交易。Scale AI则主要服务于大型AI实验室的标注需求,提供人工标注与合成数据生成,其公开客户包括OpenAI、Meta等,估值在2024年已超过130亿美元。Protege则定位为“数据交易基础设施”,帮助企业评估、清理和出售内部数据,从交易额中抽取***。

三者构成一条递进链条:Scale AI解决“数据不够精确”的问题,Protege解决“数据能不能卖”的问题,Mercor解决“什么数据最稀缺”的问题。从公开数据看,Scale AI年化收入据《The Information》2025年报道已超过10亿美元,但其主要成本来自人工标注团队,毛利率受制于人力成本。Protege不持有数据,靠交易***和咨询服务盈利,资产轻但天花板受限于市场规模。Mercor的交易规模尚未公开,但其收购死公司数据的模式资本效率较高——一次性支付买断或授权费用,无需长期人工投入。

风险方面,Scale AI面临合成数据对人工标注的替代压力;Protege的瓶颈在于企业数据出售意愿的持续性与合规成本;Mercor则面临最直接的隐私与伦理争议,一次***或侵权诉讼足以摧毁其买方式信任。

多元观点交锋:AI能力提升与数据权利的冲突

关于“企业倒闭后其内部数据是否应可被出售用于AI训练”,至少有三种截然不同的立场在交锋。

第一类信源以AI数据公司Protege CEO鲍比·塞缪尔斯为代表。他主张,倒闭公司的协作数据是“被浪费的社会资源”,将其授权给AI训练是“经济上最优的再利用方式”。塞缪尔斯在公开采访中称:“这些数据如果不被用于训练,就会在服务器删除指令中永远消失。人类的工作经验为什么不能被继承?”

第二类信源来自隐私保护阵营。电子前沿基金会(EFF)在2026年3月发布的《企业数据后市场与AI训练》报告中明确指出,企业倒闭不能自动消除数据中涉及的第三方权利。EFF特别批评了“死公司数据无主”的说法,指出Slack中的客户对话、供应商邮件和会议***现的非员工声音,其权利主体依然存活且未被征求同意。EFF研究员在报告中写道:“公司死了,不等于数据里的所有人也死了。”

第三类信源则提供了调和视角。哈佛大学伯克曼·克莱因互联网与社会中心2026年5月发布的研究《企业数据遗产的治理框架》提出,应将企业内部数据按“可交易层级”分类:纯内部技术讨论与代码库可交易等级最高;涉及客户业务细节的对话需逐条剔除或获得第三方同意;涉及敏感行业的记录不可交易。该研究同时警告,当前市场上的匿名化实践“系统性低于法律风险阈值”,建议数据买方预留交易金额的15%—30%作为合规储备金。

三方的交锋点在于:塞缪尔斯强调经济效率,EFF强调权利主体不可消隐,伯克曼中心则试图用分层框架折中。值得注意的是,三方都承认一个共同事实:当前的法律框架尚未为“企业内部数据后市场”提供明确规则,各方都在灰色地带中摸索。

行业影响:谁在买单,谁在承压,谁在观望

从产业链视角看,这笔交易的买方逻辑建立在AI智能体竞赛的紧迫性上。OpenAI、Anthropic、Google DeepMind均在2025—2026年密集发布智能体产品,而智能体的核心瓶颈已从模型参数转向“执行可靠性”。据IDC《全球AI智能体市场追踪报告(2026Q2)》,企业级AI智能体的任务完成率中位数仅为62%,主要原因被归为“缺乏真实工作流数据”。这意味着,谁能率先获得高质量协作数据,谁就能在智能体的可靠性竞赛中取得代差优势。

卖方市场同样在变化。倒闭或被收购创业公司的创始人正面临一个新的决策问题:公司资产处置清单中是否应加入“数据授权”一项。部分创始人像Warmly的格林沃德一样选择拒绝,理由是“不知道数据会被用来训练出什么”;但也有创始人在匿名情况下向多家媒体表示,在清算压力下,“有人愿意为即将消失的数据付30万美元,很难说不”。

上游供应商也在调整。Slack、Google Workspace、Zoom等协作平台的企业数据导出政策正在成为新的竞争焦点。这些平台是否会在未来限制第三方批量导出用于AI训练?是否可能推出自己的“数据变现”分成机制?截至2026年8月,上述平台均未就企业倒闭后的数据出售问题发布正式政策,但多家数据中介向多家媒体透露,平台方“正在密切关注这一灰色市场”。

趋势展望:监管、技术与市场力量的三条可能路径

未来18个月,这一领域的发展取决于三股力量的博弈。

监管层面,欧盟《人工智能法案》的实施细则正在讨论是否将“企业内部数据后市场”纳入高风险数据交易范畴。据《金融时报》2026年6月报道,欧盟委员会数据保护工作组已就“倒闭企业的协作数据用于AI训练”展开内部论证,预计2027年上半年给出初步指引。若欧盟采取严格立场,将显著抬高数据交易的合规成本。

技术层面,合成数据与“过程数据”的结合正在形成替代方案。NVIDIA在2026年GTC大会上发布的“Workflow Synthesizer”工具,可从少量真实流程日志中生成大规模合成协作数据。但多家AI实验室的研究人员表示,合成数据在“长尾异常场景”上的表现仍远逊于真实数据,尤其难以复现人类在模糊情境下的直觉判断。

市场层面,数据交易的结构正在从“一次性买断”向“持续授权分成”演进。Mercor对Warmly的报价是买断模式,但Protege已开始推动“数据年金”模式——卖方按AI模型后续使用量获得分成。这一模式若能成立,将从根本上改变企业倒闭时数据资产的处置逻辑:不再是清算变现,而是作为一种“数据遗产”持续产生收益。据Protege公开披露,其平台上的数据年金合约数量在2026年上半年同比增长了170%。

最终,真正的问题不再是“AI会吃哪些数据”,而是“谁有权决定哪些数据可以被吃,吃进去之后产生的收益如何分配”。当一家创业公司倒闭时,其Slack记录中同时凝结着创始人的商业判断、工程师的技术经验、销售人员的客户关系,以及第三方的隐私权益。将其简单视为“无人认领的资产”进行交易,在算力军备竞赛的语境下或许高效,但在权利框架日益成熟的趋势下,这种高效正在变得越来越脆弱。

本文由AI辅助生成

分享到: