长三角经济

Kimi实习生开公司,估值快200亿了

Sep 14, 2026 IDOPRESS

大模型数据公司,很长一段时间并不在VC的视野中,不过这种境况有所变化。我最近听说,几个有阿里通义、月之暗面等模型大厂实习经历的年轻人创立了一家数据公司,颇受资本青睐。

这家公司以AI训练数据为切入口,在不到一年时间里便拿下千万美元级订单,完成约三轮融资,估值也是水涨船高。外媒最新消息显示,这家公司即将完成一轮3亿美元融资,投资方阵容豪华,囊括了红杉、阿里和腾讯这些明星机构,估值达到25亿美元。

当然,国内此前并非没有数据服务公司,但在今年之前,这样的公司很少会被风险投资关注到。原因在于,这个模式主要做的是现金流生意,创业门槛在AI领域内也不高。更早些时候,三四线小城市有一批数据公司利用廉价劳动力为模型训练提供语料。随着大模型智力水平的提升,数据质量要求同步提高,越来越多名校背景的高学历从业者加入。各行各业的资深人士,比如法律、医生、记者、编剧等开始入驻一些数据服务公司的平台。作为一份兼职,数据标注的收入在每小时500-1000元。

但如果只是做专家网络,在国内很难顶到百亿估值。卖数据这个模式,在不少投资人眼里,仍然是一个阶段性的可持续性存疑的生意。

一位接触过前述项目的投资人告诉我,在2亿美金轮次以前,投资人还是从对创始人的判断层面去下注的。到如今,要以25亿美元估值对外融资,这家公司必须讲出新的故事。据我了解,今年上半年,它已经开始涉足金融领域,在预测市场做了一套可对比、可验证的系统,据说要以卖API来盈利。

国内数据训练公司大概有二十多家,上述跨界金融的故事还只是他们试图描述的未来方向之一。在和投资人交流后,我发现人工标注、专家外包、数据交付,这些很难讲出足够性感的增长故事的传统数据服务模式,在越来越多95后、00后年轻创业者那里有了新的说法。他们凭借模型训练的经验和对模型能力的足够了解,让一个原本相对枯燥的现金流生意,开始有了新的想象空间,由此搅动起一波融资热度。

数据有了新需求

理解这些实习生做的生意,可能要从去年媒体上热议的“985、211硕博生去当AI训练师”说起。比如,DeepSeek北大中文系毕业生和Kimi的医学博士等。他们有人在网上自嘲为“数据包工头”,带领一些以BPO(外包)形式存在的标注员,配合研发团队,为模型生产训练数据。

卖数据的商业逻辑并不复杂,只要能够拿到订单,自身就可以跑成一家现金流不错的公司,也不一定需要融资。Surge AI就是一个典型案例,这家公司成立于2020年,创始人Edwin Chen此前曾在Google和Meta从事机器学习工作,后来出来创业。这家公司很长一段时间没有拿外部融资,主要靠自身滚动发展。直到2025年,市场开始传出它寻求最多10亿美元融资的消息。当时,公司过去一年收入已经超过10亿美元,市场讨论的估值也超过150亿美元。

随着模型能力的提升,医疗、法律、金融等专业领域,以及需要主观判断的复杂任务中,对资深人才标注的需求正快速增长。市场上高质量人类标注者稀缺,特别是专业领域人才,大型AI公司为此愿意支付高额溢价。Mercor便捕捉到了这一机会,这家公司早期只是为大型数据标注公司提供“合同制人才”的AI招聘平台,后来直接把专业人士组织成训练数据供应网络。2025年,Mercor以100亿美元估值融资,2026年又传出按200亿美元估值筹集约5亿美元的计划。

总之,海外诞生了许多独角兽,但是国内的AI训练数据服务商却很少有机会获得VC支持。

一位调研过这些模型厂的投资人告诉我,当时,模型厂内部对于数据采购的标准,包括新增供应商的标准,都还不是特别清晰。尽管已经和几家互联网厂商,甚至一些海外供应商有所合作,但整体供应量还没有那么大。另一方面,国内有段时间以蒸馏为主,很大程度上削弱了大家去找专家数据的必要性。

今年Agent全面爆发,需要的数据类型也早已不是简单的专家数据,而是一种更接近环境的数据。

一位模型厂的研究员告诉我,现在需要的数据,已经不只是“问题和答案”,而是能够让模型反复行动、获得反馈的可闭环、可验证的训练环境。模型在里面执行任务,环境记录它的每一步行动,再通过验证器判断结果,最后把反馈交还给模型。比如,想训练一个模型写出更好的前端代码,光靠人工告诉它“这段代码好不好”是不够的。你需要一个能够执行代码的环境,还需要一个能够理解页面效果的模型去做裁判,再通过几百轮甚至更长时间的运行,不断给模型反馈。

一些美国创业公司开始专门做强化学习环境。AfterQuery希望让模型和智能体学会像专业人士一样完成任务,公司将其描述为“将世界顶尖从业者的模式、决策和推理进行编码”,为前沿大模型输出专家推理数据集、强化学习仿真环境、模型评测服务。

需求方这边,Anthropic管理层也讨论过在未来一年内拿出10亿美元投入强化学习环境。OpenAI方面,2025年全年数据开销约10亿美元,内部预测到2030年将涨到80亿美元。现在,美国差不多已经有十几家这样的种子轮团队,人数不超过20人,服务1到3家大客户。

国内也开始出现许多这样的创业机会。一位投资人告诉我,越来越多研究员正在从模型厂外溢出来。到了今年5、6月份,这个趋势就比较清晰了:市场上开始出现一批提供高质量数据的新团队,同时,模型厂对于一些新领域数据的需求也在上涨。

00后造富扎堆

和AI其他领域的创业者一样,训练数据公司的创始人通常也很年轻。Scale AI创始人Alexandr Wang在24岁时成为亿万富翁,Mercor的三位创始人也在22岁时凭借百亿美元估值跻身亿万富翁行列。

最近的是AfterQuery的两位联合创始人。斯宾塞・马蒂加(Spencer Mateega)23岁、卡洛斯・乔治斯库(Carlos Georgescu)22岁,创立公司的时候两人还都处于大学在读状态。他们公司刚刚宣布正在筹集新一轮融资,估值达到32亿美元。这家公司成立仅仅18个月,主要业务是AI训练数据服务。

如今,国内的数据初创公司创始人同样如此,而且他们不一定是具身赛道里那种“小天才”,就比如开头我提到的,来自头部模型大厂的实习生。

一位接触过国内一家独角兽数据训练公司的投资人告诉我,早期大家的判断仍然更多集中在“人”身上。兼具business sense和researcher属性的人,到今天在市场上都比较少见。而这家公司的创始人曾在月之暗面等一线模型大厂有过实习经历,参与过模型训练工作并且发表论文。

现状是,模型训练的一线工作主要由名校PhD承担,他们从实习开始就会承担具体的执行工作。当他们跟着外包团队完成这些工作后,很容易就会想到,既然这件事可以在大厂的外包部门完成,为什么不能自己出来做?于是,一部分人开始从模型厂或外包团队中走出来,成立数据创业公司。

这也是当下这批数据创业者的共同特征:他们离模型厂的实际需求更近,对外部市场的变化也更敏感。一位已经投资过类似项目的投资人告诉我,他对创业者画像的判断多数是在团队至少要达到T0或T1级别,且最好是95后、98后到00后这一代真正参与过一线模型训练的人。

工程能力同样关键。如何搭建团队,如何把研究员认可的数据质量要求落到实际生产中,都需要很强的工程能力。从整个数据pipeline的搭建,到Query设计、数据初步构成,再到后续清洗和质量控制,背后都有复杂的工程链路,并不是简单的人工标注。

数据表面上是一门生意,但做得足够好时,它也可能成为模型厂之外的一个候选人团队,甚至是一个小型的预训练、后训练组织。投资人可以在早期以较小代价获得一个研究员密度较高的团队,数据业务是他们阶段性养活自己的方式,也可以帮助他们证明自己在行业中的位置,跟上模型智能发展的变化。

数据生意的天花板

但单纯的数据生意,很难支撑这些创业公司持续走下去。

2025年市场曾披露,和垂直领域专家数据起家的Mercor年化收入达到1亿美元,但其中60%到70%的总收入需要支付给承包商,留给公司的空间非常有限。Scale AI也有超过一半的营收用于直接业务成本,其中包括承包商薪资。国内一些数据标注平台公布的价格中,标注员的时薪通常在200至500元,资历更高、专业性更强的人甚至可以达到上千元。

随着模型能力继续提升,后训练公司对顶尖专家的需求还会越来越复杂。如果仍然依赖大量人工去寻找专家、生产数据,就意味着成本不断上涨;如果提高专家的收费,毛利会被压缩;如果不提高收费,又很难获得足够高质量的数据。

而且数据业务订单并非完全确定。投资人朋友告诉我,第一批数据供应商进入市场时,很多公司先在每个垂直领域做出一批高质量样本,不管是人工手工打磨出来,还是通过其他方式生产,都会在样本上投入大量精力,再拿去给阿里、腾讯等客户展示。客户认可之后,才会进一步下订单。但是数据行业里,一个订单并不等于一笔可以立即确认的收入。每一批数据都需要研究员验收和质量控制,如果连续几次交付的数据数量或质量不达标,客户完全可能缩减甚至取消订单。比如客户签下1亿美元订单,并不意味着公司半年、一年或者两年后就一定能够实现对应规模的收入。

从VC的角度看,投资最终还是要回到两个问题:这家公司能不能形成足够高的价值倍数,以及未来有没有清晰的退出路径。

海外大厂的分工相对成熟,每家大厂给外部数据公司的年度预算,到2027年、2028年仍在增长,而且体量很大。因此,海外数据公司确实有不错的市场空间,也已经出现了被并购的退出机会。但中国市场的逻辑不太一样,如果最终只是一家数据外包公司,无论是被并购还是上市,空间都相对有限。

在前述投资人看来,未来的数据生意可能不再是今天这种“一条数据卖多少钱”的模式,一些数据创业公司开始试图站到SaaS的位置上。比如,一些传统企业本身没有训练AI模型的能力,但内部拥有大量独特的业务流程和高价值数据。数据公司可以进入这些企业的工作流,帮助其完成AI化改造。

在这个过程中,企业会开放一些独特的业务场景,公司不仅获得数据,也能积累真实的任务轨迹和交互反馈,再把这些东西沉淀到自己的模型和训练体系中。这样一来,数据就不再只是一次性交付的商品,而变成了连接客户工作流、模型训练和长期服务的一层基础设施。数据公司的定价方式也会发生变化。大厂不会再简单按照数据条数付费,而是为一套能够持续产生高质量数据、完成任务执行和模型反馈的系统付费。

海外一些数据公司已经往这种更深的服务能力走。Turing、Scale、Invisible等公司都在发展咨询或更深度的企业服务业务,希望从单纯提供数据和人力,进一步介入客户的AI工作流。

当然,数据越深入客户核心业务,风险也越高。Mercor今年遭遇数据泄露事件后,Meta暂停了与其合作,OpenAI也对此展开调查。相关数据可能涉及模型公司的训练方法、承包人员信息和专有数据。

新故事在哪

除了追求更高的智能,模型发版速度的加快,也是今年数据订单增长的另一个原因。2026年以来,头部模型厂商的发版节奏,已经压缩到了月度级。技术方面来看,这背后可能有一个关键变量正在发挥作用:RSI。

RSI(Recursive Self-Improvement,递归式自我改进),指的是AI参与甚至改进自身研发流程,从而持续缩短模型迭代周期。它被视为本轮模型发版加速的重要推手,也成为中美AI创投圈的热词。

这并不是一个全新的概念。学术界很早就开始讨论,工业界也一直在尝试推进。5月,由Meta前FAIR研究总监田渊栋等8位顶级AI研究员联合创办的新AI实验室Recursive Superintelligence(RSI)完成6.5亿美元融资,投后估值约46.5亿美元。这一技术概念正式被推到资本市场面前。

一些数据初创公司,也开始把RSI作为自身融资叙事的一部分。

我的投资人朋友关注到,最近看的一些数据团队已经开始在新的领域里搭建“半RSI”的系统。它们当然还没有实现完全自动化的迭代,但在某些环节上,可能已经做到接近一半,甚至70%到80%。比如,团队可以在一个新的垂直领域里,快速生产高质量的分析、标注和合成数据,同时把专家经验和人的判断高效地嵌入系统。未来,如果能够进一步减少人工介入,让系统自己完成任务生成、执行、评估和迭代,就有机会从数据生产走向更完整的模型改进闭环。

然而,RSI创业是一场门槛极高的游戏。它同时需要前沿模型、巨额算力、顶尖研究人才、训练基础设施、大规模实验能力,以及足够强的模型评估系统。当前真正有能力尝试闭合完整循环的,仍然主要是OpenAI、Anthropic、Google DeepMind,以及极少数资本和人才配置超常规的新Lab。

今天市场上很多公司都在讲RSI,但它们做的其实并不是同一件事情。有的团队对标大模型公司,目标是做下一代模型研发,试图把完整的模型训练流程跑通;有的RSI只发生在某个产品的自动化层面;还有的团队所说的RSI,是自己的数据管线可以实现自净化、自迭代。这些工作的层次、方向和scope都不一样,短中期内,它们之间可能存在非常明显的差距。

所以,从投资角度看,首先要拆解RSI的具体含义:它究竟在解决哪个层面的问题?这个层面未来在整个行业中能够占据什么样的生态位?它的能力边界在哪里,又有没有继续向上延展的可能?

当然,数据创业者也不必都以RSI做下一代模型为目标。一切都取决于你如何看待自己做的这件事。有些人可能想得非常清楚:出来创业不是为了融资,而是找三五个人、十个人,做一门能够赚钱的生意。只要第一笔订单跑通,客户能够正常回款,现金流就不会有太大压力。

总之,作为年轻人的第一桶金,数据似乎是个不错的生意。

在前述投资人朋友看来,一个团队也不会因为选择“做数据”而减分。相反,过程中积累的能力可能会成为未来做出更大事情的重要前提。“如果一个团队能够一边做数据、一边赚钱养活自己,同时持续积累researcher和工程能力,再沿着模型智能不断往前走,这件事情其实是非常有意思的。”

(责任编辑:zx0600)

华东新闻网(huadongnews.com.cn)是中国华东地区权威新闻门户,聚焦上海、江苏、浙江、安徽、福建、江西、山东等省市的时政要闻、经济发展、民生政策、文化旅游及社会热点。每日提供最新资讯、深度解读和独家报道,致力于打造华东地区信息传播与公众服务的核心平台。

快速搜索

华东新闻网 - 中国华东地区新闻门户,权威发布上海|江苏|浙江|安徽|福建|江西|山东最新资讯

© 华东新闻网

隐私政策