深入Mercor对话:AI数据标注的未来与市场变化
在旧金山的一场盛会——Assembling 2026上,我们汇聚了千余名参与者,探讨了AI领域的最新动态与未来趋势。此次活动设有三个舞台,近二十场深入的对话和交流,涵盖了AI创业者们倍感关注的多个方面。今天分享的是在Founder舞台上,我与市值高达200亿美元的硅谷公司Mercor团队的部分对话实录。
Mercor是一家备受瞩目的公司,专注于数据标注。最近传出它正在与英伟达展开投资洽谈,仅2023年成立的Mercor就已获得200亿美元的估值。值得一提的是,该公司在2025年完成了3.5亿美元的C轮融资,估值一度达到100亿美元。如今AI模型的发展与数据采集密切相关,这是促使Mercor迅速崛起的重要原因。对此,我对此前数据行业经历的变化,以及Mercor对未来AI行业的预判和公司战略的制定,产生了浓厚的兴趣。
在Assembling 2026的大会上,我们与Mercor的团队进行了多次交流。Chirag Mahapatra是Mercor的副总裁,负责前沿实验室的运作、模型评估、研究工程及数据业务等核心领域。他曾参与发表多篇有影响力的研究论文,如Apex-SWE及APEX-agents等。在加入Mercor之前,Chirag创立了AI驱动的营销平台Blaze AI,并且在Meta与Airbnb等公司担任过技术领导职务,这使得他在AI基础设施及数据工具领域拥有了独特的视角。他的言论对当今的AI创业者们而言,具有很高的参考价值。
下面是我们的对话实录。王兆洋:接下来我们聊聊Chirag。我发现上一场圆桌会议的许多问题其实可以从“数据”的角度来解读。AI行业正愈加接近数据行业。那么,请问在场的各位,有多少人听说过Mercor?——很多;那有多少人已经是它的客户呢?——不多。是不是比你预想的还要少?Chirag Mahapatra回应道:我们最初将重心放在前沿实验室。回顾我们的历程,这些实验室对创建高质量的评测和数据集持有执念,并采用科学的方法进行操作。创业伊始,必须集中精力,清楚自身能力,因此前沿实验室是最理想的合作伙伴。
如今,我们看到了新机遇。随着模型的不断进步,越来越多的企业开始采用我们的用例。第一种用例是路由,企业希望弄清哪些场景真正需要高端模型,哪些场景可以用更简单的模型满足。这是最普遍的需求。第二种则是企业希望在自己的代码库中评估编程代理,因为正如上一场讨论所提到的,通常情况下,编程代理会在开源或公开仓库中进行基准测试,而实际企业的代码具有许多微妙差异,复杂性较高。我们认为这方面有相当大的市场潜力。第三类是企业意识到想要利用自身产生的数据来训练模型,并对特定用例进行后续训练,这些都是我们所帮助解决的实际问题。
王兆洋:你提到的数据市场在不断变化,我留意到你在许多平台上写过文章,分享你在Facebook时参与推荐算法的经历。能否为我们梳理一下当前数据市场的状况?与我们所说的“Scale AI时代”已经大不相同了。同时,也分享一下Mercor在发展历程中的关键时间节点和转折点。Chirag Mahapatra说道:当然可以。刚起步时,数据标注市场的景象截然不同。追溯到Mechanical Turk的时代,用于训练模型的任务往往比较简单,比如分类、垃圾邮件检测等任务,这些可以由一些勤奋的普通人完成,并不需要特定领域内的专家参与。
然而,我们观察到的第一个变化来自需求端。随着数据集的复杂性增加,创建推理轨迹和评估解法所需的专业知识也愈加突显,如如今需要MIT及哈佛的博士、IMO奖得主来完成这些任务。进一步令人惊讶的是,这些高水平专家愿意走入这个领域。
她被称为“女篮界的气质女神”,与郭艾伦传过绯闻,30岁依然单身
篮球场上,每一个回合都需要智慧与决心!...
[无下一篇]
篮球场上,每一个回合都需要智慧与决心!...