从 Scale AI到 Surge AI,再到异军突起的 Mercor,在北美,一批AI Data公司的价值已经被验证。
它们做的事情,不只是传统意义上的数据标注,是把专家、真实任务、模型评测、RLHF、Agent 环境,甚至企业真实工作流程,组织成可以持续产生训练信号的基础设施。
Alex Wang把Scale AI的数据引擎,定义为「收集、整理和标注数据,再训练和评估模型」的完整闭环;
Mercor则进一步把专家网络、数据集、Benchmark 和 RL Environment 放到了一起。
当模型越来越强之后,真正稀缺的可能不再是更多数据,而是更接近真实世界、更难获得、能够产生有效反馈的数据。
随着AI从屏幕里的语言模型走向Agent、走进机器人和具身智能,物理世界和数字世界的边界被打破,关于数据新的范式和可能性也在延伸。

在国内,同样有着来自AI数据领域的公司,做出了非常前沿的探索。
本原智数,就是一家深耕AI数据行业十年的公司,也是港股千百度(01028.HK)旗下全赛道专业数据服务商。
他们提供以数据为核心的AI一站式解决方案,包括采标审一体化、高质量数据集建设、智能体搭建、模型部署、微调等。

「高质量数据稀缺时代,人机协同的智能数据标注正改写AI能力边界。」
今天,特别邀请了本原智数的CTO林震亚,听听他怎么说。

林震亚:
我加入本原智数,这个选择看起来像是“逆行”,但其实它是我一直以来沿着产业应用方向探索的结果。
我在中兴通讯研究院工作时发现一个有意思的现象:过去学术界优化模型,常用控制变量法——在数据集固定时,通过不断优化embedding层、模型结构、目标函数、优化器、训练策略等来提升模型表现,每次提升通常有限,能在sota上提升一个以上百分点的已经属于优秀成果了。
但从产业应用的角度来看,我们完全可以换一个思路。与其只在模型层面优化,不如回到数据本身。通过分析模型的 counter case、bad case,找到模型能力不足的地方,然后从数据层面进行补足,往往能够带来更明显的效果。
我逐渐意识到,纯粹做模型研究并非产业最大价值所在,更应关注前沿AI技术在产业中能发挥多少价值。
基于此,我选择更靠近应用的方向。作为NLP算法负责人,选择金融行业,是因为它既有资源支持顶尖算法人才,又有大量高质量文本数据和相对成熟的数据管理体系。
大模型时代的到来让我进一步确认了这个方向。过去训练一个模型,需要花大量时间设计模型结构、准备数据。但大模型出现以后,技术范式发生了变化,通过 few shot learning(少样本学习)范式,依托后训练或是提示工程,用较少的数据也可以在垂直领域取得不错的效果。
于是我也希望看看,在新的AI范式下,传统行业能不能通过智能化赋能发生改变。
之后我以首席架构师的身份加入了春秋航空,牵头负责五十多个AI项目。在这个过程中,我们看到大模型给传统行业带来了很多新的可能。过去很多问题需要大量人工和结构化数据才能解决,但现在大模型能够更好地利用企业内部大量非结构化数据,比如文档、知识资料等,帮助企业提升效率。
同时,我也发现一个更深层的问题——大模型应用的“最后一公里”,依然是数据,数据质量和使用方式直接影响模型输出表现。
现在模型的能力越来越强,大部分场景不需要再做训练微调,真正决定企业AI应用效果的,是企业如何构建自己的数据体系和 Harness。
哪些数据适合进入知识库,哪些数据适合作为长记忆,哪些数据适合作为短记忆,不同数据如何在业务流程中被模型有效调用,这些都依赖业务理解和垂域数据能力。
此外,AI应用最终能不能落地,也需要评测体系来验证。评测集决定了业务场景的AI应用落地标准,定义了模型效果差异,评测集是另一种形式的高质量数据。
如今我选择加入本原智数,希望把过去在模型研发、数据工程和产业实践中的经验用于服务更多行业,推动千行百业的AI落地。
从某种意义上来说,这并不是一次“逆行”,而是回到了AI产业非常关键的一环。
林震亚:
当前AI行业最大的瓶颈我认为是高质量数据集供给不足。
过去几年大模型的快速发展,很大程度上依赖互联网公开数据的规模化利用。但随着模型规模扩大,容易获取的通用数据正在快速减少,数据红利逐渐消退。
更重要的是,公开数据本身存在局限:一方面,很多数据质量参差、重复度高、有效信息密度不足;另一方面,通用数据能覆盖的场景越来越有限,企业真正需要的是面向专业领域、复杂任务和真实业务场景的高价值数据。
所以现在AI行业面临一个非常明显的矛盾:一边是模型表现不断提升,应用需求不断扩大;另一边是能够支撑模型能力进一步提升以及在垂域场景落地应用的数据供给速度,远远跟不上需求的发展。
模型和算力当然仍然重要,但已不是最大制约因素。更好的模型可以降低训练和推理成本,让 scaling 曲线变得更加平稳、提高斜率;更丰富的算力可以支撑更多训练实验,同时更好的保障token供给。
但如果缺少高质量数据支撑,模型能力提升最终会遇到瓶颈,特别是在高价值垂域场景,很难将模型能力转化为应用价值。
林震亚:
未来AI竞争的核心,一定是数据飞轮的竞争。
我们过去讲数据生产,更多关注的是数据采集和简单标注。但随着大模型、智能体的发展,数据生产本身正在发生变化。
未来真正有价值的数据,不只是“标出来”,而是需要围绕模型能力提升和业务场景需求,对数据进行深度加工、评估和优化。
针对垂域场景,GDPval、ALE等评测集已经做的很不错了,这些bench可以客观评价大模型在垂域任务上的表现。现在因为相关数据成本还不高,所以数据公司有很高的leverage。
但是随着成本上升,能驱动这件事的会越来越多变成做平台或垂类业务的公司。在未来,最好的RL环境就是每一家垂域公司的核心资产,而不再是只让agents做post train的众多环境的一个。
这件事已经在发生,之前在春航提出一个概念叫无感标注,本质上是将AI应用嵌入到业务流程中,通过业务人员的审核、优化等反馈动作获取数据,再将数据用于模型表现的提升。
在这个背景下,本原正在聚焦做两件事,一是bench顶尖研发者生态建设,二是安全可靠的token工厂。
为什么要建这个生态,因为每家企业都想建数据飞轮,但是数据飞轮能转起来的根基是有好的AI落地评价标准,大部分企业都没有具备发表大模型评测方向顶会的人才。
有了这个生态,可以给研究者提供场景、提供数据甚至算力,加快高质量bench论文发表;对于企业来说,顶尖研究者的参与可以构建更高质量的RL environment,加速数据飞轮的构建。
为了支撑这个生态,本原智数构建了原识标注 Harness、原测评测 Bench、原智智能体 Flow、原物具身 Physis 四大平台,打通模型评测、数据生产、数据应用全链路,覆盖大模型、世界模型、physical AI、智能体等多类场景。

建token工厂的逻辑更简单,当前大部分token工厂并不是安全可靠的,少量安全可靠的token工厂不具备将数据飞轮转起来的能力。AI应用范围越广,token工厂的价值越高,提供token的逻辑就不讲了,重点是集成效应和飞轮效应。
集成效应容易理解,做过模型的都知道,ensemble是最简单有效的模型效果提升方法,从机器学习时代的bagging、boosting、stacking,再到deep learning时代的weight averaging。
大模型时代更简单,OpenRouter Fusion API做了一件事,把同一条 prompt 并行丢给多个模型 → judge 抽共识/矛盾/盲点 → synthesizer 出最终答案,效果惊人的好,DRACO 深研基准上:Fable 5+GPT-5.5 fusion ≈ 69.0%,Fable 5 单体 65.3%,半价预算面板 64.7%;Opus 4.8 自 fusion(问两遍)从 58.8%→65.5%。
DeepMind 研究员 Andrew Trask提出了一个概念叫“九头蛇效应”: 前沿厂商每发一个新头,路由网络就把它吸进去变强,单体永远追不上集成;为什么token工厂能构建飞轮效应,源自于一个大家都清楚的逻辑,高质量数据可以结合harness提升模型表现。
能将飞轮转起来的公司有两个特点,一是具备大量高质量数据,二是具备轨迹数据清洗、加工、标注能力,数据公司天然具备优势。
当然,token工厂安全可靠也是做这件事的前提,需通过私有化算力集群和官方账号直连提供token,配套完善的安全保障措施。否则没有高质量用户用我们的token工厂,自然数据飞轮也转不起来。
林震亚:
第一个方向,是提升大模型的“智力表现”。
大模型的“智力”本质是三层能力叠加:预训练的知识密度、推理时的隐式搜索能力、后训练的行为策略。
当前模型在简单问答、翻译、摘要上已够用,但在多步推理、精确计算、长程规划等高价值场景中,智力瓶颈明显——幻觉频发、逻辑断裂、无法自我修正。
虽然coding数据、long horizon垂域任务数据能一定程度提升模型智力表现,但针对智力本身的研究意义仍然很大,我们需要找到模型智力缺陷的最小子单元。目前,胜寒高智商俱乐部会长在我们公司,在他的支持下,对模型智力的研究不断有新进展。
第二个方向,我认为是 Coding 能力。
Coding之所以重要,是因为它已是AI领域中被验证具备商业化闭环能力的方向,且国内外模型能力与顶尖架构师仍有明显差距。
只要这个差距存在,Coding的数据需求就会持续。未来AI若在代码领域超越顶尖人类专家,影响将非常大。因为Coding本身具备递归自迭代潜力,AI可帮助优化自身软件系统,包括模型结构设计、硬件适配、训练效率提升以及推理加速等。
基于此,本原智数获得了CMMI3级认证,我们不仅是数据公司,也是专业软件公司,一方面,我们会保障内部系统平台的可靠性、稳定性;另一方面,专业的软件研发体系为我们交付大规模复杂coding项目数据提供保障。
第三个方向,是 long horizon 复杂任务能力。
未来AI不能只完成单点任务,需要具备从任务理解、过程规划、执行反馈到结果优化的完整能力。尤其在垂直行业中,我们需要把专家从接收任务到解决问题的全过程串联起来,形成复杂任务闭环。
如果AI能在各领域持续攻坚,就能成为垂域专家的智能助手,提升工作效率并沉淀业务经验。这也是AI推动产业应用的重要方向。
为掌握long horizon任务设计框架,我一方面作为信通院专家参与高质量数据集项目评审,理解垂域业务;另一方面安排公司资深研究员进入伯克利的ALE(agents' last exam)课题组参与前沿研究。
社区建成后也将支持垂域long horizon评测集构建及高质量数据生产。当然,作为头部数商,我们有海量专家资源,这也是我们能做好这件事的基石。
最后一个方向,是多模态理解和真实世界交互能力。
目前的大模型已经可以解决复杂的知识类问题,但对于真实世界中的空间关系、物理规律和环境变化,理解能力仍然有限。
未来AI需要进一步融合视觉、听觉、触觉等多模态信息,建立对真实世界更深层次的感知和交互能力。这不仅是大模型需补足的短板,也是具身智能的核心。
本原智数在具身领域已有布局,一方面依托专业交付能力和平台能力承接了大量项目,另一方面在做数据配比和模型调优实验,寻找更好的数据采集、清洗、加工、标注、应用pipeline。

林震亚:
本质上是更好的依托我们的基础设施形成数据飞轮,不管是在数据公司内部还是面向垂域企业的服务。
需要注意的是,面向业务专家的模型/智能体跟直接面向业务问题的模型/智能体有差异,有些模型即使效果很好,专家校验、修改结果的成本仍会很高,甚至跟重新做成本接近。
因此,需要想明白如何真正意义上提升专家效率,以及在单位时间内如何获得更有效的专家反馈。
林震亚:
从技术角度来看,本原智数评测平台的核心特点主要体现在两个方面。
第一,我们希望充分利用积累的数据资产,建立能够对模型进行系统性评估的统一入口。
目前行业中已经有很多优秀的 Benchmark 和评测工具,但整体来看,模型评测仍然比较分散。不同团队、不同机构会针对不同能力维度设计自己的评测集,但缺少一个能够系统整合这些能力、帮助用户全面了解模型表现的平台。
因此,我们希望通过平台化的方式,把行业内高质量的公开评测集与我们自身积累的数据资源进行整合。我们会根据不同模型能力需求,对评测数据进行分类分级,形成针对不同场景的专业评测体系,让模型评测不只是一个单点成绩,而是一份更加全面的体检报告。
第二,我们希望通过建设评测社区,汇聚顶尖 Benchmark 研究者和产业专家,共同推动评测体系的发展。
评测社区也是评测平台的一部分,关于社区建设,前面已有所提及。现在学术界和产业界之间仍存在一定gap:学术界关注模型能力突破,产业界更关注模型在真实业务中的表现。
我们希望通过评测社区把这两端连接起来,让科研成果更快进入产业应用,并持续为Benchmark研究者提供场景、数据、算力及工具支持,共同推动评测标准发展。

林震亚:
我认为中美在AI数据服务领域最大的差异,本质上来自两个方面:一个是产业环境和劳动力结构的差异,另一个是数据获取和应用体系的差异。
先看数据生产模式。
美国因为劳动力成本高,企业更关注如何通过AI替代真实岗位中的人力。因此,美国市场更重视 Computer Use数据和仿真环境。
比如我们参与较多的 ALE Benchmark,它的特点不是简单提供一条数据,而是模拟一个真实专家完成工作的完整过程。
第一,它针对美国劳动力市场进行岗位梳理,筛选出大量非体力劳动岗位,将这些岗位拆解成不同任务类型。
第二,它会把专家从接收任务、理解需求、执行任务,到最终获得反馈和评价的整个过程串联起来,形成一个 long horizon 的复杂任务。
第三,也是非常重要的一点,被评测对象不是单一能力 Agent,而是需要在虚拟机环境中混合调用 GUI、CLI、代码执行、文件操作来完成长链条交付的 Generalist Computer-Use Agent 。这比单纯的“命令行 Agent”或“GUI Agent”更贴近真实办公场景。
第四,它需要建立客观的评价体系。超过90%的任务都能通过确定性代码评估器对照参考产物自动判分,无需人工打分。
所以美国市场的数据服务特点,是更加关注贴近真实工作环境的仿真环境,对单条数据质量要求更高,价格也更高。即使是传统轨迹数据,也会要求使用更强的模型,采用更多轮交互。
而中国市场的特点则有所不同。中国拥有大量专家资源,因此更关注专家深度参与的数据生产。
国内企业对合成数据的容忍度较低,如果发现数据生产过程中大量依赖AI生成,缺少真实专家参与,需求方会认为数据可信度不足,供应商甚至可能被拉入黑名单。
所以国内很多数据项目,更关注如何由专家设计好的 Prompt、提供真实业务场景的高质量附件以及客观rubrics,再由专家基于任务要求和评价标准,与模型进行多轮交互,对模型结果进行判断和反馈。
简单来说,美国更倾向于通过模拟真实工作环境,让AI学习如何完成任务;中国更依赖专家知识,通过专家反馈帮助模型提升能力。
另外,从数据服务模式来看,中美也存在明显差异。
过去,美国模型企业更倾向于将数据生产外包,而中国模型企业过去更多选择内部建设数据团队。
但随着产业生态的成熟,越来越多国内企业也开始认识到专业化数据服务的价值,逐渐从自建走向更加开放的合作模式。
同时,数据资源体系也是一个重要差异。海外很多数据公司有前沿研究团队,在方法创新、Benchmark设计和技术框架方面具备优势,但获取真实行业数据往往较难。尤其是涉及企业核心业务的数据,垂域企业公开的可能性比较低。
而中国在这一方面具备优势,依托产业规模和政策推动,很多央国企、垂域机构拥有更丰富的可共享、可交易的数据资产,这为构建行业级Benchmark提供了基础。
我认为,未来国内每个垂直领域都有机会建立自己的Bench体系,且具备作为研究成果发表顶会的潜力。
从这个角度来看,未来中国AI标准会走向全球。

林震亚:
目前大模型领域的训练范式已经相对清晰,模型能力提升很大程度上依赖高质量数据供给。但具身智能不同,它目前还没有形成统一的数据生产路径。
比如,应该采用什么样的硬件设备采集数据?采集的数据如何清洗和加工?如何进行标注?采用什么模型进行预训练和后训练?训练完成后如何部署到不同机器人本体上?这些环节目前都没有完全确定的答案。
所以我们认为,具身智能数据服务当前最重要的事情,不只是生产数据,而是要探索并验证一套完整的数据Pipeline。也就是说,需要证明通过什么样的数据采集、加工、标注方式,能够真正提升模型能力,并最终让机器人在真实场景中表现更好。
具身智能目前处于类似“大模型早期阶段”的探索期。
虽然在少数场景中已经跑出了路径,但整体来看,Scaling规律还没有完全建立,评测体系也没有成熟。
从数据采集路径来看,目前主要有几种方式,包括真机数据、仿真数据、Umi数据和Ego 数据。
真机数据成本高、采集效率低,很难支撑大规模扩展;仿真数据虽然效率高,但存在sim2real gap;UMI数据存在异构问题,像富士康流水线这类复杂度高的场景用不了UMI夹爪。相比而言,我认为Ego 数据未来具有非常大的潜力。
因为第一视角信息是人类理解世界最重要的数据来源之一,深度、姿态、轨迹等信息都可通过视觉数据推导。Ego数据目前还存在遮挡、精度不足等问题,但可通过加入更多传感器补足。
我们探索的路径是Ego加软手:Ego负责第一视角环境理解,让机器人清楚世界是什么样的、下一步该做什么;软手则通过视触觉传感器和柔性操作能力补足精细操作不足。
传统机械手要求精准位置控制,但人类操作其实有一定冗余。软手能提供这种操作冗余。Ego数据解决理解世界的问题,软手末端视触觉数据解决操作问题,两者结合可以更好地释放具身数据价值
林震亚:
保持学习,理解业务和人性,做对社会有价值的事。
林震亚:
总有一天AI会在大量生产环节中超过人类,这是技术发展的必然趋势。
但这并不意味着人的价值消失,而是意味着社会分工会发生新的变化。
回顾历史,每一次重大技术革命都会带来生产方式的改变。比如汽车出现以后,马车以及相关产业逐渐消失,但人类并没有因此失去价值,而是进入了新的产业和新的工作形态。我认为AI时代也会类似。
当AI能够完成更多一线生产工作时,人可以去二线管理AI;当AI进一步提升能力,人又可以继续寻找新的价值点,形成新的娱乐及产业生态。我的根本点是AI是人类文明的服务者而不是统治者,因此AI的价值需要由人类评定。
在任何时代,AI都会有它不擅长的事情,而人的价值就在于解决这些AI无法解决的问题,包括新场景下的创造、判断、价值选择以及人与人之间的连接。
Hinton曾说过,当AI从事了大量工作,他最担心的还不是分配问题,而是很多人的尊严会消失。
我倒是没那么担心,社会人群本身就有分化,对于一部分人来说,他们一定会找到新的创造价值的方式;而另一部分人在生产力富足、娱乐活动更丰富的未来,反而有更多机会找到自己的价值点。
未来,每个人的数据都会是重要资产,这也会成为资源分配的新锚点。
之前思考过一个问题,AI4S从长远来看势必能推动基础理论的突破,从而实现人类文明等级的跃迁。
在物质生活极度丰富的未来,什么样的价值观可以支撑人类文明继续进步,同时保障社会的幸福感。这个问题我还没想清楚,但是在思考的过程中更清楚了教育的重要性。
情绪价值是驱动人类行为的源动力,埃隆马斯克之所以伟大,是因为他的经历和教育告诉他需要让人类成为跨行星物种,因此愿意为这个愿景投入一切,他的产业生态都是围绕这个大目标创建的。他不是天生伟大,而是因为他做这件事开心。
过程中多苦多累都能坚持,因为与对目标的憧憬以及达成阶段性成果带来的喜悦相比,都算不上什么。但为什么其他人做不到,甚至有些人在低级趣味中荒废一生?本质上,因为接受的教育和经历不同。
我希望技术能在教育中扮演更重要的角色,让每个人都能树立正确的价值观,当做对社会有益的事能成为让每个人开心的事,世界会变得非常美好。

从数据,到模型,再到Agent和具身智能,AI正在从数字世界逐渐走向真实世界。
在这个过程中,数据的角色也在发生变化。它不再只是训练模型的“原材料”,而开始成为连接专家、业务、模型与真实世界的基础设施。谁能够持续获得高质量数据,建立可靠的评测体系,并让数据在真实应用中不断产生新的反馈,谁就有可能建立起真正的数据飞轮。
这或许也是AI Data行业正在发生的变化:它正在从模型背后的供应链,走向AI产业基础设施的一部分。
而当AI最终进入更多真实的生产环节,技术之外的问题也会变得越来越重要——人应该如何与AI协作,又应该如何重新定义自己的价值?
林震亚给出的答案并不复杂:保持学习,理解业务和人性,做对社会有价值的事。
对于仍在快速变化中的AI行业而言,或许这也是数据、模型和技术之外,我们最终需要回答的问题。
而本原智数,聚焦于世界模型、具身智能、多模态大模型及自动驾驶的全链数据治理及产业服务,自研的算法标注平台已服务于多家企业。

现在已经在多个垂直领域的客户数量、业务量、交付团队规模、交付口碑专业度等均居行业前列。
接下来的AI数据未来,大概会更精彩……
文章来自于"AI异类弗兰克",作者 "FrankGPT"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0