🤖 AI总结
主题
AI数据服务企业本原智数发布双十亿计划及四大平台,推动AI数据从规模供给转向专业能力供给。
摘要
本原智数发布双十亿计划及四大平台,聚焦专家数据与具身智能,推动AI数据服务向高价值环节跃迁,构建产业生态。
关键信息
- 1 AI数据需求从通识转向专家数据,面临数据枯竭挑战。
- 2 本原智数发布双十亿计划,建设十亿条专家轨迹数据和十亿小时具身操作数据。
- 3 推出四大平台,构建从评测到落地的数据服务闭环。
![]()
剑桥大学的一项研究显示,截至2025年,互联网公开的高质量文本数据已消耗超过七成。
过去十年支撑大模型快速成长的公开数据红利,正在以超出预期的速度消失。
与此同时,AI本身也在进化,它不再满足于学习知识,正在进入学习如何干活的阶段。
大模型、智能体、具身智能的接连涌现,让AI对数据的需求发生了根本性变化。
李逆勇对此有一个很直白的判断。
他说,通识数据决定模型的下限,专家数据才真正触碰智能的上限。
![]()
这句话其实点出了当前AI行业最核心的焦虑,公开的互联网数据快见底了,但模型还要继续往上走,接下来靠什么来喂?
8月28日,贵阳。本原智数首届生态发布会现场,创始人李逆勇站在台上,给出了他的答案。
这家今年6月刚刚并入港股上市公司千百度的AI数据服务企业,正式发布了面向未来五年的双十亿计划,并首次集中亮相四大自研平台。
这是第一次,一场数据一次企业战略升级,也被业界视为中国AI数据服务向高价值环节跃迁的标志性事件。
01当AI开始「学干活」,数据成了最大的瓶颈
模型进化真正的瓶颈,正在从有没有数据,转向有没有足够好的数据。
李逆勇在演讲开篇就抛出了这一判断。在他看来,AI数据服务行业的本质只有一件事,就是把人类的知识和经验萃取出来,投喂给AI。而萃取什么样的经验,取决于AI进化到了哪个阶段。
他梳理了一条清晰的演进路径。
从语音模型的听和说,到视觉模型的看和认,再到自动驾驶的复杂决策,最后是大模型的思考和干活能力。
这条路径有一个明确的方向,AI正在从模仿感官走向模仿工作。前两个阶段相对简单,AI学习这个世界是什么样的,声音对应什么文字,图片里有什么物体,这些任务的数据也相对容易获取。
但从自动驾驶开始,AI进入了在这个世界里怎么干活的阶段。开车不是单纯看到路况,而是要在复杂的三维空间中做出一连串决策。
到了大模型时代,AI要学习的是人类的语言能力、逻辑能力和推理能力,属于白领的工作技能,而且正在从初级白领走向高级白领。
以前做代码任务的时候,可能单轮交互就完成了,给一个需求就返回一段代码。
现在可能需要十轮以上的交互,解决一个系统化的软件工程问题,和写一个简单的小程序,数据难度完全不是一个量级。
李逆勇曾经打过一个比方,算力是你有钱就可以解决的,数据可不是你有钱就能解决的。
![]()
数据里面有很多边界情况,你有钱也不好解决。
这句话在行业内引起了不少共鸣,因为做AI的人都知道,收集一批通用数据容易,但要把那些长尾场景、极端情况的数据补齐,靠砸钱是砸不出来的。
核心变化是,AI正在从学知识走向学干活,而干活的数据在互联网上没有现成的。算力是有钱就能买到的,GPU就是GPU,只要有足够的资金随时可以下单,但高质量的专业数据不是这样。
一份投行分析报告、一份三甲医院的病历标注、一份资深律师的合同批注,这些东西不在互联网上,也不会公开出售。
关于合成数据,李逆勇的态度也很明确,没有人会真正想用仿真数据,大家之所以用仿真数据,是因为没有那么多真实数据,没办法了才用。
这些变化叠加在一起,指向一个清晰的结论,AI数据行业正在经历一场从规模供给到专业能力供给的范式转移。
而这场转移背后,是一个数千亿甚至万亿级别的市场正在成形。
02双十亿计划:把人类专家的经验变成AI的养料
面对AI从理解信息走向理解世界、从数字交互走向物理交互的趋势,本原智数正式推出了双十亿计划。
这个计划分为两个方向,一是面向未来人工智能发展需求,建设十亿条专家轨迹数据和十亿小时具身操作数据两大核心数据资产。
二是面向产业生态,在全球范围内招募一百家核心数据生态伙伴,通过开放协同推动数据服务、技术、场景与产业资源进一步融合,力争在五年内推动生态年总产值突破一百亿元。
为什么是十亿这个量级?李逆勇算了一笔账,头部智驾公司对外公布的道路数据是一亿小时,而具身智能比自动驾驶多一个维度,不是二维的道路环境而是三维的物理世界,所以至少需要十亿小时。
目前全球单家数据公司做得最多的也就一百万小时,从一百万小时到十亿小时差了三个数量级,这个行业才刚刚开始。
而这个市场规模有多大?一条白领数据二百到三百元,十亿条对应两三千亿市场,一小时具身数据二百到三百元,十亿小时对应两三千亿市场,合计是数千亿甚至上万亿的规模。
![]()
他特别强调,这不仅仅是数据数量上的十亿,更重要的是沉淀为真正具有训练价值、评测价值和产业价值的高质量数据资产。
为支撑这一目标,双十亿计划的生态部分同步启动。本原智数将以贵阳为核心,面向全球招募一百个千人级核心数据生态伙伴,推动生态伙伴年总产值达到一百亿元。
贵阳作为国家大数据综合试验区核心区,兼具数据要素市场化配置改革试点、绿色数据中心集群及综合成本优势,正在加速形成从数据标注、AI训练到智能终端的完整产业链条。
李逆勇坦言,不可能一家公司能独立完成这个目标,必须通过订单驱动、标准制定、工具赋能来和合作伙伴共建。
支撑这个宏伟计划的,是本原智数过去十年经历的「三次跃迁」。
![]()
第一次是从按图施工的施工队走向数据标准共建者,与客户共同定义评测体系和交付流程。
过去什么是好数据由模型厂商的算法科学家定义,数据公司只管按图施工,但现在模型厂商自己对好数据的定义能力在减弱,因为数据越来越贴近真实任务,算法科学家说了不算,行业专家说了算。
本原的破局方式是先评测再生产,通过测评模型的能力短板,再告诉客户如果想提升某项能力,需要什么样的数据集。
第二次是从通识数据建设者走向专家数据引领者,将医疗、金融、法律、代码等领域的专家隐性知识沉淀为AI可学习的数据资产。
模型需要的不再是通识知识,而是干活的能力。
要教AI干活,需要两类专家数据,学科型专家解决单点很难的任务,如数学证明、物理推理、高难度代码,实践型专家解决长链复杂的任务,如开车、审合同、做行业报告。
专家稀缺的问题如何解决?本原的解法是分层生产,以医疗为例,最顶级的主任医师定义标准、拆解流程,流程拆到足够细之后,主治医师甚至医学院的博士生也可以来填充细节。
第三次是从小样本尝试走向规模化供给,通过三梯队交付体系让高质量数据具备产业化供给能力。
李逆勇有个观点很实在,能生产一百条高质量数据和能生产一百万条高质量数据,本质是两种不同的团队能力。
本原的交付体系是科学家加专家定标准,全球十二大交付中心稳定交付,八百万众包网络弹性扩容,人机协作下标注效率提升六倍,成本降低四成五。
03四大平台:从评测到落地,打通数据全链路
与双十亿计划同台亮相的四大平台,构成了本原智数从评测到生产再到落地的完整数据服务闭环。
这四个平台分别是原测OriginBench、原识OriginWise、原智OriginFlow和原物OriginPhysis。
![]()
原测OriginBench聚焦大模型与智能体的全链路多维度量化评估,通过系统化评测帮助企业识别模型及智能体的能力短板,为模型优化和应用落地提供依据。
它能够精准界定能力边界、识别数据短板,将AI能力提升反向转化为高质量数据集建设的需求。
原识OriginWise则面向专家级人机协同与人才能力匹配,通过专家知识与经验的结构化沉淀,为专业数据生产、专家能力调用以及相关场景的数据服务提供支撑。
这个平台汇聚了十万以上的行业专家,通过众包触达、标准化工序拆解与AI工具提效,实现专家数据的高效规模化生产。
原智OriginFlow聚焦智能体从零到一的开发以及全生命周期运营,推动数据、模型与业务场景之间形成更加高效的协同,支持模块化组装,打通业务数据向能力燃料转化的闭环。
原物OriginPhysis则进一步面向具身智能领域,覆盖多本体数据采集、数据闭环处理、规模化生产以及仿真评测等环节,探索通过数据与仿真协同推动具身智能训练和应用效率提升。
它是一站式具身智能平台,覆盖从多本体采集、全流程闭环加工到规模化落地的全过程。
关于这四大平台的设计理念,本原智数CTO林震亚在发布会后的交流中提到了一个关键思考。
他说,很多数据公司还在用作坊式的方式服务客户,但AI产业已经到了需要工业化数据供给的阶段。四大平台的核心逻辑就是让数据生产从项目制变成基础设施,客户来了不需要重复造轮子,直接调用能力模块就行。
这种平台化的思路,本质上是把数据服务从手工作坊升级到了流水线。
四者协同的逻辑非常清晰,先评测模型能力短板,再组织专家规模化生产所需数据,然后帮助企业把模型转化为可运行的智能体,最后从数字世界走向物理世界。
这套体系意味着本原智数不再只是数据的加工方,而是能为客户提供从测评定义需求、专家生产数据、智能体落地应用到具身智能验证的端到端基础设施。
值得一提的是,本原智数始终坚持不做模型的定位,只做客户的数据伙伴。2026年6月正式并入港股上市公司千百度后,这种中立性被完整保全。李逆勇在采访中提到,曾有国内的大模型厂商抛出过橄榄枝希望并进去,但本原的底层思考是,一个独立第三方的数据公司价值非常高,不希望变成某一家模型公司的数据部门。
这种中立定位让本原智数得以服务市场上彼此竞争的各类客户。
依托港股数据标注第一股千百度的上市平台与稳健现金流,本原智数得以在技术与产能上坚持长期主义投入。
年均标注量已达数亿级,核心项目交付及时率百分之百,质量达标率百分之九十八以上,并蝉联了2024和2025语料风云榜十佳企业。
04生态协同:从单点能力走向协同网络
在本次生态发布会上,本原智数还举办了生态合作伙伴仪式。从这份长长的合作伙伴名单中,可以清晰看到一家数据公司如何一步步走向基础设施的定位。
![]()
在云计算和数字基础设施领域,合作伙伴包括阿里云、联通数智、东软云科技、中国广电云南网络有限公司、云南广电网络投资有限公司。
在科研与高校领域,合作伙伴包括中国信通院华东分院、华东师范大学、上海师范大学、上海工业互联网中心、交大实验室、哈工大实验室以及伯克利ALE等。
在数据要素和产业应用领域,合作伙伴包括深圳数据交易所、泛亚汽车技术中心、众安保险、华院计算、金卫信息等。
此外还有景烁科技、智算星空、元枢智汇、深工智擎、珂珂矩阵、言信科技、海隼数字、小宿科技、Qlab等AI及创新科技企业。
这些合作覆盖从数据生产、治理与评测,到云计算、科研研发,再到产业场景应用的多个环节,也构成了本原智数推进双十亿计划的生态基础。
从云计算、通信基础设施,到科研创新、数据交易,再到汽车、保险、工业互联网及AI应用,多元伙伴的加入正在帮助本原智数进一步打通AI数据产业链上下游。
李逆勇在谈到生态建设时说:我们不做模型,只做数据,但这并不意味着我们只做一个孤立的环节。数据要真正产生价值,必须和算力、存储、场景、应用连在一起。
所以本原智数选择用生态的方式来做这件事,而不是单打独斗。
在他看来,未来的AI数据公司如果不能融入一个更大的协同网络,单点能力再强也很难走远。
随着具身智能进入产业化加速阶段,机器人正在从实验室走向更加复杂的真实应用场景。
从工业制造、应急救援,到商用服务、家庭陪护,机器人在不同环境中持续产生海量视觉、触觉、传感时序以及仿真合成等多模态数据。
这意味着具身智能的发展不仅需要算法和模型能力,也对数据的采集、传输、存储、管理以及训练基础设施提出了更高要求。
在发布会上,阿里云公共云事业部高级解决方案架构师分享了基于飞天盘古分布式存储底座的全链路解决方案,覆盖数据采集、数据处理、时序存储到模型仿真训练的全链条。
这进一步说明,随着具身智能进入产业化阶段,数据服务正在与云计算、存储、算力、模型训练等基础设施形成更加紧密的协同关系。
对于AI产业而言,未来的数据生态将不再是孤立的数据生产环节,而是连接数据、算力、模型和应用的综合基础设施体系。
05让数据真正成为智能进化的基础设施
从大模型到智能体,再到具身智能,人工智能正在不断突破数字空间与物理世界之间的边界,而数据也正在经历从训练材料向智能基础设施的角色转变。
此次数博会期间,本原智数通过双十亿计划、四大平台以及生态伙伴体系的集中展示,进一步明确了其面向AI产业的数据战略,以高质量数据为基础,以标准和平台为支撑,以产业生态为连接,持续推动数据生产、评测、治理、流通与应用能力协同发展。
未来随着十亿条专家轨迹数据、十亿小时具身操作数据等核心数据资产持续建设,以及更多生态伙伴加入,本原智数希望进一步推动高质量数据进入大模型、智能体、具身智能及更多产业场景,让数据从被使用的资源逐步成为推动人工智能持续进化的基础设施。
李逆勇在发布会尾声说了一段话。
他说,我们站在智能系统与真实世界不断交互、不断学习、不断修正的连接处,每一次帮助模型突破一道能力边界,那道边界就永久地后退了一步。
![]()
模型会迭代,架构会演进,算力会不断提升,但所有智能的成长都离不开对世界经验的学习。
本原智数希望通过双十亿计划和四大平台,与更多伙伴一起,把人类知识、经验和智慧转化为AI能够学习的高质量数据,以人类之智识探索通用人工智能之边界。
似乎,我看到了一份面向未来的行动地图。
当数据从原料升维为资产,本原智数正试图为中国AI产业写下新的注脚,而这条路已经启程。
![]()
朋友圈会发一些具体的案例和商业化日常~