}


作者黄小艺
微信 H997Hbiu

随着Agent走向真实工作,后训练和数据正在成为提升智能的关键。

据数据供应商 Handshake 方估算,多家头部 AI 公司每年在“人类数据”上的支出已接近 10 亿美元量级。

从专家完成的 SFT、RLHF 数据,到可以运行数万次 rollout 的 RL 环境,再到 评分器(grader)、验证器(verifier)、训练 recipe、算力和整套 RL 服务,“数据公司”正在变成模型后训练的外部研发部门,长出了Surge AI、Mercor、Scale AI 这样的头部选手。

将视线转回中国数据市场,其体量也在快速增长。以字节为例,据报道,2026 年为世界模型训练数据安排的预算达到数千万元人民币, Coding 数据投入仅次于世界模型。

在这个背景下,一个值得关心的问题是,国产模型的后训练需要哪些数据,正在把哪些环节留在内部,哪些工作交给外部团队?如果模型公司需要专家任务、Agent 轨迹、Benchmark、可执行环境和自动验证信号,国内有哪些团队正在提供这些能力?

本期项目推荐,我们整理了一批新兴公司,包括智能知识、Copula Lab、原壤智能、UniPat AI、维纳智能等。这些公司都位于“后训练—评测—数据反馈”这条宽泛链条上,但商业形态不同:有的是专家数据供应商,有的是数据生产软件或 RL 环境创业公司,有的是研究型 Benchmark 团队,还有的把合成数据能力封装进企业 Agent。

以下是具体信息。

1

智能知识(Human Intelligence )


一句话定位:智能知识是一家“专家网络 + 数据生产软件 + RL-ready 任务数据”的组合型供应商。

产品概述

其业务可以分成三层:专家从哪里来、数据如何生产,以及最终生产什么数据。

第一层是“一面千识”,负责专家供给。和简单开放任务、让普通标注员抢单的方式不同,它是根据模型公司的训练目标确定人才画像,再通过身份和学历验证、AI 面试等流程筛选专家,最后完成任务分配、质量追踪和报酬结算。


从目前公开的招募岗位看,一面千识以程序员为主,其它岗位覆盖金融证券、内容运营、法律实务、创新药研发、K12教育、记者编辑、医生、保险、税务和高校科研人员等。

以金融岗位为例,专家需要设计真实投研任务,准备公告、财报、行情和监管规则等材料,确定估值方法、核心假设和验收标准,再审核模型结论中的数据误读、风险遗漏与证据问题,偏向于“专业工作任务生产工作流”。

官方披露,一面千识已实现每日数百场AI面试、每月数千名专家成功接单,已连接50,000+领域专家。

第二层是 Xpert Studio,负责把专家组织成一条可规模化的数据生产线。平台覆盖标注界面配置、任务分发、权限管理、抽样审核、多轮质检、标注一致性计算和质量看板,也支持通过 API、SDK、云端或私有化方式接入模型团队现有的数据流程。

第三层是它最终交付的数据。Xpert Studio 除了支持常规问答、分类和偏好排序,还面向 CoT、规划、多轮对话、API调用、Browser Use、Computer Use等复杂Agent任务,目前已发布了Terminal RL Data、MCP Data。

团队背景

智能知识核心团队来自字节跳动 Seed 部门,已经获得头部大模型公司订单,完成初步 PMF,2026年6月宣布完成由锦秋基金、耀途资本联合投资的天使轮融资,此前种子轮获得五源资本和奇绩创坛投资。本轮资金主要用于扩张Coding、Enterprise Office、Agentic Tool Use等数据品类,以及升级专家画像、技能评估和人岗匹配系统。

为什么值得关注

智能知识的业务形式,直接对标Scale AI。

一面千识对应Scale旗下的Outlier,负责招募、筛选和管理领域专家;Xpert Studio对应Scale Data Engine,由AI辅助,把任务配置、专家协作、标注审核和质量控制沉淀成软件;Terminal RL等数据资产,则开始向Scale AI 的RL Environments靠近,不仅包含题目和答案,还包含Docker环境、测试脚本、Oracle参考解法、运行轨迹和元数据;MCP任务则进一步加入受控网页、浏览器工具和程序化Verifier,可以让模型进入环境反复尝试,记录完整rollout,并通过测试结果获得明确的奖励信号。

值得注意的是,Xpert Studio还试图降低专业数据生产工具的门槛。平台目前提供三档定价:社区版面向独立开发者限量免费,会员价格为3000元/年,VIP为5万元/年,相比只服务头部实验室的大额数据合同,这套定价意味着小型Agent团队、研究机构和独立开发者也可以自己组织专家、设计评测集和迭代数据。

1

Copula Lab


一句话定位:Copula Lab 提供专家工作流数据、Benchmark、评测和 RL 环境,主要面向前沿模型团队。

产品概述

继编程之后,下一个前沿是模型能否真正深入高经济价值、高门槛的专业工作流。前沿后训练正在从静态问答、偏好标注和单轮任务,转向可交互、可验证、可扩展的专家工作流环境。

Copula Lab想解决的问题是:如何让模型在一个接近真实工作的环境中连续使用工具、处理多步依赖、修正错误,最终完成一份可以被专业人士验收的交付物。


目前官网公开的数据产品主要集中在 Coding、设计和专业办公任务。例如,WebDev 将自然语言需求、可运行的前端产品、开发轨迹、页面截图和专家审美评分组合成数据,可用于 SFT、偏好训练、RL 和评测。

团队背景

创始人梁丽曾负责 MiniMax 的 Agent 业务,并从零建立内部 Agent Benchmark。

技术联合创始人蔡佳人曾担任 MiniMax 开源负责人和后训练工程师,参与 MiniMax M2 系列在 Coding 方向的后训练,并负责与 LMArena、Vals AI、Terminal-Bench 等 Benchmark 和数据项目的合作。目前公司尚未公开披露融资情况。

为什么值得关注

如果说智能知识更像“专家众包网络+数据生产平台”,GOMAX 更偏向中文科学与产业数据及垂类评测,那么 Copula Lab 的特点,是从模型公司内部的后训练需求出发,反向设计数据和环境。

创始团队既做过 Agent 产品,也参与过模型后训练和 Benchmark 建设,因此它的出发点不是召集专家网络,而是模型在真实任务中为什么失败,从不同的 failure mode,形成不同的任务、轨迹、Rubric、环境和奖励信号,这使 Copula 的数据更接近模型训练团队实际采购的形态。

在本期几家公司中,Copula 是将 RL Environment 明确放在核心产品位置的一家。但目前公开案例主要证明它能够生产“任务+运行资产+轨迹+评分标准”,还不能证明这些环境已经具备大规模 RL 训练所要求的完整工程能力。

真正值得继续验证的是:环境能否被稳定重置和复现,能否直接连接模型公司的 Agent 与训练框架,能否支持大量并行 rollout;评分函数是否足够自动化、稳定且不容易被模型钻空子;以及这些任务经过训练后,能否在独立 Benchmark 上带来可复现的能力提升。

1

UniPat AI


一句话定位:UniPat AI 是一家围绕真实世界能力构建 Benchmark、训练数据和实验模型的 research-first 团队。

产品概述

它不是传统意义上的数据公司,也暂时不像 Copula Lab 那样明确向模型公司销售专家工作流数据和 RL 环境。UniPat 更像一座数据与后训练实验室:先构造足够真实、足够困难的任务,找到模型的能力缺口;再围绕这些缺口生产数据、设计 Rubric,并通过实际后训练验证这些训练信号是否有效。

在 Agent 评测方面,UniPat 已发布 SaaS-Bench、RoadmapBench、EvoCode-Bench、Monthly-SWEBench、BabyVision 等多个 Benchmark,覆盖 Computer Use、长期软件开发、多轮 Coding 和视觉推理。

除了 Benchmark,UniPat 也在生产后训练数据并亲自训练模型。

其 UniScientist 项目通过人类专家与 LLM 协作,生产了超过 4,700 个研究级科学任务,覆盖 50 多个学科,并为每个任务配套可验证的 Rubric。团队随后用这些数据对 Qwen3-30B-A3B-Thinking 进行 Agentic SFT,显著提升了效果。

团队背景

UniPat 公开研究的主要贡献者包括 Liang Chen、Kuan Li 等人,公开资料未披露其融资情况,也没有明确说明 Benchmark、数据和 RL 环境的商业化收入。

为什么值得关注

UniPat 值得关注的地方,是它没有把 Benchmark、数据和后训练当成三件分离的事。

很多数据公司完成交付后,很难回答一个问题:这批数据到底有没有让模型变强?UniPat 的做法是先用真实任务找到模型的 failure mode,再围绕这些失败生产训练数据和评分标准,最后实际训练模型,并在留出集和外部 Benchmark 上验证能力有没有提升。

从 UniScientist、ExpertEval 到 BabyVision,其公开项目已经覆盖了三种不同的数据路线:LLM 大规模合成、专家直接生产,以及面向 RLVR 的可验证数据。它也分别用 Agentic SFT、Rubric rejection sampling 和 GRPO 做过后训练实验。相比单纯发布排行榜,这更接近一套“发现能力缺口—生产训练信号—训练模型—验证泛化”的数据研究闭环。

下一步需要观察的是,它会继续作为研究团队发布模型和 Benchmark,还是把这些能力封装成面向模型公司的环境、数据或后训练服务。

1

原壤智能

一句话定位:原壤智能目前通过两个品牌开展业务:负责专家招募和任务交付的 TalentsAI,以及负责高质量数据、Benchmark 和企业数据合作的 Humanlaya。

产品概述

TalentsAI 是原壤智能的专家数据生产平台。它负责寻找不同学科的专业人员,验证学历、执业资格和工作经历,再将专家匹配给模型训练与评测项目。

据平台披露,TalentsAI 目前已有超过5万名专家入驻,覆盖300多个细分学科,其中包括5000多名博士级人才,并与10多家头部 AI Lab 合作。平台公开的任务类型包括复杂指令遵循、Rubric 设计与评测、HLE 高难度推理、RLHF、VLM、长文本与专业文档处理,以及金融、法律、医疗、自然科学、软件工程等领域的多轮对话和学科验证。


Humanlaya 则更像原壤智能的数据与评测实验室。它围绕真实专业工作推出 Benchmark 和高保真数据集,目前已经发布 BiomniBench、ExcelBench、$OneMillion-Bench 和 WorldTravel,覆盖生物医学分析、表格操作、专业知识工作和多模态旅行规划等任务。

两个品牌组合起来,形成了一条从“找专家”到“定义任务”的链条。

团队背景

原壤智能的公开招聘资料披露,公司已获得红杉中国与 BAI 资本的天使轮投资,融资近千万美元。

为什么值得关注

它同时踩在专家供给、数据生产和模型评测三个位置上。TalentsAI 解决“谁有资格定义专业工作”,Humanlaya 解决“如何把这种判断变成模型可理解、可比较的标准”。如果两边能够持续互相反馈,Benchmark 不只是一个对外传播产品,也会成为寻找训练数据需求和检验数据效果的入口。

接下来需要验证的,是5万名注册专家中有多少能够稳定参与高难度任务,公开 Benchmark 能否转化为持续的数据采购和评测收入,以及公司是否已经为模型客户生产了与公开测试集隔离、并能带来可量化训练提升的数据集。

1

维纳智能(Wiener Intelligence)


一句话定位:维纳智能做的是大模型推理数据生成,以及基于这些数据构建闭环 Agent 系统。

产品概述

前面的公司主要依靠专家生产任务、轨迹和评价标准。

但专家数据有一个天然限制:贵,而且慢。任务越专业,真正能够完成和审核的人就越少。所以还有公司选择了另一条路:让模型自己出题、自己生成推理过程和答案,再利用测试与反馈不断筛选和优化这些数据。

它提出的核心数据结构是 cQrA 四元组,即 Context、Question、reasoning 和 Answer。模型读取行业文档或结构化信息后,不只生成答案,还要主动提出问题,并生成相应的推理过程。

维纳把传统模型训练概括为“数据→Token”,自己的重点则是补上“Token→数据”:用模型输出重新生成专业推理数据,再让这些数据进入测试、优化和后续训练,形成“数据→Token→数据”的循环。

从目前公开的商业化产品看,维纳并不是把数据集单独摆上货架,而是将数据生成能力封装进企业 Agent。

团队背景

创始人兼 CEO 柳崎峰毕业于中国科学院自动化研究所,曾任香港生成式人工智能研发中心总经理、平安集团加马 AI 研究院院长,并参与香港大模型训练和超算基础设施建设。

据公司官网披露,维纳智能总部位于香港,在深圳和北京设有分部,已完成由联想创投领投的千万美元级种子轮融资。

为什么值得关注

维纳智能押注的是,专家无法无限生产数据,但模型可以。

如果 AI 能够从企业文档、数据库和实际交互中持续生成高质量问题、推理过程和答案,企业就有可能建立自己的合成数据飞轮,不再完全依赖人工标注。

它更准确的定位是:合成推理数据公司,以及以数据反馈为底座的闭环 Agent 公司。

这条路径最大的难点,是如何验证 AI 生成的数据。模型自己出题、自己回答,也可能把原有错误和偏见循环放大。维纳能否建立独立的 verifier、专家抽检和真实业务结果反馈,将决定“AI 造数据”究竟是有效的训练信号,还是规模更大的合成噪声。

1

小结

以上几个项目都在处理大模型后训练阶段的“数据”问题,但它们并不属于同一种公司。

Human Intelligence、原壤智能等接近专家供给与专业数据生产:它们试图找到真正理解任务的人,再把专家的知识转化为任务、答案、Rubric 和评价信号。Copula Lab 和 UniPat 更关注如何把真实工作变成 Benchmark、可执行任务或可验证环境,让模型不只回答问题,而是在接近实际的软件和工作流程中完成任务。维纳智能走的则是另一条相邻路线:利用模型生成问题、推理过程和答案,再通过企业应用中的反馈筛选和更新这些数据。

这些路径之间并非泾渭分明。一家公司既可能招募专家,也可能制作 Benchmark;既可能交付训练数据,也可能搭建环境、评分器和企业 Agent。

某种意义上,这也说明了国内后训练数据市场仍处在品类形成期。专家数据、Benchmark、RL 环境、自动验证和企业反馈尚未形成稳定、清晰的专业分工,模型公司更偏向将核心后训练环节留在内部,外部团队能够承接的主要是专家组织、任务生产和部分环境构造。

但无论从专家出发、从环境出发,还是让模型参与数据生成,这些项目的目标是一致的:构建更多来自真实工作、承载专业判断且能够被验证的高质量数据,让模型学会处理更复杂的任务,推动其向下一代智能演进。

我们也会继续关注这个赛道,动态记录其中的公司、产品以及后训练供应链的变化。


点个爱心,再走 吧