国家数据局近期印发《关于推进行业高质量数据集建设行动的实施方案》,将“标注攻坚行动”列为六项重点任务之一,明确提出引导数据标注从“以人为主”向“人机协同、专家深度参与”的多层次标注模式转变。这一要求明确了行业升级的核心方向,数据标注产业的发展重心,将逐步从人力规模扩张转向技术能力与专业能力的双重提升。
一、纯人力标注模式的现实瓶颈
AI发展早期,标注需求多是基础图像框选、语音转写,靠人力堆叠就能快速响应。如今AI向多模态生成、垂类场景、具身智能延伸,标注任务的复杂度大幅上升,纯人力模式的短板愈发明显。
最直观的是效率与成本的矛盾。以智能驾驶为例,标注内容已从2D框拓展到3D点云融合、4D时序关联、OCC场景重建,单帧数据处理耗时成倍增加,产能爬坡慢,交付节奏跟不上大模型迭代速度,人力成本也同步攀升。
质量稳定性同样难以保障。标注结果依赖人员对规则的理解,即便统一培训,不同人处理边界场景、模糊案例时仍会出现偏差。传统抽检质检无法覆盖全量数据,精度与成本难以兼顾,最终影响训练数据集的整体质量。
专业领域的能力缺口更为突出。大模型SFT微调、RLHF强化学习、具身智能任务轨迹标注,以及医疗、法律等垂类知识标注,都需要标注人员具备对应领域的知识储备。普通标注员无法准确理解专业规则与深层语义,直接制约了高质量行业数据集的供给。
二、人机协同工具的落地路径
政策明确的工具智能化方向,核心就是落地“模型预标注+人工校准”模式:由专项标注模型完成基础、重复性工作,人工专注修正复杂边界与特殊场景。这既能提升效率,也能通过模型统一标注基准,减少人为偏差。
针对这些痛点,全知启航自主研发了三大数据标注平台,均围绕人机协同设计:
VisuLab全栈视觉标注平台:内置智能预标注工具,覆盖2D语义分割、3D点云融合、4D时序标注等全场景视觉需求。“预标注-人工修正”工作流可使标注效率提升30%-50%。
SonicLab语音采标一体化平台:实现采集、入库、标注端到端闭环,消除传统数据流转中的损耗与延迟,整体交付效率提升50%。
EmbodiLab具身智能标注平台(即将推出):将搭载半自动化标注工具,通过人机协同交互兼顾效率与质量。
三大平台均集成柔性项目管理与全流程质检功能,执行“一轮标注+三轮质检”标准化流程,在提效的同时将标注精度稳定在99%以上,适配高质量数据集建设标准。
三、专家型标注的能力建设
工具解决效率与基础质量问题,而数据集的知识密度与专业价值,仍需专业人才深度参与。政策提出发展专家型标注服务,就是要破解垂类领域标注能力不足的问题。
全知启航组建了由985/211高学历人才构成的独立大模型专家标注团队,可承接SFT监督微调、RLHF强化学习、思维链推理、多轮对话设计等高难度任务。同时联动高校与行业机构,储备多领域垂类专家资源,针对特定行业场景提供符合专业标准的标注服务,保障数据集的专业准确性与知识密度。
四、分层产能体系的支撑作用
工具与专家团队的能力落地,需要稳定的规模化产能支撑。全知启航在国内布局6个自营标注基地,配备600余人全职标注队伍,所有人员均经过系统标准化培训,熟练掌握标注工具与作业规则。
基础标注人力与自动化工具配合,承接大批量基础需求;专家团队聚焦高价值、高难度专项任务。这种分层作业体系,可同时兼顾不同复杂度项目的交付效率与质量要求。
五、结语
标注环节的质量与效率,直接影响高质量数据集的建设水平。随着政策引导与行业需求双重推动,数据标注产业告别粗放式人力扩张已是必然。构建“智能化工具提效+专业化人才提质+规模化产能托底”的服务能力,是数据服务商响应政策的实际落点,也是支撑AI产业落地的具体路径。