在华为 Inspire 盛会上,百行数智集中展示具身智能高质量数据集解决方案,围绕工业场景的数据采集、域内标注和 VLA 模型训练,帮助企业提升模型落地效率。
行业背景
具身智能正从实验验证走向工厂、物流、商超等真实场景,但高质量数据稀缺、采集成本高、标注流程复杂、数据出域受限,仍是行业普遍难题。对于制造业客户而言,能否快速建立稳定的数据管线,直接影响模型训练效果和本体落地进度。
方案亮点
百行数智围绕“采集—标注—训练—适配”构建全链路服务,已沉淀上千个成品高质量数据集,覆盖文本、图片、音频、视频等多模态数据。公司可提供私有化部署能力,支持数据不出域;同时依托覆盖各学科的专业标注团队,能够按客户需求在 1—2 个月内完成从数据采集到数据标注的闭环交付,适配 LLM、VLA 和具身智能训练需求。
落地案例
在大模型与行业客户项目中,百行数智已形成多项可验证成果:服务 MiniMax 构建题库及法律垂类数据后,模型效果提升 27%,成本下降 16%;服务商汤科技提供多模型数据集后,多模态能力提升 35%;服务国家电网构建通用与电力专用数据配方后,垂直大模型效果提升 19%;服务苏州汇川构建 PLC 领域高知识密度知识库,并持续推进具身数据采集与标注合作。
企业简介
北京百行数智科技有限公司成立于 2024 年,总部位于北京,在上海、深圳设有分公司,服务客户超过 500 家。公司专注高质量数据集构建、数据采集标注平台、私有化部署和模型训练,已服务字节、商汤、智谱、MiniMax、面壁、阶跃、国家电网、中国石油、苏州汇川等客户,并为具身智能、制造业和大模型企业提供数据解决方案。公司还是全国数标委及信通院相关标准化技术委员会成员单位。