AnsSeekAnsseek安思智拓·企业信息与内容平台

百行数智发布大模型高质量数据集解决方案,助力模型效果提升27%、成本下降16%

百行数智面向大模型企业和行业客户推出高质量数据集解决方案,围绕数据采集、标注、治理与模型训练提供端到端服务,帮助客户在私有化环境下更快构建可用数据资产,提升模型效果并降低训练成本。

随着大模型从通用能力竞争进入行业落地阶段,数据质量、领域知识密度和交付效率,正成为影响模型效果的关键变量。尤其在制造、能源、法律、金融等场景中,客户普遍面临数据不出域、标注链路长、行业语料稀缺、定制化需求离散等问题。

针对上述痛点,百行数智沉淀了上千个成品高质量数据集,覆盖文本、图片、音频、视频等多模态场景,并配套私有化部署的数据采集与标注平台,支持“数据不出域也能标注”。同时,公司拥有覆盖多学科、多领域的专业标注团队,以及具备大模型和具身智能研究能力的算法团队,可为客户提供从数据构建到模型定制训练的完整支持。

在落地层面,百行数智已服务字节、智谱、商汤、MiniMax、阶跃、面壁等国内多数头部大模型企业,并参与中国石油、国家电网、苏州汇川等行业项目。在MiniMax相关训练项目中,百行数智帮助构建题库与法律垂类高质量数据集,推动模型效果提升27%、成本下降16%;在商汤多模态项目中,助力多模态能力提升35%;在国家电网项目中,围绕通用数据集与电力专用数据集建立数据配方,推动垂直大模型效果提升19%。

面向具身智能方向,百行数智率先提出从产线/场景数据采集、工具链搭建、域内数据标注到VLA模型训练的全链路方案,已覆盖居家、商超、酒店、工厂、物流等场景,持续为制造业客户的智能化升级提供数据底座。

关于北京百行数智科技有限公司 北京百行数智科技有限公司是一家专注于人工智能数据解决方案的企业,围绕大模型数据集、具身智能数据管线、私有化采集标注和模型训练等场景,为大模型、制造业、能源等行业客户提供端到端服务,助力客户构建高质量数据资产与行业模型能力。