中国资讯分析 China Insight Analysis

海天瑞声的公司基本信息

公司全称
北京海天瑞声科技股份有限公司
上市日期
2021-08-13
成立日期
2005-05-11
所属地区
北京市
董事长
贺琳
法人代表
李科
总经理
李科
董事会秘书
张哲
控股股东
贺琳
实际控制人
贺琳
板块(三级)
IT服务Ⅲ
会计师事务所
容诚会计师事务所(特殊普通合伙)
法律顾问
北京市天元律师事务所
组织形式
中小微民企
币种
CNY
注册资本(万元)
6,032.518
员工人数
262
联系电话
010-62660772
公司网址
www.haitianruisheng.com
办公地址
北京市海淀区知春路68号院1号楼4层401
注册地址
北京市海淀区知春路68号院1号楼4层401
公司简介
AI训练数据解决方案提供商,服务全球主流科技公司,行业领先。
主营业务
AI训练数据的研发设计、生产及销售业务

海天瑞声的经营评述

报告期 报告名称
2025-12-31 2025年报

2025-12-31 · 经营评述

2025年,在全球人工智能产业蓬勃发展的大背景下,公司业务实现全面增长。

一方面,随着多模态大模型技术持续突破和“人工智能+”应用场景不断丰富,全球训练数据需求呈现爆发式增长,公司凭借丰富的数据服务经验以及海量标品数据集积累,持续获得国内外头部科技企业的数据需求订单。

此外,在国家“人工智能+”战略指引下,地方政府积极布局结合各地产业特色的人工智能应用,公司一方面为相关项目交付垂直领域AI模型及应用平台,实现了从数据服务向模型交付与解决方案落地的业务延伸,另一方面助力地方政府建设针对地方产业特色的高质量数据集,推动数据资源向资产化、价值化转化。

与此同时,以运营商为代表的国央企也在加速AI布局,重点投入多模态基座模型研发和垂直领域应用落地,为公司带来新的业务增长点。

另外,2024年公司新拓展的东南亚数据交付基地已进入稳定运营阶段,该基地不仅成功打开了海外定制化服务市场,更为海外业务贡献了显著的增量收入。

以上因素共同推动,公司2025年度营业收入、归属于母公司所有者的净利润、归属于母公司所有者的扣除非经常性损益的净利润同比均实现较高增长。

报告期内,在上交所发布的“沪市上市公司2024-2025年度信息披露工作评价结果”中,公司首次荣获最高“A级”评价。

这一优异成绩不仅体现了公司在治理体系规范透明、信息披露全面及时、投资者关系管理及规范运作等方面的卓越水平,也彰显了监管机构对公司的高度认可。

报告期内,公司实现营业收入3.77亿元,较上年同期增长59.00%;归属于母公司所有者的净利润1,411.85万元,较上年同期增加24.54%;归属于母公司所有者的扣除非经常性损益的净利润为1,078.52万元,较上年同期增加116.85%;经营性现金流净额177.26万元,较上年同期下降93.83%。

截至报告期末,公司总资产为8.61亿元,较期初增加6.51%;归属于母公司的所有者权益为7.42亿元,较期初减少0.21%。

2025年年公司具体经营情况如下:(一)核心业务板块经营情况1.境外训练数据业务2025年,在全球人工智能产业加速渗透及多模态大模型需求爆发的背景下,AI训练数据服务市场持续扩容。

在此趋势下,公司海外业务实现收入1.58亿元,同比增长38.68%,继续保持强劲增长态势。

从业务驱动因素来看,一方面,以全球头部消费电子、企业级SaaS应用软件公司等为代表的国际客户,为支撑其全球化业务拓展,持续释放大规模多语种语音、平行语料等高质量训练数据需求。

公司凭借在语言研究领域超二十年的技术积累,以及覆盖智能语音、自然语言等多个技术方向的标准化数据集产品优势,进一步赢得了境外客户优选。

另一方面,公司在东南亚新建的数据交付基地已进入稳定运营阶段,该基地不仅成功打开了定制化服务市场,更为海外业务贡献了显著的增量收入,未来该基地也将成为支撑公司全球化战略的重要支点。

此外,为进一步提升全球市场竞争力,报告期内,公司持续优化国际化布局。

在市场拓展方面,进一步强化北美、欧洲及日韩销售团队,深化本地化服务能力;同时,通过参与CVPR、ACL、Interspeech等全球顶级AI学术会议,提升技术品牌认知度和影响力;同时,重点加强海外交付能力建设,通过拓展东南亚数据交付基地的团队规模和服务范围,为国际客户提供更加高效、合规的数据服务支持。

未来,这些战略布局也将为公司把握全球AI产业发展机遇、实现更高质量的国际化发展奠定坚实基础。

2.境内训练数据业务2025年,随着人工智能技术在各行业的深度渗透和垂直场景的加速落地,AI产业呈现出明显的"场景纵深化"发展趋势。

从市场需求结构来看,AI生态的参与主体日趋多元,除传统科技企业外,政府与国央企积极入局共建。

政府机构依托数据资源优势,通过可信数据空间等新型基础设施建设打通数据孤岛,围绕当地特色产业构建高质量语料体系。

报告期内,公司已为广西、四川等地打造多类特色数据集,并同步推进湖南、内蒙古等地的专项数据集建设。

同时,国务院国资委深入推进央企“AI+”专项行动,以运营商为代表的央企加快布局自主可控AI大模型,数据资源投入力度持续加大,为公司带来新的增量空间。

此外,以短视频平台、本地生活服务平台为代表的头部科技互联网企业开始将AI技术提升至核心战略地位,重点布局多语种语音交互、智能内容生成等关键技术,持续优化用户体验和内容创作效率,为业务创新和国际化发展提供技术支撑。

同时,传统科技企业持续加大AI技术研发投入,重点强化多模态基础模型能力建设,特别是在多语种处理等关键领域深化布局,夯实全球化发展的技术基础。

公司基于在智能语音、自然语言、计算机视觉等领域多年的技术积累,以及构建的近1,900个标准化数据集的专业产品体系,已成为多家行业领先企业的核心数据服务供应商,市场竞争优势进一步巩固。

3.数据要素业务2025年,随着《"数据要素×"三年行动计划(2024—2026年)》深入实施和各地数据要素市场化配置改革加速推进,我国数据要素产业迈入高质量发展新阶段。

在这一背景下,国家数据局指导成都、长沙、保定等7个城市建设数据标注基地,先行先试探索数据标注产业发展经验。

数据标注基地建设成为推动数据要素价值释放的关键举措,旨在解决AI产业发展中的数据质量、标准统一和要素流通等核心问题。

为支持国家数据产业发展战略,公司充分发挥在数据服务领域的技术积累,提供覆盖数据全生命周期的综合解决方案。

在数据汇聚环节,公司与地方政府合作共建高质量数据集,整合公共数据和行业数据资源;在生产加工环节,建设数据可信空间,提供数据处理平台和运营服务;在开发利用环节,基于高质量数据开展模型训练;同时为中小企业提供数据治理服务。

截至目前,公司已与成都、长沙、保定等承担数据标注基地建设任务的城市的地方政府成立合资公司,并与内蒙古呼和浩特签署战略合作协议,聚焦当地乳业、草种、文旅等特色产业,共建高质量数据集,有效驱动当地产业的数字化转型。

此外,公司也正在持续拓展与华东、华南等地的战略合作,进一步完善标注基地的全国性业务布局。

在支撑地方政府文旅产业数字化方面,公司也已取得阶段性成果:已完成彭州等地高质量文旅视频数据集的建设工作,重点为智能导览等应用场景提供专业数据支撑。

此外,公司深度参与华为+陕文投集团合作的陕西文旅示范项目,充分发挥在数据服务领域的技术优势,重点支持高质量文旅数据集建设和AI文旅垂直大模型开发,推动"AI+文旅"场景的规模化应用,为陕西文旅产业数字化转型提供全方位数据支撑和解决方案。

与此同时,公司还参与"京西智谷数字人平台及配音平台项目",提供2,000余个数字人形象,通过数字人技术助力北京门头沟区乡村振兴和文化传播。

在区域合作方面,公司立足广西作为中国—东盟数字合作枢纽的战略定位,全面深度参与中国—东盟人工智能创新合作中心建设并与地方政府联合成立数字工坊,凭借在东盟小语种数据处理以及OCR预识别算法上的技术优势,有力支持东盟语料库建设。

通过参与国家级数据标注基地建设和区域数字合作项目,公司不仅实现了数据要素业务市场空间的持续拓展,也为推动我国数据要素市场高质量发展注入了新动能。

未来,公司将继续深化在数据汇聚、处理、应用等环节的技术创新,致力于构建更加完善的数据要素产业生态体系。

以上境内训练数据业务以及数据要素业务,共同驱动公司境内业务收入同比增长77.72%至2.19亿元。

(二)核心技术能力建设情况2025年,按照技术+产品双轮驱动的定位,公司继续保持有竞争力的研发投入强度,不断提升技术和平台工具先进性、在大模型数据处理技术方向进行积极探索储备、巩固标准化数据集产品储备、增厚语音语言学基础研究领先性,持续巩固公司核心竞争力。

报告期内,公司研发费用共计5,858.58万元,占当期营业收入的15.54%。

截至报告期末,公司研发人员数量为61人。

1.算法及平台能力建设、大模型数据处理技术持续探索储备报告期内,公司持续保持大规模基础研发投入,重点提升人工智能基础算法、一体化数据处理平台及前沿技术研究等领域的核心能力,持续推动大模型数据服务的迭代升级,并形成了一定的代表性成果:1.1算法公司在智能语音、计算机视觉、自然语言处理等领域的预标注算法上持续深耕布局,同时,在面向智慧文旅场景的多模态大模型能力研究、面向数字人场景的基础能力研究、智能驾驶、大模型训练数据清洗与自动化标注、面向语音场景的数据自动化清洗、面向中文方言的语音识别大模型等垂直领域取得显著进展。

面向智慧文旅场景的多模态大模型能力研究主要包括:文旅场景的语音合成大模型、视觉大模型、LLM大模型训练与微调,并完成主流国产算法的模型推理适配工作。

面向数字人场景的基础能力研究主要包括:图片数字人算法、视频数字人算法的研发和国产服务器部署;智能驾驶主要聚焦在4D点云重建算法、4D到2D厘米级自动化映射、预刷红绿灯算法、亿级点云地面检测算法、3D单边定制化自动贴合算法、3D连续帧跟踪算法等;在大模型训练数据清洗与自动化标注研发领域内,研发老挝语OCR、文本过滤、敏感信息脱敏等语料自动化清洗算法,研发覆盖10+个垂类领域适配的OCR算法矩阵,完成10+个语种的ITN/TN清洗pipeline搭建与优化;针对语音大模型训练数据,完成语音数据自动化清洗pipeline的升级,融合10+种模型算法,构建了5个适配不同垂类清洗任务的自动化pipeline,可满足90%以上的语音自动化清洗与标注需求;针对中文方言领域,完成面向中文方言的语音识别大模型相关的流式模型框架搭建、训练数据清洗与整合、评测数据集制定、待评测的对标模型推理环境搭建,完成语料配方、模型训练相关实验,并取得预期效果。

1.2平台公司持续在数据处理平台进行规模化投入,重点提升语音、视觉等核心领域的数据采集、数据清洗及数据标注环节处理效率。

同时,为完善产业生态布局、增强内部管理效率,公司新增建设人工智能数据服务实训和AI数据生产管理两大专业平台,具体情况如下:智能语音平台:声优工厂平台形成规模化声优资源池,覆盖中、英、日、韩4大语系36种音色标签。

通过性别校验等算法模型,大幅提升试音通过率,且单条试音审核时长压缩10倍以上;自研流程引擎让项目平均周期缩减一半。

公司自研的多模态推荐模型,可实现候选声优的秒级反馈,匹配精准度提升至90%以上。

副语言&音素边界标注平台实现全流程自动化升级,通过集成语音识别等算法模块,将标注时间缩短约一半。

新增多轨打点标注体系,实现多通道音频多人对话场景的专业化标注,支持语音重叠预测可视化、多通道波形-频谱-文本层联动展示,填补了复杂语音场景标注空白,大幅提升了多人对话类数据的标注精准度与专业性。

构建了精细化权限治理体系,该体系可适配多场景任务需求,且使跨角色协同效率提升50%以上。

计算机视觉平台:Bev视角点云、2D图标注平台攻克多源数据技术难关,自研时空配准引擎实现多源点云亚像素级对齐;轻量化拓扑压缩算法在保持99.5%几何精度下,通过点云压缩技术,将训练加载时间缩短80%。

此外,采用风格迁移网络实现4种天气、5个时段无缝切换,兼容主流行业标准,大幅降低客户迁移成本。

标注工具效率较传统提升近5倍,支持超过1,000个标注员并发作业,日均可产出50万张AI训练样本,并已在智能驾驶为代表的三大场景应用落地。

面向人工智能数据服务的实训平台:旨在服务高校人才培养、面向企业人员开展AI知识科普与技能培训,助力企业掌握AI数据应用能力、实现智能化升级,为AI产业链提供高质量的人才培养方案。

平台包括理论体系建设、课程学习、上机实训、课后练习、在线考试、资格认证、人才推送等一体化体系,重点覆盖文本、语音、图像、视频、3D点云等多类型数据标注实训。

公司已完成整体架构设计及重要模块开发,并形成基础理论体系和全模态实战课程课件。

面向人工智能数据生产的管理平台:为应对人工智能数据业务不断发展所带来的项目管理、商务管理、财务管理等诸多管理能力不断提升的需求,公司整合既有工具模块、优化现存平台、并整体提升用户交互体验,建设新一代面向人工智能数据生产的管理平台。

该平台包括不少于20个重要功能模块的建设任务。

公司今年已完成包括客户管理、合同管理、项目管理、供应商管理等重要模块的建设任务;初步完成发票和决算等财务管理模块的框架搭建;并陆续启动剩余模块的开发任务。

同时,为保证新老模块切换及系统升级的连续性,已完成数据迁移设计并启动迁移脚本开发工作。

部分能力已在公司内部落地,并支撑业务加速发展。

以上平台均以技术创新构建壁垒,兼具规模化能力与商业化成果,为持续增长奠定基础。

2.标准化数据集产品标准化数据集产品,是公司区别于众多竞争对手以定制化服务为主的特有商业模式,也是公司核心竞争力之一,标准化产品是公司基于未来行业需求的研判,在市场需求出现之前,预先开发的数据集,具有即用即取的特点,可帮助客户大幅缩短模型研发周期并有效降低数据投入成本。

同时,由于产品本身的知识产权由公司享有,具有一次性研发生产、可重复多次销售的特点,因此可更好帮助公司实现未来可持续性销售、以及毛利空间提升。

因此,为更好适应行业发展需求,公司2025年在产品研发方面持续投入,用于开发覆盖智能语音、计算机视觉以及自然语言等传统深度学习以及大模型领域的相关数据集产品。

截至报告期末,公司新增研发超160个训练数据集产品,自有知识产权的训练数据产品储备达到1,877个,尤其在多语种语音对话、多语种OCR、多音色多情感数据集等方面积累了更丰富的标准化产品资源,并建成包括“双工数据集”、“视觉大模型(图像-文本)预训练及微调数据集”等在内的多领域大模型数据集。

截至报告期末,公司标准化数据集产品储备情况如下:截至报告期末,公司已向下游客户提供了累计超过12,000次/个定制或标准化训练数据集,并已应用于个人助手、语音输入、内容生成、智能家居、机器人、语音导航、智能客服、智能播报、语音翻译、移动社交、虚拟人、智能驾驶、智慧医疗、智慧教育、智慧交通、智慧城市、智慧金融、机器翻译、智能问答、信息提取、情感分析、OCR识别等22类创新应用领域,赋能人工智能技术与实体经济的深度融合。

3.语音语言学能力随着全球化扩张成为头部AI企业收入增长的重要引擎,多语种数据的作用和价值更加凸显。

为更好满足客户多语种拓展需求,公司持续保持语音语言学研究力度,在语音语言学基础研究方面,公司不断丰富合作语言学家团队资源,成员遍布世界各地的学校及研究机构,在语音语言学领域具备丰富经验和技术储备。

截至报告期末,公司已经拥有超过300个语种/方言的覆盖能力,不仅包括英、法、德、意、西、日、韩等常见语种,还包括东南亚、一带一路等国家地区的罕见小语种,尤其在亚洲小语种、中东欧小语种的服务上具备竞争优势。

同时,公司建立了成熟的发音词典构建流程,公司已积累下近140个多语种的发音词典,覆盖波斯尼亚语、塞尔维亚语、巽他语、尼泊尔语、奥利亚语、基隆迪语、茨瓦纳语、达利语等小语种,累计词条数超过1,200万条,可支撑构建高质量的智能语音、以及多模态训练数据,是公司的主要竞争壁垒及核心技术之一。

(三)其他综合能力建设情况1.数据安全及合规2025年,中央和地方出台了一系列有关数据要素、数据安全的法律法规和政策,对企业的数据安全水准和能力提出了更高要求,也为企业在数据要素、人工智能等领域的发展提供了新的机遇。

公司一直以来非常重视数据安全管理以及相关能力的提升,并将其作为把握新发展机遇所必须练好的“基本功”。

报告期内,公司积极参与行业发展,提出立法建议、参与行业调研,数据安全能力获得广泛认可。

2.供应链体系2025年,公司围绕AI大模型在垂直领域的深度应用,全面升级供应链生态体系。

在产业布局方面,公司深度整合产学研资源,重点布局具身智能、医疗、金融、教育、美学等专业领域,通过与行业权威机构合作,构建了覆盖诊断、智能投顾、合规风控、数字版权等场景的专业资源池,显著提升了供应链的行业适配性和专业壁垒。

公司在全球化资源网络建设方面取得重要突破:通过海外数据基地建设和供应商资源拓展,已覆盖60万终端资源,涉及176个国家和地区及超过300种语种/方言,大幅提升全球数据服务的响应能力。

此外,公司通过技术创新驱动供应链管理效能提升:通过知识图谱与区块链技术融合,实现跨领域资源的智能匹配与全流程可信溯源;依托动态标签体系和智能算法,完成需求线上化、结算线上化管理;基于精细化成本模型与实时化系统,实现订单处理、资源配置的全链路数字化,为可持续产能扩张奠定基础。

3.人力资源报告期内,公司坚持人才强企战略,持续完善人力资源管理体系,不断拓宽人才渠道,精准为交付体系补充核心岗位人才,提升人岗匹配度。

重点健全人才培训与职业发展体系,分层分类开展业务培训和管理能力培养,对应届高潜毕业生、新锐力量、中坚力量、中高层管理人员采取不同的梯队建设规划,以保障人才队伍的不断夯实。

深化绩效、薪酬、晋升联动改革,健全中长期激励机制,有效激发员工积极性与创造力。

文化建设方面,强化高度敬业和持续创新文化,进行榜样之星等多样化的文化倡导和活动辐射,打造更加尊重信赖和追求卓越的组织基因,持续提升人力资源整体效能,为公司长期可持续发展筑牢人力根基。

2025-12-31 · 未来展望

(一)行业格局和趋势1、行业的发展阶段、基本特点、主要技术门槛1.1行业的发展阶段、基本特点(1)政策、技术、应用协同共振,全球AI产业迈入高速发展新阶段当前,全球人工智能产业正处于历史性拐点,政策、技术与应用的三重共振正推动行业进入高速增长通道。

政策层面,主要经济体竞相加码。

中国国务院于2025年8月印发《关于深入实施“人工智能+”行动的意见》,明确提出到2027年新一代智能终端、智能体等应用普及率超70%,至2035年全面迈入智能经济与智能社会时代,标志着我国AI产业进入“规模化提升”阶段。

美国在“星际之门”计划(5000亿美元基础设施投资)基础上,相继推出“美国AI行动计划”与“创世纪计划”,持续扩大领先优势。

欧盟于2025年4月发布《人工智能大陆行动计划》,聚焦算力、数据、应用、人才与法规五大领域,计划在2021-2027年间投资超100亿欧元建设AI工厂。

技术层面,革命性突破持续涌现。

以DeepSeekR1为代表的开源模型将API调用成本降低90-95%,大幅降低应用门槛。

同时,多模态大模型(如GoogleDeepMind的Genie3、OpenAIGPT-5、阿里Qwen3-VL等)不断拓展能力边界,实现从语言理解、视觉识别到3D世界生成的全模态交互。

2025年被视为“智能体元年”,AIAgent凭借自主任务规划、动态决策与闭环执行能力,实现从“被动响应指令”向“主动解决复杂问题”的跨越,正成为驱动产业变革的核心力量。

应用层面,技术平权加速AI向千行百业渗透。

大模型正向金融、医疗、制造等核心领域深度赋能,智能风控、智慧医疗、智能制造等应用场景持续丰富,推动各行业效率提升与模式创新。

总体来看,在政策引导、技术迭代与商业落地的正向循环下,全球AI产业正加速迈向规模化、价值化发展的新阶段,迎来前所未有的战略机遇。

根据国际数据公司(IDC)的数据,预计全球人工智能(AI)IT总投资规模在2028年增至8,159亿美元,2024年至2028年复合增长率(CAGR)为32.9%。

数据来源:国际数据公司(IDC)中国作为全球科技大国,深度受益AI技术发展。

根据艾瑞咨询的数据,2024至2029年中国AI产业将保持32.1%的年均复合增长率,在2029年突破1万亿的市场规模。

数据来源:艾瑞咨询(2)训练数据作为AI发展的“燃料”作用更加凸显,成为大模型竞赛中的重要决定因素算法、算力、数据是AI三大核心要素。

当前,产业正经历从“以模型为中心”向“以数据为中心”的范式转变。

算法端,主流大模型纷纷开源,技术壁垒持续降低;算力端,以DeepSeek为代表的架构创新大幅降低了训练成本,算力不再构成发展瓶颈。

在此背景下,训练数据的重要性被进一步放大,从“辅助燃料”升级为“核心引擎”。

高质量数据直接决定模型能力上限,能显著提升推断可靠性并减少幻觉现象。

当前,大模型发展正面临严峻的“数据墙”——高质量数据短缺已成为AI规模化落地的关键制约。

业内普遍反映,诸多行业大模型未达预期,根源在于数据基础薄弱。

因此,数据已成为各国发展AI产业的关键胜负手。

根据Cognilytica数据统计显示,预计2027年全球AI训练数据市场规模将增长到220亿美元,2021-2027年复合增长率达32%。

数据来源:Cognilytica中国作为全球人工智能产业增速最快的国家之一,对高质量训练数据的需求持续攀升。

国务院《关于深入实施“人工智能+”行动的意见》及国家数据局相关方案明确提出,将持续加强高质量数据集建设,重点布局多模态、具身智能、推理思维链及长视频数据等方向。

在产业和政策双轮驱动下,中国AI基础数据服务市场进入加速增长通道。

根据艾瑞咨询的数据,2024年中国人工智能基础数据服务市场规模为58亿元,2028年规模将达到170亿元,年复合增长率为30.84%。

数据来源:艾瑞咨询(3)数据要素价值加快释放,数据产业已成为数字经济发展新增长点a.政策驱动持续加码,数据制度不断完善国家数据要素市场化配置改革已进入系统深化阶段。

2024年1月,财政部《企业数据资源相关会计处理暂行规定》正式施行,数据资产入表从自选动作转变为规定动作。

同年,国家数据局等17部门联合印发《“数据要素×”三年行动计划(2024—2026年)》(国数政策〔2023〕11号),选取工业制造、金融服务、医疗健康等12个行业和领域,推动发挥数据要素乘数效应。

《关于促进数据产业高质量发展的指导意见》《关于促进数据标注产业高质量发展的实施意见》等21项政策和指导意见陆续发布,明确到2029年数据产业规模年均复合增长率超15%。

从数据基础制度建设年到数据改革攻坚年,国家数据局进一步明确将2026年定调为“数据价值释放年”,加强高质量数据建设,持续支撑人工智能创新发展。

b.市场活力加速迸发,产业布局多点开花在政策与需求双重驱动下,数据要素市场规模稳步扩大。

高质量数据集建设成为“数据要素X”和“人工智能+”两大行动的“焊接点”,国家数据局推动成都、长沙、保定、沈阳等7个城市率先开展承接国家数据标注任务城市建设,先行先试探索产业发展经验,随后,呼和浩特、武汉、南宁等新一批城市也陆续开展强基扩容、标注攻坚、应用赋能等数据标注产业攻坚行动,推动数据标注创新试验区建设。

“人工智能+”行动到哪里,高质量数据集的建设和推广就到哪里的发展势头强劲。

c.技术创新持续突破,流通底座日益夯实核心技术迭代持续赋能数据要素市场化。

数据标注领域,大模型辅助自动化标注、生成式AI融入标注流水线,推动人机协同智能化升级,2025-2026年全球数据标注解决方案市场年复合增长率达24.3%。

可信数据空间建设进入规模化实践阶段,首批遴选的63个国家级试点项目已全面启动,覆盖国民经济32个行业大类,服务900余个具体应用场景,吸引了近7万家市场主体参与,数据流通利用的基础设施体系正在加速完善。

数据要素的流通与利用成本持续降低,技术创新正为数据要素市场化配置构筑起日益坚实的支撑体系。

综上,数据要素正从支撑性资源转变为基础性生产要素,政策、市场、技术协同推进,深度融入企业经营与产业升级,将成为未来十年最重要的新兴生产要素之一。

(4)训练数据领域的未来发展趋势随着DeepSeek、Gemini等成为现象级应用,以及AI手机、具身智能等终端加速落地,大模型技术正驱动数据需求发生深刻变革。

a.多模态大模型成为主流,驱动多模态数据需求爆发式增长大模型正从单模态向多模态范式加速演进。

多模态技术的本质在于跨模态信息融合,即通过协同处理文本、图像、音频、视频等不同形式的数据,使AI具备更接近人类的全维度认知能力。

这种演进解锁了诸如视觉问答、跨模态生成、智能语音交互等复杂场景的应用潜力。

以视觉问答为例,系统需同时解析图像中的视觉和文本信息,并通过模态对齐与知识推理生成准确回答。

这一过程的实现,依赖于海量高质量的图文对数据。

数据服务商需构建覆盖多样化场景的问答对,通过模拟现实中的视觉推理逻辑,训练AI建立视觉-语言联合表征能力。

实践证明,数据质量与多样性直接决定多模态模型的能力上限。

随着多模态数据生态的完善,AI的感知与认知能力将实现新跨越。

b.大模型从“规模驱动”转向“推理驱动”,思维链(CoT)数据成为关键突破口随着模型参数量逼近实用天花板,传统ScalingLaw的边际收益正在递减。

单纯堆算力与参数已难以解决逻辑、数学等复杂推理任务,行业正加速向“推理驱动”范式转型——让模型从直觉式“快思考”转向逻辑式“慢思考”。

2025年,DeepSeekR1的推出验证了这一路径的可行性。

其核心创新在于思维链(Chain-of-Thought,CoT)技术:通过将复杂问题拆解为多步可追溯的推理步骤,得以模拟人类的分步思考过程,显著提升逻辑一致性与答案可解释性。

这一技术突破使CoT数据从“可选项”变为“必选项”。

对于数据服务商而言,CoT数据的供给能力将成为衡量专业水准的关键标尺。

率先建立专家标注体系、掌握复杂推理数据生产方法论的企业,将在大模型下一阶段的竞争中占据核心生态位。

c.从通用到垂直,高质量行业数据需求显著提升DeepSeek等开源模型的高性能、低成本加速了AI应用普及,推动AI从通用助手向行业专家和AIAgent演进。

医疗、法律、金融等垂直领域对专业数据的需求激增:医疗大模型要求标注人员具备医学知识,法律模型需理解法条与判例逻辑。

同时,AIAgent需要理解用户指令并执行订餐、行程规划等复杂任务,对多轮交互、任务拆解类数据提出新要求。

对于数据服务商而言,上述变化意味着核心竞争力正在重构:不再仅仅是“数据产量”的比拼,更是行业理解深度、专家资源网络、复杂任务拆解能力的综合考验。

能够为垂直领域提供“数据+知识”一体化解决方案的企业,将在AI产业深水区占据不可替代的位置。

d.具身智能浪潮来袭,数据供给瓶颈亟待突破具身智能被广泛视为通往AGI的关键一跃。

2025年,特斯拉Optimus、Figure01等机器人加速从实验室走向工厂与家庭。

与纯软件AI不同,具身智能要求模型理解并交互于真实物理世界——这一跨越带来了根本性的数据挑战。

行业依赖以下种数据来源:互联网开源数据集(规模有限,仅百万级)、虚拟合成、动作捕捉、第一人称视角(如头戴相机记录人类操作)、UMI(通用操作接口)、真机遥操。

虚拟合成数据虽可批量生成,但“仿真到现实”的差距始终存在——物理引擎无法完美模拟摩擦力、形变、光照变化等复杂因素。

真机遥操采集(如人类通过VR设备远程操控机器人)能产出最高质量的数据,但单条数据采集成本高达数十元,难以快速规模化。

目前,混合式数据策略成为行业共识,即用第一人称视角、UMI数据、虚拟数据等进行预训练、用真实数据精调。

对于数据服务商而言,具身智能是一个全新的蓝海市场。

当前行业仍处于“数据荒”阶段,率先建立物理世界数据采集、以及仿真数据能力的数据服务企业,将在具身智能时代占据更强的先发优势。

e.数据安全法规密集落地,合规能力成核心竞争力近年,《数据安全法》《个人信息保护法》《网络数据安全管理条例》等法律法规相继实施。

2025年,国家进一步强化数据出境安全评估、生成式AI内容标识等要求。

对于数据服务企业,数据安全与合规能力已成为核心评价维度。

能够持续跟踪法律变化、建立成熟安全管理体系、坚持发展与安全并重的企业,将具备更强的市场竞争力。

1.2行业的主要技术门槛随着AI技术不断演进、产业应用不断丰富,训练数据的市场需求呈现体量、难度、复杂性、合规性持续上升的趋势,数据服务商须同时具备对人工智能核心算法的理解能力、前瞻性的专业数据集设计能力、丰富的语言覆盖能力及场景采集能力、算法辅助数据生产能力、以及数据合规管理能力,这使得行业的技术门槛持续提升,具体体现为:(1)在训练数据研发、生产全流程中的算法全面介入随着大模型训练从“以模型为中心”转向“以数据为中心”,头部客户群体对于数据规模和处理效率的要求不断提升,数据服务商须在研发、生产流程中全面引入算法以实现高效、合理的人机协同。

一般而言,在训练数据研发、生产全流程中融入算法技术,可用于训练数据集的设计及训练数据生产的各个环节,例如调度不同类型的标注人员应对不同领域的任务、形成算法自动处理能力以帮助标注人员提升效率、降低对人员的依赖(既有人员数量的降低、也有对人员标注能力要求的降低),并构建训练数据设计、加工相关的核心技术;也可用于检查训练数据集对算法模型的训练效果,进而保障训练数据集质量。

(2)平台工具链功能及适配性要求持续提升当前,客户侧的数据采集、标注需求范围在逐渐拓宽,多模态数据、CoT数据、具身智能数据等新型数据类型的涌现,对数据服务商的平台工具能力提出了更高要求。

平台上处理大规模的数据、这些处理过的数据的多样性和复杂程度如何、算法引擎投票机制如何建立、置信区间如何设置、算法在平台中如何应用、数据流转的工程化程度如何等等这些因素都决定了平台的适配性和能力如何,并最终决定了数据处理的质量、效率、成本。

(3)语音语言学基础研究方面须有深厚积累伴随语音技术进一步落地并向更多垂直场景渗透,同时受中国企业出海需求、国外企业全球拓展两方面支撑,客户在多语种、多音色等方面的需求持续提升。

多语种数据标注需兼顾发音、语法及文化背景差异。

此外,情感标签、语调标记、韵律特征等细粒度语音标注需求日益增加,要求数据服务商在音素集构建、发音词典编制、跨语种迁移学习等基础研究领域具备深厚积累。

只有在这一领域长期投入、具备系统性语音语言学研发能力的服务商,才能满足客户在多语种、多场景下的多元化数据需求。

因此,市场上仅有极少数企业通过长期自主研发能够达到上述核心技术门槛,成为有能力向不同客户群体提供综合、高效、合规的数据产品及服务的供应商。

2、公司所处的行业地位分析及其变化情况作为行业的头部阵营企业,海天瑞声在经营情况、技术实力、以及以数据安全为代表的其他综合能力方面都展示出明显优势,并具有较强国际竞争力。

近年来公司紧跟AI技术发展趋势,尤其关注在客户资源、技术实力、产品/服务等方面的竞争优势,树立国内领先基础数据服务商的品牌形象,以巩固公司的行业领先地位。

与同行业国内外竞争对手的对比情况及优势体现如下:公司海天瑞声Appen数据堂标贝科技基本经营情况成立2005年1996年2010年2016年年份是我国最早从事训较早从事数据资练数据研发销售的源开发的数据资新三板挂牌企业,市场企业之一;源产品服务提供是国内较早从事数地位国内首家且是目前-商,经营历史较据交易、数据采标概述唯一一家A股上市长,规模、体量的服务商之一的人工智能训练数较大据服务企业312人员工262人1,185人(截至2025年6月未公开披露数量30日)大型科技公司,如阿里巴巴、Meta、腾讯、百度、字节百度、腾讯、阿里跳动、微软、三星巴巴、奇虎360、主要阿里、腾讯、微等;国央企,如中微软、亚马逊、联想、科大讯飞等客户软、百度、京国移动等;人工智谷歌、英伟达、国内互联网和高科/合东、华为、小能企业,如科大讯Oracle等大型科技企业,微软、作伙米、滴滴、字节飞、智谱华章、月技公司、汽车厂NEC、Canon、伴情跳动、中国移之暗面、Minimax商及政府Intel、Samsung、况动、中国联通等等;科研机构,如Fujitsu等企业及中国科学院、清华在华研发机构大学、中国科学技术大学等客户超过1,200家未公开披露未公开披露100余家数量技术研发及产品能力海天瑞声拥有自主Appen拥有人工智拥有人工智能数据专注于智能语音研发的一体化数据能辅助数据注释与生产服务平台,交互和AI数据服处理平台,所提供平台,在全球200可提供数据定制服务,打造多场景技术的训练数据涵盖智多个国家与100务、人工智能数据应用的语音交互实力能语音、计算机视多万名众包人集产品、人工智能方案,包括通用概述觉、自然语言等多员,训练数据涵数据处理平台私有场景的语音合成个AI核心领域,可盖科技、汽车、化部署服务,数据和语音识别,以服务于个人助手、金融服务、零采集范围遍及全球及TTS音色定公司海天瑞声Appen数据堂标贝科技语音输入、内容生售、医疗健康、30多个国家,合作制,声音复刻,成、机器人、智能教育、法律和政伙伴遍布世界10多情感合成等语音驾驶、智慧医疗、府等各个领域。

个国家。

技术产品;AI数智慧教育等22种创据业务基于自研新应用场景。

的一站式AI数据平台,提供高质量、多语言、跨领域、跨模态的数据采集和标注服务,涵盖语音、视觉、点云、大模型等核心领域,为客户提供垂直领域AI数据解决方案智能语音、计算智能语音、计算应用智能语音、计算机智能语音、计算机机视觉、自然语机视觉、自然语领域视觉、自然语言视觉、自然语言言言拥有的成品训1,877个超过700个超过1,000个188个练数据集数量语种/方言覆超过300个超过290个超过100个40余个盖能力已取42项(40项发明专得专利、1项实用新型未公开披露63项36项利授专利及1项外观设权计专利)计算机软件著192项未公开披露259项65项作权数量综合能力北京市规划和自然乙级测绘资质;ISO27001信息安ISO27001信息安资源委员会行政许ISO27001信息安全全管理体系认数据全管理体系认可乙级测绘资质;管理体系认证、证、ISO27701隐安全证、ISO27701隐ISO27001信息安全ISO27701隐私信息私信息管理体系能力私信息管理体系管理体系认证、管理体系认证、认证、ISO27017认证ISO27701隐私信息CMMI成熟度3级认云服务信息安全公司海天瑞声Appen数据堂标贝科技管理体系认证、证证书、武器装备管理体系认证、ISO42001人工智能质量管理体系认证ISO27018公有云管理体系认证证证书;数据知识产中保护个人身份书、ISO20000信息权登记信息的信息安全技术服务管理体管理体系认证、系;国家信息系统信息系统安全等安全等级保护三级级保护二级备案;CMMI成熟度3级认证证书;数据知识产权登记国家高新技术企业、国家专精特新“小巨人”企业、“北京市企业技术中心”、工信部“新一代人工智能产业创新重点任务揭榜优胜单位”、北京市科学技术进步奖二等奖等多个国家高新技术企国家或市级重要奖国家高新技术企业、国家专精特新项、北京数字经济业、中关村高新“小巨人”企业、企业100强、第一技术企业、北京资质中国自动化学会批入选北京市通用不适用市专精特新“小荣誉CAA科技进步一等人工智能产业创新巨人”企业、优奖、北京市科学技伙伴计划、入选国秀服务机器人企术奖项科技进步奖家数据局国家人工业奖二等奖智能数据产业谱图、国家数据局数据标注优秀案例、国家数据局高质量数据集典型案例、全国第一批数据标注产业伙伴、北京市2025年数字经济标杆企业、《财富》中国科技50强注1:Appen、数据堂、标贝科技数据:除特别标注外,均为2025年1-12月/截至2025年12月31日数据,前述公司官网及公开披露信息;国家知识产权局中国及多国专利审查信息查询平台(https://www.cnipa.gov.cn/)、中国版权保护中心CPCC微平台等公开信息查询渠道及第三方机构查询信息。

注2:海天瑞声数据:为2025年1-12月/截至2025年12月31日数据。

3、报告期内新技术、新产业、新业态、新模式的发展情况和未来发展趋势(1)DeepSeek带火CoT技术,多领域CoT数据需求集中涌现伴随DeepSeekR1的火爆出圈,其背后的思维链(CoT)技术成为AI领域的新焦点。

该技术通过模拟人类“慢思考”认知模式,将复杂问题拆解为逻辑严密的推理链条,使AI系统在数学推导、专业决策等场景中准确率大幅提升。

DeepSeek官方已公开R1的完整训练路径,将全过程拆解为冷启动、推理导向RL、拒绝采样再微调、对齐导向RL四步,其中冷启动阶段正是使用数千条能体现思考过程的CoT数据对模型进行监督微调,才使得R1在AIME2025测试中,准确率由70%提升至87.5%。

在医疗影像诊断、法律文书推理、金融风控等专业领域,融入分步推理过程的CoT数据,可使模型掌握从问题解析到结论验证的完整认知闭环,提升专业任务准确性和可解释性。

因此,在大模型向垂直领域拓展时,高质量的多领域CoT数据需求预期将快速增加,并成为推动AI技术发展的关键因素。

(2)垂向领域数据需求快速增加,标注复杂度不断提升以DeepSeek为代表的开源大模型,凭借高性能、低成本和无限制商用等特点,加速了AI应用的普及。

该技术民主化浪潮推动行业从通用模型竞赛转向面向医疗、金融、制造等领域的深度价值挖掘,催生出行业数据处理需求的指数级增长。

麦肯锡调研显示,全球78%的组织已在日常运营中使用某种AI工具,其中85%已将AIAgent集成至少一项工作流程。

与通用类数据处理不同,行业数据处理难度更大、更加注重专业性,对数据服务商的综合能力也提出了更高的要求。

一方面,数据服务商需具备行业know-how,以设计出符合行业需求的数据解决方案;另一方面,随着模型向更专业化和精细化方向发展,丰富的垂类专家资源也至关重要。

(3)AIAgent技术路线快速演进,GUI数据与行为轨迹数据需求已开始呈现增长态势以OpenClaw为代表的AIAgent开始大规模落地应用,标志着AI从被动响应工具向主动决策执行者的根本性跨越。

AIAgent已具备明确的“感知-决策-执行”闭环能力,可应用于采购策略制定、工作流审批、工业设备操控等复杂场景。

在技术路线上,GUIAgent路线加速走向成熟,突破传统API调用模式,使智能体能够像人类一样通过视觉识别“看”懂屏幕、利用模拟点击“操作”按钮,实现跨应用自动化操作。

然而,GUIAgent的训练面临严峻的数据瓶颈——端到端训练需要海量高质量GUI交互数据,但手动大规模标注行动轨迹成本极高。

为此,行业正积极探索从公开屏幕录制视频中自动挖掘训练数据的技术路径,有望大幅降低标注需求。

同时,行为轨迹数据的采集与标注成为新焦点,数据服务商需大规模采集鼠标移动、点击、键盘输入、屏幕触摸等完整操作序列,并将宏观看似复杂的任务指令拆解为可训练的微观动作逻辑,为AIAgent训练提供结构化且具情境意义的数据支撑。

在Agent迈向规模化落地的关键窗口期,具备多端(PC、移动)行为轨迹数据采集与标注能力的数据服务商将获得显著的差异化竞争优势。

(4)具身智能的训练数据市场呈现出巨大的供需缺口,需求旺盛且潜力巨大具身智能作为实现通用人工智能(AGI)的关键路径与终极载体,正受到越来越多的关注。

2026年被行业公认为具身智能的“数据之年”,数据需求正呈指数级爆发——从Pi0的1万小时训练,到Gen-0的27万小时,头部具身大模型所需真机训练数据正逼近甚至超过百万小时级别。

业内共识认为,具身模型真正收敛需几百万甚至数千万小时高质量训练数据,但当前国内各家具身智能公司数据总量仅约几十万小时,量级差距巨大。

从政策层面看,工信部等七部门联合印发《关于推动未来产业创新发展的实施意见》,将具身智能纳入未来制造、未来信息等六大战略方向;北京、上海、深圳等城市已出台专项行动计划,通过资金与政策支持推动具身智能产业发展。

具身智能需要机器人在复杂的真实世界中实现自主感知、学习和适应,该能力的构建依赖海量来自“真实物理环境”的动态交互数据进行训练。

目前数据获取仍面临成本高昂、场景覆盖有限等挑战,高质量具身智能数据市场正呈现巨大的供需缺口,需求旺盛,未来增长潜力巨大。

(5)数字经济发展催生新型数据服务模式发展数字经济已经成为我国经济“弯道超车”以及挖掘经济内生增长的重要战略举措。

国家在数字经济建设方面决心极为坚定,通过《中共中央、国务院关于构建数据基础制度更好发挥数据要素作用的意见》、《数字中国建设整体布局规划》等政策文件的密集发布以及组建成立国家数据局、国家数据发展研究院、世界数据组织(WDO)等职能部门和组织,进一步统筹并加速落地数字经济发展战略,而数据要素作为深化数字经济发展的核心引擎,也将迎来新的发展机遇。

未来,围绕数据确权、汇聚、处理、利用和流通等环节将会产生巨大的增量市场空间,催生出围绕公共数据以及行业数据开发的新型数据服务需求,以及以行业高质量数据集构建、可信数据空间建设运营、数据标注基地建设、数据平台开发运营、数据交易为代表的新产品、新业态、新模式。

二、经营情况讨论与分析2025年,在全球人工智能产业蓬勃发展的大背景下,公司业务实现全面增长。

一方面,随着多模态大模型技术持续突破和“人工智能+”应用场景不断丰富,全球训练数据需求呈现爆发式增长,公司凭借丰富的数据服务经验以及海量标品数据集积累,持续获得国内外头部科技企业的数据需求订单。

此外,在国家“人工智能+”战略指引下,地方政府积极布局结合各地产业特色的人工智能应用,公司一方面为相关项目交付垂直领域AI模型及应用平台,实现了从数据服务向模型交付与解决方案落地的业务延伸,另一方面助力地方政府建设针对地方产业特色的高质量数据集,推动数据资源向资产化、价值化转化。

与此同时,以运营商为代表的国央企也在加速AI布局,重点投入多模态基座模型研发和垂直领域应用落地,为公司带来新的业务增长点。

另外,2024年公司新拓展的东南亚数据交付基地已进入稳定运营阶段,该基地不仅成功打开了海外定制化服务市场,更为海外业务贡献了显著的增量收入。

以上因素共同推动,公司2025年度营业收入、归属于母公司所有者的净利润、归属于母公司所有者的扣除非经常性损益的净利润同比均实现较高增长。

报告期内,在上交所发布的“沪市上市公司2024-2025年度信息披露工作评价结果”中,公司首次荣获最高“A级”评价。

这一优异成绩不仅体现了公司在治理体系规范透明、信息披露全面及时、投资者关系管理及规范运作等方面的卓越水平,也彰显了监管机构对公司的高度认可。

报告期内,公司实现营业收入3.77亿元,较上年同期增长59.00%;归属于母公司所有者的净利润1,411.85万元,较上年同期增加24.54%;归属于母公司所有者的扣除非经常性损益的净利润为1,078.52万元,较上年同期增加116.85%;经营性现金流净额177.26万元,较上年同期下降93.83%。

截至报告期末,公司总资产为8.61亿元,较期初增加6.51%;归属于母公司的所有者权益为7.42亿元,较期初减少0.21%。

2025年年公司具体经营情况如下:(一)核心业务板块经营情况1.境外训练数据业务2025年,在全球人工智能产业加速渗透及多模态大模型需求爆发的背景下,AI训练数据服务市场持续扩容。

在此趋势下,公司海外业务实现收入1.58亿元,同比增长38.68%,继续保持强劲增长态势。

从业务驱动因素来看,一方面,以全球头部消费电子、企业级SaaS应用软件公司等为代表的国际客户,为支撑其全球化业务拓展,持续释放大规模多语种语音、平行语料等高质量训练数据需求。

公司凭借在语言研究领域超二十年的技术积累,以及覆盖智能语音、自然语言等多个技术方向的标准化数据集产品优势,进一步赢得了境外客户优选。

另一方面,公司在东南亚新建的数据交付基地已进入稳定运营阶段,该基地不仅成功打开了定制化服务市场,更为海外业务贡献了显著的增量收入,未来该基地也将成为支撑公司全球化战略的重要支点。

此外,为进一步提升全球市场竞争力,报告期内,公司持续优化国际化布局。

在市场拓展方面,进一步强化北美、欧洲及日韩销售团队,深化本地化服务能力;同时,通过参与CVPR、ACL、Interspeech等全球顶级AI学术会议,提升技术品牌认知度和影响力;同时,重点加强海外交付能力建设,通过拓展东南亚数据交付基地的团队规模和服务范围,为国际客户提供更加高效、合规的数据服务支持。

未来,这些战略布局也将为公司把握全球AI产业发展机遇、实现更高质量的国际化发展奠定坚实基础。

2.境内训练数据业务2025年,随着人工智能技术在各行业的深度渗透和垂直场景的加速落地,AI产业呈现出明显的"场景纵深化"发展趋势。

从市场需求结构来看,AI生态的参与主体日趋多元,除传统科技企业外,政府与国央企积极入局共建。

政府机构依托数据资源优势,通过可信数据空间等新型基础设施建设打通数据孤岛,围绕当地特色产业构建高质量语料体系。

报告期内,公司已为广西、四川等地打造多类特色数据集,并同步推进湖南、内蒙古等地的专项数据集建设。

同时,国务院国资委深入推进央企“AI+”专项行动,以运营商为代表的央企加快布局自主可控AI大模型,数据资源投入力度持续加大,为公司带来新的增量空间。

此外,以短视频平台、本地生活服务平台为代表的头部科技互联网企业开始将AI技术提升至核心战略地位,重点布局多语种语音交互、智能内容生成等关键技术,持续优化用户体验和内容创作效率,为业务创新和国际化发展提供技术支撑。

同时,传统科技企业持续加大AI技术研发投入,重点强化多模态基础模型能力建设,特别是在多语种处理等关键领域深化布局,夯实全球化发展的技术基础。

公司基于在智能语音、自然语言、计算机视觉等领域多年的技术积累,以及构建的近1,900个标准化数据集的专业产品体系,已成为多家行业领先企业的核心数据服务供应商,市场竞争优势进一步巩固。

3.数据要素业务2025年,随着《"数据要素×"三年行动计划(2024—2026年)》深入实施和各地数据要素市场化配置改革加速推进,我国数据要素产业迈入高质量发展新阶段。

在这一背景下,国家数据局指导成都、长沙、保定等7个城市建设数据标注基地,先行先试探索数据标注产业发展经验。

数据标注基地建设成为推动数据要素价值释放的关键举措,旨在解决AI产业发展中的数据质量、标准统一和要素流通等核心问题。

为支持国家数据产业发展战略,公司充分发挥在数据服务领域的技术积累,提供覆盖数据全生命周期的综合解决方案。

在数据汇聚环节,公司与地方政府合作共建高质量数据集,整合公共数据和行业数据资源;在生产加工环节,建设数据可信空间,提供数据处理平台和运营服务;在开发利用环节,基于高质量数据开展模型训练;同时为中小企业提供数据治理服务。

截至目前,公司已与成都、长沙、保定等承担数据标注基地建设任务的城市的地方政府成立合资公司,并与内蒙古呼和浩特签署战略合作协议,聚焦当地乳业、草种、文旅等特色产业,共建高质量数据集,有效驱动当地产业的数字化转型。

此外,公司也正在持续拓展与华东、华南等地的战略合作,进一步完善标注基地的全国性业务布局。

在支撑地方政府文旅产业数字化方面,公司也已取得阶段性成果:已完成彭州等地高质量文旅视频数据集的建设工作,重点为智能导览等应用场景提供专业数据支撑。

此外,公司深度参与华为+陕文投集团合作的陕西文旅示范项目,充分发挥在数据服务领域的技术优势,重点支持高质量文旅数据集建设和AI文旅垂直大模型开发,推动"AI+文旅"场景的规模化应用,为陕西文旅产业数字化转型提供全方位数据支撑和解决方案。

与此同时,公司还参与"京西智谷数字人平台及配音平台项目",提供2,000余个数字人形象,通过数字人技术助力北京门头沟区乡村振兴和文化传播。

在区域合作方面,公司立足广西作为中国—东盟数字合作枢纽的战略定位,全面深度参与中国—东盟人工智能创新合作中心建设并与地方政府联合成立数字工坊,凭借在东盟小语种数据处理以及OCR预识别算法上的技术优势,有力支持东盟语料库建设。

通过参与国家级数据标注基地建设和区域数字合作项目,公司不仅实现了数据要素业务市场空间的持续拓展,也为推动我国数据要素市场高质量发展注入了新动能。

未来,公司将继续深化在数据汇聚、处理、应用等环节的技术创新,致力于构建更加完善的数据要素产业生态体系。

以上境内训练数据业务以及数据要素业务,共同驱动公司境内业务收入同比增长77.72%至2.19亿元。

(二)核心技术能力建设情况2025年,按照技术+产品双轮驱动的定位,公司继续保持有竞争力的研发投入强度,不断提升技术和平台工具先进性、在大模型数据处理技术方向进行积极探索储备、巩固标准化数据集产品储备、增厚语音语言学基础研究领先性,持续巩固公司核心竞争力。

报告期内,公司研发费用共计5,858.58万元,占当期营业收入的15.54%。

截至报告期末,公司研发人员数量为61人。

1.算法及平台能力建设、大模型数据处理技术持续探索储备报告期内,公司持续保持大规模基础研发投入,重点提升人工智能基础算法、一体化数据处理平台及前沿技术研究等领域的核心能力,持续推动大模型数据服务的迭代升级,并形成了一定的代表性成果:1.1算法公司在智能语音、计算机视觉、自然语言处理等领域的预标注算法上持续深耕布局,同时,在面向智慧文旅场景的多模态大模型能力研究、面向数字人场景的基础能力研究、智能驾驶、大模型训练数据清洗与自动化标注、面向语音场景的数据自动化清洗、面向中文方言的语音识别大模型等垂直领域取得显著进展。

面向智慧文旅场景的多模态大模型能力研究主要包括:文旅场景的语音合成大模型、视觉大模型、LLM大模型训练与微调,并完成主流国产算法的模型推理适配工作。

面向数字人场景的基础能力研究主要包括:图片数字人算法、视频数字人算法的研发和国产服务器部署;智能驾驶主要聚焦在4D点云重建算法、4D到2D厘米级自动化映射、预刷红绿灯算法、亿级点云地面检测算法、3D单边定制化自动贴合算法、3D连续帧跟踪算法等;在大模型训练数据清洗与自动化标注研发领域内,研发老挝语OCR、文本过滤、敏感信息脱敏等语料自动化清洗算法,研发覆盖10+个垂类领域适配的OCR算法矩阵,完成10+个语种的ITN/TN清洗pipeline搭建与优化;针对语音大模型训练数据,完成语音数据自动化清洗pipeline的升级,融合10+种模型算法,构建了5个适配不同垂类清洗任务的自动化pipeline,可满足90%以上的语音自动化清洗与标注需求;针对中文方言领域,完成面向中文方言的语音识别大模型相关的流式模型框架搭建、训练数据清洗与整合、评测数据集制定、待评测的对标模型推理环境搭建,完成语料配方、模型训练相关实验,并取得预期效果。

1.2平台公司持续在数据处理平台进行规模化投入,重点提升语音、视觉等核心领域的数据采集、数据清洗及数据标注环节处理效率。

同时,为完善产业生态布局、增强内部管理效率,公司新增建设人工智能数据服务实训和AI数据生产管理两大专业平台,具体情况如下:智能语音平台:声优工厂平台形成规模化声优资源池,覆盖中、英、日、韩4大语系36种音色标签。

通过性别校验等算法模型,大幅提升试音通过率,且单条试音审核时长压缩10倍以上;自研流程引擎让项目平均周期缩减一半。

公司自研的多模态推荐模型,可实现候选声优的秒级反馈,匹配精准度提升至90%以上。

副语言&音素边界标注平台实现全流程自动化升级,通过集成语音识别等算法模块,将标注时间缩短约一半。

新增多轨打点标注体系,实现多通道音频多人对话场景的专业化标注,支持语音重叠预测可视化、多通道波形-频谱-文本层联动展示,填补了复杂语音场景标注空白,大幅提升了多人对话类数据的标注精准度与专业性。

构建了精细化权限治理体系,该体系可适配多场景任务需求,且使跨角色协同效率提升50%以上。

计算机视觉平台:Bev视角点云、2D图标注平台攻克多源数据技术难关,自研时空配准引擎实现多源点云亚像素级对齐;轻量化拓扑压缩算法在保持99.5%几何精度下,通过点云压缩技术,将训练加载时间缩短80%。

此外,采用风格迁移网络实现4种天气、5个时段无缝切换,兼容主流行业标准,大幅降低客户迁移成本。

标注工具效率较传统提升近5倍,支持超过1,000个标注员并发作业,日均可产出50万张AI训练样本,并已在智能驾驶为代表的三大场景应用落地。

面向人工智能数据服务的实训平台:旨在服务高校人才培养、面向企业人员开展AI知识科普与技能培训,助力企业掌握AI数据应用能力、实现智能化升级,为AI产业链提供高质量的人才培养方案。

平台包括理论体系建设、课程学习、上机实训、课后练习、在线考试、资格认证、人才推送等一体化体系,重点覆盖文本、语音、图像、视频、3D点云等多类型数据标注实训。

公司已完成整体架构设计及重要模块开发,并形成基础理论体系和全模态实战课程课件。

面向人工智能数据生产的管理平台:为应对人工智能数据业务不断发展所带来的项目管理、商务管理、财务管理等诸多管理能力不断提升的需求,公司整合既有工具模块、优化现存平台、并整体提升用户交互体验,建设新一代面向人工智能数据生产的管理平台。

该平台包括不少于20个重要功能模块的建设任务。

公司今年已完成包括客户管理、合同管理、项目管理、供应商管理等重要模块的建设任务;初步完成发票和决算等财务管理模块的框架搭建;并陆续启动剩余模块的开发任务。

同时,为保证新老模块切换及系统升级的连续性,已完成数据迁移设计并启动迁移脚本开发工作。

部分能力已在公司内部落地,并支撑业务加速发展。

以上平台均以技术创新构建壁垒,兼具规模化能力与商业化成果,为持续增长奠定基础。

2.标准化数据集产品标准化数据集产品,是公司区别于众多竞争对手以定制化服务为主的特有商业模式,也是公司核心竞争力之一,标准化产品是公司基于未来行业需求的研判,在市场需求出现之前,预先开发的数据集,具有即用即取的特点,可帮助客户大幅缩短模型研发周期并有效降低数据投入成本。

同时,由于产品本身的知识产权由公司享有,具有一次性研发生产、可重复多次销售的特点,因此可更好帮助公司实现未来可持续性销售、以及毛利空间提升。

因此,为更好适应行业发展需求,公司2025年在产品研发方面持续投入,用于开发覆盖智能语音、计算机视觉以及自然语言等传统深度学习以及大模型领域的相关数据集产品。

截至报告期末,公司新增研发超160个训练数据集产品,自有知识产权的训练数据产品储备达到1,877个,尤其在多语种语音对话、多语种OCR、多音色多情感数据集等方面积累了更丰富的标准化产品资源,并建成包括“双工数据集”、“视觉大模型(图像-文本)预训练及微调数据集”等在内的多领域大模型数据集。

截至报告期末,公司标准化数据集产品储备情况如下:储备量(截至储备量(截至业务类型应用领域2024年末)2025年末)个人助手、语音输入、智能家居、智能客服、机器人、语音导航、智智能语音1,179个1,313个能播报、语音翻译、移动社交、虚拟人、智慧金融等智能驾驶、移动社交、虚拟人、智计算机视觉慧金融、智慧交通、智慧城市、OCR177个191个识别等通用AI大模型、机器翻译、智能问自然语言360个373个答、信息提取、情感分析等合计1,716个1,877个截至报告期末,公司已向下游客户提供了累计超过12,000次/个定制或标准化训练数据集,并已应用于个人助手、语音输入、内容生成、智能家居、机器人、语音导航、智能客服、智能播报、语音翻译、移动社交、虚拟人、智能驾驶、智慧医疗、智慧教育、智慧交通、智慧城市、智慧金融、机器翻译、智能问答、信息提取、情感分析、OCR识别等22类创新应用领域,赋能人工智能技术与实体经济的深度融合。

3.语音语言学能力随着全球化扩张成为头部AI企业收入增长的重要引擎,多语种数据的作用和价值更加凸显。

为更好满足客户多语种拓展需求,公司持续保持语音语言学研究力度,在语音语言学基础研究方面,公司不断丰富合作语言学家团队资源,成员遍布世界各地的学校及研究机构,在语音语言学领域具备丰富经验和技术储备。

截至报告期末,公司已经拥有超过300个语种/方言的覆盖能力,不仅包括英、法、德、意、西、日、韩等常见语种,还包括东南亚、一带一路等国家地区的罕见小语种,尤其在亚洲小语种、中东欧小语种的服务上具备竞争优势。

同时,公司建立了成熟的发音词典构建流程,公司已积累下近140个多语种的发音词典,覆盖波斯尼亚语、塞尔维亚语、巽他语、尼泊尔语、奥利亚语、基隆迪语、茨瓦纳语、达利语等小语种,累计词条数超过1,200万条,可支撑构建高质量的智能语音、以及多模态训练数据,是公司的主要竞争壁垒及核心技术之一。

(三)其他综合能力建设情况1.数据安全及合规2025年,中央和地方出台了一系列有关数据要素、数据安全的法律法规和政策,对企业的数据安全水准和能力提出了更高要求,也为企业在数据要素、人工智能等领域的发展提供了新的机遇。

公司一直以来非常重视数据安全管理以及相关能力的提升,并将其作为把握新发展机遇所必须练好的“基本功”。

报告期内,公司积极参与行业发展,提出立法建议、参与行业调研,数据安全能力获得广泛认可。

2.供应链体系2025年,公司围绕AI大模型在垂直领域的深度应用,全面升级供应链生态体系。

在产业布局方面,公司深度整合产学研资源,重点布局具身智能、医疗、金融、教育、美学等专业领域,通过与行业权威机构合作,构建了覆盖诊断、智能投顾、合规风控、数字版权等场景的专业资源池,显著提升了供应链的行业适配性和专业壁垒。

公司在全球化资源网络建设方面取得重要突破:通过海外数据基地建设和供应商资源拓展,已覆盖60万终端资源,涉及176个国家和地区及超过300种语种/方言,大幅提升全球数据服务的响应能力。

此外,公司通过技术创新驱动供应链管理效能提升:通过知识图谱与区块链技术融合,实现跨领域资源的智能匹配与全流程可信溯源;依托动态标签体系和智能算法,完成需求线上化、结算线上化管理;基于精细化成本模型与实时化系统,实现订单处理、资源配置的全链路数字化,为可持续产能扩张奠定基础。

3.人力资源报告期内,公司坚持人才强企战略,持续完善人力资源管理体系,不断拓宽人才渠道,精准为交付体系补充核心岗位人才,提升人岗匹配度。

重点健全人才培训与职业发展体系,分层分类开展业务培训和管理能力培养,对应届高潜毕业生、新锐力量、中坚力量、中高层管理人员采取不同的梯队建设规划,以保障人才队伍的不断夯实。

深化绩效、薪酬、晋升联动改革,健全中长期激励机制,有效激发员工积极性与创造力。

文化建设方面,强化高度敬业和持续创新文化,进行榜样之星等多样化的文化倡导和活动辐射,打造更加尊重信赖和追求卓越的组织基因,持续提升人力资源整体效能,为公司长期可持续发展筑牢人力根基。

三、报告期内核心竞争力分析(一)核心竞争力分析1.研发优势公司拥有同行业具有竞争力的综合研发实力,截至报告期末,公司研发团队规模为61人,研发能力全面覆盖平台工具开发、算法研究、产品设计等多条主线。

公司核心研发人员均曾服务于全球顶尖科技企业或毕业于名校,组成了公司坚实的研发领导核心力量。

同时,多年来,公司积累了较为完备的综合性、一体化数据处理平台及工具体系,覆盖智能语音、计算机视觉、自然语言等全业态领域,可服务于市面上绝大多数数据处理场景需求,包括但不限于智能驾驶、智能家居、个人助手、文旅应用、内容生成等场景。

公司还设置了专门的产品研发部门,可及时应对大模型时代加速变化的技术变革、前瞻性挖掘和布局新兴市场需求、抢占市场先机。

此外,基于公司在训练数据领域多年积累下的大量、多元化数据以及数据处理经验,通过算法平台团队与数据业务团队无缝衔接,公司可更好完成预识别算法性能提升,实现少量数据注入->算法训练->标注员反馈->模型生成->处理大量数据的自闭环体系,助力公司做大规模、提升效率、降低成本。

同时,20多年数据行业的从业经验积累,使得公司具备较强的数据生产工程化能力,可助力公司大幅缩短数据研发及生产周期,为公司抢占市场提供了有力支撑。

上述因素共同驱动公司构建较高的行业技术壁垒。

2.产品优势通常来说,标准化数据集产品具有可即时获取、价格相对优惠等特点,因此市场需求旺盛。

但由于标准化数据集产品是先于客户需求形成,需要数据服务商具备较强的市场趋势前瞻能力、以及财务实力进行提前投入,因此行业中具备标准化数据集产品规模化生产能力的服务商较为有限,该方向具备较高竞争壁垒。

对于公司而言,标准化训练数据集产品的知识产权由公司享有,具有一次性研发生产、可重复多次销售的特点,可显著助力公司毛利水平提升,实现训练数据产品的规模化效应,因此也是公司区别于众多竞争对手的一个优势亮点。

公司基于20多年数据服务经验、以及对客户需求的深刻理解,持续开拓标准化数据集,自有知识产权的训练数据产品储备达到1,877个,全面覆盖智能语音、计算机视觉、自然语言等多条业务线。

这些高质量数据集可全面支持智能客服、个人助手、数字人等前沿AI应用场景的研发落地。

特别值得一提的是,我们的标品数据已支持超300种语言/方言,能够充分满足全球AI企业的多语言需求,为客户的国际化战略提供强有力的数据支撑。

3.语音语言学能力优势随着境外客户全球化扩张以及境内客户出海成为新的行业发展趋势,多语种能力成为数据服务领域的核心竞争力之一,而语音语言学储备则是实现多语种拓展的重要前提。

经过20年积累,公司已沉淀下深厚的语音语言学基础研究成果,并已将其运用至构建高质量的智能语音、以及多模态训练数据。

在语音语言学基础研究领域,公司拥有丰富的多语种语言学家团队资源积累和多语种发音词典积累,以及不断创新的发音词典构建技术和流程技术。

截至报告期末,公司已经拥有超过300个语种/方言的覆盖能力,不仅包括英、法、德、意、西、日、韩等常见语种,还包括东南亚、一带一路等国家地区的罕见小语种,尤其在亚洲小语种、中东欧小语种的服务上具备竞争优势。

同时,公司已积累下近140个多语种的发音词典,覆盖波斯尼亚语、塞尔维亚语、巽他语、尼泊尔语、奥利亚语、基隆迪语、茨瓦纳语、达利语等小语种,累计词条数超过1,200万条,可支撑构建高质量的智能语音、以及多模态训练数据,是公司的主要竞争壁垒及核心技术之一。

4.数据安全及合规能力优势海天瑞声自成立之初即把数据安全、数据合规视为生命线,公司在多年的数据风险识别和管理实践中,已经形成了较为成熟的安全、合规管理体系。

资质方面,公司拥有ISO27001信息安全管理体系认证、ISO27701隐私信息管理体系认证、ISO42001人工智能管理体系认证证书、ISO20000信息技术服务管理体系、国家信息系统安全等级保护三级备案、北京市规划和自然资源委员会行政许可乙级测绘资质等。

行业参与方面,公司入选中共中央网络安全和信息化委员会办公室“人工智能企业典型应用案例”,相关业务和数据安全实践受到《人民日报》等权威媒体报道和关注。

公司为中国信通院数据安全推进计划成员单位,董事兼总经理李科连续入选该计划数安智库专家,其所参与、领导的公司数据安全工作,受到《北京日报》等权威媒体报道。

此外,公司积极参与行业发展,入选国家标准《信息技术人工智能术语》核心参编单位、《人工智能数据标注平台技术要求和测试方法》核心参编单位,数据安全能力获得认可并产生广泛、积极的行业影响。

(二)公司发展战略2026年,公司将在保障基础数据业务稳健发展的同时,寻求新的业绩增长点。

首先,公司将以全球化战略扩张为核心,通过全球化营销体系搭建、升级,进一步深化全球化发展策略,持续扩大公司的全球卡位优势。

同时,公司将继续聚焦大模型赛道,重点投入多语种语音和视觉数据集,完善CoT推理数据体系。

同时布局具身智能新兴赛道,填补真实场景数据空白。

随着"AI+"战略推进,公司将加速扩充金融、医疗等垂直领域数据资源,把握大模型行业落地机遇,持续巩固市场领先地位。

此外,公司也将持续探索以数据要素为代表的高增长业务领域,基于过往数据服务能力,通过前沿市场跟踪,不断拓展服务边界,探索潜在增量市场空间。

(三)经营计划2026年,公司将围绕既定战略,继续发扬二次创业精神,坚守“构筑智能世界数据基石”使命,不断提升核心能力,优化用户体验,促使业务长期健康稳定发展。

2026年公司具体经营计划如下:1、夯实传统业务,力拓新兴业务(1)全球化战略扩张,持续扩大全球卡位优势2025年,公司在新时期的全球化战略取得初步成效。

2026年,公司将进一步深化全球化发展战略:一是加快全球化服务网络建设,在已设立的中国香港、新加坡和美国区域子公司基础上,积极推进日本、韩国及欧盟子公司落地,提升客户触达效率和需求响应速度;二是持续完善东南亚数据交付基地的运营能力,并考虑在东南亚其他地区拓展类似基地,持续开拓中高端数据标注市场;三是积极参与全球顶级AI会议,拓展品牌影响力和优质客户渠道,持续扩大公司的全球卡位优势。

(2)大模型数据业务持续深耕,Agent数据需求蓄势待发大模型技术是AI发展的核心推动力量,大模型相关数据业务已成为公司的核心业务基本盘。

2026年,公司将重点推进以下工作:一是持续更新以多语种语音、通用及特定领域视觉为代表的多模态数据集产品,更好服务大模型语音交互和视觉理解、视觉生成等需求;二是积极扩展CoT推理数据集储备,在K12、大学专业课程、理科竞赛、代码等领域构建权威专家题库和详尽解题流程,助力大模型适应各领域的复杂推理任务;三是在垂直领域,伴随DeepSeek带来的大模型性能和成本革命,“AI+”继续成为国家重要战略,垂类数据处理需求快速增长,公司将持续扩充金融、医疗等专业领域标注资源储备。

智能终端侧的AIAgent预计将成为又一个重要的AI落地场景,预期将带来新型数据需求。

AIAgent需要大量各类应用的操作数据以训练其对操作流程的理解,同时也需要处理和理解来自终端场景的多样化数据。

海天瑞声已在2025年与华为昇腾联合发布“海天瑞声×昇腾DeepSeek数据飞轮智能体”,为企业提供零代码、低门槛的智能体部署方案,构建了“数据标注—模型训练—应用反馈”的完整闭环。

公司已具备面向AIAgent的全流程数据服务能力,能够覆盖各类应用操作数据、多语种多模态数据等多样化需求。

2026年,公司将持续布局Agent智能体数据赛道,拓展GUI数据、行为轨迹数据等新型数据服务能力,抢抓AIAgent规模化落地的市场机遇。

(3)聚力具身智能数据赛道,打造全流程能力闭环2025年以来,具身智能进入加速发展期,产业正从技术验证迈向场景应用,对具身训练数据的质量、规模和场景化提出了更高要求。

公司已组建具身智能数据专项团队开展相关业务,并开始在全国多个城市启动项目落地,与多家头部机器人本体厂商开展合作,加快扩大高质量人形机器人数据资源供给,推动人形机器人在千行百业的规模化应用。

2026年,公司将加快具身智能数据训练场方案落地与数据资源储备,持续深化与头部机器人本体厂商、科技大厂、相关地方政府的合作,为具身智能产业的加速发展提供坚实的数据支撑。

(4)创新数据要素业务,构建数据服务新模式数据已成为智能经济时代最重要的生产要素之一,2026年国家数据局将其定调为“数据要素价值释放年”。

一是加速智能化标注工程服务平台升级,人机协同降本增效。

数据标注行业正从人工密集型向技术密集型加速转型,公司将进一步引入大模型辅助预标注与自动化纠错机制,实现人机协同数据服务模式。

同时,开发面向特定场景的自动化标注工具,优化处理效率。

二是不断从通用通识领域逐步向行业和场景高质量数据集建设深化。

行业高质量数据集正取代通用语料,成为决定模型落地效果的关键变量,公司将重点深耕商贸流通、教育教学、金融服务、医疗卫生、自动驾驶、具身智能等细分赛道,构建专家标注团队,打造专业壁垒。

提供兼具领域知识与标注能力的“数据专家”服务,提升附加值和客户黏性。

三是前瞻布局合成数据与多模态数据新赛道。

随着具身智能、人形机器人、智能体等前沿技术涌现,市场对多模态数据、思维链数据的需求呈井喷之势,布局合成数据生成业务,抢占新赛道。

四是积极与国家数据标注基地、人工智能中试基地和数据标注创新试验区等深度合作,开展高质量数据集建设,助力地方人工智能和数字经济发展。

基于地方特色数据建设行业高质量数据集、搭建可信数据空间保障数据安全、参与建设数据交易平台促进数据流通、向下游延伸开展场景化模型开发与应用落地。

在数据汇聚、加工、开发利用及流通交易等各环节拓展服务能力,开发行业智能体解决方案,切实将数据要素能力赋能给政企客户,助力国家智能经济的高质量发展。

2、聚焦主业,进行全方位核心能力建设(1)核心技术公司将持续聚焦智能语音、计算机视觉、自然语言等核心业务领域,关注智能驾驶、智能家居、个人助手、文旅应用、内容生成等行业场景及以大模型为主的新兴技术方向的数据需求,在数据工具链及平台建设、大模型及具身智能前沿技术探索、行业场景理解、新语言研究以及多语种多模态数据布局等方面持续投入研发力量,不断提升训练数据生产的智能化与规模化水平。

与此同时,公司将加快推进标注流程的智能化升级与标准化数据产品体系建设,持续优化毛利结构,夯实公司在新一轮AI竞争中的核心优势。

(2)数据安全近年来,随着《数据安全法》《个人信息保护法》《网络数据安全管理条例》《数据出境安全评估办法》《促进和规范数据跨境流动规定》《个人信息保护合规审计管理办法》等法律法规快速落地实施,公司所处行业的法律环境正在快速趋严,在此背景下,数据安全、个人信息保护已成为行业客户选择数据服务商时的重要考量因素以及新的行业壁垒。

2026年,公司将继续加大数据安全及合规能力体系建设,通过完善内部制度流程建设、根据业务发展方向提前进行资质布局、广泛参与行业交流、不断提升企业数据安全及合规技术和机制等方式,提升应对更高标准、更严格的数据监管要求的能力,提高整体数据安全保障水平,将之逐步打造成为核心竞争力之一,更好地为公司数据业务发展和数据要素市场开拓提供保障和助力。

(3)供应链2026年,公司将继续推进供应链管理的智能化和自动化。

实时监控供应链运行状态,提前识别并应对风险。

在数据管理方面,完善数据可视化平台,新增实时数据展示模块以优化用户体验,并加强数据安全管理,确保数据的保密性、完整性和可用性。

在供应链优化与创新方面,持续推进供应商多元化战略,扩大供应商的地理分布和行业覆盖,深化与供应商的协同合作;加大海外资源池建设投入,优化海外资源布局,提升全球供应链的竞争力。

同时,加强供应链韧性建设,完善风险管理体系,提高应对突发事件的能力。

在人才培养与团队建设方面,加大供应链人才的培养和引进力度,提升员工数字化技能,鼓励团队协作与创新,为供应链建设提供坚实的人才支持。

(4)市场营销2026年,为更好支撑全球化发展战略,公司将持续加强全球市场营销体系建设,全面升级品牌战略工程。

公司将进一步加大品牌营销投入,在拓展社交、直播、搜索引擎等多渠道营销的同时,积极参与海内外顶级AI会议,持续提升品牌知名度与客群覆盖范围。

同时,公司将强化境外本土营销团队建设,通过织密客户服务网络,不断提升客户服务体验。

在国内市场,公司将持续为各领域合作伙伴提供专业的新型高质量AI数据解决方案,提升客户服务满意度,并依托开源语音大模型Dolphin升级版,进一步增强公司技术影响力。

(5)人力资源在人工智能产业快速发展的背景下,公司应对市场变化、保持领先地位、推动业务与技术创新的根本动力,源于组织与人才的高质量发展。

人力资源工作将紧紧围绕业务中长期发展目标的实现,在2026年重点推进以下关键举措:1、大力提升基层人才储备密度,增强中层人才的管理能力,建设结构健康、持续有力的人才梯队。

其中,以吸引和招募人工智能及训练数据领域的创新人才为最高优先级,同时强化各层级梯队的人才能力建设,全面支撑公司核心战略落地;2、高效监控人工成本的投入产出,通过提升人效,切实保障经营目标的实现;3、优化销售、生产、研发等多体系的绩效与薪酬管理机制,结合员工持股等中长期激励手段,更有效地牵引员工与公司共同实现业务目标。

海天瑞声的前五大客户与供应商

报告期 报告名称 类别 名称 交易金额(万元) 占营业收入比例(%) 合计金额(亿元)
2025-12-31 2025年报 供应商 供应商1 5,592.65 25.44 2.20
2025-12-31 2025年报 供应商 供应商2 1,782.81 8.11 2.20
2025-12-31 2025年报 供应商 供应商3 1,471.92 6.7 2.20
2025-12-31 2025年报 供应商 供应商4 932.81 4.24 2.20
2025-12-31 2025年报 供应商 供应商5 790.07 3.59 2.20
2025-12-31 2025年报 供应商 其余供应商 11,414.47 51.92 2.20
2025-12-31 2025年报 客户 客户1 7,158.68 18.99 3.77
2025-12-31 2025年报 客户 客户2 2,739.57 7.27 3.77
2025-12-31 2025年报 客户 客户3 2,721.60 7.22 3.77
2025-12-31 2025年报 客户 客户4 2,421.82 6.42 3.77
2025-12-31 2025年报 客户 客户5 2,373.54 6.3 3.77
2025-12-31 2025年报 客户 其余客户 20,280.05 53.8 3.77

海天瑞声的对外投资

序号 企业名称 持股类型 注册资本 持股比例(%) 实际投资金额 主营产品 报告期
1 安徽瑞天数智科技有限公司 全资子公司 1000.00万元 100 200.00万元 技术服务 2025-12-31

海天瑞声的十大股东

报告期 股东名称 持股数量(万股) 持股比例(%) 持股数变动(万股) 较上期变化 总股本(万股) 持股市值(亿元)
2026-03-31
贺琳
1,177.38 19.52 不变 不变 6,032.52 15.60
2026-03-31
宁波中毅安创业投资合伙企业(有限合伙)
549.22 9.1 -3.00 -0.5464 6,032.52 7.28
2026-03-31 479.79 7.95 不变 不变 6,032.52 6.36
2026-03-31
北京清德投资中心(有限合伙)
222.12 3.68 -60.33 -21.3675 6,032.52 2.94
2026-03-31 156.22 2.59 新进 新进 6,032.52 2.07
2026-03-31 148.38 2.46 新进 新进 6,032.52 1.97
2026-03-31
宁波丰琬创业投资合伙企业(有限合伙)
82.71 1.37 不变 不变 6,032.52 1.10
2026-03-31
王风龙
61.69 1.02 新进 新进 6,032.52 0.82
2026-03-31 50.00 0.83 新进 新进 6,032.52 0.66
2026-03-31
北京海天瑞声科技股份有限公司-2024年员工持股计划
43.99 0.73 不变 不变 6,032.52 0.58

海天瑞声的十大流通股股东

报告期 股东名称 持股数量(万股) 占流通股比例(%) 持股比例(%) 持股数变动(万股) 持股市值(亿元) 更新日期
2026-03-31
贺琳
1,177.38 19.5172 19.5172 不变 15.60 2026-04-24
2026-03-31
宁波中毅安创业投资合伙企业(有限合伙)
549.22 9.1044 9.1044 -3.00 7.28 2026-04-24
2026-03-31 479.79 7.9534 7.9534 不变 6.36 2026-04-24
2026-03-31
北京清德投资中心(有限合伙)
222.12 3.682 3.682 -60.33 2.94 2026-04-24
2026-03-31 156.22 2.5896 2.5896 新进 2.07 2026-04-24
2026-03-31 148.38 2.4596 2.4596 新进 1.97 2026-04-24
2026-03-31
宁波丰琬创业投资合伙企业(有限合伙)
82.71 1.371 1.371 不变 1.10 2026-04-24
2026-03-31
王风龙
61.69 1.0226 1.0226 新进 0.82 2026-04-24
2026-03-31 50.00 0.8288 0.8288 新进 0.66 2026-04-24
2026-03-31
北京海天瑞声科技股份有限公司-2024年员工持股计划
43.99 0.7292 0.7292 不变 0.58 2026-04-24

海天瑞声的公司高管

姓名 职务 简历 薪酬(万元) 年龄 学历 国籍 就任日期 报告期 持股数量(万股) 持股比例(%)
贺琳 董事长,非独立董事
贺琳,曾任职于中国科学院声学研究所,从事语音识别、语音合成、汉语语言理解、语音心理测试等方面的研究工作,先后参与了“汉语人-机语音对话系统工程”、“汉语语音参数合成”等国家自然科学基金重点项目、国家八六三计划智能计算机主题项目和中国科学院“八五”重大项目,完成《计算机汉语口语输出系统的设计与实现》等论文十余篇,参与编写《汉语语音合成-原理和技术》著作;2015年12月至今任盐城创合执行董事、经理,贺琳为海天瑞声创始人,现任公司董事长。
227.00 58 本科 中国 2024-11-05 2025-12-31 1,177.38 19.5172
黄宇凯 副总经理,非独立董事
黄宇凯,曾任微软互联网工程院首席研发总监,为必应搜索、必应网典、微软地图等多款重要互联网产品做出积极贡献。2018年12月加入海天瑞声,现任公司董事、副总经理、技术总监,主要负责公司技术与研发活动的管理和规划。
182.98 43 硕士 中国 2020-01-02 2025-12-31 3.03 0.0503
郝玉峰 副总经理
郝玉峰,曾任北京捷通华声语音技术有限公司技术研究部经理;杭州红杉树信息技术有限公司高级研发工程师。2008年12月加入海天瑞声,现任公司副总经理、技术总监、首席语言学家。
59.90 52 博士 中国 2021-01-18 2025-12-31 0.11 0.0018
李科 总经理,法定代表人,非独立董事
李科,曾任IBM中国技术开发中心软件工程师。2009年10月加入海天瑞声,现任公司董事、总经理。
246.52 45 硕士 中国 2024-11-05 2025-12-31 3.11 0.0515
吕思遥 副总经理,非独立董事,财务负责人
吕思遥,曾任普华永道中天会计师事务所审计师、高级审计师、经理;英特尔(中国)内部控制经理;北京新合作连锁超市有限公司财务总监;英特尔(中国)信用管理高级经理。2016年8月加入海天瑞声,现任公司董事、副总经理、财务负责人。拥有中国注册会计师、国际注册内审师等资质。
231.76 43 硕士 中国 2017-11-09 2025-12-31 1.83 0.0303
张哲 董事会秘书
张哲,曾任新合作商贸连锁集团有限公司证券融资部经理。2017年10月加入海天瑞声,现任公司董事会秘书、证券事务代表。
108.60 42 硕士 中国 2024-11-05 2025-12-31 0.59 0.0098
杨柳 独立董事
杨柳,曾先后担任清华大学经济管理学院管理科学与工程系助理教授、副教授。现任清华大学经济管理学院管理科学与工程系长聘副教授。2024年11月至今,任公司独立董事。
6.00 44 博士 中国 2024-11-05 2025-12-31 0.00 0
任凌玉 独立董事
任凌玉,曾任河南大学经济学院教师、副教授,华美商贸信息咨询有限公司财务顾问。现任上海立信会计金融学院教师、副教授;法兰泰克重工股份有限公司独立董事。2024年11月至今,任公司独立董事。
6.00 51 博士 中国 2024-11-05 2025-12-31 0.00 0
秦勇 独立董事
秦勇,曾任IBM中国研究院语音技术组研究员、资深研究员、高级研究员、经理;IBM中国研究院信息、知识和交互部门高级研究员、高级经理;IBM中国研究院和IBMWatson事业部认知交互部门高级研究员、总监;IBM中国研究院运维团队、IBM中国thinkLab高级研究员、总监。现任南开大学计算机学院教授、博士生导师。2021年10月至今,任公司独立董事。
6.00 59 博士 中国 2024-11-05 2025-12-31 0.00 0
曹文 非独立董事
曹文,曾任北京语言大学汉语学院院长,教育部人文社科重点研究基地北京语言大学对外汉语研究中心主任助理、语音实验室负责人,中国声学学会语言、听觉和音乐专业委员会委员。现任北京语言大学语言科学院院长,研究员,博士生导师,博士后合作导师;中国语言学会语音学分会副主任委员;捷克帕拉斯基大学、意大利锡耶纳外国人大学、法国南特大学博士生合作导师。2024年11月至今,任公司董事。
58 博士 中国 2024-11-05
贾琦 非独立董事
贾琦,曾任北京移动顺义分公司总经理,中国移动终端公司综合部总经理,中国移动终端公司研发部总经理,中国移动终端公司北京分公司总经理。现任中移资本控股有限责任公司投资三部总经理;启明星辰信息技术集团股份有限公司董事;北京赛目科技股份有限公司董事。2021年10月至今,任公司董事。
48 双本科 中国 2024-11-05

海天瑞声的核心题材与板块归属

板块名称 入选原因
人形机器人
2025年年报显示,公司已组建具身智能数据专项团队开展相关业务,并开始在全国多个城市启动项目落地,与多家头部机器人本体厂商开展合作,加快扩大高质量人形机器人数据资源供给,推动人形机器人在千行百业的规模化应用。
智谱AI概念
2024年4月2日投资者关系活动记录表显示,公司已与其他大模型 领域的知名机构签署了合作协 议, 包括 中国科 学院自 动化研究所、澜舟 科技、 智谱AI、中国 信通院 等,未来拟围绕人工智能 大模型 数据 处理 技术、大 模型 数据集 供给和大模型评测等方面进行合作。
数据要素
2023年04月12日回复称公司多年提供的训练数据集及服务本身即属于数据要素的一部分,同时围绕国家战略,也正在积极布局数据要素更多领域的业务,加大对数据要素服务模式和相关技术探索,将其作为公司未来收入增长的潜在支撑。
算力概念
2025年半年度报告显示,随着多模态大模型技术持续突破和“人工智能+”应用场景不断丰富,全球训练数据需求呈现爆发式增长,公司凭借丰富的数据服务经验以及海量标品数据集积累,持续获得国内外头部科技企业的数据需求订单。
ChatGPT概念
2024年年度报告显示,自然语言处理(NaturalLanguageProcessing,NLP)是使机器能够像人一样理解语言意图的技术。公司通过设计训练数据集结构、采集、加工、质检;或者对客户提供的自然语言文本执行加工、质检工作,最终形成客户所需的自然语言训练数据集。
AIGC概念
2023年12月25日回复称,公司是专业的人工智能训练数据服务提供商,目前正在围绕AIGC/大模型数据服务领域进行投入、建设。
机器视觉
2021年8月9日招股书显示公司提供的训练数据定制服务和训练数据产品覆盖计算机视觉领域。
AI语料
公司主要从事AI训练数据的研发设计、生产及销售业务。公司通过设计数据集结构、组织数据采集、对取得的原料数据进行加工,最终形成可供AI算法模型训练使用的专业数据集,通过软件形式向客户交付。公司的产品和服务已获得阿里巴巴、腾讯、百度、科大讯飞、海康威视、字节跳动、微软、亚马逊、三星、中国移动、中国科学院、清华大学等国内外客户的认可,应用于其研发的个人助手、智能音箱、语音导航、内容生成、搜索服务、短视频、虚拟人、智能驾驶、机器翻译等多种产品相关的算法模型训练过程中。目前公司客户累计数量超过1,100家,覆盖了科技互联网、社交、IoT、智能驾驶、大模型等领域的主流企业,以及政企、教育科研机构。
抖音概念(字节概念)
2024年11月14日回复称,字节跳动一直以来是公司的重要客户,公司为其提供智能语音、计算机视觉以及自然语言等各类数据产品或服务。
百度概念
2024年5月8日回复称,百度一直以来是公司的重要客户之一,公司为其提供智能语音、计算机视觉以及自然语言等各类数据产品或服务。但公司相关数据是否用于其无人出租车业务,还请以百度发布的相关信息为准。
小米概念
2022年5月31日公告显示小米是公司数据客户。
车联网(车路云)
2024年7月5日回复称,截至目前,公司DOTS-AD已在为车路云类项目进行服务。DOTS-AD为公司智能驾驶类数据标注平台,已具备3D点云语义分割、BEV(鸟瞰图)、300万大点云以及4D标注等各类行业前沿数据标注能力,同时平台集合各类前沿算法,在数据处理工具迭代以及算法赋能方面均处于行业领先水平。
无人驾驶
2022年年报显示受益于智能驾驶行业的快速发展,以及公司在智能驾驶领域的深度布局,2022年智能驾驶业务收入同比大幅增长,达到4,174.51万元、同比增幅达到115.12%,客户数量超过50家。
人工智能
公司是国内领先的AI训练数据提供商;公司主要从事训练数据的研产销,在基础研究、平台工具、训练数据生产三个维度均积累下核心技术,在中国语音类基础数据服务领域排名第一。

海天瑞声的个股研报

标题 研究机构 分析师 评级 评级变动 东财评级 机构评级 报告类型 发布日期
2025年报&2026一季报点评:业绩持续高增 东吴证券 王紫敬, 张文佳 A 3 买入 买入 0 2026-04-24
AI数据领军企业,全球化布局打造第二成长曲线 东吴证券 王紫敬 A 2 买入 买入 0 2025-06-22
AI数据训练龙头,挖掘数据集价值 中邮证券 孙业亮, 常雨婷 CCC 2 买入 买入 0 2025-05-30

海天瑞声的涨停记录

交易日 首次涨停 涨停原因 涨跌幅(%) 换手率(%) 所属板块
2026-01-12 2026-01-12 13:45:42
AI训练数据服务商,此前与华为联合发布“海天瑞声×昇腾DeepSeek数据飞轮智能体”,并深度参与华为昇腾一体机及陕西智慧文旅等项目,形成软硬件协同解决方案
0.2 0.1183 人工智能大模型
2024-12-11 2024-12-11 13:54:58
1、国内领先的AI训练数据提供商; 2、公司在互动平台表示,微软一直以来都是公司的重要客户之一,公司主要向其提供智能语音-训练数据定制服务及训练数据产品、自然语言-训练数据定制服务及训练数据产品、计算机视觉-训练数据定制服务及训练数据产品、训练数据相关的应用服务
0.2 0.1563 人工智能大模型, 字节跳动概念股
2024-11-13 2024-11-13 09:54:32
1、国内领先的AI训练数据提供商; 2、公司在互动平台表示,微软一直以来都是公司的重要客户之一,公司主要向其提供智能语音-训练数据定制服务及训练数据产品、自然语言-训练数据定制服务及训练数据产品、计算机视觉-训练数据定制服务及训练数据产品、训练数据相关的应用服务
0.2 0.151 人工智能大模型
2024-03-20 2024-03-20 13:04:59
1、国内领先的AI训练数据提供商; 2、公司在互动平台表示,微软一直以来都是公司的重要客户之一,公司主要向其提供智能语音-训练数据定制服务及训练数据产品、自然语言-训练数据定制服务及训练数据产品、计算机视觉-训练数据定制服务及训练数据产品、训练数据相关的应用服务
0.2 0.177 人工智能大模型
2023-09-26 2023-09-26 10:00:49
1、国内领先的AI训练数据提供商; 2、公司在互动平台表示,微软一直以来都是公司的重要客户之一,公司主要向其提供智能语音-训练数据定制服务及训练数据产品、自然语言-训练数据定制服务及训练数据产品、计算机视觉-训练数据定制服务及训练数据产品、训练数据相关的应用服务。
0.2 0.1232 ChatGPT
2023-03-17 2023-03-17 10:11:20
1、国内领先的AI训练数据提供商; 2、公司在互动平台表示,微软一直以来都是公司的重要客户之一,公司主要向其提供智能语音-训练数据定制服务及训练数据产品、自然语言-训练数据定制服务及训练数据产品、计算机视觉-训练数据定制服务及训练数据产品、训练数据相关的应用服务。
0.2 0 ChatGPT
2023-02-15 2023-02-15 14:56:00
1、国内领先的AI训练数据提供商; 2、公司在互动平台表示,微软一直以来都是公司的重要客户之一,公司主要向其提供智能语音-训练数据定制服务及训练数据产品、自然语言-训练数据定制服务及训练数据产品、计算机视觉-训练数据定制服务及训练数据产品、训练数据相关的应用服务。
0.2 0 ChatGPT
2023-02-08 2023-02-08 14:52:36
1、国内领先的AI训练数据提供商; 2、公司在互动平台表示,微软一直以来都是公司的重要客户之一,公司主要向其提供智能语音-训练数据定制服务及训练数据产品、自然语言-训练数据定制服务及训练数据产品、计算机视觉-训练数据定制服务及训练数据产品、训练数据相关的应用服务。
0.2 0 ChatGPT
2023-02-06 2023-02-06 09:51:28
国内领先的AI训练数据提供商;公司主要从事训练数据的研产销,在基础研究、平台工具、训练数据生产三个维度均积累下核心技术,在中国语音类基础数据服务领域排名第一
0.2 0 ChatGPT
2023-01-30 2023-01-30 09:25:00
公司积极加入了北京、上海数据交易所,成为首批数据服务商,并已上线了几款数据产品
0.2 0 数字经济
2022-10-14 2022-10-14 14:41:18
1、国内领先的AI训练数据提供商;在中国语音类基础数据服务领域排名第一,覆盖了阿里巴巴、腾讯、百度、微软、三星、亚马逊等客户; 2、公司已与25家车企在自动驾驶技术方面建立了合作
0.2 0.0899 信创
2022-06-10 2022-06-10 10:49:14
人工智能-国内领先的AI训练数据提供商;在中国语音类基础数据服务领域排名第一,覆盖了阿里巴巴、腾讯、百度、微软、三星、亚马逊等客户
0.2 0.2021 科创50
2022-01-17 2022-01-17 09:55:16
人工智能-国内领先的AI训练数据提供商;在中国语音类基础数据服务领域排名第一,覆盖了阿里巴巴、腾讯、百度、微软、三星、亚马逊等客户
0.2 0.1239 数字中国
2021-11-19 2021-11-19 10:40:26
0.1999 0.2017

注意:数据可能不是最新的,也可能不完整。 · 本页数据来自公开披露信息,仅供检索与研究使用,不构成投资建议。 Note: the data may be neither current nor complete. Compiled from public disclosures for research and reference only; not investment advice.

顶部