广东省数据知识产权存证登记平台
登记信息
人工智能领域机器翻译模型训练用汉英平行语料库 已登记
  • 数据申请号:

    粤2026031204091

  • 数据登记号:

    SZ2026320008185.4

  • 关键词:

    自然语言处理,汉英对齐语料,双语平行语料,机器翻译

  • 登记时间:

    2026-09-10

  • 平台证书编号:

    20260344000008185

  • 数据处理者:

    暂无

  • 服务机构:

    暂无

  • 登记主体:

    深圳市点通数据有限公司

  • 法院编号:

    广州互联网法院 - 88058898136d7938b79a1bb4025347b0602900508907a16e28dbec0537e9ce3c-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2026-09-02

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    345190d95d7eb6aac36498d34546dd005baa952382b473e9edcfaa40747c481565026c9009ae7f261a4de12e0fc747f643b8d39a6efa2ebb2d541e836d094708

  • 区块链存证证书编号:

    LXM-GDIPI-23202609024315257533

数据信息
数据简介
人工智能领域机器翻译模型训练用的汉英平行语料库是由深圳市点通数据有限公司为面向机器自动翻译的研发项目加工的数据资源。采集内容包含体各类新闻、文献、解说词、法律法规、影视、医学等,涉及政治、经济、军事和生活等各方面的内容。平行语料库的构建遵循国家科研课题的相关规范,是一个高质量的数据资源库。 语料采集来源基于现有各类双语资源,力求覆盖面广泛,采集语料时,在满足规模和质量的条件下,兼顾语料的平衡性,统筹考虑语料在题材、语体和时间跨度方面的平衡。包括语言教材、双语图书、技术文档、双语新闻、政府白皮书、政府公文和Web上双语资源等。 数据处理按相关对齐双语语料库的加工规范进行。主要用于机器翻译、模型训练、数据加工和信息检索等多方面的科学研究。目标客户包括人工智能相关企业、互联网公司、大学和科研机构等。
  • 数据来源:

    公开采集

  • 数据所属行业分类:

    I65 软件和信息技术服务业

数据处理规则说明
根据双语资源原始数据的不同,对在公开渠道采集的文本和自购入的图书采用了不同的数据处理方法,具体主要过程如下: 1.对公开渠道采集文本的数据处理过程 第一步:选定一个双语网站,向网站URL 发送HTTP/HTTPS 请求; 第二步:检查有无robots.txt,根据其要求从网络服务器获取 许可的页面的HTML 内容; 第三步:解析 HTML,从中提取并选择合适文本,并通过校对软件和人工审核避开可能涉及个人隐私和政治敏感的内容; 第四步:对选取文本进行双语对齐处理; 第五步:对所生成语句对进行查重处理,如果未重复,质检后 入库,并最终形成“汉英平行语料库”。 2.对图书的数据处理过程 第一步:对图书先每页进行扫描成图像,再对图像进行OCR 识别,并进行文本校对,确保得到正确中、英文文本; 第二步:对中文和英文分别进行语句拆分与筛查,并通过校对软件和人工审核,避开可能涉及个人隐私和政治敏感的内容; 第三步:将拆分的中、英语同时导入比对软件中; 第四步:确认后,选择保存,将自动按XML 格式保存; 第五步:对所生成语句对进行查重处理,如果未重复,质检后 入库,并最终形成“汉英平行语料
应用场景描述
本汉英平行语料库供在中国境内的科研机构和企事业单位使用。其中企业单位可免费使用20万条数据用于评估和测试,科研机构可以免费使用100万条数据用于研究、评估和测试。更多数量经双方协商一致后购买。 本汉英平行语料库主要面向机器翻译和跨语言检索等应用领域,因为语料库包含了支撑机器翻译等应用的词汇和短语知识,为这些领域的研究开发提供了最有力的基础资源数据。进一步可在此基础上研发面向英-汉、汉-英机器翻译的生成树库,该树库可同时包含源语言句法知识和目标语生成知识。 作为高精度的汉英平行语料库,机器翻译和跨语言检索等应用的算法研究、模型训练都是很有价值的,可以有效提高翻译和检索的准确性。
  • 数据格式:

    xlsx

  • 数据更新频率:

    其他

  • 数据量:

    10000000

样例数据
<sentence12> <hanwen>尼克每天晚上都听收音机。</hanwen> <yingwen>Nick listens to the radio every night.</yingwen> </sentence12> <sentence13> <hanwen>独木不成林。</hanwen> <yingwen>One tree does not make a forest.</yingwen> </sentence13> <sentence14> <hanwen>他没有被邀请,因为他的名字从名单中被删除了。</hanwen> <yingwen>He was not invited because his name was omitted from the list.</yingwen> </sentence14>
数据结构样例
<sentence1> <hanwen>发货人应赔偿承运人所发生的任何费用。</hanwen> <yingwen>The shipper shall hold the carriers harmless from any expense they may incur.</yingwen> </sentence1>
数据状态
  • 2026-09-10

    数据知识产权登记完成