广东省数据知识产权存证登记平台
登记信息
金赋大模型预训练强化学习数据集 已登记
  • 数据申请号:

    粤2025060401012

  • 数据登记号:

    SZ2025120005458.1

  • 关键词:

    强化学习,NL2SQL,数据智能,样本随机抽取与分析算法

  • 登记时间:

    2025-07-01

  • 平台证书编号:

    20250644000005458

  • 数据处理者:

    暂无

  • 服务机构:

    暂无

  • 登记主体:

    广东金赋科技股份有限公司

  • 法院编号:

    广州互联网法院 - 004489eaf073ab1a044622e46e0147bb868c14cbc55543cf0fcfaa1f800b4326-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2025-06-05

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    b2bbc0db73e80ad866576fae2abf46f3604dbff92533267fb388113d53ca155fd25ab09471425edd77ef75cdaee38bff71f2c61d5694d6f2922b05ceb3295735

  • 区块链存证证书编号:

    LXM-GDIPI-23202506056166585194

数据信息
数据简介
本数据集主要包括以下字段,id, questions, query, db_name, shcema。数据id为数据主键,用于数据查询。Questions为模型训练问题,主要用于训练中自然语言处理部分,本字段为字符串,作为问题的自然语言文字部分。Query 为模型训练文字问题对应的 SQL 代码,db_name 为训练题对应的数据库。 schema 用于解释数据库的数据结构。模型通过提取模型训练问题(Questions)生成SQL代码,样本检验通过模型生成代码和Query评估样本相关性和学习影响度。然后通过db_name选择高质量的数据进行模型强化学习。
  • 数据来源:

    自行产生

  • 数据所属行业分类:

    I65 软件和信息技术服务业

数据处理规则说明
基于最新学习影响度量算法,创新开发优化强化学习的自动化数据处理。以往传统模型训练推理能力需要依赖大量数据,金赋科技有限公司技术研发团队提出通过拣选精细数据选择样本应用于金赋大模型的预训练,显著提高金赋大模型的数据效率。具体实现使用 Open-RLHF框架,实现强化学习算法,然后通过vLLM框架进行推理加速,高效评估数据样本对模型性能能的提升,最后使用学习影响度量算法进行创新的数据分析与处理方法,计算样本与模型总体学习轨迹的对齐程度,从而自动化样本筛选。数据处理算法主要使用学习影响度量算法,研发新的样本随机抽取与分析算法(Baseline Method)和基于数据集提出的新奖励设计算法(Reward Design)并使用公司内部评价基准(Evaluation Benchmark)对新数据处理方法进行评测。
应用场景描述
数据集适用于7B 和32B模型的NL2SQL能力的提升。通过使用高质量数据集优化模型的强化学习训练,训练降低模型训练所需要的时间,同时降低模型训练所需要的硬件成本。解决了传统模型训练需要多数据集,高硬件成本,高训练时长等影响模型训练的核心问题的同时降低了强化训练所需要的资源。
  • 数据格式:

    xlsx

  • 数据更新频率:

    年更新

  • 数据量:

    441933

样例数据
金赋大模型预训练强化学习数据集数据结构主要包括:id、questions、query、db_name、schema。具体参考附件。 附件下载
数据结构样例
金赋大模型预训练强化学习数据集数据结构主要包括:id、questions、query、db_name、schema。具体参考附件。
数据状态
  • 2025-07-01

    数据知识产权登记完成