广东省数据知识产权存证登记平台
登记信息
金赋智能用数训练数据集 已登记
  • 数据申请号:

    粤2024081900293

  • 数据登记号:

    SZ2024120004673.9

  • 关键词:

    NL2SQL、语料库、智能用数、智能问数、生成式BI、训练数据集

  • 登记时间:

    2024-09-14

  • 平台证书编号:

    20240844000004673

  • 数据处理者:

    暂无

  • 服务机构:

    暂无

  • 登记主体:

    广东金赋科技股份有限公司

  • 法院编号:

    广州互联网法院 - 3150f01712990311ff933539b18b9eb099e3667bb3d700ff49ffb232c21804a4-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2024-08-19

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    81a1fd73900788e0ead83c41e083a80c22b9f94903163508ac4e7c647eade63df00b52f806c4939d0c0db1d4fc16c55565d29facf5e00a55c0c6fbc84bd1657a

  • 区块链存证证书编号:

    LXM-GDIPI-23202408193876105997

数据信息
数据简介
目前针对通用大模型的数据集已经有很多了,然而这个仅仅是简单的语言类模型,对应的训练知识也只是语言类文本知识,对应的模型仅能提供聊天机器人类似的服务,无法执行具体任务。这个时候就需要垂直大模型来完成特定场景任务,而针对特定场景的模型训练数据集就比较稀缺。 本数据集是金赋科技自主训练垂直类NL2SQL大模型过程中,自行生产的训练数据集。本训练数据集主要包括了用数场景的instruction、标签、问题、用到的字段、、知识、fewshot内容、参考答案SQL、库名、分类、难度等。通过对标准化SQL进行关键词分类,根据SQL的DML不同情况、不同组合,分为简单查询、一般查询、复杂查询。根据不同的情况下,对instruction进行工程处理,并提供一套机制评估生成的SQL与参考答案SQL进行比对,差异大的通过人工反馈机制,结果反馈给模型进行调整,持续提高准确率。 本数据集可以用于NL2SQL垂直类大模型训练使用,通过高质量数据集训练,提高该垂直类大模型从自然语言到SQL转化的准确度。支持政府、企业内部通过对话方式高效获取数据,无需技术参与,实现数据所问即所见。
  • 数据来源:

    自行产生

  • 数据所属行业分类:

    I65 软件和信息技术服务业

数据处理规则说明
本数据集通过人工处理生成,根据数据分析师在以往项目经验过程中,根据SQL的DML进行分类处理,区分查询关键字、内置函数等,针对不同的关键字、函数、以及不同组合,结合日常问数的场景,构建训练集。NL2SQL模型训练集主要包括了instruction、标签、问题、用到的字段(columns)、、知识、fewshot内容、参考答案SQL、库名、分类、难度等。instruction主要是对场景和输出目标的描述,主要是让大模型知道具体场景;问题就是根据场景进行抽象和泛化的一些场景问题;标签主要是对该场景的一些关键词描述;用到的字段(columns)是在场景下用到的字段列表;是在该场景下的提示词描述;知识是该场景下关联的其他信息;fewshot内容是样本内容,相当于举例子的对照关系。 根据以上规则,丰富了一个训练集,并基于训练集构建一个自动化机制,可以让大模型自动学习里面的知识,并与答案脚本进行比对验证,计算偏差值,同时通过人工反馈机制,持续完善知识内容,训练模型在NL2SQL场景下更精准生成SQL。
应用场景描述
本NL2SQL训练数据集主要应用于对智能用数场景方面,可以适应不同行业不同场景。支持通过自然语言问答模式,通过大模型,自动输出对应的数据结果,应用广泛。1、企业经营分析:基于企业营销数据,通过本数据集训练后的NL2SQL大模型,构建智能用数场景,可以让非技术业务人员也可以进行经营分析,如公司产品分布、竞争力、竞品分析等;2、公司内部数据分析,利用公司内部数据进行高效利用,挖掘内部数据价值,如财务、项目管理等,无需开发,所问即所得等;3、与传统的领导驾驶舱结合,可以对驾驶舱指标进行动态生成,并可以做到指标解读和归因分析等。
  • 数据格式:

    cvs

  • 数据更新频率:

    月更新

  • 数据量:

    3100

样例数据
溯源方法数据集数据结构包括:instruction、input、output、序号、库名/db_name、分类/query、难度/level、课程标签、其他标签、问题、答案脚本、测试、用到字段、查询结果、生成、知识、生成脚本、添加日期、添加人、备注、对应fewshot序号。 生成式数据集数据结构包括:序号、库名/db_name、分类/query、难度/level、课程标签、其他标签、问题、答案脚本、测试、用到字段、查询结果、生成、知识、生成脚本、添加日期、添加人、备注、对应fewshot序号。数据样例详见附件。 附件下载
数据结构样例
溯源方法数据集数据结构包括:instruction、input、output、序号、库名/db_name、分类/query、难度/level、课程标签、其他标签、问题、答案脚本、测试、用到字段、查询结果、生成、知识、生成脚本、添加日期、添加人、备注、对应fewshot序号。 生成式数据集数据结构包括:序号、库名/db_name、分类/query、难度/level、课程标签、其他标签、问题、答案脚本、测试、用到字段、查询结果、生成、知识、生成脚本、添加日期、添加人、备注、对应fewshot序号。数据样例详见附件。
数据状态
  • 2024-09-14

    数据知识产权登记完成