广东省数据知识产权存证登记平台
登记信息
中国古代类书结构化知识数据集 已登记
  • 数据申请号:

    粤2026081405308

  • 数据登记号:

    SZ2026340008309.4

  • 关键词:

    中国古代类书;古典文献;结构化数据;数字人文;知识库

  • 登记时间:

    2026-09-11

  • 平台证书编号:

    20260844000008309

  • 数据处理者:

    王治田

  • 服务机构:

    厦门大学马来西亚分校

  • 登记主体:

    王治田 ;张杰 ;侯君明

  • 法院编号:

    广州互联网法院 - e1ea86fb5e4be6f2b3d2d9d9181ec88269a98701dd135bba6bab17ada06d381c-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2026-08-31

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    9e042003d955aa28b269815b7f3cf6349c3cb549b352a1321bd95119e6c663344a80de9199a2d9c105177628d9f5bca92923ebacbb5d1cbd6736c99e7731ecd1

  • 区块链存证证书编号:

    LXM-GDIPI-23202608313754137613

数据信息
数据简介
本数据集以中国古代类书文献为主要数据来源,对公开获取的古籍文本进行采集、清洗、校核、分类、切分、信息提取与结构化加工,形成具有统一数据规范的古典知识数据集。数据涵盖《初学记》《白氏六帖》《唐类函》《渊鉴类函》等重要类书,按照原书知识分类体系及文本特征,对部类、卷次、词目、正文、注文、事对及相关知识单元进行结构化组织,并保留不同文献间可关联的信息。数据集主要采用JSON、表格等结构化及半结构化形式,可用于古典文献检索、类书研究、知识分类研究、文学互文分析、数字人文研究,以及人工智能模型训练、检索增强生成与知识库建设等应用。
  • 数据来源:

    公开采集

  • 数据所属行业分类:

    R86 新闻和出版业

数据处理规则说明
数据主要来源于依法公开获取的中国古代类书数字文本。首先通过自动化程序及人工方式完成数据采集与汇总,并对原始文本进行格式统一、字符清洗、异常数据处理及人工校核;其次依据类书原有知识分类体系及文本结构,对数据进行卷次识别、部类划分、条目切分和层级解析;在此基础上,通过Python程序、规则匹配及自然语言处理等方法提取部类、卷次、词目、正文、注文、事对、来源等信息,按照统一字段规范转换为JSON、表格等结构化或半结构化数据,并进行去重、规范化和质量检查。数据不涉及个人信息,无需进行个人信息匿名化、去标识化处理。
应用场景描述
本数据集主要面向中国古典文献研究、数字人文、古籍智能整理及人工智能应用等场景。适用于中国古代类书的知识分类、文献检索、词目关联、知识组织及跨文献比较,可支持文学研究中的典故识别、互文关系发现、知识来源追踪和文学知识史分析。在数字人文领域,可用于知识图谱构建、文本统计、语义分析和可视化研究;在人工智能领域,可作为古典文献领域模型训练、检索增强生成(RAG)、语义检索及智能问答系统的专业知识数据源。数据集通过将传统非结构化古籍文本转化为机器可读取、检索、计算和关联的结构化数据,解决古籍知识分散、检索困难及机器利用效率较低等问题。
  • 数据格式:

    JSON、Markdown(MD)、Excel(XLSX)

  • 数据更新频率:

    实时更新

  • 数据量:

    161359

样例数据
[ { "卷": "一", "部类": "天", "部类序号": "一", "部类附名": null, "词条": "高明柔克", "注文": "高明,天也。柔克,寒暑不干。", "注文類型": "解釋文意" }, { "卷": "一", "部类": "天", "部类序号": "一", "部类附名": null, "词条": "陰騭下人", "注文": "言天默定下人之命。", "注文類型": "解釋文意" }, { "卷": "一", "部类": "天", "部类序号": "一", "部类附名": null, "词条": "天尊", "注文": "地卑。", "注文類型": "對仗" },
数据结构样例
本数据集采用分文献、分层级的结构化数据组织方式,主要包括《初学记》《白氏六帖》《唐类函》《渊鉴类函》等数据表(集)。主要字段包括:书名(String,文献标识)、卷次(String/Integer,卷次信息)、部类(String,知识分类)、部类序号(Integer,分类排序)、词目(String,知识条目标识)、正文(Text,条目正文)、注文(Text,原文注文)、事对(Text/Array,事对知识单元)、来源(String,文献来源)等。不同类书依据原书体例设置相应扩展字段。以“书名+卷次+部类+词目/条目序号”等字段组合识别具体知识记录;数据主要采用JSON、XLSX格式存储。
数据状态
  • 2026-09-11

    数据知识产权登记完成