广东省数据知识产权存证登记平台
登记信息
中古文学注释研究用-《昭明文选》正文—李善注文结构化数据集 已登记
  • 数据申请号:

    粤2026091105532

  • 数据登记号:

    SZ2026310009434.1

  • 关键词:

    《昭明文选》,李善注文,结构化,古典文学

  • 登记时间:

    2026-10-04

  • 平台证书编号:

    20260944000009434

  • 数据处理者:

    王治田

  • 服务机构:

    厦门大学马来西亚分校

  • 登记主体:

    王治田

  • 法院编号:

    广州互联网法院 - 7f1cd47b1d009b96dc355f5a27451c5497294f47e7fdc64de9f68c2389c7c6cd-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2026-09-24

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    f6f4a21e0978327665d7d68dd133e133cb7465af31f75ad548ad8326560a8f5f6924cdf5041142b1fcded147c9f43a08cc68f259c92e5a8645177d82fe873601

  • 区块链存证证书编号:

    LXM-GDIPI-23202609243988511950

数据信息
数据简介
本数据集以《昭明文选》六十卷为整理对象,依据胡克家重刊宋淳熙尤袤刻李善注本相关公开数字文本,对《文选》正文及李善注文进行系统整理、清洗与结构化加工。数据覆盖全书六十卷,形成约1.94万条结构化记录。 数据以“正文—注文”的对应关系为基本组织单元,主要设置卷数、文类名、部类名、作品名、正文、注文等字段,将原有连续古籍文本转化为可检索、可统计、可计算的数据资源,并保留作品层级、文类层级及正文与注文之间的对应关系。 该数据可用于《昭明文选》文本检索、李善注研究、典故与引文分析、知识来源分析、词汇统计、文学文献研究及数字人文计算,也可进一步用于古籍知识库建设、文本相似度分析、自然语言处理及人工智能模型训练等应用场景,具有较高的古籍数据开发与研究利用价值。
  • 数据来源:

    公开采集

  • 数据所属行业分类:

    P83 教育

数据处理规则说明
本数据以《昭明文选》正文及李善注文原始数字文本为加工前数据,以“正文—注文”对应关系为基本处理单元。首先依据卷次、文类、部类、作品名及原文编排顺序拆分文本,识别正文段落与紧随其后的注文内容。正文—注文匹配以原书注释位置和语义指向为主要依据:注文直接解释某一字、词、句或典故者,匹配至相应正文;注文连续解释同一句或同一语义单元者合并归入同一正文记录;如一条注文涉及前后多个语句,则结合注释起止位置、所释词语及上下文语义确定其主要对应对象;无法明确定位或存在歧义的记录进入人工复核,不作强制匹配。电子表格及程序工具仅用于文本清洗、字段整理和辅助检查,最终对应关系及标注结果均由人工核验确认。
应用场景描述
本数据可应用于古典文学研究、古籍整理、数字人文、知识库建设及人工智能辅助研究等场景。首先,可支持《昭明文选》正文与李善注的全文检索、篇章定位、文类统计及正文—注文对应关系研究,提高传统文献检索与校读效率。其次,可用于典故、引文、人物、地名、书名及知识来源等信息的提取与统计,为中古文学、文献学、注释学和知识史研究提供结构化数据基础。再次,可进一步用于文本相似度分析、互文关系识别、词汇与主题统计、知识图谱构建,以及古籍自然语言处理模型、检索增强系统和人工智能辅助阅读工具的训练与测试。该数据还可服务于高校教学、科研数据库建设及数字古籍平台开发,具有较强的学术研究和数字化应用价值。
  • 数据格式:

    xlsx

  • 数据更新频率:

    实时更新

  • 数据量:

    19400

样例数据
见附件图片 附件下载
数据结构样例
字段名: 卷数 文类名 部类名 作品名 正文 注文
数据状态
  • 2026-10-04

    数据知识产权登记完成