广东省数据知识产权存证登记平台
登记信息
党政综合知识库数据 已登记
  • 数据申请号:

    粤2026011303756

  • 数据登记号:

    SZ2026320000132.X

  • 关键词:

    政务信息资源;知识分类;知识标签;知识切片;知识服务

  • 登记时间:

    2026-01-25

  • 平台证书编号:

    20260144000000132

  • 数据处理者:

    暂无

  • 服务机构:

    北京集佳知识产权代理有限公司

  • 登记主体:

    京华信息科技股份有限公司

  • 法院编号:

    广州互联网法院 - e2447599c7dc9319d47b19ef457725712719afb4705580e8b610aa15ca62ba9c-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2026-01-19

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    0001d9e7222eb60ef06e8ef3caec5854104951e1152711634e0cae1b0346ac1de9555275338f78559d4b29a02f63ce25dbebc8831f3028bcdf723f3bd53ccf2a

  • 区块链存证证书编号:

    LXM-GDIPI-23202601195854475108

数据信息
数据简介
党政综合知识库数据汇集了从党政机关门户网站、专业知识信息网、新闻资讯网等权威网站采集的政务信息资源,经过知识预处理、切片、打标签等操作,形成规范化、结构化的知识资源集合。根据知识内容和形式特征,将其划分为党的文献、法律法规、专项政策、领导指示、政务百科等类别,各类资源再从区域、层级、机构、领域、主题、体裁等不同维度进行多层级分类,实现知识资源的体系化和有序化管理。该数据集合依托领域知识本体数据,利用自然语言处理、本体匹配、大模型等技术对知识资源进行自动化打标签,实现多维度知识关联与智能检索。数据采用全天候7*24小时定时采集方式,保证数据的持续性、自动化更新。 该数据集合可广泛应用于政策检索与解读、公文办理辅助参考、文稿写作、决策支持、知识问答等场景,通过将庞杂的信息资源转化为系统有序、机器可理解与可推理的高价值知识资产,能够有效解决知识查找分散、知识筛选效率低、知识利用与业务脱节等问题,为提升工作效率、规范工作流程、提升决策科学性提供知识数据支撑,助力党政机关运行效能与治理能力提升。
  • 数据来源:

    公开采集

  • 数据所属行业分类:

    S92 国家机构

数据处理规则说明
采用自主研发的网页采集工具,通过灵活的规则配置,快速从网页上抓取结构化的文本、图片、文件等资源信息,并存储到综合知识库中。支持文本自动识别解析,并可对解析后的内容进行自动分类标注、自动查重、自动生成摘要、关键词抽取等智能化处理。 文本识别环节运用基于深度学习的中文分词算法、实体识别算法、关键词提取算法等;标签标注环节采用自训练语言模型,实现领域、主体、行为、客体、时间、空间等多维度本体标签的自动分类识别与标注;知识切片环节运用基于规则的文本分块算法和基于深度学习的语义分割算法。 数据处理严格遵循《政务信息资源目录体系 第3部分:核心元数据》(GB/T 21063.3-2007)、《政务信息资源目录体系 第4部分:政务信息资源分类》(GB/T 21063.4-2007)、《信息技术 数据质量评价指标》(GB/T 36344-2018)等国家标准,同时符合《中华人民共和国网络安全法》《中华人民共和国数据安全法》《中华人民共和国个人信息保护法》《中华人民共和国反不正当竞争法》《中华人民共和国民法典》《党政机关公文处理工作条例》等相关规定和要求,保障数据处理的规范性、准确性与安全性。
应用场景描述
1、适用条件(1)需求匹配:应用场景存在明确的知识支撑需求,且需求场景与数据集合覆盖的知识内容高度契合。(2)技术环境:需搭建适配的软硬件支撑环境,如可承载大规模结构化知识数据的数据库系统、支持知识检索的技术平台。 2、适用范围:覆盖党政领域全流程知识应用场景,如:公文起草场景,提供主题相关的依据文件与参考信息。 3、适用对象(1)党政机关工作人员:涵盖各级党政组织,满足日常办公、业务办理、决策部署等需求,辅助提升工作效率和质量。(2)智能应用系统:赋能内部办公自动化、辅助决策、智能问答等系统,确保输出信息的专业性、权威性与合规性。 4、解决的主要问题(1)多源知识分散与检索低效:通过统一数据标准整合各类资源,实现“一站式检索”,解决了“找文件难、找全文件更难”的痛点。(2)知识碎片化:通过对分散在不同文件中的非结构化文本进行精细化切片和标签化处理,打破原有的文档边界,使知识单元有效关联,用户无需遍历海量全文即可精准定位和关联相关知识片段。(3)检索精准度不足与智能理解效率低下:通过对知识内容进行深度语义标注,实现基于知识图谱的语义检索和智能问答,提升知识获取的精度和效率。
  • 数据格式:

    xlsx

  • 数据更新频率:

    日更新

  • 数据量:

    10000

样例数据
请查阅附件 附件下载
数据结构样例
序号 字段名称 数据类型 字段说明 1 系统唯一号 字符串 资源唯一标识符,由系统自动生成 2 资源库编号 字符串 所属资源库的ID 3 标题 字符串 资源完整标题 4 正文纯文本内容 字符串 不带格式的正文内容 5 html内容 字符串 带格式的正文内容 6 目录id 字符串 资源所属目录的唯一标识符 7 资源层级目录名称 数组 资源所在目录路径 8 发文号 字符串 正式发文编号,如"国发〔2025〕XX号" 9 发布日期 日期 正式发布日期 10 发布者 字符串 发布机构名称 11 体裁 字符串 文种类型,如通知、意见、条例、办法 12 粒度 字符串 知识单元大小,如篇、条、段 13 原文地址 URL 原文链接地址 14 创建日期 日期 数据采集/录入时间 15 归属领域 数组 资源所属政务领域,如发展改革、交通运输 16 来源 字符串 数据采集来源 17 是否为碎片 整型 0否,1是 18 密级 字符串 资源保密等级,如公开、内部、秘密、机密等 19 关联标签 数组 与资源语义相匹配的多个本体或关键词标签
数据状态
  • 2026-01-25

    数据知识产权登记完成