广东省数据知识产权存证登记平台
登记信息
佛山大学基于SETD1A基因破坏对人类神经发育轨迹影响的基因组与转录组表达变化数据集 已登记
  • 数据申请号:

    粤2025112402767

  • 数据登记号:

    SZ2025320022975.6

  • 关键词:

    SETD1A基因;神经发育疾病;致病机制研究

  • 登记时间:

    2025-12-21

  • 平台证书编号:

    20251244000022975

  • 服务机构:

    佛山大学

  • 登记主体:

    佛山大学

  • 法院编号:

    广州互联网法院 - 19d8fb681a072b23cf272b55e5385927af53029357bcb3975fd61e24eb03f0e3-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2025-12-16

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    4deea50868670c8b2e35db50dc42b0f194badaa5669418ac96e6a5c18ea29368b5712e0f53dd88145d83259640d57de29a4e2bdbb1de05e7bba93863ccafda55

  • 区块链存证证书编号:

    LXM-GDIPI-23202512165183704046

数据信息
数据简介
本数据集为基于美国国立生物技术信息中心(NCBI)GeneExpressionOmnibus(GEO)数据库原始数据的衍生数据集。原始数据经过差异表达分析(DESeq2算法)处理后,本数据集进一步计算了基因长度、基因表达效应值,并进行了染色体分类,形成了可直接用于深度分析的结构化数据。该数据集应用于神经发育疾病机制研究、药物靶点筛选等生物医学研究场景。
  • 数据来源:

    公开采集

  • 数据所属行业分类:

    M73 研究和试验发展

数据处理规则说明
数据需求发起与原始数据获取:佛山大学为进行SETD1A基因破坏对人类神经发育轨迹影响的分子机制研究,于2023年11月24日从NCBI的GeneExpressionOmnibus(GEO)数据库公开获取了原始数据集(数据库登录号:GSE237165)。数据集基于差异表达分析结果(包含baseMean、lfcSE、stat、padj等字段),本数据集进行了以下衍生数据处理:基因长度计算:gene_length = end_position - start_position,注:基于GRCh38参考基因组坐标计算基因长度;效应值标注:effect_size字段根据基因表达变化程度进行分类标注:Large:效应值较大的基因,Small:效应值较小的基因,染色体分类规则:chromosome_group字段按以下规则分类,chr1-chr12-chr13-chr22区间分为Autosome:c;chrX,chrY分为Sex_chromosome,染色体命名遵循GRCh38参考基因组标准
应用场景描述
1.基础科学研究:用于深入理解SETD1A基因在人类大脑皮层发育过程中的分子功能及其调控网络,揭示神经发育的轨迹和机制。 2.疾病机制研究:SETD1A基因突变与神经发育障碍(如精神分裂症、自闭症)密切相关。本数据集可作为核心资源,用于研究这些疾病的潜在分子病理学。 3.生物标志物发现:数据集中的显著差异表达基因可能作为SETD1A功能缺失相关疾病的潜在诊断生物标志物。 4.药物靶点筛选:筛选出的关键差异表达基因及其通路,可为开发治疗相关神经系统疾病的创新药物提供候选靶点。
  • 数据格式:

    xlsx

  • 数据更新频率:

    其他

  • 数据量:

    60

样例数据
数据库序列 baseMean lfcSE stat padj hgnc_symbol chromosome_name start_position end_position gene_length effect_size chromosome_group ENSG00000141449 279.1843969 0.144989789 11.83145497 3.45526E-28 GREB1L 18 21242242 21525417 283175 Large Autosome ENSG00000008196 136.7918453 0.320565846 11.80677493 3.45526E-28 TFAP2B 6 50818723 50847619 28896 Large Autosome ENSG00000185551 1578.730684 0.123202326 11.0984078 8.16845E-25 NR2F2 15 96325938 96340263 14325 Large Autosome
数据结构样例
字段名 数据类型 计量单位 描述说明 数据库序列 字符型 - ENSEMBL基因唯一标识符 baseMean 数值型 counts 标准化后基因表达基线均值 lfcSE 数值型 log2倍数 对数倍数变化的标准误 stat 数值型 - 差异表达统计检验值 padj 数值型 - 校正后的显著性P值 hgnc_symbol 字符型 - 标准基因符号 chromosome_name 字符型 - 染色体编号 start_position 整型 bp 基因起始位置 end_position 整型 bp 基因终止位置 gene_length 整型 bp 基因长度(衍生计算) effect_size 数值型 - 基因表达效应值(衍生计算) chromosome_group 字符型 - 染色体分类(衍生标注)
数据状态
  • 2025-12-21

    数据知识产权登记完成