数据信息
数据简介
本数据集原始数据来源于国际权威公共数据库NCBI的及其管理的Gene Expression Omnibus(GEO)数据库(数据库登录号:GSE248242),为研究PFKP基因在喉癌中的功能,确定需要对PFKP基因缺失后的基因表达变化进行精准分析,佛山大学对原始数据集进行创造性的深度加工,经过功能注释及生物信息学处理,最终形成本数据集。本数据集可用于喉癌分子机制研究、基因功能验证及潜在治疗靶点筛选等生物医学研究领域。
数据处理规则说明
本数据处理基于原始公共数据(FPKM值、log2(fc)、p值、q值),不涉及原始测序分析。步骤包括:1.数据验证与筛选:验证基因ID和指标完整性,筛选FPKM≥1的基因。基因名称脱敏:将原始基因名称替换为临时映射ID,以保护数据隐私。2.衍生标注列添加:基于实验设计添加组织类型、处理方式、敲除方式、基因类型。3.衍生列计算:平均FPKM:三重复样本算术平均值,公式:平均FPKM=(FPKM.A_1+FPKM.A_2+FPKM.A_3)/3。
FPKM_std:三重复样本标准差,公式:FPKM_std=√[Σ(FPKM.A_i-平均FPKM)²/(3-1)]。
综合显著性评分=|log2(fc)|×-log10(pval),值越高差异越显著。
变异系数=FPKM_std/平均FPKM。
表达稳定性指数:公式:表达稳定性指数=平均FPKM/FPKM_std,值越大越稳定。
表达一致性=MIN(FPKM.A_1,FPKM.A_2,FPKM.A_3)/MAX(FPKM.A_1,FPKM.A_2,FPKM.A_3),值近1表示一致性强。
质量控制:检查衍生值合理性,如评如评分与p值逻辑一致性。
应用场景描述
1、基础科研领域,该数据可用于深度解析PFKP缺失如何通过重编程糖酵解等代谢途径,影响喉癌细胞的增殖、凋亡与侵袭行为,为揭示喉癌发病新机制提供关键证据。
2、药物研发层面,筛选出的显著差异表达基因(如蛋白质编码基因和功能性非编码RNA)是潜在的创新药物靶点,可支持小分子抑制剂、抗体药物或核酸药物的早期发现与评估,并为开发个体化伴随诊断方案提供分子标志物。
3、临床诊疗方面,数据集支持构建基于多基因表达谱的分子分型与预后预测模型,有助于实现喉癌的精准诊断、复发风险分层及疗效监控,推动临床决策的精准化。
4、还可用于构建基因编辑细胞模型、丰富公共基因组数据库,为生物医学研究提供重要工具与资源;同时也为生物技术公司的靶点验证与转化研究提供关键数据支撑。
样例数据
gene_id 序号 映射名称 差异表达变化程度log2(fc) 显著性pval 显著性的可靠性qval FPKM.A_1 FPKM.A_2 FPKM.A_3 组织类型 处理方式 敲除方式 基因类型 平均FPKM FPKM_std 综合显著性评分 表达稳定性指数 变异系数 表达一致性
ENSG00000267062 1 gene001 15.42238172 0.023108609 0.079741884 0 6.427638 6.746456 喉癌细胞 PFKP基因缺失 慢病毒包装 长链非编码 RNA 4.391364667 3.806372808 25.23450484 1.153687481 0.86678586 0.86678586
ENSG00000276612 2 gene002 14.89002767 0.005812845 0.023149547 0 8.783094 0.325812 喉癌细胞 PFKP基因缺失 慢病毒包装 长链非编码 RNA 3.036302 4.97953332 33.28831327 0.609756336 1.639999349 1.63999
数据结构样例
数据结构说明
字段名 描述
gene_id 基因唯一标识符(ENSEMBL ID),源于公共数据
序号 基因顺序编号
映射名称 基因的临时映射ID,用于替代原始基因名称以实现脱敏
差异表达变化程度log2(fc) log2倍数变化,源于原始数据库
显著性pval 差异表达p值,源于原始数据库
显著性的可靠性qval 校正p值,源于原始数据库
FPKM.A_1 样本1表达值,源于原始数据库
FPKM.A_2 样本2表达值,源于原始数据库
FPKM.A_3 样本3表达值,源于原始数据库
组织类型 样本来源标注
处理方式 实验条件标注
敲除方式 敲除技术标注
基因类型 基因功能分类
平均FPKM 三个重复样本的算术平均值
FPKM_std 三个重复样本的标准差,衡量表达波动性
综合显著性评分 |log2(fc)| × -log10(pval),用于量化差异表达的综合显著性
表达稳定性指数 平均FPKM / FPKM_std,值越大表示表达越稳定
变异系数 FPKM_std / 平均FPKM,衡量基因表达的相对波动性
表达一致性 基于变异系数的一致性分类