广东省数据知识产权存证登记平台
登记信息
中国化妆品用植物原料成分生物信息数据 已登记
  • 数据申请号:

    粤2026040204216

  • 数据登记号:

    SZ2026320002405.4

  • 关键词:

    植物天然产物,成分靶点关联,生物活性预测,置信度评分,化妆品原料数据

  • 登记时间:

    2026-05-10

  • 平台证书编号:

    20260444000002405

  • 数据处理者:

    暂无

  • 服务机构:

    暂无

  • 登记主体:

    佛山市康伲爱伦生物技术有限公司

  • 法院编号:

    广州互联网法院 - 38d3c50c4c23cec058a458773f8ea529c338037eaf80e328f3261eb22cd86b38-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2026-04-29

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    24447f0bca968efde73768eaaa25af6671fbdbd8dfa10e24fbf9f542e437130798ed3acba958a9600d0682675b750f66531312a89311619aba286979b57efdf8

  • 区块链存证证书编号:

    LXM-GDIPI-23202604294201907271

数据信息
数据简介
本数据集为植物天然产物成分与生物靶点关联数据库,旨在系统化收录化学成分与蛋白质靶点之间的调控关系及置信度评估,为天然产物活性筛选与药物靶点发现提供结构化数据支撑。数据集以矩阵宽表形式存储,行对应成分英文名称,列对应靶点名称,交叉单元格数值为综合文献证据计算得出的关联置信度得分,取值范围0.00至100.00。数据采集基于国内外公开发表的学术文献,利用SciSpacy生物医学NLP模型识别摘要中的蛋白质实体,经预定义映射表标准化,基于正则表达式匹配调控关键词并过滤否定句,统计句子级调控频次。置信度得分综合证据质量权重、数量效应非线性奖励、方向一致性及混合惩罚、对数调节项计算得出。全部处理步骤固化于自动化脚本,确保可重复追溯。本数据集可为天然产物活性筛选、药物靶点发现等应用场景提供数据参考。
  • 数据来源:

    公开采集

  • 数据所属行业分类:

    M73 研究和试验发展

数据处理规则说明
首先依据目标蛋白质名称及别名构建检索式,采集含摘要的英文文献并剔除无效记录;其次利用SciSpacy生物医学NLP模型识别摘要中的蛋白质实体,经预定义映射表标准化为统一靶点名称;再次基于正则表达式匹配上调和下调关键词,同时过滤包含否定词的句子,在句子级别统计每个靶点的调控频次;最后综合证据质量权重(依据单句关键词数量赋予高中低权值)、数量效应(非线性函数奖励多次独立证据)、方向一致性(主方向占比及混合惩罚)以及对数调节项,计算得出成分-靶点关联置信度得分。加工后产生的新数据为矩阵宽表中各靶点列下的单元格数值,即成分对靶点的关联置信度得分,类型为整数或小数,取值范围0至100,数值越大表示关联证据越强,列名即为靶点标准名称。全部步骤已固化于自动化脚本,确保可重复追溯。
应用场景描述
本数据集为植物天然产物成分与生物靶点关联置信度矩阵,主要服务于化妆品行业的原料开发、功效评价及产品创新。在功效原料智能筛选方面,研发人员可通过数据集快速查询特定植物成分与皮肤相关靶点(如酪氨酸酶、基质金属蛋白酶、环氧化酶等)的关联置信度,精准识别具有美白、抗衰老、抗炎、舒缓等潜在功效的天然活性成分,减少盲目筛选的实验成本,缩短原料开发周期。在产品功效宣称科学论证方面,企业可利用成分-靶点关联证据作为产品功效成分作用机理的理论支撑,辅助编制功效摘要报告,提升宣称合规性与科学性。在配方组合协同增效设计方面,基于多靶点关联分析可挖掘不同植物成分对同一皮肤靶点的协同调控潜力,为复方配方开发具有差异化竞争优势的复合植物提取物产品提供数据参考。在市场趋势研判与新原料布局方面,通过对靶点关联数据的系统分析可识别热门功效赛道的植物成分分布,预判具有开发潜力的新兴植物原料。在质量评估方面,可依据关联关系反向评估不同产地、工艺下提取物的活性差异,辅助建立功效导向的原料内控标准。
  • 数据格式:

    .xlsx

  • 数据更新频率:

    实时更新

  • 数据量:

    87421782

样例数据
Serine palmitoyltransferase 1 Tyrosinase Angiopoietin-1 Angiopoietin-1 receptor ((+)-cycloolivil) 0 +20 0 0 ()-alpha-Longipinene 0 0 -20 -20 (+) -limonene +21.7 0 0 0 附件下载
数据结构样例
本数据集包含一张数据表,表名为“成分-靶点关联表”。该表为二维矩阵结构,行对应成分,列对应靶点,单元格数值为成分与靶点之间的关联置信度得分。表内包含三个字段:字段一为“成分英文名称”,字符串类型,作为联合主键之一,用于唯一标识化学成分,样例数据如Histidine、Quercetin、Resveratrol等;字段二为“靶点名称”,同为字符串类型及联合主键,用于标识生物靶点标准名称,样例数据如DRD2、SLC6A4、COX2、TYR等;字段三为“关联置信度”,浮点数值类型,用于存储成分与靶点之间的调控关系强度与方向,正值表示上调(激活/促进),负值表示下调(抑制/阻断),取值范围为-100至+100,样例数据如+85、-62、+31等。
数据状态
  • 2026-05-10

    数据知识产权登记完成