广东省数据知识产权存证登记平台
登记信息
面向音频驱动生成的多模态音视频特征对齐数据集 已登记
  • 数据申请号:

    粤2026091005522

  • 数据登记号:

    SZ2026320009708.6

  • 关键词:

    多模态数据集;音视频特征对齐;数字人训练;语音驱动视频;跨模态特征

  • 登记时间:

    2026-10-10

  • 平台证书编号:

    20260944000009708

  • 数据处理者:

    冼楚华,刘润臻,洪发挺,蔡宏民

  • 服务机构:

    暂无

  • 登记主体:

    华南理工大学

  • 法院编号:

    广州互联网法院 - ed1d15ba697036eff0ee8d8a00779b40f4001828f057aa3c9d777518a90e0301-749fc1a4;legalxchain

区块链信息
  • 上链时间:

    2026-09-11

  • 所属区块链:

    司法联盟链·广东省知识产权保护中心

  • 证据指纹:

    4bda470367e6137dfcd5275a9e37d0d4e6f08ba0393b8b27632c5d6ad3b5dbcf6e4206128d2d3a70a2202fc1c33c5efc107de3718d19dd6744efeddeda5bb73d

  • 区块链存证证书编号:

    LXM-GDIPI-23202609113668942304

数据信息
数据简介
该数据是一个高度结构化的多模态音视频深度学习数据集数据集组成以英文演讲视频为基础,在时序上严格统一为25fps的视频与16000Hz的音频。数据以固定帧数(如16帧)被切分为序列片段,核心特征包含:(1)基于Mediapipe算法动态计算半径并裁剪的高清人脸图像序列。(2)提取自110个面部关键点的唇部及下颌 Mask凸包坐标数组。(3)与视觉帧在时序上逐帧/严格对齐的 Whisper 特征、Mel 频谱及DeepSpeech多维声学特征。应用场景为专为计算机视觉与跨模态生成任务设计。其高精度的时空耦合特性可直接赋能语音驱动的数字人生成(Talking Head)、3D面部动作合成等前沿音频驱动视频配音框架的端到端模型训练、测试与验证,具有极高的工程落地与知识产权复用价值。
  • 数据来源:

    公开采集

  • 数据所属行业分类:

    I65 软件和信息技术服务业

数据处理规则说明
加工工具与算法:使用FFmpeg将视频与音频分别统一重采样为25fps和16000Hz;通过Mediapipe提取面部关键点,并基于此执行动态半径的人脸中心裁剪;采用ConvexHull(凸包)算法计算唇部与面部的多边形掩码。 涉及模型:利用Whisper与DeepSpeech预训练模型提取与视频帧严格对齐的声学特征。 脱敏与去标识化规则:针对公开视频数据,执行了严格的去标识化处理。1. 空间脱敏:基于Mediapipe面部关键点执行动态半径的人脸中心裁剪,仅保留面部核心像素区域,彻底剔除视频背景、地理特征、环境信息及无关人员;2. 标识编码:对原始视频文件名进行结构化编码替换,采用"V+三位序号"的统一编码体系(如V001、V002)作为Video Id;3. 关联阻断:剥离原始视频中可能包含隐私的元数据(如原始URL、采集时间戳、来源平台标识等),数据集仅保留经编码后的结构化特征与相对路径,不包含可直接识别特定自然人的文本标识;4. 用途限定:本数据集明确限定用于人工智能领域的科研训练与算法验证,不用于对特定自然人的身份识别、肖像商业使用或其他可能侵害个人权益的场景。
应用场景描述
适用条件与范围:适用于计算机视觉与语音处理交叉领域的深度学习模型训练、微调与评测,特别是在PyTorch等框架下运行的跨模态生成式任务。 适用对象:面向从事数字人生成、音视频同步、3D 面部动作合成以及虚拟主播研发的科研人员与算法工程师。 本数据集突破了传统视频数据集中音视频特征时空未严格对齐、缺乏高精度面部掩码(Mask)的瓶颈,构建了高置信度的“语音-唇形-面部动作”空间与时序映射关系,能够直接用于解决音频驱动说话人生成(Talking Head)等高逼真音频驱动视频配音框架在端到端训练中面临的嘴型不匹配、动作不自然、跨模态同步弱等核心痛点,极大降低底层数字人算法的数据清洗成本与研发壁垒。
  • 数据格式:

    csv

  • 数据更新频率:

    其他

  • 数据量:

    83444

样例数据
样例数据见附件。 附件下载
数据结构样例
表名:多模态音视频特征对齐表;主关键字段:采用联合主键VideoId(视频唯一标识)与ClipId(切片编号)以确保数据的唯一约束。主要字段名称与类型: 基础元数据:Video Resolution(String),Video Fps(Integer),Audio Sample Rate(Integer),Language(String),Is Valid(Boolean)。特征指针与时序:Start Frame Index与Frame Count(Integer)定义时序范围;Whisper/Mel/Deepspeech/Mask File Relpath(String)记录相对路径;Deepspeech Slice Idx(String)与Mask List Idx(Integer)作为高维特征的切片读取索引。视觉索引:Sample Start/End Image Relpath(String)记录人脸图的截取范围。字段属性:核心指针与主键均为非空约束(NOTNULL)。所有路径型字段强制采用相对路径属性,避免绝对路径死锁,保障结构化数据集跨设备、跨平台的无缝加载与解耦。
数据状态
  • 2026-10-10

    数据知识产权登记完成