755小时汉语。包含755小时的语音数据,其主要是移动终端的录音数据。邀请来自中国不同重点区域的1080名演讲者参与录制。句子转录准确率高于98%。录音在安静的室内环境中进行。数据……
178小时汉语。录音文本涉及智能家居、无人驾驶、工业生产等11个领域。录制过程在安静室内环境中, 同时使用3种不同设备: 高保真麦克风(44.1kHz,16-bit);Android系统手机(16kHz,16-bit);iOS系统手机(16kHz,16-bit)。高保真麦克风录制的音频降采样为16kHz。400名来自中国不同口音区域的发言人参与录制。经过专业语音校对人员转写标注,并通过严格质量检验,此数据库文本正确率在95%以上。分为训练集、开发集、测试集。
85小时汉语集。可做为多说话人合成系统。录制过程在安静室内环境中, 使用高保真麦克风(44.1kHz,16bit)。218名来自中国不同口音区域的发言人参与录制。专业语音校对人员进行拼音和韵律标注,并通过严格质量检验,此数据库音字确率在98%以上。
1万条中文语音。包含了1万余条语音文件,大约40小时的中文语音数据,内容以文章诗句为主,全部为女声。它是由清华大学语音与语言技术中心(CSLT)出版的开放式中文语音数据库。
最大多语言语音数据集。据说是最大的。这一数据集共涵盖了23种语言,时长超过40万小时。 其中,每种语言都有9000到18000小时的无标签语音数据。 此外,还包括了共1800小时,16种语言的转录语音数据,以及17300小时,15种目标语言的口译语音数据。
音乐分类。这是一个给音乐增加标签的开源项目。 目前系统中已包含的标签: [“摇滚”,“流行”,“另类”,“独立”,“电子”,“女歌手”, “舞蹈”,“ 00s”,“另类摇滚”,“爵士”,“美丽”,“金属”, “放松”,“男歌手”,“经典摇滚”,“灵魂”,“独立摇滚”, “音乐”,“电子音乐”,“80年代' ,'民间','90年代','chill','instrumental', 'punk','oldies','blues','hard rock','ambient','acoustic,'experimental', 'female vocalist','guitar','Hip-Hop ”,“ 70年代”,“派对”,“国家”,“轻松聆听”, “性感”,“醒目”,“放克”,“电子”,“重金属”,“渐进摇滚”, “ 60年代”,“ rnb”,“独立流行音乐”,“悲伤”,“房子”,“快乐” ]
伪造检测。真实感合成技术的快速发展已经达到了一个临界点,真实图像和操纵图像之间的边界开始模糊。因此,基准测试和推进数字伪造分析已成为一个紧迫的问题。然而,现有的人脸伪造数据集要么多样性有限,要么只支持粗粒度分析。为了应对这种新出现的威胁,我们构建了 ForgeryNet 数据集,这是一个非常大的人脸伪造数据集,在图像和视频级数据中具有统一的注释,跨越四个任务:1)图像伪造分类,包括双向(真/假)、三个-way(真/假,带有身份替换的伪造方法/带有身份保留的伪造方法的假)和 n-way(真实和 15 种各自的伪造方法)分类。 2)空间伪造定位,将伪造图像的操纵区域与其相应的源真实图像进行分割。 3)视频伪造分类,它重新定义了视频级别的伪造分类,其中操纵帧位于随机位置。这项任务很重要,因为现实世界中的攻击者可以自由地操纵任何目标帧。 4) Temporal Forgery Localization,对被操作的时间段进行定位。 ForgeryNet 在数据规模(290 万张图像,221,247 个视频)、操作(7 个图像级方法、8 个视频级方法)、扰动(36 个独立和更多混合扰动)方面是迄今为止最大的公开可用的深度人脸伪造数据集) 和注释(630 万个分类标签、290 万个操作区域注释和 221,247 个临时伪造片段标签)。我们对现有的人脸取证方法进行了广泛的基准测试和研究,并获得了一些有价值的观察结果。