YouTube-ASL 数据集深度解读:基于 YouTube 挖掘的美国手语(ASL)-英语平行语料库
【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research
导读
YouTube-ASL 是 Google Research 发布的大规模、开放域美国手语(American Sign Language,ASL)视频数据集,包含 11,093 段带英语字幕的 ASL 视频,累计 984 小时、共 610,193 条英语字幕。本文以 youtube_asl/README.md 为核心,系统讲解该数据集的构建流程、规模特征、获取方式与引用方法,并结合仓库内 youtube_sl_25/README.md 等姊妹项目说明其在大规模手语语料研究中的定位。读完本文,你将掌握 YouTube-ASL 的完整数据规格、获取视频 ID 的渠道,以及在使用该数据集时应遵循的学术引用规范。
YouTube-ASL 是什么
YouTube-ASL 是一个大规模、开放域(open-domain)的美国手语视频数据集,其核心特征是:每一段视频都配有对应的英语字幕(English captions),从而构成手语-英语平行语料(parallel corpus),为手语识别、手语翻译、手语理解等研究任务提供数据基础。
与许多在受控实验室环境下采集的手语数据集不同,YouTube-ASL 直接从 YouTube 开放平台挖掘真实世界的 ASL 内容,覆盖广泛的主题、场景与说话风格,因此被定义为"开放域"数据集——这既是其规模优势,也对下游模型的泛化能力提出了更高要求。
该数据集发布在 Google Research 的 google-research 仓库中,仓库根 README.md 声明:仓库内所有数据集均以CC BY 4.0 International许可发布,所有源代码以Apache 2.0许可发布。
数据集构建流程(Process)
根据 youtube_asl/README.md,YouTube-ASL 的构建遵循一个**两步骤(two step process)**流程:
第一步:从 YouTube 大规模挖掘候选视频
研究人员对 YouTube 上的 ASL 相关视频进行挖掘(mining),搜索途径是 YouTube 为每个视频自动生成的Knowledge Graph 实体标签(machine-generated tags of Knowledge Graph entities)。具体做法为:
- 检索所有被标记为与"手语(sign language)"整体相关,或专门标记为"美国手语(American Sign Language)"的公开列表视频(listed public videos);
- 采集时间范围截止到2022 年 1 月(up to January 2022)。
这一阶段的关键在于利用知识图谱标签实现大规模粗筛:不依赖人工逐条标注,而是借助 YouTube 平台已有的结构化标签体系快速召回候选集合,这也是该数据集能够达到上万段视频规模的前提。
第二步:聋人母语者人工精筛
粗筛之后,研究团队邀请了**母语为手语的聋人标注者(native Deaf annotators)**逐条审阅候选视频,其目的是:
- 过滤掉质量较差的视频(poor quality);
- 过滤掉字幕与手语内容不对齐的视频(misaligned captions)。
这一人工环节保证了最终数据集中字幕与手语内容之间的对齐质量,是"平行语料"可用性的关键保障。从源码结构看,这种"机器粗筛 + 人工精筛"的流水线设计,也是后续大规模手语语料构建工作的通用范式——仓库中的姊妹数据集 YouTube-SL-25 就明确说明其采用了**粗粒度人工过滤(coarse human filtering)**来扩展语言覆盖范围(详见 youtube_sl_25/README.md)。
数据集规模特征(Dataset Characteristics)
YouTube-ASL 的官方统计口径如下:
| 指标 | 数值 |
|---|---|
| ASL 视频数量 | 11,093 段 |
| 视频总时长 | 984 小时 |
| 英语字幕(caption)数量 | 610,193 条 |
这些数字共同刻画了 YouTube-ASL 的量级:
- 视频数量破万:为手语识别与翻译模型的训练提供了充足样本;
- 总时长近千小时:远超多数受控手语数据集,支撑长时序建模与连续手语理解研究;
- 字幕条数超过 60 万:平均每段视频约含 55 条字幕,为视频片段-字幕对齐的弱监督学习提供了天然监督信号。
需要说明的是,以上为数据集的发布口径;由于数据集以视频 ID 形式发布(见下节),实际可用时长还取决于视频的在线可用状态与版权约束。
视频 ID 发布与获取方式(Video IDs)
与 YouTube 生态中广为使用的YouTube-8M数据集类似,YouTube-ASL不直接分发视频文件本身,而是发布视频 ID(video IDs)列表,由使用者按需获取对应视频。这样做既能规避大规模视频文件分发的存储与带宽成本,也符合 YouTube 平台的内容使用规范。
视频 ID 清单托管在Google Cloud Storage上,位于gresearch/youtube-asl存储桶中。获取方式为:访问 Cloud Storage 浏览器并定位到gresearch/youtube-asl路径,即可浏览或下载完整的视频 ID 文件。拿到 ID 列表后,研究团队通常通过 YouTube Data API 等官方渠道解析元数据并拉取视频流,再依据 youtube_asl/README.md 中描述的对齐规则建立视频片段与字幕的对应关系。
姊妹数据集:YouTube-SL-25
在仓库的 youtube_sl_25/README.md 中,Google Research 进一步发布了YouTube-SL-25——一个覆盖25 种以上手语、累计3200 小时以上视频的跨语言手语平行语料库。YouTube-SL-25 与 YouTube-ASL 的关系是:
YouTube-ASL 是 YouTube-SL-25 的一个子集(subset)。
因此,如果你同时使用了两个数据集,需要同时引用 YouTube-SL-25 与 YouTube-ASL 两篇论文(详见下节引用规范)。从数据集演进脉络可以推断,YouTube-ASL 的单语言(ASL-英语)平行语料经验被 YouTube-SL-25 推广到了多语言(>25 种手语)场景,后者在 youtube_sl_25/README.md 中同样以视频 ID 形式通过 Cloud Storage 的gresearch/youtube-sl-25路径发布。
相关研究定位
在 google-research 仓库中,除数据集发布外,还包含其他与手语相关的工程实现,例如 sign_language_detection 项目——一个基于人体姿态估计(Human Pose Estimation)的实时手语检测 TensorFlow 实现(发表于 SLRTP 2020),它使用tfrecord格式的(fps, pose_data, pose_confidence, is_signing)四元组描述视频。虽然该项目使用德国手语(DGS)公共语料而非 YouTube-ASL 训练,但它与 YouTube-ASL 同属于手语计算研究的技术栈,可以视作仓库内对手语建模能力(姿态表征、时序建模)的补充佐证。对于以 YouTube-ASL 为训练语料的模型来说,这类姿态估计管线可为其提供视频帧级的手部与身体关键点特征。
引用 YouTube-ASL(Citing)
如果你在论文或项目中使用了 YouTube-ASL,请引用其配套论文(见 youtube_asl/README.md):
Uthus, David and Tanzer, Garrett and Georg, Manfred.YouTube-ASL: A Large-Scale, Open-Domain American Sign Language-English Parallel Corpus, 2023, arXiv:2306.15162。
对应的 BibTeX 条目如下:
@misc{uthus2023youtubeasl, author = {Uthus, David and Tanzer, Garrett and Georg, Manfred}, title = {YouTube-ASL: A Large-Scale, Open-Domain American Sign Language-English Parallel Corpus}, year = {2023}, eprint = {2306.15162}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2306.15162}, }此外,若你的工作同时涉及 youtube_sl_25/README.md 中的多语言手语数据,还需要一并引用 YouTube-SL-25 的论文:
@misc{tanzer2024youtubesl25, title={YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus}, author={Garrett Tanzer and Biao Zhang}, year={2024}, eprint={2407.11144}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2407.11144}, }使用建议与注意事项
结合 youtube_asl/README.md 及仓库相关说明,使用 YouTube-ASL 时有以下几点值得注意:
- 数据形态:仓库仅发布视频 ID 清单(位于 GCS 的
gresearch/youtube-asl路径),视频原始内容需自行通过 YouTube 渠道获取,请遵守相关平台条款与版权约定; - 许可协议:数据集本体遵循仓库根 README.md 声明的 CC BY 4.0 许可,使用时应保留出处并遵循署名要求;
- 质量特征:虽然经过了聋人母语者的人工过滤,但作为开放域大规模语料,个别视频仍可能存在噪声,建议在训练与评测时结合下游任务做针对性清洗;
- 引用义务:使用 YouTube-ASL 请引用其论文;同时使用 YouTube-SL-25 时请一并引用两者,以尊重研究团队的贡献。
综上,YouTube-ASL 以其"万级视频、近千小时、60 万条字幕"的规模,以及"机器粗筛 + 人工精筛"的构建范式,为开放域手语识别与手语-英语翻译研究提供了高质量的数据基础,也是理解 Google Research 在大规模手语语料方向研究脉络(从 YouTube-ASL 到 YouTube-SL-25)的关键入口。
【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考