news 2026/9/23 1:44:23

YouTube-ASL 数据集深度解读:基于 YouTube 挖掘的美国手语(ASL)-英语平行语料库

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
YouTube-ASL 数据集深度解读:基于 YouTube 挖掘的美国手语(ASL)-英语平行语料库

YouTube-ASL 数据集深度解读:基于 YouTube 挖掘的美国手语(ASL)-英语平行语料库

【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research

导读

YouTube-ASL 是 Google Research 发布的大规模、开放域美国手语(American Sign Language,ASL)视频数据集,包含 11,093 段带英语字幕的 ASL 视频,累计 984 小时、共 610,193 条英语字幕。本文以 youtube_asl/README.md 为核心,系统讲解该数据集的构建流程、规模特征、获取方式与引用方法,并结合仓库内 youtube_sl_25/README.md 等姊妹项目说明其在大规模手语语料研究中的定位。读完本文,你将掌握 YouTube-ASL 的完整数据规格、获取视频 ID 的渠道,以及在使用该数据集时应遵循的学术引用规范。

YouTube-ASL 是什么

YouTube-ASL 是一个大规模、开放域(open-domain)的美国手语视频数据集,其核心特征是:每一段视频都配有对应的英语字幕(English captions),从而构成手语-英语平行语料(parallel corpus),为手语识别、手语翻译、手语理解等研究任务提供数据基础。

与许多在受控实验室环境下采集的手语数据集不同,YouTube-ASL 直接从 YouTube 开放平台挖掘真实世界的 ASL 内容,覆盖广泛的主题、场景与说话风格,因此被定义为"开放域"数据集——这既是其规模优势,也对下游模型的泛化能力提出了更高要求。

该数据集发布在 Google Research 的 google-research 仓库中,仓库根 README.md 声明:仓库内所有数据集均以CC BY 4.0 International许可发布,所有源代码以Apache 2.0许可发布。

数据集构建流程(Process)

根据 youtube_asl/README.md,YouTube-ASL 的构建遵循一个**两步骤(two step process)**流程:

第一步:从 YouTube 大规模挖掘候选视频

研究人员对 YouTube 上的 ASL 相关视频进行挖掘(mining),搜索途径是 YouTube 为每个视频自动生成的Knowledge Graph 实体标签(machine-generated tags of Knowledge Graph entities)。具体做法为:

  • 检索所有被标记为与"手语(sign language)"整体相关,或专门标记为"美国手语(American Sign Language)"的公开列表视频(listed public videos)
  • 采集时间范围截止到2022 年 1 月(up to January 2022)

这一阶段的关键在于利用知识图谱标签实现大规模粗筛:不依赖人工逐条标注,而是借助 YouTube 平台已有的结构化标签体系快速召回候选集合,这也是该数据集能够达到上万段视频规模的前提。

第二步:聋人母语者人工精筛

粗筛之后,研究团队邀请了**母语为手语的聋人标注者(native Deaf annotators)**逐条审阅候选视频,其目的是:

  • 过滤掉质量较差的视频(poor quality)
  • 过滤掉字幕与手语内容不对齐的视频(misaligned captions)

这一人工环节保证了最终数据集中字幕与手语内容之间的对齐质量,是"平行语料"可用性的关键保障。从源码结构看,这种"机器粗筛 + 人工精筛"的流水线设计,也是后续大规模手语语料构建工作的通用范式——仓库中的姊妹数据集 YouTube-SL-25 就明确说明其采用了**粗粒度人工过滤(coarse human filtering)**来扩展语言覆盖范围(详见 youtube_sl_25/README.md)。

数据集规模特征(Dataset Characteristics)

YouTube-ASL 的官方统计口径如下:

指标数值
ASL 视频数量11,093 段
视频总时长984 小时
英语字幕(caption)数量610,193 条

这些数字共同刻画了 YouTube-ASL 的量级:

  • 视频数量破万:为手语识别与翻译模型的训练提供了充足样本;
  • 总时长近千小时:远超多数受控手语数据集,支撑长时序建模与连续手语理解研究;
  • 字幕条数超过 60 万:平均每段视频约含 55 条字幕,为视频片段-字幕对齐的弱监督学习提供了天然监督信号。

需要说明的是,以上为数据集的发布口径;由于数据集以视频 ID 形式发布(见下节),实际可用时长还取决于视频的在线可用状态与版权约束。

视频 ID 发布与获取方式(Video IDs)

与 YouTube 生态中广为使用的YouTube-8M数据集类似,YouTube-ASL不直接分发视频文件本身,而是发布视频 ID(video IDs)列表,由使用者按需获取对应视频。这样做既能规避大规模视频文件分发的存储与带宽成本,也符合 YouTube 平台的内容使用规范。

视频 ID 清单托管在Google Cloud Storage上,位于gresearch/youtube-asl存储桶中。获取方式为:访问 Cloud Storage 浏览器并定位到gresearch/youtube-asl路径,即可浏览或下载完整的视频 ID 文件。拿到 ID 列表后,研究团队通常通过 YouTube Data API 等官方渠道解析元数据并拉取视频流,再依据 youtube_asl/README.md 中描述的对齐规则建立视频片段与字幕的对应关系。

姊妹数据集:YouTube-SL-25

在仓库的 youtube_sl_25/README.md 中,Google Research 进一步发布了YouTube-SL-25——一个覆盖25 种以上手语、累计3200 小时以上视频的跨语言手语平行语料库。YouTube-SL-25 与 YouTube-ASL 的关系是:

YouTube-ASL 是 YouTube-SL-25 的一个子集(subset)

因此,如果你同时使用了两个数据集,需要同时引用 YouTube-SL-25 与 YouTube-ASL 两篇论文(详见下节引用规范)。从数据集演进脉络可以推断,YouTube-ASL 的单语言(ASL-英语)平行语料经验被 YouTube-SL-25 推广到了多语言(>25 种手语)场景,后者在 youtube_sl_25/README.md 中同样以视频 ID 形式通过 Cloud Storage 的gresearch/youtube-sl-25路径发布。

相关研究定位

在 google-research 仓库中,除数据集发布外,还包含其他与手语相关的工程实现,例如 sign_language_detection 项目——一个基于人体姿态估计(Human Pose Estimation)的实时手语检测 TensorFlow 实现(发表于 SLRTP 2020),它使用tfrecord格式的(fps, pose_data, pose_confidence, is_signing)四元组描述视频。虽然该项目使用德国手语(DGS)公共语料而非 YouTube-ASL 训练,但它与 YouTube-ASL 同属于手语计算研究的技术栈,可以视作仓库内对手语建模能力(姿态表征、时序建模)的补充佐证。对于以 YouTube-ASL 为训练语料的模型来说,这类姿态估计管线可为其提供视频帧级的手部与身体关键点特征。

引用 YouTube-ASL(Citing)

如果你在论文或项目中使用了 YouTube-ASL,请引用其配套论文(见 youtube_asl/README.md):

Uthus, David and Tanzer, Garrett and Georg, Manfred.YouTube-ASL: A Large-Scale, Open-Domain American Sign Language-English Parallel Corpus, 2023, arXiv:2306.15162。

对应的 BibTeX 条目如下:

@misc{uthus2023youtubeasl, author = {Uthus, David and Tanzer, Garrett and Georg, Manfred}, title = {YouTube-ASL: A Large-Scale, Open-Domain American Sign Language-English Parallel Corpus}, year = {2023}, eprint = {2306.15162}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2306.15162}, }

此外,若你的工作同时涉及 youtube_sl_25/README.md 中的多语言手语数据,还需要一并引用 YouTube-SL-25 的论文:

@misc{tanzer2024youtubesl25, title={YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus}, author={Garrett Tanzer and Biao Zhang}, year={2024}, eprint={2407.11144}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2407.11144}, }

使用建议与注意事项

结合 youtube_asl/README.md 及仓库相关说明,使用 YouTube-ASL 时有以下几点值得注意:

  1. 数据形态:仓库仅发布视频 ID 清单(位于 GCS 的gresearch/youtube-asl路径),视频原始内容需自行通过 YouTube 渠道获取,请遵守相关平台条款与版权约定;
  2. 许可协议:数据集本体遵循仓库根 README.md 声明的 CC BY 4.0 许可,使用时应保留出处并遵循署名要求;
  3. 质量特征:虽然经过了聋人母语者的人工过滤,但作为开放域大规模语料,个别视频仍可能存在噪声,建议在训练与评测时结合下游任务做针对性清洗;
  4. 引用义务:使用 YouTube-ASL 请引用其论文;同时使用 YouTube-SL-25 时请一并引用两者,以尊重研究团队的贡献。

综上,YouTube-ASL 以其"万级视频、近千小时、60 万条字幕"的规模,以及"机器粗筛 + 人工精筛"的构建范式,为开放域手语识别与手语-英语翻译研究提供了高质量的数据基础,也是理解 Google Research 在大规模手语语料方向研究脉络(从 YouTube-ASL 到 YouTube-SL-25)的关键入口。

【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/23 1:43:36

基于 Vue + Node.js + Element UI 的宠物交易管理系统设计与实践

去年帮一位做宠物用品的朋友改造门店管理系统,需求聊到最后变成了一个完整的宠物交易平台。他要的不只是商品上架下架,而是把整个交易链路管起来:宠物档案、寄养预约、买卖订单、客户回访、库存盘点,全部塞进一个后台里。当时手头…

作者头像 李华
网站建设 2026/9/23 1:42:22

数据挖掘能力验证:从试卷到生产环境的工程实践

简介:本资源为重庆大学《数据仓库与数据挖掘》课程期末考试真题试卷,面向计算机、大数据及相关专业本科生与备考研究生,聚焦数据驱动决策系统的核心能力考查。试卷覆盖数据仓库设计(四类视图、星型/雪花/实时星座模式)…

作者头像 李华
网站建设 2026/9/23 1:40:09

化工企业战略规划全解析:从市场分析到落地执行

1. 项目背景与核心价值化工行业作为国民经济支柱产业之一,其战略规划直接关系到企业未来5-10年的发展方向和资源配置。这份120页的PPT战略规划报告,实际上是一个完整的化工企业战略管理工具包,涵盖了从市场分析到落地执行的全套方法论。我在化…

作者头像 李华