1. 项目概述:为什么我们需要一份靠谱的TCGA癌症简称对照表?
如果你刚接触癌症基因组学,或者正在处理TCGA(The Cancer Genome Atlas)的数据,第一个让你头大的可能不是复杂的算法,而是那些眼花缭乱的缩写。BRCA、LUAD、SKCM、COAD……这些看起来像密码一样的字母组合,背后代表的是乳腺癌、肺腺癌、皮肤黑色素瘤、结肠腺癌等具体的癌症类型。我刚开始做生信分析的时候,就曾经因为把“LUSC”(肺鳞癌)和“LUAD”(肺腺癌)搞混,导致后续的差异表达分析完全跑偏,浪费了好几天时间。这让我意识到,一份准确、全面、随时可查的TCGA癌症中英文对照表,绝不是可有可无的参考资料,而是高效、准确开展研究工作的“导航仪”和“避坑指南”。
这份对照表的核心价值在于建立一座桥梁,连接起简洁的数据库标识符(缩写)和人类可理解的疾病名称(全称)。TCGA项目为了数据管理和标准化,为每种癌症类型分配了唯一的、通常是四个字母的缩写。这些缩写大多遵循一定的命名逻辑,比如取器官英文名的前几个字母加上癌症类型,但也不乏一些历史原因形成的特例。对于数据分析师、临床研究员甚至期刊编辑来说,能够快速、无误地进行这种转换,是保证沟通无误、分析正确、论文严谨的基础。本文将不仅仅罗列一份对照表,更会深入拆解这些缩写背后的命名规则、常见的使用场景、以及在实际工作中如何高效地管理和应用这份知识,让你彻底摆脱缩写混淆的困扰。
2. TCGA癌症缩写命名规则深度解析
理解命名规则,能让你从死记硬背变为逻辑推断,即使遇到陌生的缩写也能猜个八九不离十。TCGA的癌症缩写体系并非完全随意,其核心逻辑可以归纳为“器官+类型”的简写组合。
2.1 基于器官英文名称的缩写
这是最常见的一类。通常取器官或组织英文名称的前2-3个字母。
- BRCA:BreastCarcinoma。乳腺癌。这里“Ca”是Carcinoma(癌)的常用缩写。
- LUAD:LungAdenocarcinoma。肺腺癌。注意是“肺”的“Lu”和“腺癌”的“Ad”。
- LUSC:LungSquamousCell carcinoma。肺鳞状细胞癌。这里体现了“鳞状细胞”的“S”和“C”。
- COAD:ColonAdenocarcinoma。结肠腺癌。
- READ:RectumAdenocarcinoma。直肠腺癌。
- KIRC:KidneyRenalClear cell carcinoma。肾透明细胞癌。这里稍微复杂,“Ki”是肾脏,“R”和“C”分别代表Renal和Clear。
- THCA:ThyroidCarcinoma。甲状腺癌。
2.2 基于组织学类型或特殊命名的缩写
有些缩写更侧重于癌症的特定组织学类型或沿用历史名称。
- SKCM:SkinCutaneousMelanoma。皮肤黑色素瘤。这里“M”代表Melanoma。
- GBM:GlioblastomaMultiforme。多形性胶质母细胞瘤。这是脑肿瘤中最常见且恶性程度最高的一种,其缩写直接来源于疾病名称。
- LAML:LeukemiaAcuteMyeloidLeukemia。急性髓系白血病。这是一种血液系统肿瘤,缩写体现了“白血病”和“急性髓系”的组合。
- OV:Ovarian serous cystadenocarcinoma。卵巢浆液性囊腺癌。这是一个特例,只用“OV”两个字母代表卵巢癌,主要是历史沿用和简洁性考虑。
2.3 容易混淆的缩写对及其区分要点
在实际工作中,以下几对缩写最容易出错,需要特别留意:
- LUAD vs. LUSC: 这可能是最高频的“坑”。两者都是肺癌,但LUAD是腺癌(Adenocarcinoma),LUSC是鳞癌(Squamous Cell carcinoma)。两者的起源细胞、驱动基因、治疗策略和预后都有显著差异。在下载数据或筛选样本时,务必double-check。
- COAD vs. READ: 两者都是消化道腺癌,但部位不同。COAD是结肠(Colon),READ是直肠(Rectum)。在涉及结直肠癌的研究中,有时会使用“CRC”(Colorectal Cancer)来统称,但TCGA数据是分开的。
- KIRC vs. KIRP vs. KICH: 这都是肾脏肿瘤。KIRC是肾透明细胞癌(最常见),KIRP是肾乳头状细胞癌,KICH是肾嫌色细胞癌。它们的分子特征和临床行为不同。
注意:永远不要凭印象猜测。当你在脚本中过滤样本、在论文中描述队列、或在报告中展示结果时,对缩写的误用会导致整个研究基础的错误。最稳妥的方法是随时查阅可靠的对照表,并在代码中用注释明确标注。
3. 完整TCGA癌症类型中英文对照与关键信息表
下面这张表是我在多年工作中整理和验证的核心对照表,不仅包含缩写和全称,还补充了常见样本量范围和关键注释,这能帮助你在实验设计或数据解读时更有数。
| TCGA项目缩写 | 英文全称 | 中文全称 | 常见样本量范围(肿瘤+正常) | 关键注释与常见用途 |
|---|---|---|---|---|
| ACC | Adrenocortical Carcinoma | 肾上腺皮质癌 | ~80 | 罕见肿瘤,研究内分泌相关癌变机制 |
| BLCA | Bladder Urothelial Carcinoma | 膀胱尿路上皮癌 | ~400 | 常用干湿结合验证模型 |
| BRCA | Breast invasive carcinoma | 乳腺浸润性癌 | ~1100 | 数据最丰富,分型(Luminal A/B, HER2, Basal-like)研究多 |
| CESC | Cervical squamous cell carcinoma and endocervical adenocarcinoma | 宫颈鳞癌和宫颈腺癌 | ~300 | 包含两种主要病理类型,与HPV感染强相关 |
| CHOL | Cholangiocarcinoma | 胆管癌 | ~50 | 样本量小,预后差,是研究难点 |
| COAD | Colon adenocarcinoma | 结肠腺癌 | ~450 | 常与READ合并为结直肠癌(CRC)分析 |
| DLBC | Lymphoid Neoplasm Diffuse Large B-cell Lymphoma | 弥漫大B细胞淋巴瘤 | ~50 | 血液淋巴系统肿瘤,基因组变异复杂 |
| ESCA | Esophageal carcinoma | 食管癌 | ~200 | 需注意区分食管鳞癌(ESCC)和腺癌(EAC)亚型 |
| GBM | Glioblastoma multiforme | 多形性胶质母细胞瘤 | ~600 | 中枢神经系统最常见恶性瘤,免疫治疗研究热点 |
| HNSC | Head and Neck squamous cell carcinoma | 头颈部鳞状细胞癌 | ~500 | 与HPV感染状态密切相关,影响预后 |
| KICH | Kidney Chromophobe | 肾嫌色细胞癌 | ~70 | 肾癌三种主要类型之一,相对惰性 |
| KIRC | Kidney renal clear cell carcinoma | 肾透明细胞癌 | ~600 | 肾癌最常见类型,VHL基因突变特征明显 |
| KIRP | Kidney renal papillary cell carcinoma | 肾乳头状细胞癌 | ~300 | 另一种主要肾癌类型 |
| LAML | Acute Myeloid Leukemia | 急性髓系白血病 | ~200 | 血液肿瘤,样本多为外周血或骨髓 |
| LGG | Brain Lower Grade Glioma | 脑低级别胶质瘤 | ~500 | 包含星形细胞瘤、少突胶质细胞瘤等 |
| LIHC | Liver hepatocellular carcinoma | 肝细胞肝癌 | ~400 | 与乙肝病毒、肝硬化关联大,异质性强 |
| LUAD | Lung adenocarcinoma | 肺腺癌 | ~500 | 非小细胞肺癌主要亚型,驱动基因(EGFR, ALK)明确 |
| LUSC | Lung squamous cell carcinoma | 肺鳞状细胞癌 | ~500 | 非小细胞肺癌另一主要亚型,与吸烟关系更密切 |
| MESO | Mesothelioma | 间皮瘤 | ~80 | 罕见,多与石棉暴露相关 |
| OV | Ovarian serous cystadenocarcinoma | 卵巢浆液性囊腺癌 | ~600 | 妇科常见恶性肿瘤,早期诊断难 |
| PAAD | Pancreatic adenocarcinoma | 胰腺腺癌 | ~180 | “癌王”,预后极差,肿瘤微环境研究多 |
| PCPG | Pheochromocytoma and Paraganglioma | 嗜铬细胞瘤和副神经节瘤 | ~180 | 神经内分泌肿瘤,多与遗传综合征相关 |
| PRAD | Prostate adenocarcinoma | 前列腺腺癌 | ~500 | 男性常见肿瘤,雄激素受体信号通路是关键 |
| READ | Rectum adenocarcinoma | 直肠腺癌 | ~170 | 常与COAD合并分析,但保留独立标识 |
| SARC | Sarcoma | 肉瘤 | ~250 | 间叶组织来源,包含多种亚型,异质性极高 |
| SKCM | Skin Cutaneous Melanoma | 皮肤黑色素瘤 | ~470 | 免疫检查点抑制剂疗效显著的癌种 |
| STAD | Stomach adenocarcinoma | 胃腺癌 | ~440 | 与幽门螺杆菌感染相关,分子分型(如TCGA分型)重要 |
| TGCT | Testicular Germ Cell Tumors | 睾丸生殖细胞肿瘤 | ~150 | 年轻人多见,治愈率高 |
| THCA | Thyroid carcinoma | 甲状腺癌 | ~500 | 最常见内分泌恶性肿瘤,通常预后良好 |
| THYM | Thymoma | 胸腺瘤 | ~120 | 前纵隔肿瘤,常伴发自身免疫性疾病 |
| UCEC | Uterine Corpus Endometrial Carcinoma | 子宫体子宫内膜癌 | ~550 | 妇科常见肿瘤,分型(POLE突变型、MSI型等)影响治疗 |
| UCS | Uterine Carcinosarcoma | 子宫癌肉瘤 | ~60 | 罕见但高度恶性 |
| UVM | Uveal Melanoma | 葡萄膜黑色素瘤 | ~80 | 眼内恶性肿瘤,与皮肤黑色素瘤基因组特征不同 |
这张表的价值在于,当你在UCSC Xena、cBioPortal或GDC数据门户浏览数据集时,可以快速定位。比如,你想研究免疫治疗相关的生物标志物,那么SKCM(黑色素瘤)、LUAD(肺腺癌)和BLCA(膀胱癌)通常是首选,因为这些癌种对免疫检查点抑制剂的响应数据相对丰富。
4. 实操应用:如何在数据分析流程中高效集成与使用对照表
知道了对照表,更关键的是把它用起来,融入你的日常工作流,避免每次用到都去临时搜索。这里分享几种我实践过的高效方法。
4.1 在生物信息学分析脚本中的集成
最推荐的方式是将对照表直接编码到你的R或Python分析脚本的开头,作为一个字典或数据框。这样既能保证准确性,又能实现自动化查询。
R语言示例:
# 在脚本开头定义TCGA癌症类型对照字典 tcga_dict <- list( "ACC" = "Adrenocortical Carcinoma", "BLCA" = "Bladder Urothelial Carcinoma", "BRCA" = "Breast invasive carcinoma", "LUAD" = "Lung adenocarcinoma", "LUSC" = "Lung squamous cell carcinoma", "SKCM" = "Skin Cutaneous Melanoma" # ... 可以继续补充完整 ) # 使用函数进行转换 get_cancer_full_name <- function(abbr) { if (abbr %in% names(tcga_dict)) { return(tcga_dict[[abbr]]) } else { warning(paste("Abbreviation", abbr, "not found in dictionary.")) return(NA) } } # 应用:清洗样本ID中的癌症类型信息 sample_ids <- c("TCGA-AA-3972-01A", "TCGA-DD-A39V-01A") cancer_abbr <- substr(sample_ids, 6, 7) # 假设项目缩写在6-7位(根据GDC最新ID结构可能需调整) cancer_full <- sapply(cancer_abbr, get_cancer_full_name) print(cancer_full)Python示例:
# 定义对照字典 tcga_dict = { "ACC": "Adrenocortical Carcinoma", "BLCA": "Bladder Urothelial Carcinoma", "BRCA": "Breast invasive carcinoma", "LUAD": "Lung adenocarcinoma", "LUSC": "Lung squamous cell carcinoma", "SKCM": "Skin Cutaneous Melanoma" } # 使用函数 def get_cancer_full_name(abbr): return tcga_dict.get(abbr, f"Unknown abbreviation: {abbr}") # 应用:在pandas DataFrame中添加一列全称 import pandas as pd # 假设df有一个‘project_id’列,值为‘TCGA-LUAD’等 df['cancer_abbr'] = df['project_id'].str.split('-').str[1] df['cancer_full_name'] = df['cancer_abbr'].map(tcga_dict)4.2 在数据可视化图表中的规范使用
在绘制发表级图表时,使用全称或“缩写(全称)”的格式能极大提升图表的可读性和专业性。
- 不佳示例:图例直接写“LUAD”、“LUSC”。对于非本领域的读者或审稿人不够友好。
- 推荐示例:
- 图例写:“Lung adenocarcinoma (LUAD)” 和 “Lung squamous cell carcinoma (LUSC)”。
- 或在图表标题或注释中说明:“LUAD, lung adenocarcinoma; LUSC, lung squamous cell carcinoma”。
- 在ggplot2 (R) 或 matplotlib/seaborn (Python) 中,你可以在绘制前,通过一个映射向量,将数据框中的缩写列直接替换为这种组合格式的标签。
4.3 创建个人知识库或速查笔记
除了嵌入代码,建立一个随时可查的个人知识库也至关重要。我习惯使用以下任何一种方式:
- 本地文本文件:如
tcga_abbreviations.txt或tcga_cheatsheet.md,放在项目根目录。 - 电子表格:如Excel或Google Sheets,可以方便地排序、筛选,并添加更多自定义列,如“相关标志物”、“常用分析工具”等。
- 笔记软件:如Notion、Obsidian等,利用双向链接功能,将TCGA缩写与相关的分析笔记、文献链接起来,形成知识网络。
5. 常见问题与易错点排查实录
即使有了对照表,在实际操作中还是会遇到一些坑。这里总结几个我踩过的雷和解决方案。
5.1 样本ID与项目缩写提取错误
问题:TCGA的样本ID格式经历过变化(如旧版的“TCGA-02-0001-01”到GDC的“b117f0b6-7b7f-4e9b-89b3-2f6b5c5b5b5b”等UUID)。直接从样本ID中提取项目缩写时,位置可能不对。
- 旧版ID:
TCGA-02-0001-01,项目缩写是前两个字母后的两位数字02,需要再对照一个内部映射表(02可能对应某种癌症)。 - GDC数据:更可靠的方式不是从样本ID硬提取,而是利用元数据文件。下载数据时,通常会有一个
metadata.json或MANIFEST.txt文件,里面包含了每个文件对应的project_id(例如TCGA-LUAD),这才是准确的项目标识。
实操心得:永远不要假设ID的结构是固定的。优先使用官方数据门户(如GDC Data Portal)提供的元数据中的
project_id字段来获取癌症类型缩写,这是最权威的方法。
5.2 合并癌种分析时的缩写处理
问题:当需要合并多个癌种进行分析时(例如,研究泛癌标志物),如何在结果中清晰标识来源?
- 错误做法:在最终结果表格或图中,只用一个新代号如“Pan-Cancer”,丢失了具体癌种信息。
- 正确做法:保留原始缩写作为前缀或后缀。例如,在基因表达矩阵中,列名可以使用
LUAD_TCGA-AA-1234和LUSC_TCGA-BB-5678这样的格式。在绘制热图时,可以通过行或列注释条(annotation bar)来高亮显示不同的癌种缩写。
5.3 与其它数据库缩写体系的冲突
问题:除了TCGA,其他数据库如ICGC、CCLE等也有自己的样本命名或癌症缩写体系,混用时容易混淆。
- 案例:CCLE(癌症细胞系百科全书)中,一个肺癌细胞系可能叫
NCI-H1650,它对应的癌症类型是肺腺癌(LUAD),但在CCLE内部标识中可能不直接使用“LUAD”。 - 解决方案:在涉及多数据源整合的项目中,建议建立一个中心映射表。这个表至少包含以下几列:
数据源、内部标识符、统一癌症类型缩写(TCGA标准)、癌症全称。所有后续分析都基于“统一癌症类型缩写”进行,这样可以确保一致性。
5.4 缩写更新与版本管理
问题:TCGA项目本身是动态的,虽然主要癌种已固定,但一些子项目或更新数据集的命名可能需要留意。
- 建议:定期查看NCI GDC官方网站的文档。对于关键项目,在论文方法部分或代码的README中,注明你所使用的数据版本和癌症类型缩写对照的来源(例如,“Cancer type abbreviations were based on the TCGA project designations as retrieved from the GDC Data Portal in January 2023”)。这增加了研究的可重复性。
6. 进阶技巧:从缩写到深度理解的资源延伸
掌握缩写只是第一步。真正发挥TCGA数据价值,需要知道每个癌种背后的生物学特性、临床问题和分析资源。
6.1 关联癌种特异性分析工具与数据库
每个TCGA癌种都有一些特别受关注的分析工具或数据库:
- BRCA: 可以使用
BRCAness相关签名来评估同源重组修复缺陷状态。关注cBioPortal上的乳腺癌专属数据集。 - GBM/LGG: 脑肿瘤浸润免疫细胞分析工具(如
CIBERSORTx)常用,需注意血脑屏障的影响。参考IVY GAP数据库的空间转录组数据。 - SKCM/LUAD: 免疫检查点抑制剂疗效预测是热点。
TIDE数据库和IMvigor210等免疫治疗队列数据是重要的验证资源。 - PAAD: 肿瘤微环境(特别是癌症相关成纤维细胞)分析至关重要。
EPIC、MCP-counter等反卷积工具常用。
6.2 利用缩写进行高效数据检索与批量下载
当你需要下载多个癌种的数据时,缩写列表就是你的批处理脚本的核心输入。
# 假设有一个包含目标癌种缩写的文件 cancer_list.txt # 内容: # BRCA # LUAD # COAD # 使用GDC Data Transfer Tool进行批量下载(示例) while read cancer; do gdc-client download -m manifest_${cancer}.txt done < cancer_list.txt在R的TCGAbiolinks包或Python的gdcdownload等工具中,你也可以轻松地循环遍历一个缩写列表,来自动化数据查询和下载流程,这能节省大量手动操作的时间。
6.3 在论文写作与学术交流中的规范表达
在撰写论文时:
- 首次出现时定义:在摘要或引言部分首次提到某个TCGA癌种时,应使用全称并括号注明缩写,例如:“...using lung adenocarcinoma (LUAD) data from The Cancer Genome Atlas (TCGA).”
- 图表中保持一致:如前所述,图表中的标签应尽可能清晰。
- 方法部分详细说明:在“数据获取”部分,明确列出所使用的所有TCGA项目缩写,并说明数据版本和下载来源。这体现了研究的严谨性。
最后,我个人最深刻的体会是,对待这些缩写就像对待实验中的化学试剂标签一样,必须准确无误。它看似是微不足道的细节,却构成了整个数据分析大厦的基石。花一点时间整理好这份对照表,并将其固化到你的分析流程和知识体系中,未来在处理任何TCGA相关数据时,你都会感到无比顺畅和自信。我习惯在每一个新的癌症基因组学分析项目的开头,第一个脚本就是定义这个tcga_dict,它像是一把可靠的钥匙,帮我打开后续所有分析的大门。