GSE109887 是人脑颞中回(middle temporal gyrus,MTG)的基因表达芯片数据。官方样本注释中有 46 份 AD、32 份 Control,共 78 份样本,平台为 Illumina HumanHT-12 v4 BeadChip。旧文中的“内侧颞回”现更正为“颞中回”。
2026-09-17 已下载并读取 GEO 官方 SOFT 注释核对以上信息。本文说明数据身份、文件区别和开始分析前的检查,不提供未经独立验证的诊断效果结论。
论文标题提到甲基化,为什么这里是表达数据
官方系列标题提及阿尔茨海默病 DNA 甲基化、羟甲基化及 OXT。GEO 摘要同时明确:本条目提交的是这项研究用于比较表观遗传变化与基因表达关系的 MTG 表达数据。
因此,不能仅看论文标题就将这个 GSE 当成甲基化芯片,也不能把它写成单细胞或 RNA-seq 数据。下载前以系列的 Experiment type、平台和样本注释交叉确认。
从官方入口获取什么
打开 GSE109887 官方记录:
| 文件或入口 | 用途 |
|---|---|
| SOFT family | 系列、平台和样本的结构化注释 |
| Series Matrix(若使用) | 对照其说明检查表达值、列名与处理状态 |
| GSE109887_MTG_non-normalized_GA_illumina_expression.txt.gz | 官方列出的未标准化表达补充文件 |
文件名明确标有non-normalized,不能下载后就直接声称是已完成标准化的最终分析矩阵。应结合平台、数据处理说明及数值分布确定后续方法。
旧文的网盘入口被标记含异常文件;另一条分享虽在导出表中显示“永久有效”,实际打开却提示“文件已被分享者删除”。本次撤下旧下载推荐,保留官方入口,避免把分享有效期误当成文件完整性。
如何独立核对 46 / 32 的样本数
在官方页面下载GSE109887_family.soft.gz后,用基础 R 检查每份样本的疾病状态字段:
con <- gzfile("GSE109887_family.soft.gz", "rt") lines <- readLines(con, warn = FALSE) close(con) sample_ids <- sub("^\\^SAMPLE = ", "", grep("^\\^SAMPLE = ", lines, value = TRUE)) states <- sub("^!Sample_characteristics_ch1 = disease state: ", "", grep("^!Sample_characteristics_ch1 = disease state: ", lines, value = TRUE)) stopifnot(length(sample_ids) == 78L, !anyDuplicated(sample_ids)) stopifnot(length(states) == length(sample_ids)) table(states)本次核对得到 AD 46、Control 32。这个检查用于确认总数,不代替正式样本表;构建分析对象时必须按 GSM 标识匹配表达矩阵,不能只靠两个向量恰好长度相同。
开始分析前还要确认什么
先核对表达矩阵列名与样本标识、探针与基因注释关系、缺失值、样本分布、年龄及性别等协变量。跨数据集合并还要评估平台和批次差异。
若做分类模型,训练与测试划分应先确定;特征筛选与参数选择不能提前使用测试集信息。单个公开队列上的拟合效果不等于临床诊断能力。本文不复述旧版中未逐篇核验的二次研究结论。
来源:NCBI GEO 系列记录、同条目提供的官方 SOFT family 文件。