什么是 SSN
样本特异性网络(Sample-Specific Network,SSN)由 Liu 等人在 2016 年发表于 Nucleic Acids Research,用于从单个样本的表达数据中构建个体特异性分子网络。
传统共表达网络需要一组样本估计基因间相关性,因此不能直接描述某一个样本。SSN 的核心思路是:先用参考样本建立基准网络,再观察加入目标样本后每条边的相关性是否发生显著扰动。
第一性原理与本质
一个样本只有一个表达值,不能独立定义两个基因之间的相关性。相关性描述的是多个观测值之间的协同变化,因此 SSN 并不是直接从单个样本计算网络,而是借助参考群体的统计结构,通过扰动来定位该样本的网络贡献。
其逻辑可以概括为:
- 参考样本建立基准相关结构。
- 加入目标样本后重新估计相关结构。
- 将两次估计的差异归因于被加入的样本。
- 对这种差异进行显著性检验,保留被目标样本显著扰动的边。
因此,SSN 输出的不是完整的功能网络,而是一个差分扰动网络。边表示“相对于参考群体,目标样本使某种分子关联异常增强或减弱”,不等同于直接物理互作或因果关系。
这也是 SSN 能够补充差异表达分析的原因:它关注的是关系的扰动,而不只是表达量的高低。高度数节点和显著模块可以作为候选扰动中心,但仍需结合独立队列、功能实验或其他数据库验证。
核心流程
设参考样本数为 n,目标样本为 d。
1. 构建参考网络
用参考样本计算候选基因对之间的 Pearson correlation coefficient(PCC),记为:
PCC_n
参考样本应尽量来自同一组织、相近实验条件和相同测序流程。正常样本常被用作参考,但“正常”并不是唯一选择。
2. 加入目标样本
将目标样本 d 加入参考样本集,重新计算同一批基因对的相关性:
PCC_(n+1)
3. 计算网络扰动
对每一条候选边计算:
ΔPCC_n = PCC_(n+1) - PCC_n
ΔPCC_n 表示目标样本加入后该基因关系的变化方向和幅度。它不是目标样本中两个基因表达值的简单相关性。
4. 进行显著性检验
SSN 根据相关系数扰动的统计分布计算边的显著性,常见结果包括 Z-score、p-value 或经过多重检验校正的 q-value。
有些介绍会使用类似下面的简化表达来帮助理解:
Z ≈ ΔPCC_n / sqrt((1 - PCC_n^2) / (n - 1))
这只是示意,不应当作为所有 SSN 实现的通用公式。实际分析应遵循所采用算法版本、论文定义和代码实现,并进行多重检验校正。
5. 保留显著边
根据预先设定的显著性阈值保留边,例如校正后的 q-value 和效应量阈值。最终得到的边集合就是目标样本的 SSN。
背景网络过滤
理论上可以计算所有基因对,但全连接候选边数量过大,且会引入大量统计噪声。实际分析通常使用 STRING、BioGRID 或其他 PPI/调控网络作为背景网络,只检验已有生物学依据的基因对。
背景网络的作用是限制候选边,不等于证明该边在目标样本中发生了直接物理作用。SSN 仍然主要反映统计关联的改变。
输入与输出
输入通常包括:
- 参考样本表达矩阵,行是基因,列是样本。
- 目标样本表达向量或表达矩阵。
- 可选的背景网络边列表。
- 显著性、效应量和多重检验阈值。
输出通常包括:
- 每个目标样本的显著边列表。
- 每条边的
ΔPCC、统计量和 p-value/q-value。 - 网络节点度、模块和候选关键节点。
- 样本间网络距离或网络相似性。
适合解决的问题
个体化疾病表征
同一种疾病内部可能存在明显异质性。SSN 可以在单个患者或样本层面描述相对于参考群体的网络扰动。
识别个体特异性模块
将显著边组成网络后,可以进一步寻找连通模块、枢纽节点和样本特异性子网络。
补充差异表达分析
某个基因即使没有显著差异表达,也可能因为改变了与多个基因的关系而出现在 SSN 中。因此,SSN 可以作为 differential expression analysis 的补充,而不是替代。
癌症亚型、预后和耐药研究
可以比较不同患者的 SSN,提取共同扰动模块或个体特异性网络特征,用于分型、预后建模和药物耐药机制研究。
扩展到其他数据类型
在满足统计假设并重新评估参考集合的前提下,SSN 思路可以扩展到单细胞、蛋白质组、代谢组和疾病进展时间点数据。
分析时需要注意
- 参考样本数量和质量直接影响相关系数稳定性,实际项目通常需要至少 20–30 个质量可靠且具有代表性的参考样本;具体数量应通过稳定性评估确定。
- 参考样本内部异质性、混杂因素和低质量样本会使
PCC_n不稳定,降低扰动信号的信噪比。 - 参考样本与目标样本最好来自同一组织、平台、实验流程和批次。
- 不同平台或批次直接混合可能使
ΔPCC主要反映技术差异,而非生物学扰动。 - ComBat、Harmony 等批次校正方法不能自动保证相关结构未被改变,校正后仍需验证网络稳定性。
- 跨队列、跨平台使用通用正常参考库时,需要多中心标准化样本、批次校正和独立迁移验证。
- 预处理、过滤和归一化方式会影响网络扰动结果。
- 应报告候选边总数、显著性阈值和多重检验方法。
- 仅凭 SSN 不能推出因果关系或直接分子互作。
- 枢纽节点需要结合独立数据、功能实验或已有数据库进行验证。
现实使用建议
SSN 不是可以脱离数据条件直接套用的黑盒个体化工具。更稳妥的应用范围是同一队列内部、技术条件受控且参考样本定义清楚的比较。临床迁移前,应优先评估正常参考基线能否跨批次、跨中心稳定复现,再解释个体特异性模块或候选驱动基因。
一句话总结
SSN 不是用一个样本直接计算相关性,而是比较“参考群体网络”和“加入该样本后的网络”,从显著相关性扰动中提取样本特异性分子关系。
原作者实现可参考 xp-liu/SSN。