给结论留一点空间:关于证据和不确定性的阅读笔记

这是一篇供讨论的思考札记。所有案例均为假设情境,不是实际研究结果;内容讨论通用的证据阅读方法,不提供医疗判断或建议。

读论文时,一个困难并不是完全看不懂,而是看懂之后太快形成了一个更强的结论。图里出现了两组差异,就觉得机制已经被证明;模型给出较高的预测分数,就觉得它解释了原因;某项检验没有达到阈值,又把它概括为“没有作用”。

也许更有帮助的阅读习惯,是暂时把结论放慢半步:先说清看到了什么,再问这些观察最多能够支持什么。

观察、推断和解释,不要写在同一格里

假设一篇文章比较了两个条件下某个测量指标。图上可以直接读到的,是测得数值的分布、差异和不确定性。把它写成“在这些样本与测量条件下,观察到这样的变化”,比立即写成“这个因素决定了变化”更准确。

进一步说变化与某个因素有关,需要检查比较对象、分组方法和其他可能解释。若要主张因果机制,还需要相应设计或干预证据;一幅图的视觉说服力,不能替代这些条件。

可以把阅读笔记分成三格:

层次 写什么 避免什么
直接观察 指标、样本范围、比较方向 把推测混进图上读数
基于证据的推断 推断依赖哪些设计和假设 忽略替代解释
尚未验证的解释 下一步需要怎样的证据 当作作者已证明的机制

这不是要求每篇论文都回答所有层次,而是让自己的概括不要悄悄跳过一层。

在数样本以前,先问独立性

假设同一份样本产生了很多读段,或者同一个对象被测量很多次。数据点数量确实增加了,但它们是否代表同样数量的独立实验单位,需要根据采样和实验设计判断。

不能仅凭表格很长,就把每行都视为独立重复。对于这类问题,Lazic 等人的方法文章讨论了实验单位、观测单位及伪重复之间的区别,可作为核对设计的入口:What exactly is ‘N’ in cell culture and animal experiments?

阅读时可以依次问:处理分配给了谁?哪些观测共享同一个来源?分析有没有考虑这种结构?文中的 n 表示对象、样本、孔、读段,还是重复测量次数?

问题的重点不在于找一个尽可能大的数字,而在于数字是否对应研究结论所需的独立信息。

“没有发现差异”仍需要说明范围

假设一个比较没有得到足够明确的差异证据。可能确实不存在值得关注的变化,也可能当前数据噪声较大、样本不足,或者测量与问题没有充分对应。究竟更接近哪种解释,需要看效应估计、区间、设计与分析假设。

因此,“在当前数据和分析下,没有获得明确支持”通常比“已经证明完全没有影响”更谨慎。反过来,也不能借不确定性无限维护一个想法,声称只要再收集数据就一定能得到想要的结果。

美国统计协会关于 p 值的声明强调,单个阈值不应替代科学判断;p 值不直接表示假设为真的概率,也不衡量效应大小或结果重要性。阅读时应结合设计、估计和完整报告,而非仅把结果分成两类。见 ASA 官方声明。

对于需要证明“足够接近”或“不超过某个实际重要差异”的问题,也应先明确那个界限和合适的分析方案,而不是直接把一次不显著检验改名为“等效”。

一个好看的预测结果,回答的可能只是预测问题

再设想一个模型能区分两类样本。这个结果首先支持的是:在所用数据、划分方式与评价设置下,模型具有相应的区分表现。它不自动回答模型依赖了什么信息,也不自动证明某个特征具有因果作用。

如果训练集与测试集共享来源,或者预处理使用了全部数据,漂亮的指标还可能回答了一个比预期更容易的问题。评价一个模型时,先检查数据划分和可用信息,再讨论架构与分数。

这也提醒阅读者:作者提出的问题、实验实际回答的问题,以及自己想应用的问题,可能不是同一个。应用之前,应把这三者并排写一次。

允许笔记保留“不确定”

不确定并不等于没有进展。它可以被拆成很具体的任务:补充材料里有没有分组规则?置信区间覆盖多大的范围?另一种解释有没有被对照实验排除?这个结论能否推广到不同来源的数据?

与其用一句“还需要更多研究”结束,不如写出缺的是哪种证据。明确缺口以后,后续阅读才知道该寻找什么,而不是只寻找更多支持原观点的句子。

下次读到一个重要结论,检查这六项

  1. 结论对应哪张图、哪组样本和哪种测量?
  2. 比较对象与实验单位是什么?
  3. 观察、推断和机制解释有没有被混写?
  4. 效应有多大,不确定范围有多宽?
  5. 阴性或不一致结果是否被如实报告?
  6. 换一个来源或条件,结论还需要哪些证据?

谨慎不是把每个结论都稀释成“也许”。更有建设性的做法,是给结论配上清楚的范围、明确的依据,以及下一步可以检查的疑问。这样保留下来的不确定性,才有机会成为继续理解的起点。