给结论留一点空间:关于证据和不确定性的阅读笔记

给结论留一点空间:关于证据和不确定性的阅读笔记
Perry这是一篇供讨论的思考札记。所有案例均为假设情境,不是实际研究结果;内容讨论通用的证据阅读方法,不提供医疗判断或建议。
读论文时,一个困难并不是完全看不懂,而是看懂之后太快形成了一个更强的结论。图里出现了两组差异,就觉得机制已经被证明;模型给出较高的预测分数,就觉得它解释了原因;某项检验没有达到阈值,又把它概括为“没有作用”。
也许更有帮助的阅读习惯,是暂时把结论放慢半步:先说清看到了什么,再问这些观察最多能够支持什么。
观察、推断和解释,不要写在同一格里
假设一篇文章比较了两个条件下某个测量指标。图上可以直接读到的,是测得数值的分布、差异和不确定性。把它写成“在这些样本与测量条件下,观察到这样的变化”,比立即写成“这个因素决定了变化”更准确。
进一步说变化与某个因素有关,需要检查比较对象、分组方法和其他可能解释。若要主张因果机制,还需要相应设计或干预证据;一幅图的视觉说服力,不能替代这些条件。
可以把阅读笔记分成三格:
| 层次 | 写什么 | 避免什么 |
|---|---|---|
| 直接观察 | 指标、样本范围、比较方向 | 把推测混进图上读数 |
| 基于证据的推断 | 推断依赖哪些设计和假设 | 忽略替代解释 |
| 尚未验证的解释 | 下一步需要怎样的证据 | 当作作者已证明的机制 |
这不是要求每篇论文都回答所有层次,而是让自己的概括不要悄悄跳过一层。
在数样本以前,先问独立性
假设同一份样本产生了很多读段,或者同一个对象被测量很多次。数据点数量确实增加了,但它们是否代表同样数量的独立实验单位,需要根据采样和实验设计判断。
不能仅凭表格很长,就把每行都视为独立重复。对于这类问题,Lazic 等人的方法文章讨论了实验单位、观测单位及伪重复之间的区别,可作为核对设计的入口:What exactly is ‘N’ in cell culture and animal experiments?
阅读时可以依次问:处理分配给了谁?哪些观测共享同一个来源?分析有没有考虑这种结构?文中的 n 表示对象、样本、孔、读段,还是重复测量次数?
问题的重点不在于找一个尽可能大的数字,而在于数字是否对应研究结论所需的独立信息。
“没有发现差异”仍需要说明范围
假设一个比较没有得到足够明确的差异证据。可能确实不存在值得关注的变化,也可能当前数据噪声较大、样本不足,或者测量与问题没有充分对应。究竟更接近哪种解释,需要看效应估计、区间、设计与分析假设。
因此,“在当前数据和分析下,没有获得明确支持”通常比“已经证明完全没有影响”更谨慎。反过来,也不能借不确定性无限维护一个想法,声称只要再收集数据就一定能得到想要的结果。
美国统计协会关于 p 值的声明强调,单个阈值不应替代科学判断;p 值不直接表示假设为真的概率,也不衡量效应大小或结果重要性。阅读时应结合设计、估计和完整报告,而非仅把结果分成两类。见 ASA 官方声明。
对于需要证明“足够接近”或“不超过某个实际重要差异”的问题,也应先明确那个界限和合适的分析方案,而不是直接把一次不显著检验改名为“等效”。
一个好看的预测结果,回答的可能只是预测问题
再设想一个模型能区分两类样本。这个结果首先支持的是:在所用数据、划分方式与评价设置下,模型具有相应的区分表现。它不自动回答模型依赖了什么信息,也不自动证明某个特征具有因果作用。
如果训练集与测试集共享来源,或者预处理使用了全部数据,漂亮的指标还可能回答了一个比预期更容易的问题。评价一个模型时,先检查数据划分和可用信息,再讨论架构与分数。
这也提醒阅读者:作者提出的问题、实验实际回答的问题,以及自己想应用的问题,可能不是同一个。应用之前,应把这三者并排写一次。
允许笔记保留“不确定”
不确定并不等于没有进展。它可以被拆成很具体的任务:补充材料里有没有分组规则?置信区间覆盖多大的范围?另一种解释有没有被对照实验排除?这个结论能否推广到不同来源的数据?
与其用一句“还需要更多研究”结束,不如写出缺的是哪种证据。明确缺口以后,后续阅读才知道该寻找什么,而不是只寻找更多支持原观点的句子。
下次读到一个重要结论,检查这六项
- 结论对应哪张图、哪组样本和哪种测量?
- 比较对象与实验单位是什么?
- 观察、推断和机制解释有没有被混写?
- 效应有多大,不确定范围有多宽?
- 阴性或不一致结果是否被如实报告?
- 换一个来源或条件,结论还需要哪些证据?
谨慎不是把每个结论都稀释成“也许”。更有建设性的做法,是给结论配上清楚的范围、明确的依据,以及下一步可以检查的疑问。这样保留下来的不确定性,才有机会成为继续理解的起点。


