Private observatory · public notes
PERRYResearch Galaxy
Biology · Computation · Curiosity
在生命、计算与未知之间持续探索。
Observe · Think · Build
01 / EXPLORE
Explore the Galaxy
这里记录生信、深度学习与日常思考。沿着主题找到想读的下一篇。
CURATED / START HERE
A reading compass
编辑精选的基础文章。与按发表时间排列的最新文章分开,随时从这里开始。
02 / LATEST NOTES
Latest Notes
论文阅读、方法分享、编程经验与日常思考,按时间缓慢积累。
有了差异表达表,分析还没有结束。下一步不是立刻从 GO 结果里找一句最符合预期的话,而是回头确认样本、模型和候选是否值得解释,再把统计结果放回原来的生物学问题中。
本篇继续使用上一章的公开 airway 计数数据及保存的 airway_bundle.rds,只演示 bulk RNA-seq 的样本检查与功能分析。它不是单细胞教程,也不提供针对个人的医疗解释。下面代码是供读者运行的学习脚本,本机没有执行,因此文中没有虚构的 PCA 分离效果、富集通路名单或显著性数值。
1. QC 应在检验前做,结果出来后还要复核这篇把画图安排在统计学习练习之后,是为了复用上一章保存的对象,不意味着正式项目应先差 ...
上一篇把 FASTQ 处理到来源明确的计数或定量结果。这一篇往前走一步:如何从一个计数矩阵得到“比较了谁、考虑了什么因素、结果有多不确定”都能够说清楚的差异表达表?
本文只讨论 bulk RNA-seq,不是单细胞分析。本篇练习使用 Bioconductor airway 包附带的公开计数对象,不需要先下载原始 FASTQ。它包含四个气道平滑肌细胞来源的处理与未处理样本,适合演示配对关系。数据背景来自 airway 官方说明。这里学习统计流程,不将演示结果当成新的实验发现或医疗建议。
代码按 2026-10-06 核验的官方 API 组织,DESeq2 官方教程标注的包版本为 1.52.0。读 ...
RNA-seq 分析的起点不是某条比对命令,而是一句话:我想比较什么样的生物学对象,比较能够排除哪些其他解释?先把这句话说清楚,后面的文件、模型与图才会围绕同一个问题组织起来。
这是三篇连续教程的第一篇,讨论常规 bulk RNA-seq:每个文库代表一个组织、细胞群体或其他整体样本。它不是单细胞教程,不能直接套到带有细胞条形码和 UMI 的单细胞矩阵上。本文中的六样本设计是原创的假设练习;命令只是准备好真实数据之后的执行模板,写作过程中没有在本机下载 FASTQ、安装软件或运行测序流程。
读完这一篇,应该能交付样本表、参考文件清单、处理参数、质控记录,以及来源明确的计数或定量结果。下一篇再用 ...
上一章得到峰集合,并不意味着差异分析已经完成。“对照没有叫到峰,处理叫到了峰”是峰识别结果的比较;“在考虑深度、批次与重复变异后,这个区域的信号是否有统计支持的变化”才是差异可及性的问题。前者可能由测序深度或阈值差异造成,不能代替后者。
本文继续讨论 bulk paired-end ATAC-seq,沿用两组各三个独立生物学重复、非配对的学习设计。唯一可以直接运行的小练习使用人工数据,只检查结构和计数约定;真实 BAM 计数及 DESeq2 部分是资料准备完成后的模板,本文没有运行真实测序分析,不提供杜撰的差异区域数量、p 值或图。
一、先过 QC 门,再问差异统计软件不会因为样本被错标、 ...
本篇继续讨论 bulk paired-end ATAC-seq,不覆盖 scATAC-seq。示例命令是教学模板,没有在本站执行测序分析,也没有真实实验结果。先完成实验设计与质控口径中的输入核对,再考虑运行流程。
这一篇的目标,不是记住一长串命令,而是让每个输出都能回答三个问题:它由什么输入产生,经过哪些转换,下一步允许拿它做什么。
一、把流程画成数据转换双端 FASTQ 保存两端读段;比对后的 BAM 保存读段与参考坐标的关系;过滤后的 BAM 决定后续使用哪些有效信息;峰文件描述信号富集的区域;bigWig 用于浏览连续信号;统一区域计数表才是差异分析的输入候选。它们不是同一种数据的不 ...
这是一份面向 bulk、双端测序(paired-end)ATAC-seq 的学习教程,不适用于把单细胞 ATAC-seq 按同一流程直接处理。文中的样本名称和问题场景均为教学假设,不代表本站作者完成过相应实验,也没有真实样本的分析结果。
本系列采用已核验的 nf-core/atacseq 2.1.2 作为流程学习入口。第一篇不急着运行峰识别,而是回答一个更早的问题:手里的数据,是否真的能够支持想做的比较?
一、先把“开放”说准确ATAC-seq 利用转座酶对相对可及的染色质区域进行标记,随后从测序片段的分布观察染色质可及性。它提供的是一类测量信号,不是所有调控结论的直接答案。原始方法论文是 ...
生信分析中的困扰不总是“软件不会用”。几周后重新打开项目,可能已经记不清哪张表是输入、哪次运行修改了参数、某个样本为什么被排除。目录结构不能替代方法学,但能为查清这些问题提供基础。
这篇只搭建一个教学项目骨架,用六个虚构样本和三行人工计数练习元数据检查与日志记录。不下载真实 FASTQ,不调用比对或差异分析软件,不生成任何可用于解释真实生物学问题的结论。
1. 将来源、决定和结果分开建议把原始输入、样本信息、配置、脚本、结果与日志分别保存。目录名字本身没有统一标准,关键是每一层职责清楚,其他人可以看懂。
123456789project/ inputs/raw/ 真实输入的存放 ...
一个模型获得很高的测试分数,不一定说明它学会了希望学习的规律。它也可能认出了同一个人的重复记录,利用了未来信息,或者通过预处理提前看到了测试集。
在生物数据中,“一行”经常不是一个独立个体。一个人可以贡献多个时间点,一个供体可以贡献很多细胞,一个样本可以拆成许多片段。划分数据前,需要先回答:以后模型面对的新对象是什么?
这里选择的任务是泛化到未见过的个体,所以按照个体 ID 分组。示例全部使用人工生成的数字,不涉及真实受试者,不给出任何疾病预测结论;模型分数只用于检查程序能否运行。
1. 从评价对象倒推划分单位如果未来要预测新供体,同一供体的记录不应同时出现在训练集和测试集。如果要评估未来时间 ...
一个好脚本不只是“这次运行成功”。它还应该告诉我们:处理了什么输入、在哪里写了结果、遇到异常是否停下,以及第二次运行会不会覆盖第一次的文件。
这篇从一个非常小的计数任务开始。脚本只在自己刚创建的临时目录里生成三行教学数据,不读取真实测序文件,不移动用户文件,也不自动删除任何目录。先建立这样的安全边界,再把思路迁移到正式工作流。
1. 先约定脚本的职责我们的任务是读取两列教学 TSV:第一列样本名,第二列非负整数。结果包括有效样本数和计数之和。
输入范围有意很窄:样本名只能包含英文字母、数字、下划线或短横线;计数是十进制整数;两列都不能为空。它不是通用 CSV 解析器,也不是对真实表达矩阵进行生 ...
这是一篇供讨论的思考札记。所有案例均为假设情境,不是实际研究结果;内容讨论通用的证据阅读方法,不提供医疗判断或建议。
读论文时,一个困难并不是完全看不懂,而是看懂之后太快形成了一个更强的结论。图里出现了两组差异,就觉得机制已经被证明;模型给出较高的预测分数,就觉得它解释了原因;某项检验没有达到阈值,又把它概括为“没有作用”。
也许更有帮助的阅读习惯,是暂时把结论放慢半步:先说清看到了什么,再问这些观察最多能够支持什么。
观察、推断和解释,不要写在同一格里假设一篇文章比较了两个条件下某个测量指标。图上可以直接读到的,是测得数值的分布、差异和不确定性。把它写成“在这些样本与测量条件下,观察到这样的 ...
03 / TOPICS
Knowledge Constellations
一张只指向公开内容的星图:生命、计算、阅读、方法与好奇心。
01
Open the topic index ↗
Biology
生命科学知识、公开论文与通用概念
↗ 02Computation
Python · R · Linux · Data
↗ 03Artificial Intelligence
模型、工具与学习过程中的思考
↗ 04Papers
论文阅读、证据链与写作笔记
↗ 05Methods
公开、通用、可复现的方法与教程
↗ 06Notes & Life
学习记录、科研生活与日常思考
↗04 / ABOUT PERRY
Somewhere between biology and computation.
一个喜欢生命科学、计算、人工智能与探索未知的研究者。这里记录学习、技术与思考。
About Perry ↗




