“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
写给工程师的基因组学入门:从细胞到DNA的深度解析
本文以工程师视角,用系统化的抽象和类比,深入浅出地介绍了真核生物细胞、染色体、基因组、DNA结构与基因表达的核心概念,为理解癌症基因组学奠定基础。
写在前面:为什么工程师需要理解基因组学?
在人工智能和大数据席卷生物医学的今天,基因组学已经成为数据密集型科学的典型代表。一个人类基因组的原始数据量约为100-200GB,而全球基因组数据总量预计在2025年将达到数十EB。处理这些数据需要高效的算法、分布式存储、并行计算以及机器学习模型。然而,大多数工程师缺乏分子生物学的背景知识。本文正是为计算机科学家和工程师量身定制的基因组学导论,旨在用我们熟悉的抽象思维和系统建模方式,拆解生命最底层的“源代码”。
免责声明:癌症基因组学背后的生物学极其复杂,需要多年专业研究。本文采用“粗线条”方式呈现核心概念,目的是让你快速入门。所有内容仅限科研讨论,不可用于临床决策。如有错误,欢迎在GitHub仓库提交Issue。
适用范围:本文聚焦于真核生物(eukaryotes)的分子生物学。真核生物的特点是DNA被包裹在细胞核内,包括人类、动物、植物、真菌等。细菌等原核生物的DNA则散布在细胞质中,不在本文讨论范围内。
1. 细胞、基因组与生命的最小单元
1.1 细胞:生命的“计算机硬件”
细胞是生命的最小单位。从单细胞的细菌到人体中数万亿个细胞,所有生物都由细胞构成。细胞是高度组织化的结构,它们分化出多种形态,形成组织、器官,最终完成人体的各种功能。
对于工程师而言,可以把细胞想象成一个专用计算机:它有自己的“硬件”(细胞器、膜结构)、 “能源系统”(线粒体)、 “物流网络”(内质网和高尔基体),以及最重要的——“指令集”(基因组)。
1.2 基因组:生命的“完整指令集”
几乎每个细胞内都包含一个基因组(genome)。基因组是用于产生、运行和维护一个活细胞或生物体的完整遗传指令集。这些信息物理上编码在一种名为脱氧核糖核酸(DNA)的分子中。
DNA中包含了组装数万种不同分子产品的指令。这些指令(或配方)被称为基因(genes),而基因编码的物理分子产品被称为蛋白质(proteins)。
细胞在不停地读取和解释DNA中存储的基因,以组装各种蛋白质。每种细胞类型都会产生一个复杂的蛋白质生态系统,维持细胞的存活并执行其特定功能。
2. 面包店类比:理解基因与蛋白质的关系
为了帮助工程师直观理解细胞、基因和蛋白质的关系,这里引入一个面包店类比:
- 细胞 = 一家面包店
- 基因组(存储在DNA中) = 一本大师级食谱书,包含超过20,000种不同的蛋糕配方(即基因)
- 蛋白质 = 根据配方制作出来的物理蛋糕
关键点:
- 每个配方(基因)在正常人体细胞中通常只有两份拷贝(分别来自父亲和母亲)
- 但从一个配方可以制作成千上万个物理蛋糕(蛋白质)
- 不同种类的细胞(如神经细胞、肌肉细胞)相当于不同风味的蛋糕店,它们从同一本食谱书中选取不同的配方,以不同的比例和组合方式生产蛋白质,从而形成各自的功能特性
这个类比将在后续文章中反复使用,建议牢记。
3. DNA的抽象模型:一个3GB的字符串
3.1 概念模型
从概念上讲,可以将DNA首尾相连视为一个约30亿字符长的字符串,且字符串仅由四个字母组成:'A'、'C'、'T'、'G'。这个字符串及其任意子串通常被称为基因组序列(genomic sequences)。
这些字符分别代表四种物理碱基(或核苷酸):
- A = 腺嘌呤(Adenine)
- C = 胞嘧啶(Cytosine)
- T = 胸腺嘧啶(Thymine)
- G = 鸟嘌呤(Guanine)
3.2 双链结构与碱基配对
虽然将DNA视为一个很长的字符串很方便,但实际情况更复杂。DNA由两条互补的序列(称为链)组成。每个碱基实际上是一个碱基对(base pair)的成员。碱基之间遵循严格的互补配对规则:
- A 只与 T 配对
- G 只与 C 配对
近距离观察,这种结构就像一座螺旋楼梯(即著名的双螺旋结构)。当细胞分裂时,螺旋解开,每个碱基对分裂,分子被分成两条单链,每条单链都包含复制原始DNA结构所需的信息。正常健康的细胞在复制遗传密码时非常精确,很少引入变异。
3.3 对工程师的启示
- 数据规模:人类基因组约3×10^9碱基对。如果每个碱基用2比特存储(A/C/T/G四种状态),原始数据约750MB。但实际测序数据(FASTQ格式)包含质量分数,通常达到几十GB。
- 比对算法:将测序得到的短读段(reads)比对回参考基因组,本质上是字符串匹配问题,但需要容忍错配和插入缺失(indel)。BWA、Bowtie等工具使用了BWT(Burrows-Wheeler Transform)等经典算法。
- 变异检测:寻找个体与参考基因组的差异,类似于版本控制中的diff操作。
4. 物理结构:染色体与组蛋白
4.1 染色体:DNA的“数据分片”
在植物和动物细胞中,DNA被分割成若干大段序列,称为染色体(chromosomes),它们被折叠塞进细胞核中。
染色体通常成对出现(一条来自父亲,一条来自母亲),并缠绕在称为组蛋白(histones)的蛋白质周围。组蛋白的作用:
- 将DNA字符串紧密包装,使其能在微小的细胞核中容纳
- 帮助控制特定细胞中哪些基因产物被制造(即基因表达调控)
4.2 人类染色体数目
对于人类,正常情况下有:
- 22对常染色体(autosomes,两性共享),编号1到22,按大小从大到小排列
- 1对性染色体(sex chromosomes):女性为XX,男性为XY
- 总计23对染色体(46条)
所有染色体的完整集合构成基因组。
4.3 数据结构的视角
从数据结构的角度看:
- 基因组 = 一个由23个“文件”(染色体)组成的数据库
- 每个文件是一个线性字符串
- 字符串被“压缩”并“分片”存储在组蛋白上
- 不同细胞类型通过“索引”(表观遗传标记)来访问不同的“记录”(基因)
5. 总结:基因组——生物学的搜索空间
基因组是一个巨大的搜索空间,用于回答生物学问题。每个基因组都是一个生物化学数据库,如果正确访问,它可以揭示人体如何运作。
基因组的作用:
- 解释个体间的自然差异
- 定义家族特征
- 区分不同组织器官中细胞的功能差异
当基因组获得有害突变时,就会发生癌症及其他遗传疾病。通过研究物理性状(如血压、肿瘤发展)与基因组之间的关系——即基因型-表型关联(genotype-phenotype relationships)——临床医生可以根据个体的基因组成制定个性化的医疗方案。
延伸思考:工程师在基因组学中的机会
- 压缩算法:基因组数据量大,需要高效的压缩算法(如CRAM格式)。
- 并行计算:比对、组装、变异检测等任务天然可并行化,适合GPU和分布式框架。
- 机器学习:从海量基因组数据中识别致病突变、预测蛋白质结构(如AlphaFold)。
- 数据库设计:基因组变异数据库(如gnomAD)需要支持高效的区间查询和变异检索。
- 可视化:基因组浏览器(如IGV)需要处理百万级数据点的实时渲染。
基因组学是下一个计算密集型领域,理解底层生物学是设计优秀工具的前提。
原文链接:https://learngenomics.dev/docs/biological-foundations/cells-genomes-dna-chromosomes/