欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

写给工程师的基因组学入门:从细胞到DNA的深度解析

2026/7/6生物信息学

本文以工程师视角,用系统化的抽象和类比,深入浅出地介绍了真核生物细胞、染色体、基因组、DNA结构与基因表达的核心概念,为理解癌症基因组学奠定基础。


写在前面:为什么工程师需要理解基因组学?

在人工智能和大数据席卷生物医学的今天,基因组学已经成为数据密集型科学的典型代表。一个人类基因组的原始数据量约为100-200GB,而全球基因组数据总量预计在2025年将达到数十EB。处理这些数据需要高效的算法、分布式存储、并行计算以及机器学习模型。然而,大多数工程师缺乏分子生物学的背景知识。本文正是为计算机科学家和工程师量身定制的基因组学导论,旨在用我们熟悉的抽象思维和系统建模方式,拆解生命最底层的“源代码”。

免责声明:癌症基因组学背后的生物学极其复杂,需要多年专业研究。本文采用“粗线条”方式呈现核心概念,目的是让你快速入门。所有内容仅限科研讨论,不可用于临床决策。如有错误,欢迎在GitHub仓库提交Issue。

适用范围:本文聚焦于真核生物(eukaryotes)的分子生物学。真核生物的特点是DNA被包裹在细胞核内,包括人类、动物、植物、真菌等。细菌等原核生物的DNA则散布在细胞质中,不在本文讨论范围内。


1. 细胞、基因组与生命的最小单元

1.1 细胞:生命的“计算机硬件”

细胞是生命的最小单位。从单细胞的细菌到人体中数万亿个细胞,所有生物都由细胞构成。细胞是高度组织化的结构,它们分化出多种形态,形成组织、器官,最终完成人体的各种功能。

对于工程师而言,可以把细胞想象成一个专用计算机:它有自己的“硬件”(细胞器、膜结构)、 “能源系统”(线粒体)、 “物流网络”(内质网和高尔基体),以及最重要的——“指令集”(基因组)。

1.2 基因组:生命的“完整指令集”

几乎每个细胞内都包含一个基因组(genome)。基因组是用于产生、运行和维护一个活细胞或生物体的完整遗传指令集。这些信息物理上编码在一种名为脱氧核糖核酸(DNA)的分子中。

DNA中包含了组装数万种不同分子产品的指令。这些指令(或配方)被称为基因(genes),而基因编码的物理分子产品被称为蛋白质(proteins)。

细胞在不停地读取和解释DNA中存储的基因,以组装各种蛋白质。每种细胞类型都会产生一个复杂的蛋白质生态系统,维持细胞的存活并执行其特定功能。


2. 面包店类比:理解基因与蛋白质的关系

为了帮助工程师直观理解细胞、基因和蛋白质的关系,这里引入一个面包店类比:

  • 细胞 = 一家面包店
  • 基因组(存储在DNA中) = 一本大师级食谱书,包含超过20,000种不同的蛋糕配方(即基因)
  • 蛋白质 = 根据配方制作出来的物理蛋糕

关键点:

  • 每个配方(基因)在正常人体细胞中通常只有两份拷贝(分别来自父亲和母亲)
  • 但从一个配方可以制作成千上万个物理蛋糕(蛋白质)
  • 不同种类的细胞(如神经细胞、肌肉细胞)相当于不同风味的蛋糕店,它们从同一本食谱书中选取不同的配方,以不同的比例和组合方式生产蛋白质,从而形成各自的功能特性

这个类比将在后续文章中反复使用,建议牢记。


3. DNA的抽象模型:一个3GB的字符串

3.1 概念模型

从概念上讲,可以将DNA首尾相连视为一个约30亿字符长的字符串,且字符串仅由四个字母组成:'A'、'C'、'T'、'G'。这个字符串及其任意子串通常被称为基因组序列(genomic sequences)。

这些字符分别代表四种物理碱基(或核苷酸):

  • A = 腺嘌呤(Adenine)
  • C = 胞嘧啶(Cytosine)
  • T = 胸腺嘧啶(Thymine)
  • G = 鸟嘌呤(Guanine)

3.2 双链结构与碱基配对

虽然将DNA视为一个很长的字符串很方便,但实际情况更复杂。DNA由两条互补的序列(称为链)组成。每个碱基实际上是一个碱基对(base pair)的成员。碱基之间遵循严格的互补配对规则:

  • A 只与 T 配对
  • G 只与 C 配对

近距离观察,这种结构就像一座螺旋楼梯(即著名的双螺旋结构)。当细胞分裂时,螺旋解开,每个碱基对分裂,分子被分成两条单链,每条单链都包含复制原始DNA结构所需的信息。正常健康的细胞在复制遗传密码时非常精确,很少引入变异。

3.3 对工程师的启示

  • 数据规模:人类基因组约3×10^9碱基对。如果每个碱基用2比特存储(A/C/T/G四种状态),原始数据约750MB。但实际测序数据(FASTQ格式)包含质量分数,通常达到几十GB。
  • 比对算法:将测序得到的短读段(reads)比对回参考基因组,本质上是字符串匹配问题,但需要容忍错配和插入缺失(indel)。BWA、Bowtie等工具使用了BWT(Burrows-Wheeler Transform)等经典算法。
  • 变异检测:寻找个体与参考基因组的差异,类似于版本控制中的diff操作。

4. 物理结构:染色体与组蛋白

4.1 染色体:DNA的“数据分片”

在植物和动物细胞中,DNA被分割成若干大段序列,称为染色体(chromosomes),它们被折叠塞进细胞核中。

染色体通常成对出现(一条来自父亲,一条来自母亲),并缠绕在称为组蛋白(histones)的蛋白质周围。组蛋白的作用:

  • 将DNA字符串紧密包装,使其能在微小的细胞核中容纳
  • 帮助控制特定细胞中哪些基因产物被制造(即基因表达调控)

4.2 人类染色体数目

对于人类,正常情况下有:

  • 22对常染色体(autosomes,两性共享),编号1到22,按大小从大到小排列
  • 1对性染色体(sex chromosomes):女性为XX,男性为XY
  • 总计23对染色体(46条)

所有染色体的完整集合构成基因组。

4.3 数据结构的视角

从数据结构的角度看:

  • 基因组 = 一个由23个“文件”(染色体)组成的数据库
  • 每个文件是一个线性字符串
  • 字符串被“压缩”并“分片”存储在组蛋白上
  • 不同细胞类型通过“索引”(表观遗传标记)来访问不同的“记录”(基因)

5. 总结:基因组——生物学的搜索空间

基因组是一个巨大的搜索空间,用于回答生物学问题。每个基因组都是一个生物化学数据库,如果正确访问,它可以揭示人体如何运作。

基因组的作用:

  • 解释个体间的自然差异
  • 定义家族特征
  • 区分不同组织器官中细胞的功能差异

当基因组获得有害突变时,就会发生癌症及其他遗传疾病。通过研究物理性状(如血压、肿瘤发展)与基因组之间的关系——即基因型-表型关联(genotype-phenotype relationships)——临床医生可以根据个体的基因组成制定个性化的医疗方案。


延伸思考:工程师在基因组学中的机会

  1. 压缩算法:基因组数据量大,需要高效的压缩算法(如CRAM格式)。
  2. 并行计算:比对、组装、变异检测等任务天然可并行化,适合GPU和分布式框架。
  3. 机器学习:从海量基因组数据中识别致病突变、预测蛋白质结构(如AlphaFold)。
  4. 数据库设计:基因组变异数据库(如gnomAD)需要支持高效的区间查询和变异检索。
  5. 可视化:基因组浏览器(如IGV)需要处理百万级数据点的实时渲染。

基因组学是下一个计算密集型领域,理解底层生物学是设计优秀工具的前提。


原文链接:https://learngenomics.dev/docs/biological-foundations/cells-genomes-dna-chromosomes/

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消