“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
从LLM到JEPA,中国团队正在把“世界模型”搬进细胞内部
四年前LeCun提出JEPA的时候,估计他自己也没想到,这套架构有一天会被用来理解一颗细胞。
最近AI虚拟细胞(AIVC)这个赛道,终于有了一个让我觉得真正“破局”的进展。百曜科技——全球最早布局这个领域的企业之一——发布了全球首个基于LLM-JEPA架构的AI虚拟细胞世界模型,叫AURA CellOS。这玩意儿是目前公开报道里参数规模最大的单细胞基础模型,基于3.905亿个人类单细胞转录组数据训练,覆盖了40多种人体组织、260多种细胞类型,基本上把你我身上能想到的细胞种类都囊括了。
最让我兴奋的点是,它第一次把JEPA(联合嵌入预测架构)和“世界模型”的理念系统性地引进了单细胞研究。你可能知道,世界模型现在在自动驾驶、机器人、生成式AI这些领域已经是热得发烫的技术方向。但把它搬到生命科学里,而且是高度复杂的细胞层面,这事儿到底能不能落地?CellOS给了我们一个初步答案。
从目前公开的评测结果来看,它在预测精度、扰动建模这几个核心指标上,跟目前的主流模型拉开了倍数级的差距,直接干到了SOTA(当前国际领先水平)。但要说清楚它为什么牛,咱们得从一颗细胞说起。
AIVC走到了十字路口
理解细胞怎么变化,这基本上是生命科学最核心的问题了。疾病怎么发生的?药物怎么起作用的?细胞治疗到底在干嘛?本质上都是细胞状态在变化。过去,科学家只能靠养细胞、做动物实验、甚至人体验证,一点一点去试。这个成本有多高呢?新药研发有个著名的“双十定律”:十年研发周期、十亿美元投入,临床成功率还不到10%。这个“双十”魔咒,整个行业都想打破。
“虚拟细胞”这个概念,就是在这个背景下被寄予厚望的。其实早在90年代,就有学者开始尝试在计算机里“复刻”细胞,搞出了最早的细胞建模软件VCell。后来斯坦福还发布了全球首个全细胞计算模型。但以前的虚拟细胞,说白了就是个静态的模拟器,它不是学习型的,没法模拟细胞在不同条件和变化环境下的运作。你不能让它预测“如果我敲掉这个基因,细胞会怎样”,它做不到。所以它在药物开发里的价值就很有限。
直到最近几年,AI技术爆发,加上单细胞测序技术飞速进步、成本断崖式下降,才让虚拟细胞有了成为“生命科学模拟沙盘”的可能。单细胞测序的数据量,过去几年每6个月就翻一番,这为建模提供了海量的底层数据。AI这边,处理、学习和推理能力也上来了。
2024年12月,斯坦福、基因泰克(Genentech)和陈-扎克伯格基金会联合搞了个大新闻,在顶级期刊《Cell》上发了一篇重磅论文,直接宣告AI虚拟细胞(AIVC)时代正式到来。在那之前,其实已经有一些模型出来了,比如Geneformer、scGPT、scFoundation、GeneCompass这些,但业内还没统一叫AIVC。
但这些第一代AIVC模型,有个共同的硬伤:它们能解决细胞类型识别这种基础需求,可一旦涉及到预测细胞的动态变化,比如敲除某个基因、给药、或者诱导分化之后,细胞会怎么演化?它们就抓瞎了。
问题出在哪儿呢?核心在于它们的训练目标。它们主要是学习基因表达的模式本身,而不是细胞状态变化的内在机制。换句话说,它们很难区分哪些表达变化是真正的关键信号,哪些只是背景噪声。因为模型只从单一的表达视角看问题,学的都是静态的基因表达模式,基因调控关系、细胞状态演化的动态规律,它根本刻画不出来。很多只有在特定扰动条件下才会出现的生物学信号,很容易就被大量稳定表达的背景信号给淹没了。
所以,光靠堆数据、堆参数,并不能显著提升模型预测细胞状态演化轨迹的能力。2026年6月,《Nature Methods》上发的一项研究,结果挺扎心的:研究人员基于2220万个细胞的scTab语料库,预训练了400个模型,做了6400次评估。结果发现,在很多任务上,模型性能在用大约1%的预训练数据之后,就进入平台期了。也就是说,你喂大概22万个细胞,性能就基本拉满了,再喂更多同质化的细胞样本,效果几乎不涨。
这直接让行业开始反思:Scaling Law在AIVC领域是不是失效了?还是说,问题压根就不在数据规模上,而是第一代AIVC的建模范式本身就已经碰到天花板了?
CellOS给出的答案是后者。它认为,真正限制模型持续提升的,不是Scaling Law本身,而是传统语言模型架构跟细胞数据特性之间存在系统性的错配。只有让模型真正去学习细胞状态演化的规律,而不是死记硬背静态的表达模式,数据的扩展才能持续转化成模型能力的提升。
从“看懂”到“理解”细胞:CellOS的“三板斧”
李飞飞最近有篇长文,标题就很直接:“世界不是由文字构成的”。我觉得把这句话套在细胞领域也一样:细胞世界,更不是由文字定义的。
说到底,AIVC需要的是AI对细胞状态有真正的理解,而不是单纯的表达模式复现。只有这样的模型,才能支撑起动态预测(比如扰动响应)和可迁移的虚拟细胞能力。
从技术路线上看,CellOS这次的打法挺狠的。它没有走大多数团队还在走的“安全路线”——继续在大语言模型上卷参数、卷数据,而是直接押注了JEPA这条更难、但潜在天花板更高的路。因为AI领域有个共识:世界模型最擅长感知规律、推演环境动态变化。自动驾驶和机器人领域已经证明了这一点。现在,CellOS是第一个把世界模型理念引入AI虚拟细胞领域的“吃螃蟹者”。
而且它不只是概念,它是目前公开信息里规模最大的单细胞Foundation Model,12B参数,基于3.905亿个人类单细胞转录组数据训练。这个数据量基本覆盖了所有已知的人类细胞类型。
CellOS的核心创新可以总结为三点:多视角表征学习、JEPA联合嵌入预测、无损扩容。咱们一个一个拆开看。
创新一:多视角表征学习
这一步是为了让模型在进入更复杂的训练阶段之前,先获得更丰富、更敏锐的细胞特征辨别能力。
传统单细胞基础模型,通常只依赖单一的“表达视角”。什么意思呢?就是只看基因在单个细胞里的表达丰度,也就是这个基因活跃不活跃。但这种方式有个大问题:很多在生物学上具有重要标志意义的基因,比如调控基因、应激响应基因,它们的表达量可能并不高,很容易就被背景噪声给淹没了。
CellOS的解法是引入“双视角互补机制”。在传统的表达视角之外,增加一个“群体感知视角”。相当于给模型装了两双眼睛:一双看表达丰度,另一双看这个基因在整个细胞群体里有多特别、包含了多少信息量。
把这两个维度拆开,同时并行分析,模型就像突然开了“透视挂”,能更容易抓住那些隐藏的重要生物学信号。结果是,模型对细胞状态变化的敏感度大幅提升,这为第二层创新打下了坚实的基础。
创新二:引入JEPA架构
这一步是核心中的核心。在创新一(双视角)给模型提供了高质量的互补表征之后,CellOS引入了JEPA(联合嵌入预测架构)。它在隐空间里,利用这些互补表征进行跨视角预测和对齐。
传统模型的训练方式,本质上是在做“自回归”或“掩码重建”:给你一个细胞的基因表达数据,让你尽量把它“原样复述”出来。这就好比让学生死记硬背一篇课文,他可能背得一字不差,但根本不理解课文在讲什么。
CellOS引入JEPA,是彻底换了一种玩法。它不再让模型简单复述输入,而是让模型用“一种视角”去预测“另一种视角”看到的结果。简单说,就是逼着模型在脑子里建立一个“细胞状态的内在模型”,去抓住那些真正稳定的生物学规律。
举个例子,传统模型看的是“这个细胞现在长什么样”;JEPA则在学“如果从不同角度看这个细胞,它的状态本质是什么?如果发生变化,它会往哪个方向走?”这一招直接让模型的能力从“看懂表面”升级到“理解本质”。特别是在预测“敲除某个基因细胞会怎样”“加药物后细胞如何反应”这类动态问题上,效果提升非常明显。
创新三:无损扩容训练方案
模型越大越聪明,这是共识。但参数变多之后,有个很头疼的问题:它经常把以前学到的东西忘掉,业内管这叫“灾难性遗忘”。
CellOS在这一点上做了特别的设计——无损扩容机制。具体做法是:先好好训练一个“中小型”的稠密模型(Dense),把基础打牢;然后用一种平滑的方式,把它升级成超级大的MoE模型(混合专家模型)。在升级过程中,保留原来学到的核心知识,同时新增很多“专家”去学习更复杂的内容。这样一来,模型既能变得更大、更强,又不会把之前辛苦学会的细胞表达规律忘掉。
到这里你会发现,这三大创新不是各自为政,而是环环相扣的。双视角是基础,负责提供“好原料”;JEPA架构是核心,负责“深度思考”;无损扩容是保障,让模型变大后,性能“不掉链子”。
那模型搭好了,具体怎么训练呢?CellOS提出了一套非常务实的Dense-to-MoE三阶段训练策略。它没有把这些创新一股脑塞进一次训练,而是拆成三个循序渐进的阶段:
- 第一阶段(Dense):先用传统的“表达视角”,训练一个扎实的中小型稠密模型。这相当于先让模型学会基本功。
- 第二阶段(MoE):模型基础打好后,开始扩容,通过无损扩容机制,把模型平稳扩容到12B参数规模。这时候模型变大了,但核心知识没丢。
- 第三阶段(多视角联合训练):等模型长大后,再加入第二套“群体感知视角”,同时开启JEPA对齐训练。这时候模型才开始真正学习“理解”细胞。
这种分阶段训练的设计非常务实,既降低了训练风险,又让每一层创新都能在最合适的时机发挥最大作用。
在三层创新+三阶段训练的加持下,多基准测试的结果非常亮眼。在衡量细胞状态预测能力的核心指标Pearson_edist上,CellOS取得了0.619的成绩,不仅位列所有模型第一,也是唯一突破0.6的模型。相比目前表现最好的开源模型TranscriptFormer(0.373),拉开了66%的性能差距。另外,在细胞状态注释任务中,它在聚合注释基准上取得了0.792的生物学保守分数,全面超越了UCE、scGPT、TranscriptFormer这些主流单细胞基础模型。
CellOS不只是一个新的大模型,它代表的是一种研究范式的升级。它让AI从“看懂细胞表达”走向了“理解细胞状态”。而这种转变,也为虚拟细胞的实际应用奠定了基础。
全球竞速,AIVC迎来爆发前夜
过去两年,AIVC已经从概念验证进入了技术竞速阶段。一个标志性事件是2025年6月,知名研究机构Arc Institute发起了“虚拟细胞挑战赛”(Virtual Cell Challenge,简称VCC)。这个比赛有英伟达、10x Genomics这些大佬赞助,Cell期刊也鼎力支持。它被看作是细胞版的“图灵测试”,吸引了全球五百多支团队参赛,华人科学家团队强势霸榜。而预赛全球第一、决赛全能榜全球第二、国内第一的x.Compass团队,其核心成员正是本次发布CellOS的研发团队。
技术竞速之外,资本和产业界的较量更激烈。成立仅1年就单轮融资10亿美元的Xaira Therapeutics,创下了当年全球医疗健康领域最大的单笔融资纪录。Somite.ai、Noetik、Turbine这些生物科技公司也陆续拿到了知名机构的投资。大型制药巨头(Big Pharma)也纷纷向AIVC公司抛出业务合作的橄榄枝。
宏观层面,监管也在发生变化。美国FDA在持续推动New Approach Methodologies(NAMs),鼓励用计算模型、类器官、器官芯片等新方法补充甚至替代部分动物实验。欧洲、中国的监管机构也开始加强AI辅助药物研发相关的研究。国内已经把“细胞编程与调控”“先进组学研究”“生命工程设计软件工具”列为前沿攻关方向。
随着赛道升温,全球入局者快速增加,逐渐分化出三类核心玩家:
- 科研机构:以Arc Institute、同济大学为代表,主要推动算法创新和公开Benchmark建设,比如STATE、AlphaCell这些模型,为行业建立统一的评价体系和开放生态。
- 平台型创业公司:以Xaira、Noetik、Cellular Intelligence、Tahoe Therapeutics、百曜科技为代表。这类企业通常拥有专有数据、湿实验平台以及药企合作能力,目标是构建覆盖数据、模型和实验验证的完整研发平台。
- AI制药公司:以Recursion、Owkin、Isomorphic Labs为代表。它们更关注AI如何直接进入药物研发流程,通过长期合作、自研管线和平台授权来实现商业化。
要在这种喧闹中保持领先,就必须关注长期价值的复利,而不是短期热点的狂欢。观察那些获得较大融资和商业合作的平台公司,你会发现它们几乎都有一个共同特点:不仅拥有AI模型,更拥有能持续积累数据和验证模型的实验体系。行业对AIVC的期待已经不只是一个算法,而是希望它成为连接AI、生物数据、实验平台和药物研发的新型基础设施。大家开始关注:谁拥有持续产生高质量数据的能力?谁能形成“模型—实验—数据”持续迭代的闭环?谁真正进入了药物研发决策流程?这些能力,往往比单一模型性能更难建立,也更难复制。
值得关注的是,在这一轮AI虚拟细胞竞赛中,中国团队开始逐渐从“跟随者”转向“规则参与者”。过去几年,全球AI制药领域的重要创新主要集中于欧美。但随着国内单细胞组学、生物计算以及大模型技术的不断发展,一批中国原生AI生物科技公司开始强势进入这一赛道。比如CellOS背后的百曜科技,先发优势明显,已经搭建了覆盖单细胞数据处理、高通量扰动实验和AI模型训练的技术体系,构建了“数据—模型—实验”持续迭代的研发闭环。这一路线与海外头部平台公司不谋而合。据公开报道,百曜科技目前布局了管线资产和模型服务两大应用落地方向,前者延伸到细胞治疗、工程细胞,后者则涵盖靶点发现、虚拟药筛及虚拟临床全周期。
当然,尽管行业发展迅速,但AIVC还处于产业早期,仍然面临四大挑战:
- 高质量扰动数据仍然稀缺。跟互联网行业海量的文本数据不同,生命科学的数据获取成本极高,尤其是高质量的扰动数据(比如基因敲除、药物处理后的细胞响应数据)。
- 多模态融合仍有待突破。目前多数模型主要依赖单细胞转录组数据,但真实的生命活动同时涉及蛋白组、空间组学、代谢组、细胞形态等多个层面。把这些信息融合起来,是下一步的关键。
- 模型可解释性仍需提升。对于科研人员来说,一个预测结果是否正确固然重要,但更重要的是模型能否解释其背后的生物学机制,能否提出可验证的新假设。黑盒模型在生命科学领域很难被信任。
- 商业价值仍需持续验证。目前,大多数AI虚拟细胞企业仍以平台合作、联合研发或技术服务作为主要商业模式。未来,只有真正帮助药企大幅缩短研发周期、降低研发成本、提高临床成功率,AIVC才能成为新药研发不可或缺的基础设施。
对于整个生命科学产业而言,这场围绕AIVC商业化落地而展开的新竞赛,才刚刚开始。当所有人都在谈论世界模型的时候,或许,最值得建模的那个“世界”,就藏在人体内那36万亿个细胞里。