技术
细胞世界模型
一个能理解、预测、设计任意细胞行为的计算系统。它需要同时表征细胞的物质流与信息流,并且给出的答案要能在湿实验里验证。
两条流,两种算法
物质流是「DNA → RNA → 蛋白 → 代谢物 / 通量」。给定基因组,基因组尺度代谢模型即可重构化学计量网络,直接推演代谢通量的分布。这条链路守恒、定量、可验证,属于机理驱动。
信息流是转录因子、非编码 RNA、蛋白互作与反馈。它不携带质量,只决定速率与丰度,难以从头推导,需要从大规模多组学数据中学习,属于数据驱动。
现有的虚拟细胞路线大多只做后者,用 RNA 表达预测另一个 RNA 表达向量,跨不过功能因果这一层。我们的判断是:机理模型必须作为底座。
下图是细胞调控网络的完整视图。绿色是可用机理重构的物质流,金色是只能从数据中学习的信息流。两者共同决定细胞在做什么。
UCE × GEM
两套模型,在蛋白层汇合
数据驱动的模型从表达数据学习细胞表征,机理驱动的模型用化学计量计算细胞功能。蛋白既是两者的共同语言,也是天然的融合接口。
细胞表征
- 输入
- RNA 表达 + 蛋白序列
- 方法
- 大模型学习高维嵌入
- 输出
- 细胞「像什么」
- 强项
- 跨物种泛化与相似性发现
功能计算
- 输入
- 基因组 + 蛋白 / 酶约束
- 方法
- 化学计量与因果求解
- 输出
- 细胞「在做什么」
- 强项
- 因果、定量与可验证
表征(细胞像什么) × 功能(细胞在做什么) → 因果动力学(干预后怎样) = 细胞世界模型
解空间收敛
用实测蛋白组,
把解空间收敛到一张低维流形
GEM:高维、巨大、不唯一
满足化学计量与热力学约束的所有代谢流,构成一个高维且巨大的可行解空间。真实细胞只是其中一个点,无法唯一确定。
ecGEM:收敛到低维流形
以实测蛋白组作为酶容量约束,解空间被收敛到一张低维流形。真实状态,就是流形上最可能的那一点。
模型覆盖
从工业微生物到人体细胞
物种不同,枝桠不同,建模语法相同。以下是目前已建成的四类物种模型。
| 物种 | 学名 | 模型 | 基因 | 反应 | 代谢物 | 定位 |
|---|---|---|---|---|---|---|
大肠杆菌 | Escherichia coli | GEM · ecGEM(iML1515) | 1,515 | 2,719 | 1,877 | 工业菌株 · 经典基准 |
酿酒酵母 | S. cerevisiae | Yeast-GEM · ecYeast · pcSecYeast | 1,639 | ~4,060 | ~2,740 | 细胞工厂 · pcSec 旗舰 |
中国仓鼠卵巢细胞 | CHO cell | iCHO · ecCHO · pcSecCHO | 1,788 | 55,404 | 35,982 | 生物药 · 主力生产载体 |
人体细胞 | Homo sapiens | Human-GEM(Human1) | 2,887 | 12,971 | 8,455 | 疾病 / 药物研究基座 |
pcSecYeast 与 pcSecCHO 把约 5.5 万个蛋白与代谢物纳入同一网络,精细到单个酶与分泌通路。Human-GEM 是目前全球引用最多的人体细胞代谢模型。
数据战略
在可深度扰动的物种上学习,
迁移到人体细胞
人体细胞受伦理、成本与实验条件限制,只能观察、难以验证。工业微生物与哺乳动物细胞则可以做基因深度编辑、环境深度改变与多组学完整读出。
守恒关系、酶约束与资源分配在物种之间是保守的,构成可迁移的骨架。我们在可编程的物种上学到真实因果,再迁移到人体细胞。
训练域
在原核细菌、真核微生物与 CHO 上做更深、更广、可重复的闭环实验:敲除、插入、通路重写与组合编辑;营养、氧气、pH、压力与工艺条件的深度改变。
因果对齐
物质流按「蛋白 / 酶 → 代谢 → 通量 → 表型」跨物种对齐,信息流用多物种深度扰动学习调控与信号规律,形成共享的细胞因果表示。
迁移目标
把跨物种学到的因果先验带入人体细胞,补上样本稀缺、扰动受限的缺口,支撑靶点、药效与安全性的虚拟实验。

艾比欧义
大肠杆菌
酿酒酵母
中国仓鼠卵巢细胞
人体细胞