技术

细胞世界模型

一个能理解、预测、设计任意细胞行为的计算系统。它需要同时表征细胞的物质流与信息流,并且给出的答案要能在湿实验里验证。

两条流,两种算法

物质流是「DNA → RNA → 蛋白 → 代谢物 / 通量」。给定基因组,基因组尺度代谢模型即可重构化学计量网络,直接推演代谢通量的分布。这条链路守恒、定量、可验证,属于机理驱动。

信息流是转录因子、非编码 RNA、蛋白互作与反馈。它不携带质量,只决定速率与丰度,难以从头推导,需要从大规模多组学数据中学习,属于数据驱动。

现有的虚拟细胞路线大多只做后者,用 RNA 表达预测另一个 RNA 表达向量,跨不过功能因果这一层。我们的判断是:机理模型必须作为底座。

下图是细胞调控网络的完整视图。绿色是可用机理重构的物质流,金色是只能从数据中学习的信息流。两者共同决定细胞在做什么。

细胞调控网络:物质流与信息流 细胞调控网络:物质流与信息流

UCE × GEM

两套模型,在蛋白层汇合

数据驱动的模型从表达数据学习细胞表征,机理驱动的模型用化学计量计算细胞功能。蛋白既是两者的共同语言,也是天然的融合接口。

UCE · 数据驱动

细胞表征

Universal Cell Embedding
输入
RNA 表达 + 蛋白序列
方法
大模型学习高维嵌入
输出
细胞「像什么」
强项
跨物种泛化与相似性发现
共同语言
蛋白
PROTEIN
GEM · 机理驱动

功能计算

GEM / ecGEM / pcSec
输入
基因组 + 蛋白 / 酶约束
方法
化学计量与因果求解
输出
细胞「在做什么」
强项
因果、定量与可验证

表征(细胞像什么) × 功能(细胞在做什么) → 因果动力学(干预后怎样) = 细胞世界模型

解空间收敛

用实测蛋白组,
把解空间收敛到一张低维流形

GEM 可行解空间 GEM 可行解空间

GEM:高维、巨大、不唯一

满足化学计量与热力学约束的所有代谢流,构成一个高维且巨大的可行解空间。真实细胞只是其中一个点,无法唯一确定。

ecGEM 收敛到低维流形 ecGEM 收敛到低维流形

ecGEM:收敛到低维流形

以实测蛋白组作为酶容量约束,解空间被收敛到一张低维流形。真实状态,就是流形上最可能的那一点。

模型覆盖

从工业微生物到人体细胞

物种不同,枝桠不同,建模语法相同。以下是目前已建成的四类物种模型。

物种学名模型基因反应代谢物定位
大肠杆菌Escherichia coliGEM · ecGEM(iML1515) 1,5152,7191,877工业菌株 · 经典基准
酿酒酵母S. cerevisiaeYeast-GEM · ecYeast · pcSecYeast 1,639~4,060~2,740细胞工厂 · pcSec 旗舰
中国仓鼠卵巢细胞CHO celliCHO · ecCHO · pcSecCHO 1,78855,40435,982生物药 · 主力生产载体
人体细胞Homo sapiensHuman-GEM(Human1) 2,88712,9718,455疾病 / 药物研究基座

pcSecYeast 与 pcSecCHO 把约 5.5 万个蛋白与代谢物纳入同一网络,精细到单个酶与分泌通路。Human-GEM 是目前全球引用最多的人体细胞代谢模型。

数据战略

在可深度扰动的物种上学习,
迁移到人体细胞

人体细胞受伦理、成本与实验条件限制,只能观察、难以验证。工业微生物与哺乳动物细胞则可以做基因深度编辑、环境深度改变与多组学完整读出。

守恒关系、酶约束与资源分配在物种之间是保守的,构成可迁移的骨架。我们在可编程的物种上学到真实因果,再迁移到人体细胞。

01

训练域

在原核细菌、真核微生物与 CHO 上做更深、更广、可重复的闭环实验:敲除、插入、通路重写与组合编辑;营养、氧气、pH、压力与工艺条件的深度改变。

TRAIN
02

因果对齐

物质流按「蛋白 / 酶 → 代谢 → 通量 → 表型」跨物种对齐,信息流用多物种深度扰动学习调控与信号规律,形成共享的细胞因果表示。

ALIGN
03

迁移目标

把跨物种学到的因果先验带入人体细胞,补上样本稀缺、扰动受限的缺口,支撑靶点、药效与安全性的虚拟实验。

TRANSFER

想看模型在你的场景里能算到什么程度?

我们可以基于你的体系做一次可行性评估。