中国版「生物DeepSeek」诞生:GeneLLM多组学大模型技术解析

https://www.vava8.com/index.php?app=index&act=view&id=122462

核心突破

由4位牛津大学归国博士创办的津渡生科,自主研发了生命科学垂类大模型 GeneLLM。该模型是全球首个直接基于组学原始数据进行预训练的多组学大模型,相关成果已发表于《Nature Communications》与《Advanced Science》,被视为继AlphaFold(结构预测)和EVO2(基因组理解)之后,向生命”系统级”理解迈进的关键一步。

技术架构与训练范式

Token化策略: GeneLLM将约150bp长度的RNA测序片段,通过7碱基滑动窗口(7-mer)切分为”生命Token”,以RNA四种碱基(A/U/G/C)作为基本语义单元,构建生命语言的离散表示。

无监督预训练: 模型采用Transformer架构,在无基因注释、无人工标签的条件下,直接对原始测序数据执行下一碱基预测(Next-Base Prediction)。训练过程处理了约数十万亿条RNA reads,在百卡NVIDIA A100集群上完成,使模型摆脱对已知基因注释的依赖,从原始信号中自主发现潜在生物模式。

两阶段训练流程:

  1. 无监督预训练与原型挖掘——从海量原始组学数据中学习通用生命表征;
  2. 患者级疾病微调(Disease Tuning)——面向具体疾病任务进行下游适配。

模型规模: 基础版已完成15亿参数、3.5万亿碱基序列预训练;XLarge版本扩展至300亿参数,持续扩大技术壁垒。

多组学覆盖: 训练数据涵盖RNA组、蛋白质组、代谢组等多组学原始数据,具备跨模态生命信息的联合理解能力。

推理效率: 传统方法依赖6Gb深度测序,GeneLLM在1Gb极浅深度测序下仍保持AUC > 0.8,测序成本降低约83%,为大规模临床筛查与普惠精准医疗提供工程可行性。

BioFord物理AI科研平台:从模型到闭环

以GeneLLM为认知底座,津渡生科构建了连接AI与物理实验的完整AI for Science闭环:

认知层——五大智能体协同网络: 文献检索智能体(自动文献综述与假设生成)、实验设计智能体(将实验设计周期从数月压缩至一周)、科学智能体(推理与假设验证)、实验调度智能体(基于通用仪器抽象层统一纳管PCR仪、酶标仪、流式细胞仪、自动化移液工作站等异构设备,内置动态调度算法实现自动排程与冲突规避)、数据分析智能体(结果解读与模型反馈)。

执行层——BioFord Harness: 将实验室转化为可编译、可调度、可观测、可追溯的工程系统,完成三项关键任务:将科学意图或实验DSL编译为跨设备可执行指令;在多设备间完成调度、资源约束管理与异常处理;将实验结果、设备日志和环境参数回流至模型,驱动下一轮迭代。

数据闭环——DBTL循环: 通过Design-Build-Test-Learn闭环,每一次实验(包括失败实验)的参数逻辑、环境记录与错误路径均沉淀为训练数据,形成持续进化的科研数据飞轮。

全球主要路线对比

公司/平台 路线 核心能力 当前阶段
FutureHouse AI科学大脑 文献理解、科学推理 数字科研Agent
DeepMind 基础科学模型 生物结构预测 科学基础模型
Insilico Medicine AI药物研发 靶点发现、分子设计 AI制药平台
XtalPi晶泰科技 AI+机器人实验 自动化药物研发 实验闭环
Lila Sciences AI Science Factory 自动化科学工厂 重资产实验室
Recursion 生物数据工业化 大规模细胞实验 数据驱动研发
Isomorphic Labs AI药物设计 AlphaFold路线延伸 分子发现
津渡生科 生命大模型+科研Agent AI理解生命+执行实验 全栈AI科研OS

在这一格局中,津渡生科选择轻量化物理AI路线:不做纯数字AI科学家,不做重资产科学工厂,不做端到端制药管线,而是专注打通模型与实体实验室之间的”最后一公里”基础设施,以实验轨迹、设备接口协议、失败经验库和跨实验室执行网络构建核心护城河。

资本

公司一年内完成4轮融资,投资方包括红杉中国种子基金、创东方投资、南山战新投及高特佳投资(A轮近亿元领投)。

“AI for Science真正的分水岭,不是模型回答得多像科学家,而是实验室能否开始像一个持续学习的系统。”

Leave a Reply

Your email address will not be published. Required fields are marked *