中国版「生物DeepSeek」诞生!GeneLLM让AI接管生命科学

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

中国版「生物DeepSeek」诞生!GeneLLM让AI接管生命科学
AI资讯 2026-08-04 19:50
+8197 阅读

DeepSeek-V4-Flash正式版刚炸翻全球通用大模型圈,中国生命科学版Deepseek就紧随其后。


近日,津渡生科(由4个牛津大学归国学霸创办)自主研发的生命科学垂类GeneLLM多组学大模型,接连登上国际顶级学术期刊——《Nature Communications》与《Advanced Science》。


作为全球首个直接使用组学原始数据进行预训练的多组学大模型,GeneLLM是继谷歌AlphaFold和斯坦福大学的EVO 2之后的又一重磅模型,填补了中国生命科学基础大模型的空白,堪称中国生命科学版Deepseek让AI开始理解生命的多个「语言」与整个「系统」。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


像预测下一个token一样,


预测下一条生命信息


疾病识别只是GeneLLM的一个应用场景,津渡生科真正想做的,是打造生命科学领域的「Claude Code」。


ChatGPT、Claude、DeepSeek等大语言模型的核心,是下一个token预测。


GeneLLM思路类似,但它预测的不是文字,而是生命信息。


RNA序列中的四种碱基——腺嘌呤(A)、尿嘧啶(U)、鸟嘌呤(G)、胞嘧啶(C),成为GeneLLM理解生命语言的基本Token。


传统生物信息学分析通常依赖基因注释、序列比对和人工定义标签。这种方法虽然准确,但会提前限定模型的认知范围,也可能丢失大量隐藏在原始数据中的未知生物信号。


GeneLLM则另辟蹊径,直接从未经加工的原始测序数据中学习生命规律。


它以RNA组、蛋白质组、代谢组等多组学原始数据作为训练数据,让模型自主发现疾病相关模式。


目前,GeneLLM已完成15亿参数和3.5万亿碱基序列的模型预训练,XLarge版本实现300亿参数模型预训练,持续扩大技术壁垒。


作为全球首个基于原始测序数据预训练的多组学大模型,GeneLLM包括两大阶段:


(1)无监督预训练与原型挖掘 


(2)患者级疾病微调(Disease Tuning)


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


GeneLLM首先需要解决一个问题:


如何把复杂的生命数据变成AI可以理解的语言?


在自然语言处理中,BPE算法会把句子切分成Token;而GeneLLM则将约150bp长度的RNA测序片段,通过7个碱基组成的滑动窗口(7-mer)切分为生命Token。


随后,模型利用Transformer架构,在没有基因注释和人工标签的情况下,直接预测下一个碱基。


这意味着AI不是先看人类整理好的「字典」,而是直接从生命原始信号中学习。


在训练过程中,GeneLLM处理了约数十万亿条RNA reads,在百卡集群 NVIDIA A100 GPU上训练。


至此,GeneLLM泛化等能力开始「涌现」。


作为生科领域的重大创新突破,GeneLLM这一国产生科模型可以应用于新药研发、精准医疗、合成生物、环境监测、微生物与生物农业、蛋白质与分子设计等多个领域,是全球范围内少有实现实际场景落地的大模型。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


当我们审视完GeneLLM在「数据、架构、训练」等底层创新后,才能真正理解:为何它代表了中国的「生物版DeepSeek」。


硅谷以数万张H100堆砌万亿参数,DeepSeek则以算法创新提高算力效率,GeneLLM同样四两拨千斤,撬动亿万生命科学数据。


如果说AlphaFold让AI第一次看懂生命的「结构」,EVO2让AI开始理解生命的「代码」,那么GeneLLM试图进一步理解生命的「系统」。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


更狠的是效率。传统方法依赖6Gb深度测序,成本高企,难以落地。GeneLLM 在1Gb极浅深度(成本缩减83%)下仍保持AUC > 0.8。


这意味真正有希望让普惠精准医疗成为现实。


一种新的科研范式开始浮现:让AI从生命数据中学习,让生命科学进入可预测、可计算、可规模化探索的新阶段。


不只是模型,还是「最后一公里」的智能基础设施


但津渡生科的布局不仅在基础模型。


以GeneLLM多组学大模型为生命认知底座,津渡生科进一步构建连接AI智能与物理世界的执行体系,通过Harness智能实验执行层与DBTL(Design-Build-Test-Learn)数据闭环,实现从生命规律理解、科学假设生成,到自动化实验验证和持续迭代优化的完整AI for Science闭环。


正如前OpenAI VP、后训练负责人Liam Fedus所说,当前LLM已经耗尽了互联网上有限的文本和代码,下一步的科学发现的重大进展必须依赖实验迭代。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


也就是说,不能只靠读人类已写下的内容来发现新知识,AI 必须自己做实验。


可问题来了——


互联网服务天生有API,网络信息天生是数字化的,但科研设备来自不同厂商,协议各不相同,既复杂又昂贵,没有人能在几个月内推倒重建。


今天大多数实验室,是专为人类设计:仪器面板、移液动作、样本状态、临场判断,绝大多数没有变成机器可理解的信号。


AI进入实验室,当前不只是模型能力的问题,还需要一套新的基础设施。


因此,AI进入实验室,当前不只是模型能力问题,还需要物理Harness:把实验室变成一个可编译、可调度、可观测、可追溯的系统。


这,才是AI4S真正的最后一公里。


BioFord Harness,让实验室开始「自己动」


为此,津渡开发了一套名为BioFord Harness的系统。


这是一套把AI和物理实验室打通的基础设施。


他们不是让机械臂模仿人手,而是把实验室变成一个可编译、可调度、可观测、可追溯的系统。


这个过程中,物理Harness至少要完成三件事:


1.把科学意图或实验DSL,编译为不同设备能够执行的指令;


2.在多设备之间完成调度、资源与安全约束管理,并处理异常;


3.让实验结果、设备日志和环境参数回流,成为下一轮模型与实验设计的输入。


科学问题→AI理解→实验方案→设备调度→执行→数据回流→模型优化→下一轮。


一套科学实验数据的飞轮,就这样启动了。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


五大智能体,把科研流程「卷」成流水线


BioFord Agent具身智能科研平台,则向下连接实验室物理层,向上承载科学家认知层,中间用物理AI打通推理与执行的断层。


在认知层,BioFord Agent有五大智能体组成协同网络,打通了生命科学研究全流程,可数倍提高科研效率。


文献检索智能体

实验设计智能体

科学智能体

实验调度智能体

数据分析智能体


举个例子,文献检索智能体可以快速帮你检索和阅读海量文献,完成文献综述并辅助提出假设。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


实验设计智能体让科研团队把原本数月的实验设计周期缩短至一周。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


而津渡生科推出的实验调度智能体,依托通用仪器抽象层(Universal Instrument Abstraction Layer),打破了多类异构设备之间的协议壁垒。


无论是PCR仪、酶标仪、流式细胞仪,还是自动化移液工作站,均可实现统一纳管与统一调度。系统内置动态调度算法,可自动批量排程、实时冲突规避,并全程记录实验参数,形成可追溯的审计链条。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


这意味着,AI不再停留「出谋划策」的阶段,而是真正走进实验室,操纵设备、执行任务,成为一位可信赖的「科研助手」。


失败数据,也许比成功数据更珍贵


这套系统解决的更深层的价值在于:让每一次实验——无论成功还是失败——都变成系统可以消化的数据。


传统实验室里,一次失败的记录可能只是一行「结果不符合预期」,经验存在人的脑子里,人走了,经验也没了。


而在BioFord系统里,每一次失败都是宝贵的训练数据——参数选择的逻辑、环境条件的记录、错误路径的证明……全部沉淀下来,成为系统「经验」的一部分。


下一次,AI就知道:此路不通。


耐人寻味的是,在这个赛道,不是算力最强的赢,也不是模型最大的赢。


算力买得到,但科研数据买不到。


津渡生科创始人&CEO金泳成表示:「在研发过程中,我们逐渐发现AI for BioScience 不是简单地堆模型、堆数据。对做实验的人来说,要最终解决的仍然是算完不会做、做了又不对的困境。


这,就是AI4S赛道最重要、也最难被复制的护城河。


四个牛津人,


其中还有罗福莉的同门师兄


2022年,金泳成在拿到牛津大学生物工程博士学位的那一刻,面临着一个选择。


他的导师是英国皇家学会会员、三代测序巨头英国上市公司Oxford Nanopore的创始人Hagan Bayley,实验室里「成果落地」的传统深厚。留在英国,是一条清晰的坦途。


但他选择了另一条路——把实验室里的一个「原型技术」装进行李箱,带回国。与他同行的,还有三位牛津校友:生物学博士邓司伟、计算机学院副研究员沙磊(北京大学计算机博士,小米大模型负责人罗福莉的同门师兄),以及擅长做产品落地的周天尧。四人具备生物工程、人工智能、计算生物学、商业运营等相关知识背景,缺一不可。他们曾组队开展联合科研项目,通过结合AI和转录组技术实现疾病预测检测。4个人像拼图一样恰好互补,可以完成高度交叉的学科研究。 


公司名字「津渡生科」,「津」取自牛津,寓意他们从牛津的顶尖实验室等学术高地出发,「渡」意在渡人,那是他们认为AI for Science应该抵达的终点。 


目前,津渡生科的 BioFord Agent 物理 AI 科研平台已在国内一些知名高校落地,成效显著,将科研周期从原本的数月缩短至一周。


起风了:1年4轮融资,资本「真香」现场


然而,走一条「前无古人」的路,必然伴随着孤独。


创业初期,困难重重。彼时AI创业如火如荼,但生物科学领域的「AI+」尝试寥寥无几。「懂AI的不一定懂生物科学,懂生物科学的大部分不懂AI。」


金泳成坦言:「投资方一度无法理解我们在做什么。」


团队选择了一条「最难的路」:从生物基础大模型切入,全球做此方向的公司屈指可数。


2025年,转机出现了。


当时,国务院印发《关于深入实施「人工智能+」行动的意见》,AI for Science位列其中,赛道起风了。


津渡生科创下「一年完成4轮融资」的战绩。公司的主要融资时间线堪称行业标杆。


天使+轮: 获红杉中国种子基金领投;


Pre-A+轮:获创东方投资千万级领投;


Pre-A+轮:获南山战新投千万级投资;


A轮: 获高特佳投资近亿元领投。


高特佳投资执行合伙人滕宇航表示:「津渡生科把生命科学基础研究变成了可订阅、可扩张的『算力+实验』基础设施。」


而金泳成的目标更远:「我们不满足于卖软件,要搭建生命科学领域的智能操作系统。就像英特尔定义了PC时代的算力,我们希望定义AI时代生命科学的研发新范式。」


从牛津实验室到深圳,从无人理解到获一线资本重注,四个牛津人的故事,不只是创业传奇,更是一场关于「我们能为人类做什么」的灵魂拷问。


当AI学会自己「通宵」科研,科学发现或许不再依赖天才的偶然灵感,而成为可预期的必然。这条路,他们才刚刚开始。


行业地图:津渡走出轻量化物理AI路线


在更大的AI for BioScience地图上,津渡并不孤单,但切入点截然不同。


第一类,是数字端的AI科学家。


斯坦福孵化的Biomni(已商业化为Phylo)拥有150多个专业工具,能自动执行文献回顾、假设生成和生物信息分析。


Eric Schmidt支持的FutureHouse,致力于构建能自主生成假设、撰写论文的AI科学家。


然而,它们虽然强大,却仍然局限在数字世界。


第二类,是全栈自主路线。


晶泰科技以「AI+机器人」在全球部署超300台工站。


Flagship Pioneering孵化的Lila Sciences,5.5亿美元融资,试图让AI完全接管实验的设计、执行与重新设计,目标是「科学超级智能」。


但这些,都太烧钱了。


第三类,是端到端管线路线。


英矽智能将AI直接推进自有创新药物管线,首款AI药物已进入III期临床,但他们是「造车人」而非「修路人」。


而津渡生科的选择是:专注构建物理Harness,做模型与实体实验系统之间「最后一公里」的基础设施。


不做底座竞赛,不做端到端管线,不做纯数字世界的AI科学家。只做那一公里,无疑是更加轻量化的打法。


金泳成把这个判断说得很清楚:「AI for Science真正的分水岭,不是模型回答得多像科学家,而是实验室能否开始像一个持续学习的系统。」


而且,在全球AI for Science领域,津渡并非简单地「只做最后一公里」。


更准确地说,它以最后一公里为入口,争夺整条科研工作流的编排权。


相比纯数字AI科学家,它能够触碰物理世界;相比自建重资产科学工厂,它有机会接管客户已有实验室;相比端到端AI制药公司,它不必把命运押在某一条临床管线上。


中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学


它真正的护城河,将不是参数量,而是不断积累的实验轨迹、设备接口、失败经验和跨实验室执行网络。


正如金泳成所言,生物体内数以万计的信号通路和充满未知的反应机理令人着迷。「生物学有多丰富,AI for Science的前景就有多美。」


以AI的智能探索生命之谜,这群牛津学霸的星辰大海,才刚刚拉开序幕。


文章来自于微信公众号 “新智元”,作者 “新智元”

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

4
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

5
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

添加客服微信openai178,进AITNT官方交流群