(来源:DrugAI)
生物医学研究正在被海量文献、数据库、软件工具和实验流程推向一个新的瓶颈:真正限制科研效率的,往往不是单个模型的预测能力,而是研究者能否在复杂任务中快速找到合适资源、组合分析流程、执行代码、生成实验方案,并把结果整理成可验证的假设。
2026年7月9日,斯坦福大学、Phylo、Genentech等机构的研究人员在《Science》在线发表论文,题为“Autonomous biomedical research with an artificial intelligence agent”。

研究提出通用生物医学AI智能体Biomni,用于自主执行跨领域生物医学研究任务。不同于只解决单一任务的专用代理,Biomni试图构建一个覆盖工具、数据库、软件包、实验协议和AI模型的“生物医学行动空间”,并通过大语言模型推理、检索增强规划和代码执行,将自然语言研究问题转化为可运行的科研流程。
Biomni代码仓库与网页端接口:
https://github.com/snap-stanford/biomni
https://biomni.phylo.bio
背景:生物医学AI需要从“会回答”走向“会行动”
近年来,大语言模型在医学问答、代码生成、文献总结和临床辅助决策中表现突出,但生物医学研究并不只是回答问题。一个真实科研任务可能需要检索数据库、下载原始数据、运行R或Python包、调用专用算法、解释统计结果、设计实验方案,甚至生成液体处理机器人可执行的程序。仅靠文本生成很难覆盖这类复杂行动链。
已有生物医学AI智能体多聚焦于特定领域,例如单细胞组学、空间转录组、CRISPR设计或药物发现。Biomni的目标更大:建立一个统一的环境,让智能体可以跨遗传学、基因组学、合成生物学、细胞生物学、生理学、微生物学、药理学、病理学等多个方向组合行动,完成从数据分析到实验设计的端到端任务。
结果
从2500篇论文中抽取“科研行动空间”
Biomni首先通过一个行动发现智能体,系统阅读来自25个生物医学类别的2500篇近期bioRxiv论文,每个类别选取100篇。该智能体逐篇提取完成论文中研究所需的任务、工具、数据库、软件和测试用例。随后,研究团队对这些资源进行人工验证和整理,形成Biomni-E1基础环境。
图1 Biomni构建统一生物医学行动空间和智能体环境Biomni-E1包含三类核心资源。第一类是150个专用生物医学工具,包括湿实验协议、AI预测模型和领域知识工具;第二类是105个常用生物医学软件包,预装在支持Python、R和命令行的执行环境中;第三类是59个数据库。对于PDB、OpenTargets、ClinVar等可通过API访问的大型数据库,Biomni使用自然语言查询接口,并由内部LLM解析数据库模式、生成可执行查询;对于无Web接口的数据资源,则下载到本地数据湖并预处理为结构化文件。
在智能体架构上,Biomni-A1并不为每类任务写死流程。它会先根据用户目标检索相关工具、数据库和软件,再用大语言模型生成结构化计划,并把每一步表达为代码。代码成为通用行动接口,使智能体能够执行循环、并行、条件判断、文件操作和多工具调用,也可以在观察到执行结果后迭代修正计划。
在443个任务上超过多个基线,并接近专家效率
研究首先构建Biomni-Eval1基准,共443个查询,覆盖10类代表性生物医学研究任务。Biomni平均准确率达到57%,高于Claude Sonnet 4.5基础LLM的30%、治疗学专用智能体TxAgent的25%、通用编码智能体Claude Code的43%,也高于配备Biomni-E1环境的ReAct生信软件智能体44%。
图2 Biomni在通用基准、专家任务和强化学习训练中表现突出在Humanity’s Last Exam生物医学子集(HLE-Bio)上,Biomni智能体框架在多个前沿LLM骨干上均带来提升,相比只使用LLM的基线提高6到12个百分点。这说明性能提升并不完全来自某个底层模型,而来自A1智能体架构与E1行动环境。
更贴近真实科研的比较中,Biomni被放到三类专家任务上。单细胞RNA-seq注释任务中,Biomni准确率为45.8%,处于强专家基线40.5%到50.9%的范围内,同时将平均分析时间从每个数据集约230分钟降至75分钟。罕见病诊断任务中,Biomni达到60%准确率,与5名专家60%到70%的表现相当,但完成时间约3分钟,而人类专家超过110分钟。GWAS因果基因检测任务中,Biomni准确率为80%,也接近专家水平,并将每个位点的执行时间从约90分钟降至4分钟。
研究还训练了Biomni-R0强化学习模型。Biomni-R0基于Qwen3开源模型,先从Claude-Sonnet-4蒸馏,再通过专家标注奖励在Biomni-E1环境中优化端到端任务成功率。训练后,Biomni-R0-8B平均任务表现从0.32提升到0.59,Biomni-R0-32B从0.35提升到0.67;8B模型已超过Claude 4 Sonnet教师模型0.56,32B模型进一步带来约10%的绝对提升。
从可穿戴数据到多组学,智能体可复现并扩展专家分析
在真实研究案例中,Biomni首先分析COVID-19生理反应可穿戴设备队列。该数据集包含1027名参与者的分钟级Fitbit心率和步数数据,总计超过14亿条心率记录和3700万条步数记录,平均每人监测170天。Biomni从原始数据出发,自动生成端到端分析流程,提取六类已验证的COVID-19相关生理标志物,包括静息心率升高、昼夜节律振幅降低、心率变异性下降、夜间心率升高、每日步数减少和变时反应减弱。
图3 Biomni自主执行复杂多模态生物医学分析并生成假设Biomni还重建了群体层面的24小时节律结构,将多个生理标志物整合为0到6分的风险评分,并生成论文级可视化。其结果与原研究和后续文献相符,包括静息心率与昼夜节律振幅负相关(r=-0.34),每日步数与心率变异性正相关(r=+0.54)。
第二个案例是发育中人类骨骼多组学数据。数据集包含约336,162个单核RNA-seq和单核ATAC-seq液滴,并配有人类胚胎5到11周肩、髋、膝等部位的空间转录组信息。Biomni被要求研究骨骼谱系中的转录调控关系,随后自主规划并执行10步分析流程:加载数据、准备RNA-seq、配置pySCENIC、运行GRNBoost2、用cisTarget剪枝网络、计算regulon活性、提取ATAC可及性、过滤预测靶点、分析不同细胞类型和发育阶段的活性模式,并生成总结报告。
最终,Biomni重现了RUNX2、HHIP及TWIST1、LMX1B、ALX4等骨生成调控相关关系,同时提出AUTS2、ZFHX3和PBX1等潜在调控因子在多个骨骼细胞类型中具有较高推断活性。其中PBX1是已知骨骼调控因子,而ZFHX3和AUTS2在骨骼发育中的报道较有限,因此这些结果形成了可进一步实验验证的假设。
从计算分析走向湿实验方案设计
为了测试Biomni是否能支持真实实验设计,作者选择分子克隆作为案例。研究团队与基因编辑专家合作设计了10个现实克隆任务,涵盖Golden Gate、Gibson、Gateway和限制性酶切克隆,并要求生成完整端到端实验方案和最终质粒图谱。盲审专家评估显示,Biomni生成的方案在准确性和完整性上接近资深人类专家,明显优于初级人类实验者,并且耗时更短。
图4 Biomni可设计并验证湿实验克隆方案进一步的实验验证中,研究者要求Biomni把靶向人B2M基因的sgRNA克隆到lentiCRISPR v2 Blast载体。Biomni首先分析质粒结构,识别克隆所需关键特征;随后设计3条靶向B2M的Cas9 sgRNA,并生成带BsmBI接头的正反向寡核苷酸,用于方向性插入sgRNA序列。它还给出寡核苷酸退火、双链DNA形成、Golden Gate组装、热激转化、抗生素筛选和U6启动子测序引物设计等步骤。
实验人员严格按照Biomni方案执行。次日选择平板上出现菌落,挑取两个菌落培养、小量提取并使用Biomni设计的引物进行Sanger测序,结果两个菌落均显示sgRNA插入完全匹配。这一案例说明,Biomni不只是在文本层面“描述实验”,而是在特定任务上生成了可以被实验台验证的完整方案。
AI蛋白设计和液体处理机器人让闭环更近一步
在蛋白优化案例中,Biomni整合AlphaFold-2、ThermoMPNN和生成式设计模型。用户只需提供蛋白序列和提升热稳定性的目标,智能体便自动预测初始结构、估计热稳定性、检索同源蛋白中已知稳定化突变,并结合结构和领域知识提出候选突变。在三轮优化中,Biomni最终提出Q83I、C110F和C66F三个突变,预测累计热稳定性改善ΔΔG为-4.108 kcal/mol,同时保持98%序列一致性。Q83I被解释为增强疏水核心堆积,C66F和C110F则通过芳香稳定化和π-π堆叠带来结构收益。
研究还将Biomni与开源实验自动化框架PyLabRobot结合,使其能够把自然语言实验需求转化为可执行液体处理代码。简单液体转移任务中,Biomni可生成包含deck配置、错误处理和资源清理的完整代码。复杂任务中,作者测试了8种化合物、12点梯度稀释、三重复的细胞活力剂量反应实验,Biomni可从硬件规格出发生成包含吸头选择、串联稀释计算和体积校验的完整协议,并在Hamilton STAR系统上验证。
图5 Biomni连接AI蛋白优化和实验自动化执行总结
Biomni的意义在于,它把生物医学AI从单点预测推进到行动组合:检索资源、调用数据库、运行软件、分析原始数据、生成报告、设计实验、调用AI模型,甚至输出实验机器人代码。它在443个基准任务上达到57%平均准确率,在单细胞注释、罕见病诊断和GWAS因果基因检测中接近专家表现,并在真实案例中复现可穿戴数据分析、多组学调控网络推断、分子克隆、蛋白稳定性优化和液体处理自动化。
但这并不意味着AI已经可以独立替代生物医学研究者。论文也指出,Biomni在需要临床判断、复杂实验推理和深层生物学综合的任务中仍不稳定;高层提示并非总能让复杂多步骤分析可靠完成,部分任务仍需要明确中间步骤;行动空间来自近期文献,可能低估经典方法和基础知识;不同任务类别之间性能不均衡。更重要的是,能够自主检索、设计和执行生物医学任务的系统也带来生物安全与责任治理问题,需要持续评估、透明记录和人类专家监督。
总体来看,Biomni代表了一种新的科研基础设施方向:AI不再只是论文写作助手或问答工具,而是可以作为连接文献、数据库、软件、模型和实验平台的行动层。真正的价值不在于让AI“替科学家思考”,而在于让科学家把更多精力放在问题定义、结果判断、机制解释和伦理边界上。
参考链接:
Kexin Huang et al. ,Autonomous biomedical research with an artificial intelligence agent.Science0,eadz4351DOI:10.1126/science.adz4351
Copyright © 2024 九游体育创新科技有限公司 All Rights Reserved 粤ICP备2023064493号 网站地图