行业资讯

18亿美元共建AI就绪生物数据开放资源

Heooo 10月09日05时58分 3 阅读

「Biohub联合多方宣布扩展虚拟生物学计划,总计投入18亿美元生成并开放AI就绪的生物数据。美国能源部五年投入超5亿美元用于测量、建模与计算,国立卫生研究院协调超5亿美元既有数据集,Google DeepMind、Isomorphic Labs与Meta合计投入3亿美元,共同构建面向生命预测模型的开放数据底座。」

据Hacker News报道,Biohub与多方合作伙伴宣布大幅扩展一项国际性科研计划,共同投入18亿美元用于生成并开放AI就绪的生物数据,这是迄今为止规模最大的、面向AI就绪生物数据的协同投入。

该计划的核心目标是让全球科研社区能够共同构建并使用AI模型,从而在数字世界中提出、预测并回答生物学问题,加速疾病预防与治疗新路径的出现。按照官方介绍,这项努力将为预测性生物AI模型提供数据基础,最终形成面向研究社区的开放资源。

在资金与资源分配上,各方分工明确。美国能源部将在五年内投入超过5亿美元,用于实验室测量、建模与计算,以支撑这一国际性的AI就绪开放数据资源建设。美国国立卫生研究院将协调相关数据集、数据仓库与知识库的贡献,这些资源来自此前超过5亿美元的联邦投入,并与本计划保持一致。Biohub将与国立卫生研究院合作,把这些数据集标准化,使其适合用于AI模型训练。

企业侧的参与同样引人注目。Google DeepMind、Isomorphic Labs与Meta将合计投入3亿美元,用于虚拟生物学计划,开发构建生命预测模型所需的技术与多模态数据集。

Biohub科学负责人Alex Rives表示,一个准确的生物学预测模型可以通过让科学家在数字环境中执行实验,极大加速科学发现,由此产生的洞见有望解锁对疾病更深入的理解,并开辟全新的治愈路径。他认为,正因为这种潜力,虚拟细胞的创建是下一个科学时代最重要的挑战之一,它需要国家级与国际级协同的数据生成努力,这也是各方走到一起的原因。他还向全球科学界发出邀请,希望更多团队加入这一项目。

从技术路线看,该计划将交付用于训练这些模型的基础测量数据,把细胞响应数据扩展到远超以往研究范围的细胞类型与条件,并构建和验证相关技术,以便以更大规模、更快速度、更高精度研究细胞及细胞间的相互作用。

虚拟生物学计划于2026年4月宣布,旨在协调跨机构、跨学科的数据生成工作,构建AI就绪的开放数据集,以支撑生命的预测模型。Biohub最初承诺的5亿美元资金成为该计划的锚点。

值得关注的是,这一计划的重心并非单一模型或单一机构的突破,而是数据基础设施本身。生物学数据长期存在异质性、碎片化与标准化程度不足的问题,这是制约AI模型泛化的关键瓶颈。计划中明确提出由Biohub与国立卫生研究院共同推动数据集标准化,意味着未来训练语料的格式、标注与质量控制将走向统一,这直接影响模型能否跨细胞类型、跨实验条件迁移。

此外,多模态数据集的提出也指向一个更长期的方向:把基因表达、蛋白质形态、细胞形态与干预响应等信息整合进同一表征空间,使模型不仅能描述生物现象,还能对干预结果做出预测。若开放数据资源如期建成,全球研究团队将能在同一数据底座上比较模型、复现结果并共享评测方法,这对AI与生命科学的交叉研究具有重要意义。

# AI生物 # 虚拟细胞 # 开放数据 # 生命预测模型 # 多模态数据集

来源:Heooo AI工具导航