Krystal Hu
路透10月7日 - Biohub周三表示,美国政府与科技巨头Meta Platforms(META.O)及谷歌母公司Alphabet(GOOG.O)正携手非营利组织Biohub,共同构建用于生物研究领域AI模型训练的开放数据集,此项计划的总投资额已达18亿美元。
Meta、谷歌DeepMind以及药物发现初创公司Isomorphic Labs将共同投资3亿美元。美国能源部将在五年内投入超过5亿美元,用于实验室测量、建模和计算。美国国立卫生研究院将协调利用此前超过5亿美元联邦资金构建的数据集和存储库,Biohub将对这些数据进行标准化处理,以用于人工智能训练。
此前,Biohub(由Meta首席执行官马克·扎克伯格及其妻子陈普莉丝拉博士共同创立的慈善机构)已于4月向该项目投入5亿美元。
这些投资将用于资助“虚拟生物学计划”(Virtual Biology Initiative),该计划旨在测量细胞在远超科学家迄今研究范围的各种条件下如何响应变化,并利用这些数据构建预测模型,从而缩短目前耗时数年的药物研发周期。
“迄今为止,生物学一直只是一种基于发现的‘巧妙’科学,”陈在一次采访中表示。“我们一直将此视为社区资产,而非仅供某个群体独享,以便它能随着时间的推移不断积累和完善。”
据Biohub科学主管亚历克斯·里夫斯(Alex Rives)介绍,这些数据集最终将向公众开放,但提供资金支持的企业将获得优先使用权。
“对于商业资助方,我们设有保密期:在此期间,相关团队可以对数据进行研究,之后这些数据将作为公共科学资源向公众开放,”里夫斯说道。
正是通过这种安排,Biohub将私人资金引入了其称为“开放科学”的项目。里夫斯表示,同时进行的政府资助项目将不设此类限制,且Biohub计划接下来与制药公司及慈善机构接洽。
里夫斯指出,当前的细胞数据集规模达数亿个细胞,而一个准确的预测模型则需要数十亿甚至最终达到数万亿个细胞。Biohub的目标正是弥合这一差距。
“我们需要捕捉生物学的语言,需要捕捉细胞的语言。而目前这些尚不存在,”他说。
这些数据将来自多种技术,包括空间转录组学(该技术可绘制完整组织内部的分子活动图谱)以及记录细胞如何响应环境变化的筛选技术。其中大部分数据此前从未以协调一致的方式生成过。
里夫斯表示,这项工作通常需要数十年时间,而合作伙伴们计划将其压缩至五年内完成,首个数据集预计在一年左右准备就绪。他预计五年内将建立起准确的预测模型。
其他人工智能实验室也在推进类似的计划。Anthropic 通过设立湿实验室 (link) 加大了在生物学领域的投入,而 OpenAI 基金会则启动了一项超过 1.25 亿美元的资助计划,用于资助人工智能研究所需的生物和医学数据集。