Krystal Hu
路透10月7日 - Biohub周三表示,美國政府與科技巨頭Meta Platforms(META.O)及谷歌母公司Alphabet(GOOG.O)正攜手非營利組織Biohub,共同構建用於生物研究領域AI模型訓練的開放數據集,此項計劃的總投資額已達18億美元。
Meta、谷歌DeepMind以及藥物發現初創公司Isomorphic Labs將共同投資3億美元。美國能源部將在五年內投入超過5億美元,用於實驗室測量、建模和計算。美國國立衛生研究院將協調利用此前超過5億美元聯邦資金構建的數據集和存儲庫,Biohub將對這些數據進行標準化處理,以用於人工智能訓練。
此前,Biohub(由Meta首席執行官馬克·扎克伯格及其妻子陳普莉絲拉博士共同創立的慈善機構)已於4月向該項目投入5億美元。
這些投資將用於資助「虛擬生物學計劃」(Virtual Biology Initiative),該計劃旨在測量細胞在遠超科學家迄今研究範圍的各種條件下如何響應變化,並利用這些數據構建預測模型,從而縮短目前耗時數年的藥物研發周期。
「迄今為止,生物學一直只是一種基於發現的‘巧妙’科學,」陳在一次採訪中表示。「我們一直將此視為社區資產,而非僅供某個群體獨享,以便它能隨着時間的推移不斷積累和完善。」
據Biohub科學主管亞歷克斯·裏夫斯(Alex Rives)介紹,這些數據集最終將向公衆開放,但提供資金支持的企業將獲得優先使用權。
「對於商業資助方,我們設有保密期:在此期間,相關團隊可以對數據進行研究,之後這些數據將作為公共科學資源向公衆開放,」裏夫斯說道。
正是通過這種安排,Biohub將私人資金引入了其稱為「開放科學」的項目。裏夫斯表示,同時進行的政府資助項目將不設此類限制,且Biohub計劃接下來與製藥公司及慈善機構接洽。
裏夫斯指出,當前的細胞數據集規模達數億個細胞,而一個準確的預測模型則需要數十億甚至最終達到數萬億個細胞。Biohub的目標正是彌合這一差距。
「我們需要捕捉生物學的語言,需要捕捉細胞的語言。而目前這些尚不存在,」他說。
這些數據將來自多種技術,包括空間轉錄組學(該技術可繪製完整組織內部的分子活動圖譜)以及記錄細胞如何響應環境變化的篩選技術。其中大部分數據此前從未以協調一致的方式生成過。
裏夫斯表示,這項工作通常需要數十年時間,而合作伙伴們計劃將其壓縮至五年內完成,首個數據集預計在一年左右準備就緒。他預計五年內將建立起準確的預測模型。
其他人工智能實驗室也在推進類似的計劃。Anthropic 通過設立溼實驗室 (link) 加大了在生物學領域的投入,而 OpenAI 基金會則啓動了一項超過 1.25 億美元的資助計劃,用於資助人工智能研究所需的生物和醫學數據集。