曾任 Adaptive Biotechnologies 共同創辦人,正在打造一個專有科學資料集市集,讓 AI 開發者無需檢視原始資料即可進行訓練。
曾任 Adaptive Biotechnologies 共同創辦人,正在打造一個專有科學資料集市集,讓 AI 開發者無需檢視原始資料即可進行訓練。

由 Adaptive Biotechnologies 共同創辦人 Harlan Robins 創立的 Harell Data Corp.,從 Fuse 與 Cercano Management 募得 1,500 萬美元,用於打造一個連接 AI 模型開發者與專有科學訓練資料集的安全平台。
「公司的目標是將 AI 模型開發者與專有訓練資料集連結起來,以解決具挑戰性的科學問題,」Robins 表示。「目前,那些動用自己的技術與經費來產生專有訓練資料的機構,缺乏良好的管道將資料商業化。因此,這些資料實際上只能被閒置擱置。」
這家總部位於貝爾維尤(Bellevue)的新創公司,其平台允許資料創建者在安全的雲端環境中託管專有資料集,使機器學習團隊得以訓練模型,而原始資料自始至終不會離開系統。資料所有者可從訓練過程中產生的運算營收中直接分潤,而非苦候多年等待臆測性的下游藥物權利金。這支 11 人團隊分布於貝爾維尤與帕羅奧圖(Palo Alto),由 Rakesh Nair 擔任技術長、Saray Covey 擔任營運主管、Analise Polsky 擔任銷售主管。
此次募資之際,AI 開發者正面臨公開可用訓練資料與計算醫學、材料科學突破所需的高成本專有資料集之間日益擴大的鴻溝。市值達 39 億美元的 Adaptive Biotechnologies 是首批資料合作夥伴之一,另一家是總部位於西雅圖的 A-Alpha Bio。
AlphaFold(DeepMind 的蛋白質結構預測系統)等備受矚目的成功案例之所以蓬勃發展,是因為它們受益於數十年來公開可用、經實驗驗證的蛋白質結構資料。但在生物學與醫學的許多關鍵領域中,產生高品質資料集需要數百萬美元的成本與多年的投入。擁有這些資料的機構目前缺乏安全且有利可圖的分享途徑,因此資料只能持續封存在孤立的孤島中。
Harell Data 的模式透過為資料所有者開創直接營收來源來解決此問題。資料創建者並非一次性授權資料或等待下游權利金,而是在 AI 開發者以其資料集進行訓練時,從產生的運算營收中分得一份。隨著模型透過在這些豐富資料集上訓練而持續精進,底層資料的內在價值也會隨之複利增長。
雖然這家新創公司最初鎖定計算醫學領域——這是 Robins 在 Adaptive Biotechnologies 多年任職期間最熟悉的領域——但他強調,資料孤島問題橫跨各科學學科,從材料科學到影像學皆是如此。
「如果這個事業運作得當,我們應該能夠促成真正重要問題的解決方案,」他表示。
平台搶先體驗已於本週上線,首批資料來自 A-Alpha Bio 與 Adaptive Biotechnologies。Adaptive 今年稍早分拆出 Digital Biotechnologies 以開發臨床 DNA 定序技術,同時持續以顧問身分與 Robins 合作,就科學策略提供諮詢。
公司名稱背後有一個私人故事:Robins 請他 8 歲的兒子 Ellis 幫忙取個名字,男孩在幾秒鐘內就提出了「Harell」——這是「Harlan」與「Ellis」的合體。
「無意冒犯那些大型雲端運算公司,但我覺得這個名字聽起來比他們任何一個都好聽,而他們似乎也都發展得不錯,所以我就採用了,」Robins 表示。
這輪募資率先由 Timmerman Report 報導,為日益高漲的 AI 科學基礎設施創投浪潮再添一筆。隨著 AI 模型開發者耗盡公開可用的訓練資料,能解鎖專有資料集的平台,可望成為下一波藥物發現與材料創新浪潮的關鍵基礎設施。對於關注 AI 於科學應用主題的投資人而言,這輪募資釋放出一個訊號:資料所有權正崛起為 AI 價值鏈中一個獨立的變現層級,有別於模型開發與運算供應。
本文僅供參考,不構成投資建議。