最全面人類細胞圖譜發佈:110萬個細胞看清調控與衰老

AI速讀
科學界發佈最全面的人類細胞圖譜 Tabula Sapiens 2.0,將分析規模提升至 110 萬個細胞,覆蓋 28 種人體組織。研究深入解析了 1,635 個轉錄因子的表達,證實細胞身份受局部微環境影響而異。在抗衰老研究方面,發現細胞衰老並無統一標誌物,而是依賴於其原始細胞類型與組織。該圖譜採取開放獲取模式,將顯著推動精準藥物開發及細胞 AI 的泛化能力研究。

人體大約由數十兆個細胞組成。它們擁有基本相同的基因組,卻因為開啟和關閉不同的基因,形成神經元、免疫細胞、肌肉細胞等截然不同的細胞類型。

因此,解析人體生命活動的基礎問題就是:人體內到底存在多少種細胞?每一類細胞分別啟動那些基因來實現自身功能?

2022 年,Tabula Sapiens 聯盟在 Science 發佈 Tabula Sapiens 1.0 首版人類多器官細胞圖譜。研究收集了 15 名捐獻者、24 種人體組織器官,解析了近 50 萬個細胞,系統刻畫了各類細胞的基因表達特徵,識別出數百種人類細胞類型,為後續人體細胞研究提供了首個多器官單細胞參照資料集。

四年後,這張人類細胞圖譜迎來了大規模升級。

近日,Cell 期刊正式發表了 Tabula Sapiens 2.0。研究新增了 9 名捐獻者和 4 種組織,將整個資料集擴大到 24 名捐贈者、28 種組織和超過 110 萬個細胞,細胞數量相比第一版增加了一倍以上。研究團隊稱,從組織和細胞類型覆蓋的廣度來看,這是目前最全面的人類細胞圖譜參考之一。

相比 1.0 版本,Tabula Sapiens 2.0 不只是把細胞數量翻了一倍,還進一步開始回答這些細胞是如何被調控的,以及它們又是如何衰老的。

論文上線後,項目負責人 Stephen Quake 在 X 上用一句很直接的話概括了這次升級:“我們將資料集擴大了一倍,覆蓋 28 種組織、超過 110 萬個細胞,繪製了人類轉錄因子的表達,並分析了細胞衰老程序。”他特別強調:“The atlas is open access.”——這張圖譜完全開放。

Quake 是國際知名的物理學家與生物工程師,早年在史丹佛獲得物理學學士與數學碩士學位,後於牛津大學取得理論物理學博士。他發明了微流控大規模整合技術(被譽為生物學領域的“積體電路”),推動了單細胞基因組學與液體活檢的發展,其中包括全球首個非侵入性產前染色體異常檢測(NIPT),已惠及數百萬孕婦;同時領導了 Tabula Sapiens 人類多器官單細胞轉錄組圖譜項目,是該領域的重要奠基人與推動者。

2.0 真正升級了什麼?

Tabula Sapiens 2.0 最直觀的變化,是資料量從近 50 萬個細胞增加到了 110 多萬個。但對一張人體細胞圖譜來說,真正重要的不只是細胞更多了,而是這些細胞來自那裡。

過去很多單細胞研究,會分別從不同供體獲取不同器官。這樣雖然也能拼出一張人體細胞地圖,但會帶來一個問題:如果肺和肝臟裡的同一種細胞表現不同,很難判斷這種差異究竟來自器官本身,還是來自不同人的年齡、遺傳背景和生活環境。

因此,Tabula Sapiens 從第一版開始就有一個特殊設計:儘可能從同一名供體獲取多個器官。

2.0 進一步擴大了這部分資料。新增的 9 名捐獻者中,一名貢獻了 20 種組織,另外兩名分別貢獻了 18 種和 15 種組織。最終,整個資料集覆蓋 24 名年齡在 22 至 74 歲之間的供體,以及血液、骨髓、心臟、肺、肝臟、腎臟、胰腺、皮膚、腸道等 28 種組織。研究人員可以在同一個人身上比較不同器官中的細胞,從而儘量減少年齡、遺傳背景等個體差異帶來的干擾。

(來源:Cell

在這套更大的資料基礎上,研究團隊重點回答了兩個問題:不同細胞為什麼會形成不同身份,以及人體細胞究竟是怎樣衰老的?

細胞如何成為“自己”?

人體內所有細胞擁有同一套基因組,細胞之所以分化為免疫細胞、肌肉細胞、生殖細胞等不同類型,很大程度上由轉錄因子調控。轉錄因子通過開啟或者關閉特定基因,塑造細胞的身份與功能。

過去,人們已經知道不少經典的轉錄因子和細胞類型的對應關係,但這些研究往往集中在少數器官或細胞上。Tabula Sapiens 2.0 則提供了一個更完整的比較框架。

研究人員分析了 1,635 個轉錄因子在 175 種細胞類型中的表達情況。按照細胞特異性將它們分成兩大類別:其中 890 個轉錄因子具備顯著的細胞類型特異性,也就是僅在部分特定細胞中高表達,屬於細胞的“專用開關”;剩餘 745 個轉錄因子表達分佈更為寬泛,會在多種細胞中出現,屬於廣泛發揮作用的“通用開關”。

圖 | 在不同細胞類型中普遍表達的轉錄因子(來源:Cell

部分結果印證了過去已有的科研認知。比如在 T 細胞當中,FOXP3、EOMES 以及 IKZF1、IKZF2、IKZF3 都表現出很強的細胞特異性,這些分子早已被證實參與 T 細胞的發育、分化與功能執行。

但圖譜也揭示出很多過去被忽視的細節:那怕同歸為成纖維細胞這一大類,定居在不同器官的成纖維細胞,卻運行著不一樣的基因調控程序。肺部成纖維細胞的特徵轉錄因子是 TCF21,而心臟成纖維細胞則以 TBX20 為代表。這說明細胞的大類身份並不是全部,同一大類的細胞遷移定植到不同器官後,會受局部微環境影響,建立器官特異性的調控模式。

研究團隊還進一步分析了這些轉錄因子是否真的可能參與下游基因調控。結果顯示,在滿足分析條件的 1,390 個轉錄因子中,有 839 個被證實能夠實際驅動下游靶基因表達。

這相當於把過去零散的某個轉錄因子控制某類細胞的研究,放進了一張覆蓋多個器官的人體參考圖譜中。

這種資訊不僅對基礎研究有用,對藥物研發也有價值。一個藥物靶點如果不僅存在於病變細胞中,同時也大量表達在其他正常細胞裡,就可能帶來額外副作用。Tabula Sapiens 1.0 已經被用於評估這類潛在的靶向毒性,而 2.0 提供了更大的參考範圍。

不同細胞,連衰老方式也不一樣

論文另一項核心研究聚焦細胞衰老。部分細胞在遭遇 DNA 損傷等外界刺激後,會進入特殊狀態:永久喪失分裂能力,但並不會立刻死亡,還會持續釋放各類炎症訊號。如今,識別、清除體內衰老細胞已經成為抗衰老領域的重要研究方向。

但該領域長期存在一個關鍵難題:到底什麼樣的細胞才算衰老細胞?至今還沒有一套可以通用於人體全部組織的統一分子標誌物。

這項研究採用了一種相對保守的標準:尋找表達 CDKN2A、同時不表達細胞增殖標誌物 MKI67 的細胞。前者通常意味著細胞啟動了與衰老相關的“停止分裂”程序,後者則說明細胞已經不再增殖,兩者結合可以從單細胞轉錄組資料中篩出一批較有代表性的候選衰老細胞。

按照這一標準,研究人員在約 108 萬個細胞中找到了 48,114 個候選衰老細胞,佔比約 4.4%,分佈在 21 名捐獻者、25 種組織和 145 種細胞類型中。

研究對比這批候選衰老細胞和普通細胞的基因表達差異,一共鑑定出 3,792 個衰老相關基因。但資料分析發現,很多教科書裡熟知的經典衰老標記基因,並不會在所有衰老細胞中同步出現。

圖 |  2.0 里的組織樣本來自什麼樣的人,以及這些組織都包含那些類型(來源:Cell

進一步對衰老細胞轉錄組做對比可以看到:衰老細胞之間最主要的差異,來源於它們原本的細胞身份。發生衰老的上皮細胞,依舊保留上皮細胞的分子特徵;發生衰老的免疫細胞,也仍然帶有鮮明的免疫細胞印記。細胞原本是什麼類型,很大程度上就決定了它衰老之後會呈現出怎樣的分子表型。

團隊一共識別出 17 套和衰老相關的基因表達程序,涵蓋細胞黏附、線粒體代謝、蛋白質穩態、細胞周期停滯等多個生物學過程。但不同的細胞類型,啟動、呼叫這些通路的組合各不相同,並非全部通路同步開啟。例如,一些上皮細胞和成纖維細胞更明顯地出現細胞黏附相關變化,而部分髓系免疫細胞則表現出更強的線粒體和蛋白質降解系統異常。

因此,研究團隊認為,人體細胞的衰老具有很強的細胞類型和組織依賴性,並不存在一種完全統一的衰老狀態。

這對抗衰老藥物研究也有啟發。如果不同組織裡的衰老細胞本身就不一樣,那麼想依靠一種標誌物識別全身所有衰老細胞,再用一種藥物將它們統一清除,可能並不現實。未來的 senolytics,可能需要更多考慮不同組織和細胞類型之間的差異。

當然,研究人員也強調,這項研究中的“衰老細胞”是根據 RNA 表達特徵推測出來的,並不等同於經過功能實驗確認的衰老細胞。這種識別方式仍可能漏掉其他類型的衰老細胞,也可能包含部分並未真正進入衰老狀態的細胞。

此外,Tabula Sapiens 也開始成為細胞 AI 的重要資料資源。

Tabula Sapiens 1.0 此前已經被用於訓練和評估多種單細胞 AI 模型。論文提到,2.0 新增的資料也已經被作為獨立測試集,用來檢驗那些曾使用 1.0 資料訓練的模型,能否在沒有重新訓練的情況下識別新的細胞,也就是測試模型的 zero-shot 泛化能力。 (DeepTech深科技)