flowchart LR A["scRNA-seq 矩陣<br/>(10 億數據點)"] A --> B["Excel<br/>直接閃退、電腦發燙"] A --> C["Python + Scanpy<br/>秒級過濾、繪圖"] C --> D["Gemini 輔助生成程式碼"]
7 細胞普查:用 Gemini 馴服單細胞與蛋白質體學的巨量數據
The Cellular Census: Taming Single-Cell & Proteomics Datasets
7.1 細胞普查:當 Excel 哭著求饒的巨量數據時代
在開始討論單細胞技術前,我們先來做一個悲壯的實驗。
請打開你筆記型電腦裡的 Excel,然後試著導入一個現代單細胞轉錄體定序 (single-cell RNA sequencing, scRNA-seq) 的表現量矩陣 (expression matrix)。這個矩陣可能包含了 50,000 個細胞的定序結果,而人類有大約 20,000 個編碼基因。
這意味著,這個表格裡有高達 10 億個數據點 (data points)。
當你按下「導入」的那一瞬間,你的筆電風扇會開始發出飛機起飛般的轟鳴,Excel 的畫面會瞬間凍結,接著跳出令人絕望的「軟體沒有回應」,最後直接閃退。
在現代生醫研究中,高通量數據(如轉錄體學與蛋白質體學)的檔案大小,早已遠遠超出了常規辦公室軟體的極限。如果你只會用 Excel,你在大數據時代就等於失去了雙腿。
幸運的是,你不需要成為資工系的程式碼大神才能處理這些數據。只要有了 Gemini,你就能直接用英文請它幫你寫出乾淨、高效且附帶註釋的 Python 程式碼,並在幾秒鐘內幫你畫出漂亮的降維聚類圖。
更重要的是,Gemini 還能帶你穿梭於 GTEx 與 Human Protein Atlas (HPA) 等全球頂尖的公共數據庫,讓你不需要自己做實驗,就能知道任何一個基因在人體各個組織與細胞中的空間分佈。
本章將帶你學會如何利用 Gemini 自動生成單細胞數據分析指令,並解鎖空間蛋白質定位的檢索密碼。
7.2 核心科學概念:從細胞果汁到細胞個體普查
在請 Gemini 寫程式碼之前,我們必須先理解為什麼我們要進行「細胞普查」,以及這些數據是如何組織的:
1. 整體轉錄體 (Bulk RNA-seq) vs. 單細胞轉錄體 (scRNA-seq)
這是一個生醫界最著名的「果汁與水果拼盤」比喻:
- Bulk RNA-seq (整體轉錄體定序):就像是把一整盤水果(包含草莓、藍莓、香蕉)丟進果汁機裡打成「水果冰沙」。你測量出來的是整杯冰沙的平均甜度,但你無法知道是哪一顆草莓特別酸,也無法得知草莓和藍莓在冰沙中的精確比例。
- scRNA-seq (單細胞轉錄體定序):就像是把水果一顆顆挑出來,單獨測量每一顆水果的糖度與重量(「水果拼盤」)。這能讓我們精確分析組織中每一個單一細胞的狀態,甚至發現以前從未見過的全新細胞亞群。
2. 表現量矩陣的結構
在單細胞數據中,數據通常被組織成一個二維矩陣:
- 行 (Rows):通常是基因名稱(如 GAPDH, TP53)。
- 列 (Columns):是每一個單獨的細胞 barcode。
- 數值:代表在該細胞中檢測到該基因的轉錄本讀數數量 (counts),或是經過標準化後的數值(如 TPM, Transcripts Per Million)。
3. 蛋白質體學 (Proteomics) 與質譜儀 (Mass Spectrometry)
雖然 mRNA 是蛋白質的模板,但「轉錄量高不等於蛋白質表現量高」。細胞中存在著複雜的轉譯後調控與蛋白質降解機制。我們使用質譜儀來直接測量樣本中蛋白質的豐度,這才是細胞發揮生理功能的最直接證據。
4. GTEx 資料庫 (Genotype-Tissue Expression)
GTEx 是一個龐大的公共數據庫,收集了來自數百名健康捐贈者的 54 種不同人體組織的 RNA-seq 數據。它能告訴你,某個特定基因在正常生理狀態下,是不是只在心臟、肝臟或大腦中專一性表達。
5. 人類蛋白質地圖 (Human Protein Atlas, HPA)
HPA 是一個專注於「空間定位」的數據庫。它利用免疫組織化學染色 (immunohistochemistry, IHC) 技術,把數萬種蛋白質在人體各種組織切片中的染色圖譜數位化。透過 HPA,你可以親眼看到某個蛋白質是在細胞核、細胞質還是細胞膜上發光。
7.3 提示詞實戰:用 Python 馴服表現量矩陣與查詢組織特異標記
現在,讓我們來向 Gemini 借力,生成單細胞過濾程式碼,並規劃一條檢索組織特異基因的標準工作流。
練習一:單細胞 QC(品質管制)Python 程式碼自動生成
在拿到單細胞表現量矩陣後的第一步,就是過濾掉「死細胞」和「空液滴 (empty droplets)」。通常,死細胞會釋放出大量的線粒體 RNA。我們需要寫一個 Python 程式碼,過濾掉表現基因太少(可能是空滴)以及線粒體基因佔比太高(可能是死細胞)的細胞。
請將以下提示詞發送給 Gemini:
[Prompt]
Act as an expert bioinformatics data scientist. Write a clean, professional, and well-commented Python script using the ‘scanpy’ library to perform quality control (QC) on a single-cell RNA-seq dataset (an AnnData object). The script should: 1. Load an AnnData file ‘sample_data.h5ad’. 2. Calculate quality control metrics (including counts, number of genes, and percentage of mitochondrial genes starting with ‘MT-’). 3. Filter out low-quality cells with fewer than 200 genes expressed. 4. Filter out genes expressed in fewer than 3 cells. 5. Filter out dying cells with more than 5% mitochondrial gene expression. Provide brief explanations of why these specific QC thresholds are used.
[觀察重點]
- 程式碼語法準確度:觀察 Gemini 是否正確導入了
scanpy和pandas,並使用了標準的scanpy函數(例如sc.pp.calculate_qc_metrics和細胞過濾矩陣切片操作)。 - 線粒體基因識別:觀察程式碼中是否正確使用
adata.var_names.str.startswith('MT-')來識別人類線粒體基因。 - 注釋與科學原理解釋:觀察 AI 是否在註釋中解釋了為什麼要過濾這些細胞(例如:小於 200 個基因代表這只是一個包裹了游離 RNA 的空液滴,而高於 5% 的線粒體基因比例則強烈暗示細胞膜已破裂,導致細胞質 RNA 流失,只剩下相對較大的線粒體)。
練習二:利用 GTEx 與 HPA 驗證組織特異性標記
你想研究心肌肥大,並想確認一個標記基因 MYH6(心臟重鏈肌球蛋白)是否真的只在心臟中表達,而在骨骼肌或其它組織中完全不表達。你該如何規劃查詢?
請將以下提示詞發送給 Gemini:
[Prompt]
Act as a molecular database researcher. Write a detailed search protocol using the GTEx Portal and the Human Protein Atlas (HPA) to verify the tissue specificity of the gene MYH6. Address the following: 1. How to navigate GTEx to find the median expression level (in TPM) of MYH6 in heart tissue versus skeletal muscle. 2. How to use HPA to review immunohistochemistry (IHC) staining images of MYH6 in human tissues, and what the clinical significance of HPA’s “Reliability Score” (e.g., Enhanced, Supported) is. Format the search workflow clearly.
[觀察重點]
- 資料庫指標解析:觀察 Gemini 是否正確指出在 GTEx 中應關注的指標為 TPM (Transcripts Per Million) 中位數,並在組織箱線圖中對比不同肌肉組織。
- IHC 染色細節:觀察它是否提到在 HPA 中應檢視心肌與骨骼肌切片的染色強度 (Staining intensity: Strong, Medium, Weak, Negative) 以及陽性細胞比例。
- HPA 可信度分數解讀:觀察 AI 能否正確解釋 HPA 的 Reliability Score(例如:Enhanced 代表抗體染色結果與 RNA-seq 數據高度一致;Supported 代表有獨立的外部數據或文獻支持抗體的特異性)。
7.4 避坑指南:垃圾進,垃圾出 (Garbage In, Garbage Out)
使用 AI 進行高通量生醫數據分析時,有幾個極易踩中的天坑:
- 盲信「5% 線粒體過濾法」:在許多標準單細胞教學中,大家都盲目地使用
5%作為線粒體基因比例的過濾上限。然而,對於心肌細胞 (cardiomyocytes)、腎小管上皮細胞或棕色脂肪細胞等代謝極度活躍、富含線粒體的細胞,其正常的線粒體 RNA 佔比可能高達20%到30%。如果你直接用 AI 生成的 5% 門檻去套用,你辛辛苦苦定序出來的心肌細胞會被你當成「死細胞」全部丟進垃圾桶! - 程式庫版本漂移導致代碼報錯:Python 的
scanpy或 R 的Seurat經常進行大版本更新。Gemini 有時會混用舊版本的函數(例如舊版 Seurat 的FilterCells與新版的subset)。如果程式碼報錯,不要慌張,直接把報錯訊息 (error message) 複製貼給 Gemini,它會立刻幫你除錯 (debug)。 - mRNA 與蛋白質的「美麗誤會」:在查詢 HPA 與 GTEx 時,你可能會發現某個基因在組織中的 mRNA 豐度極高(GTEx TPM > 500),但蛋白質染色 (HPA IHC) 卻是陰性。這不一定是實驗做錯了,很可能是因為該蛋白質在轉譯後被迅速泛素化降解,或者是抗體無法識別折疊後的天然蛋白質構型。因此,多組學 (multi-omics) 的交叉驗證永遠是必需的。
7.5 本章小結與動手做
今天我們學會了用「水果冰沙與拼盤」的視角看穿 Bulk 與單細胞 RNA-seq 的本質差異,並成功利用 Gemini 自動生成了 Scanpy 品質管制程式碼,掌握了利用 GTEx 與 HPA 雙重資料庫驗證基因組織特異性的標準工作流。
🚀 今日實驗室課後作業:
請打開 Gemini,輸入以下提示詞,請它幫你寫一段資料整理的 Python 腳本:
Act as a Python pandas expert. Write a Python script using pandas to read a CSV file containing gene expression data with columns: 'Gene', 'Brain_TPM', 'Liver_TPM'. The script should filter for genes that have a 'Brain_TPM' greater than 100 and a 'Liver_TPM' less than 1, and output the top 10 genes sorted by 'Brain_TPM' in descending order.
試著在你的電腦上運行它(或者直接請 Gemini 模擬運行的輸出結果),你會發現,以前要在 Excel 裡篩選半天的矩陣數據,用 Python 只要三行就搞定了!
7.6 Glossary (中英詞彙對照表)
| 中文 | 英文 | 定義 / 解釋 |
|---|---|---|
| 整體轉錄體定序 | Bulk RNA-seq | 測量混合細胞群體(整個組織)中所有 RNA 平均表達量的技術。 |
| 單細胞 RNA 定序 | Single-cell RNA sequencing (scRNA-seq) | 在單一細胞水平上對轉錄體進行分離與高通量定序的技術。 |
| 表現量矩陣 | Expression matrix | 記錄不同基因在各個樣本或細胞中表現豐度的二維矩陣表格。 |
| 蛋白質體學 | Proteomics | 在細胞或組織水平上,對所有表達蛋白質的結構、功能與豐度進行系統性研究的學科。 |
| 質譜儀 | Mass spectrometry (MS) | 通過測量離子質荷比來鑑定樣本中分子成分與結構的分析儀器,常用於蛋白質體學。 |
| 基因表現量資料庫 | GTEx Portal | 研究人類不同組織中基因表達量以及遺傳變異調控關係的公開數據平台。 |
| 人類蛋白質地圖 | Human Protein Atlas (HPA) | 旨在繪製人體所有組織、細胞與亞細胞層級中蛋白質分佈與表現圖譜的瑞典公共計畫資料庫。 |
| 免疫組織化學染色 | Immunohistochemistry (IHC) | 利用抗原抗體特異性結合反應,在組織切片上定位並顯色特定蛋白質的實驗技術。 |
| 品質管制 | Quality control (QC) | 在數據分析前,過濾低質量樣本或細胞以確保下游分析可靠性的步驟。 |
| 線粒體基因 | Mitochondrial gene | 位於線粒體 DNA 上的基因,在單細胞 QC 中常作為細胞膜破裂與凋亡的指標。 |
| 多組學 | Multi-omics | 整合轉錄體、蛋白質體、基因體等多個維度的生物數據進行綜合分析的生物學方法。 |
| 組織特異性標記基因 | Tissue-specific marker gene | 在特定組織或細胞類型中高度專一表達,可用作其身份識別指標的基因。 |
| 降維聚類 | Dimensionality reduction & clustering | 將高維的單細胞表達數據投影到低維空間(如 UMAP/t-SNE)並將相似細胞歸類的數學算法。 |
| 空液滴 | Empty droplet | 在微流體單細胞捕獲中,未成功包裹細胞而僅含有游離 RNA 的無效反應液滴。 |
| 數據標準化 | Data normalization | 消除因定序深度或細胞大小差異引起的系統偏差,使不同細胞間數據可比的數學處理程序。 |
| 每百萬個鹼基的讀數 | Transcripts Per Million (TPM) | RNA-seq 中常用於校正基因長度與定序深度影響的基因表達量標準化單位。 |