Structural Biology結構生物學
你的模擬從哪個座標檔開始,決定了結論能不能信。
這章的頁面
這章在講什麼
這章夾在生物學與模擬中間,把「Cas9 在幹嘛」翻譯成「我的水盒子裡到底要放哪些原子、每個原子叫什麼編號」。它只回答三個問題:這台機器由哪幾塊會各自移動的積木組成、我手上這個座標檔是反應座標上的哪一點、以及沒有實驗結構時預測結構能撐到哪裡。 三個問題全部發生在你按下第一個 minimization 之前,全部不花算力,也全部沒有錯誤訊息保護你。
對你來說最接近的經驗是挑 POSCAR。要算 HER 你不會隨手抓一個 bulk 就切,你會先決定終止面、決定要不要考慮表面重構、決定 slab 厚度與真空層。這些決定沒有一個會讓 VASP 報錯,它們只會安靜地給你一組看起來完全合理的吸附能,而錯誤要到你把火山圖畫出來、跟實驗對不上的時候才浮出來。這章講的是同一件事,只是決定的名字換成「用哪個 PDB」「哪些殘基算 HNH」「沒有電子密度的那 11 個核苷酸怎麼補」。差別只有一個:Cas9 的座標檔裡有一部分原子是別人替你猜的,而 PDB 檔案格式不會在那些原子旁邊標一個星號。
一個結構決策如果不會改變任何一個下游數字,它就不屬於這章。反過來說,會改變下游數字卻沒有錯誤訊息的決策,全部都在這章。
三頁是一條有方向的鏈。Cas9 的 domain 架構先給你座標系:1368 個殘基怎麼切成七塊,以及為什麼 HNH 特別 —— 它是被插進 RuvC 序列中間、只靠 L1(765 到 780)與 L2(906 到 918)兩條短鉸鏈繫住的獨立摺疊,而這兩條鉸鏈的編號跟 HNH 本身是重疊的、不是相接的。這一頁的內容看起來像查表,但它是後面每一個 domain 級聚合量的分母。接著該用哪個結構起頭問「我在模擬哪個狀態」:4OO8、4UN3、5F9R 與近年的 cryo-EM 系列,差別不在畫質而在含哪些分子成分、construct 有沒有被去活、HNH 處於什麼構形。因為約 87 ns 的軌跡跨不過 HNH 那個大幅度的構形轉變,起始結構不是初始條件,它是「你在模擬哪個狀態」的定義。最後結構預測能不能用處理沒有晶體的情況,而它的答案有兩半,兩半都要記住:預測座標不能坐在生產 MD 的上游(從 Chai-1 起跑,逐殘基 top-8 共享 0/8、ρ ≈ −0.03,等同隨機),但預測的信心分布本身是幾乎免費的訊號 —— HNH 只有 62.9、765 到 809 這一段(L1 加上 HNH 的 N 端起始段;不要籠統叫它「L1 linker」,照上面的邊界,780 之後已經進到 HNH 本體)低到 46,而那恰恰是 MD 量到最會動的地方,逐殘基 RMSF 與 pLDDT 反相關 ρ = −0.36。
讀完這三頁,你手上應該多出兩樣東西:一份釘進版本控制的 selection 設定檔(哪些殘基算哪個 domain、哪些原子是補的),以及一句可以直接寫進 methods 的話(「本工作以 PDB 5F9R 為起始,其 non-target 股 30 個核苷酸中 19 個有實驗座標,其餘為建模補入並在所有聚合量中排除」)。這兩樣東西加起來的算力成本是零,但它們決定了後面每一張圖能不能被相信。
教授可能問
你的模擬從 5F9R 起跑。那這條軌跡能回答什麼、不能回答什麼?點開看參考答案
能回答的是「已經形成完整 R-loop、HNH 還沒 docking」這個狀態底下的聚合層級結構統計:介面接觸總數、埋藏面積、鹽橋數,以及蛋白端哪些區域相對柔軟。逐位點的接觸身分與距離不在這張清單上 —— 它們的跨 replica CV 落在四成上下,只夠排量級。不能回答的是任何需要跨過 HNH 那個構形轉變的東西 —— 檢查點的高度、docking 的速率、變體讓這道障礙升高多少。理由很物理:那個轉變在無偏 MD 裡的時間尺度遠超過 87 ns,你的軌跡連一次事件都看不到,所以「沒觀察到」不等於「不會發生」。能把這條界線畫在正確位置,比多背三個 PDB 編號有用得多。
HNH 是一塊 domain。你怎麼定它的邊界?定錯了會怎樣?點開看參考答案
domain 邊界是慣例不是自然常數,不同論文差幾個殘基是常態。實務上 HNH 大約落在 775 到 908,而 L1(765 到 780)與 L2(906 到 918)跟它在編號上重疊。定錯的後果不是報錯,而是安靜地改變分母:你算 domain 平均 RMSF、算 HNH 與 RuvC 的質心距離、算介面接觸的歸屬,全部要先說「哪些原子算 HNH」。多納入或少納入十個柔軟的 linker 殘基,就足以改變 domain 平均值的排序。正確做法是把 selection 寫成一份設定檔、進版本控制、所有腳本共用同一份,而不是每個腳本各寫一次。
有人給你一個解析度 3 Å 出頭的結構。哪些東西你可以相信、哪些不該相信?點開看參考答案
主鏈走向與 domain 的相對擺放可以相信,二級結構可以相信。不該直接相信的是側鏈旋轉異構物的細節、水分子的位置、以及任何跟氫有關的幾何 —— 那個解析度根本看不到氫,所有質子化狀態都是你或建模軟體事後指定的。這件事直接連到你的系統建立:氫鍵網路、His 的互變異構物、DNA 磷酸周圍的離子分布,全部是假設而不是觀測。在 DFT 世界你很習慣分辨「實驗測到的」與「模型補的」,這裡要保持同一個習慣,只是 PDB 檔案不會替你標出來。
apo、binary、ternary 三種結構,你各拿它們做什麼?點開看參考答案
apo(什麼都沒綁)用來對照「綁上 sgRNA 之後兩個 lobe 會重新定向」這件事,它本身不適合當生產 MD 的起點,因為你關心的所有事情都發生在綁上核酸之後。binary(Cas9 加 sgRNA)是搜尋狀態,適合問 PAM 掃描相關的問題。ternary(再加上 DNA)才是你要的,而且要進一步分辨含不含被頂開的 non-target 股 —— 沒有 non-target 股的三元結構在幾何上是不完整的 R-loop,你如果要談 eSpCas9(1.1) 那三個正電殘基怎麼挽留單股,缺了那一股就等於缺了受質。選結構的第一個動作永遠是列成分清單,不是看解析度。
Reviewer 可能問
你的起始結構有多少原子是建模補出來的?你的結論依不依賴那些原子?點開看參考答案
必須主動回答,而且要給數字。5F9R 的 non-target 股 30 個核苷酸裡只有 19 個有座標,其餘是補的;在你自己的軌跡裡,補出來的 5′ 端(res 1 到 11)RMSF 有 6 到 8 Å,而晶體本體只有 3.9 Å。正確的處理是三步:在圖上用不同顏色標出所有無實驗座標的區段、在所有聚合量的計算中排除它們、並在補充材料放一次「含與不含補模區段」的對照。這一問幾乎可以廢掉一張圖,所以要在 reviewer 之前自己講。
你為什麼不用 AI 預測結構?現在大家都在用。你有比較過嗎?點開看參考答案
有,而且這是你手上最乾淨的一組配對對照:同一套 metric、同一套分析流程、只換起始結構。從 Chai-1 預測結構起跑,四條 replica 的逐殘基 top-8 接觸殘基共享 0 個、ρ ≈ −0.03;換成 5F9R 晶體結構起跑,變成共享 3 個(450、695、765)、pairwise Jaccard 0.48、Spearman +0.77。元兇是起始結構,不是 metric。 但同樣要誠實補一句:這只把逐殘基分析從「隨機」修成「弱訊號」,並沒有把它修到可以打分的程度,所以打分仍然只用聚合量。
你的 domain 定義從哪裡來?跟你引用的文獻用的是同一套嗎?點開看參考答案
如果答不出來,那所有 domain 級的數字都失去可比性。可防守的回答是:定義寫在一份公開的設定檔裡、標明出處(通常追到原始結構論文的 domain 劃分)、並且在方法段給出實際使用的殘基區間。若跟某篇要比較的文獻不一致,就用該文獻的定義重算一次當作對照。這是零算力成本的動作,做了就沒有破口,不做就是一個隨時可以被引爆的地雷。
你只用了一個起始結構。同一個狀態的不同 PDB 條目會不會給出不同答案?點開看參考答案
誠實的回答是:「預測結構 vs 晶體結構」與「同狀態多個晶體結構」是兩組不同的對照,前者不能代替後者。 前者比較的是兩個差異巨大的來源,後者問的是同一類來源內部的變異 —— 不要假裝其中一組已經涵蓋了另一組,做了哪一組、沒做哪一組都要寫進 limitations。補救很便宜:挑一個成分接近的替代結構重跑一到兩條 replica,只看聚合量會不會落在原本的誤差棒內。這個對照做起來比多跑幾條 replica 還便宜,卻能擋掉一整類質疑。
口試可能問
你為什麼選 5F9R,而不是 cryo-EM 那些捕捉到中間態的結構?點開看參考答案
理由要講成「這個狀態是我要問的問題的定義域」,不是「這個結構比較有名」。5F9R 是第一個把位移的 non-target 股放進模型的結構,也就是完整 R-loop 都在,而你的問題(介面 engagement、正電溝槽對單股的挽留)需要那一股在場 —— 但同一句話要接著講清楚:那一股 30 nt 裡只有 19 nt 有座標,補出來的 5′ 端不能拿來當證據。cryo-EM 的中間態系列很吸引人,但要注意它們的狀態往往是靠改變樣品條件分離出來的不同樣品,不是同一條路徑上量到的先後順序。代價要一起講:從 5F9R 起跑等於站在構形檢查點的下游,所以檢查點本身的高度不在這條軌跡的射程內,那要靠增強取樣或改變起點另外處理。
你把很大一部分心力放在「起始結構」上。這是不是把簡單問題複雜化了?點開看參考答案
反向論證最有力:起始結構這件事的成本近乎為零,而它的影響力已經被你自己的數據量化過 —— 同一套 metric 可以因為換起始結構而從 ρ ≈ −0.03(隨機)變成 Spearman +0.77。一個零成本、影響到把訊號從無變到有的決定,不叫複雜化,叫投資報酬率最高的那一格。真正的複雜化是那些花了大量機時、卻只把統計誤差縮小一點的動作。
如果三年後結構預測準到可以取代晶體結構,你這一章的價值還剩下什麼?點開看參考答案
剩下兩樣,而且都不會過期。第一,方法論本身:「換起始結構、其餘全部固定、看下游 metric 怎麼變」這個配對對照設計,不管預測工具進步到哪一代都要重做一次,因為它量的是流程的敏感度不是某個工具的品質。第二,信心分布作為獨立訊號這個用法:即使座標準了,pLDDT 與 PAE 仍然帶著模型自己的不確定度資訊,而它跟 MD 的柔軟度反相關(ρ = −0.36)這件事屬於物理不屬於工具版本。要誠實承認會過期的部分:具體的數字(62.9、46)綁在特定模型與特定版本上,它們是證據不是常數。
不做結構解析的人,憑什麼對結構品質下判斷?點開看參考答案
憑的是使用者視角的檢查表,不是結構學家的直覺,而且要把這個限制講在前面。你能做的判斷是:成分清單完不完整、哪些殘基沒有座標、construct 有沒有被去活或截短、解析度容不容許你相信你要用的那個細節。你不能做的判斷是 refinement 的品質、密度圖與模型的吻合程度、以及某個側鏈擺向是不是過度擬合。正確的策略是把能做的部分做到明文化,把不能做的部分交給合作者或改用不依賴那個細節的分析,而不是假裝自己有能力全面評估一個結構。
AI 對話練習
你是一位結構生物學家,專長是 CRISPR 相關蛋白的晶體與 cryo-EM 結構。我是計算化學/材料背景,熟 DFT 與 VASP,生醫背景接近零,正在替一組 Cas9 分子動力學模擬挑選起始座標。
請你出 6 個題目,每題給我一個 Cas9 相關結構的「成分清單」描述(例如:含 Cas9 蛋白、sgRNA、20 nt target 股,不含 non-target 股,催化殘基被突變成 Ala,解析度 2.5 Å)。不要直接給我 PDB 編號,我要從成分自己判斷。
我對每一題要回答四件事:
- 這個結構落在 Cas9 反應循環的哪一步。
- 從它起跑的模擬不能回答哪一類問題。
- 這個 construct 有沒有被動過手腳,以及那會怎麼影響我的結論。
- 我要另外檢查的一件事(例如哪些區段可能沒有座標)。
規則:我答完你才評,評語要具體指出我漏掉的那一項,並用一句話說明忽略它會在下游造成什麼具體錯誤。如果我只是複述你給的清單,直接說「這是複述不是判斷」。最後一題請設計成一個「乍看很適合、其實不能用」的陷阱結構。
你扮演一位剛接手我專案的博士後,個性挑剔,任務是重現我的分析。你只能拿到我口述的定義,不能看我的腳本。
我會告訴你我的 domain 定義與原子選擇(例如:HNH 是哪些殘基、fit selection 用什麼、哪些區段被排除、核酸用哪個原子代表)。
你的任務:
- 逐條找出我的描述裡任何一個會導致你算出不同數字的模糊處,並且明講你會怎麼理解它、我原本可能是什麼意思、兩者算出來的差別可能有多大。
- 特別追問三件事:邊界殘基算不算在內、補模區段有沒有被排除、以及我有沒有在不同分析裡用了不一致的定義。
- 最後把我的口述改寫成一份沒有歧義的 selection 規格,格式是「名稱:殘基區間:包含或排除的理由」,並標出哪幾行是我原本沒講、你替我補的假設。
不要客氣,也不要幫我圓場。我的目標是在 reviewer 之前先被你問倒。
我要向你解釋一個命題:在時間尺度不足以跨越主要構形轉變的分子動力學裡,起始結構不是初始條件,而是「你在模擬哪個狀態」的定義。
你扮演一位做了二十年第一原理計算的資深研究員。你的直覺是「初始構形只要跑得夠久就會被遺忘」,因為你熟悉的幾何最佳化與 ab initio MD 大多真的如此。你不接受任何無法用位能面、能障、時間尺度這三個概念講清楚的說法。
規則:
- 我每講一段,你就用你熟悉的世界反駁一次。至少要問一次「那你怎麼知道不是你的取樣不夠,而是它真的不會動?」
- 我如果用類比,追問這個類比在哪裡失效。
- 中途挑戰我:「既然如此,那你所有的結論不就都只對這一個結構成立?那還有什麼普遍性?」
- 最後給我一段你認為正確的 90 秒講法,並指出我原本版本裡最弱的一句話,說明它弱在哪。