Analysis分析方法

軌跡跑完之後。每個分析在量什麼、什麼時候不該用。

12 頁
One trajectory drawn as an atoms-by-time grid, fanning out into four projection directions: collapsing the atom axis gives one number per frame, collapsing the time axis gives one number per site, collapsing the coordinate axis gives a few collective directions, and keeping time costs a bet on a collective variable; a rule underneath shows that reliability follows how many contributions were summed into the reported number, anchored at each end by the DFT analogy of a single band at a single k-point versus the d-band centre.
示意圖(向量繪製) 十二個分析全部是同一條軌跡的投影,差別只在壓掉哪個軸。四個方向沒有高下,但底下那條軸有:報出來的數字裡加總了多少個貢獻,直接決定它換一顆亂數種子還在不在 —— 這跟「d-band center 穩、單一 k 點的能帶位置不穩」是同一件事。

這章的頁面

RMSD★★★☆☆ Root-Mean-Square Deviation 整個結構跟參考結構差多遠,一條隨時間變化的曲線。 L4 RMSF★★★★☆ Root-Mean-Square Fluctuation 每個殘基在模擬裡晃多大,一條沿著序列的柔軟度曲線。 L4 Contact Map★★★★★ Contact maps and interface contacts 誰碰到誰,以及碰了多久。介面分析最耐用的一把尺。 L4 氫鍵分析★★★☆☆ Hydrogen bond analysis 方向性最強的非共價作用,也是最吃幾何判準的分析。 L4 鹽橋分析★★★★☆ Salt bridge analysis 帶電殘基與 DNA 磷酸骨架的靜電握手,蛋白與核酸介面的主力。 L4 介面埋藏面積★★★★★ Buried surface area at the interface 兩個分子貼在一起遮掉多少表面,一個出奇穩定的聚合量。 L4 HNH 距離與構形檢查點★★★★★ HNH docking distance 直接量那個決定專一性的構形開關開了多少。 L4 PCA★★★☆☆ Principal component analysis of trajectories 把幾萬維的運動壓成兩三個「主要在做什麼」的方向。 L4 DCCM★★☆☆☆ Dynamic cross-correlation map 哪些區域傾向一起動,用來講 allosteric 故事的圖。 L4 自由能地景與增強取樣★★★★☆ Free energy landscape and enhanced sampling 唯一能碰到能障、也就是碰到速率的那條路。 L4 Markov State Model★★★☆☆ Markov state models 用一堆短軌跡拼出狀態之間的轉換速率。 L4 MM/PBSA★★★☆☆ MM/PBSA and MM/GBSA 便宜的結合自由能估計,也是最常被過度解讀的數字。 L4

這章在講什麼

軌跡已經在硬碟上了。這章回答的是接下來那個真正困難的問題:同一份資料可以生出幾十張圖,哪一張的數字有資格被寫進結論?

每一個分析都是一次投影,而投影一定要丟掉東西。你對這件事其實非常熟:同一份自洽波函數,你可以投成 DOS、投成 PDOS、投成 COHP、投成 Bader 電荷、投成電荷密度差分圖。每一種投影回答的問題不同,安靜丟掉的資訊也不同 —— 而且你早就知道其中有一個關鍵的可靠度落差:把整條 PDOS 積分起來得到的 d-band center 很穩,但「某個特定 k 點上某一條能帶的位置」對計算細節極度敏感。這章從頭到尾都在講同一個落差,只是換到軌跡上:把上萬個貢獻積分起來的量穩,只讀單一位點的量散。 你手上的數據把這件事量化到不能再清楚 —— 同一份 5F9R 四條 replica 的軌跡,介面埋藏面積的跨 replica CV 是 2.1%,而 groove 的接觸計數是 145.5%。同一條軌跡、同一個介面,差了將近七十倍。

這章的一條主軸

不要問「這個分析準不準」,先問「這個分析把哪個維度壓掉了」。壓縮方式決定可靠度,可靠度決定它能不能打分。這個順序倒過來,這章的每一個錯誤都會發生。

十二頁分成三個家族,它們之間是遞進不是並列。第一族是幾何壓縮RMSD 壓掉原子留下時間、RMSF 壓掉時間留下原子、PCA 壓掉維度留下集體運動方向、DCCM 壓成殘基兩兩之間的相關。這四個成本近乎為零,共同的軟肋是全部依賴 superposition 的參考選擇 —— 換個對齊方式答案就會漂。第二族是介面計數contact map氫鍵鹽橋介面埋藏面積,這四個是同一個介面的四種讀法,可靠度差距卻是這一章最戲劇性的部分(BSA 2.1%、總 protein–DNA 接觸 4.1%、鹽橋 9.5%,但逐位點與稀疏計數一路衝到三位數)。第三族才碰機制HNH 距離是唯一直接對準決定專一性的那個構形開關的量、自由能地景是唯一碰得到能障也就是碰得到速率的路、MSM 是這十二個裡唯一不必先押注 collective variable 就能碰動力學的框架、MM/PBSA 則是唯一便宜到能對每個候選都算一遍、又直接給出 kcal/mol 的,但它量的是平衡結合而不是專一性。

這章回答三件事,而且刻意不回答。它不教你怎麼跑出這條軌跡(那在 Molecular Dynamics);它不回答「這個數字對不對得上實驗」,因為那是效度問題,屬於 Benchmark;它也不替你決定哪一個當打分軸,那是 Workflow Design 的收斂點。這章只負責一件事:讓你在動手之前就知道每一個分析的破口在哪。

Map of the twelve trajectory analyses, placed by cross-replica reproducibility on the horizontal axis against how close each one gets to the step that decides specificity on the vertical axis. The reproducible metrics (buried surface area, aggregate contacts, salt bridges) sit low and to the right, the two analyses that return a barrier or a rate (free-energy landscape, Markov state model) sit high and to the left, and the upper right region is marked empty.
示意圖(向量繪製) 十二個分析擺在同一張圖上:橫軸是換一顆亂數種子還在不在,縱軸是離「決定專一性的那一步」有多近。右下角那群是唯一有資格打分的,卻離機制最遠;碰得到能障的兩個全在左上。右上角空著,那就是這章的核心矛盾。位置是依定義擺的,不是量出來的座標。

教授可能問

十二個分析,給我一個分類原則。不要按字母排。點開看參考答案

最有用的分類不是按「算什麼」,是按它壓掉了哪個維度:RMSD 壓原子留時間、RMSF 壓時間留原子、PCA 壓維度留集體方向、contact map 與 BSA 壓個體留總量、自由能地景把時間積分掉但保留了沿著座標的能障(所以它接得上速率)、MSM 則是唯一連時間本身都試圖留下來的。這個分類原則比任何清單好記,因為它同時解釋了可靠度:把很多貢獻加總的量,個別的來來去去會互相抵消;只讀單一位點的量,沒有任何東西可以幫它平均。 你要不要把一個分析放進打分公式,看它落在這條軸的哪一端就有八成的答案了。

BSA 的跨 replica CV 是 2.1%,groove 接觸計數是 145.5%。用物理解釋,不要說是運氣。點開看參考答案

差別在求和的自由度數目與貢獻之間的相關結構。BSA 是把上萬個原子的表面貢獻積分起來,個別殘基今天貼上去、明天鬆開,在總和裡互相抵消;相對漲落大致隨參與貢獻的數目開根號下降,而且介面上的貢獻彼此還是負相關(這裡鬆開、那裡就補上),抵消得比獨立情形更徹底。groove 接觸計數則是一個稀疏計數:它本身數值就小,一兩個接觸的有無就能讓數字翻倍,而 CV 的分母又剛好是那個小平均值,於是同一個絕對波動被放大成三位數的相對波動。所以看到超過 100% 的 CV,第一件事不是丟掉這個量,是先分辨它是真雜訊還是小分母造成的假象 —— 兩者的處置完全不同。

這十二個裡面,有幾個真的碰得到速率?點開看參考答案

嚴格講只有兩條路:自由能地景(沿著你選的 collective variable 得到能障,配合 Eyring 或 Kramers 才談得上速率)與 MSM(從轉移矩陣直接解出狀態之間的轉換時間)。其餘十個全部是平衡態的結構統計,包括 HNH 距離 —— 它雖然直接對準檢查點,但它給的是一個幾何座標的分布,不是那道障礙的高度。這一問很致命,因為它直指整站的核心矛盾:Cas9 的專一性由動力學決定,而你負擔得起的分析幾乎全部是平衡態的。 誠實的立場是把便宜的結構統計當成描述符,然後用少數幾個昂貴的自由能計算去校準它們,而不是假裝結構統計本身就是速率。

兩個分析在同一條軌跡上給出互相矛盾的結論,你怎麼處理?點開看參考答案

先分辨矛盾發生在哪一層。如果一個是聚合量、一個是逐點量,那多半不是矛盾而是可靠度落差,逐點的那個本來就不該拿來下結論。如果兩個都是聚合量,就要檢查它們的共同前提有沒有被違反 —— 最常見的是 superposition 的參考不同、或是 equilibration 的截點不同。真正的矛盾(兩個都穩、前提一致、結論相反)非常罕見,而那反而是最有價值的訊號,通常代表你的物理圖像少了一個維度。最糟的處理方式是挑贏的那個報出來,因為那正是 reviewer 最會抓的行為模式。

Reviewer 可能問

你的 cutoff 與幾何門檻怎麼決定的?做過敏感度掃描嗎?點開看參考答案

這一題幾乎每篇都會被問,因為接觸距離、氫鍵的角度門檻、鹽橋的截斷距離都不是 Hamiltonian 的一部分,是你事後貼上去的判準。沒有掃描等於沒有回答。可防守的做法很簡單:把門檻從一端掃到另一端,看你的排序會不會翻轉。不翻轉才叫結論,會翻轉的叫參數的產物。要特別注意的是絕對數值一定會隨門檻單調變化,那不是問題;問題只在兩條曲線會不會交叉。

你報的相關係數,有沒有被 metric 本身的雜訊壓低?點開看參考答案

會,而且這件事是可以量化的。當你把一個帶雜訊的計算量拿去跟實驗值算相關,觀測到的相關係數會被兩端的可重現性同時打折,數量級上是 ρobs ≈ ρtrue · √(rxx · ryy)。實務後果有兩個方向:一個低相關可能是「這個描述符沒用」,也可能是「這個描述符太吵」,兩者要靠獨立 replica 的可重現性去區分;反過來,這也給了你一個上界 —— 一個 CV 高達 59% 的量,就算它在物理上完美對應到實驗,你也量不到高相關。詳見Metric 可靠性

你試了十幾個 metric,然後報告其中一個顯著。這是不是多重比較?點開看參考答案

如果沒有事先聲明,那就是。這一問可以整篇打掉,而防線必須建在資料之前而不是之後:分層的依據是跨 replica 的可重現性,不是它跟結果的相關性。 也就是說「哪些 metric 有資格進打分公式」這件事,是在你看到任何變體結果之前、只根據 WT 軌跡的 CV 決定的。這個順序讓你完全不需要為打分軸做多重比較校正,因為篩選用的資訊與檢定用的資訊互相獨立。如果你是先看了結果再挑 metric,那就必須做校正,而且必須說出你試過幾個。

你的 superposition 參考結構是什麼?換一個,你的 PCA 與 DCCM 結論還在嗎?點開看參考答案

第一族的四個分析全部吃這個參數,而它極少被完整寫進 methods。你必須寫出:fit selection 是哪些原子、參考是晶體結構還是軌跡平均結構、有沒有排除末端與建模補出的區段。DCCM 對這一項尤其敏感,因為整體的平移與轉動殘留會製造出全域的假相關。可以防守的做法是報兩種對齊下的結果(全域對齊看整體位移、domain 內對齊看內部變形),並說明結論建立在哪一種上;做不到就至少要在 limitations 明講這個依賴性沒有被檢查。

口試可能問

為什麼不乾脆全部都算,然後用機器學習挑出有預測力的組合?點開看參考答案

因為維度遠大於樣本數。你有十幾個描述符,但獨立的統計單位只有四條 replica、少數幾個變體條件。在這個比例下,任何特徵選擇都會非常有效率地找到雜訊裡的假訊號,而且交叉驗證也救不了 —— 因為你的樣本本身就不獨立。正確的策略是反過來:先用物理與可靠度把候選砍到三到五個,再用等權的簡單公式。 這聽起來比較不厲害,但它是唯一在這個 n 之下能防守的做法。要用機器學習,得先把樣本數提高一到兩個數量級,那是另一個層級的算力預算。

你為什麼把 MM/PBSA 降級卻不刪掉?留著它不會拖累論文嗎?點開看參考答案

因為它在一個明確界定的問題上仍然有用:「這個變體還綁不綁得上」是個是非題,而它答得了。全盤否定是過度矯正,因為削弱非序列專一靜電接觸的那類設計,MM/PBSA 確實看得見。真正要拒絕的是把它當成專一性的排序軸,因為專一性由結合之後的構形檢查點決定,而且更緊的結合反而會壓掉 off-target 受質「先脫離」那條讓專一性成立的路徑。把它定位成必要但不充分的初篩,比刪掉更誠實,也更容易在跨組討論裡取得共識。

這十二個如果只能精通三個,你選哪三個?為什麼是那三個?點開看參考答案

先講一件事:我要選的第三個嚴格說不在這十二個裡面,而那正是我要說的重點。contact map 是介面問題的主力,聚合起來 CV 4.1%,而且它同時給你打分數與一張可拆成 target/non-target/sgRNA 的地圖;自由能地景是唯一碰得到你真正在乎的那個量的路,就算現在跑不起,也必須懂到能判斷別人的結果;第三個是取樣與收斂那一套診斷(區塊平均、跨 replica CV),它是章外的,因為它不是十二選一的選項,是讓其他十一個能不能報出去的前提。選擇的邏輯要講出來:一個負責產生數字、一個負責界定整條路線的天花板、一個負責界定所有數字的作用域 —— 而如果一定要把第三個收回這一章內部,那就換成介面埋藏面積,理由是它 CV 2.1%、可以當所有比較的正規化分母與 QC 閘門。

你的打分軸全都挑最穩的量。會不會因此挑到最沒有資訊量的那些?點開看參考答案

這是這一章最刁也最誠實的一問,答案是有可能,而且目前無法排除。BSA 之所以穩,正是因為它把上萬個貢獻積分掉,而同一個道理讓它看不見介面內部的重排 —— 穩定性與敏感度在這裡是同一個機制的兩面。可以守住的立場有三層:第一,可重現性是效度的上界,所以先過這一關在邏輯上是必要的;第二,這正是為什麼驗證不可略過,只有 ground truth 才能區分「穩而有用」與「穩而遲鈍」;第三,設計上要保留一個可靠度剛好卡在門檻線上、但機制上更貼近高保真變體設計邏輯的軸(例如鹽橋,CV 9.5%,而且 n = 4 讓這個 CV 本身還帶著約四成的相對誤差)當對照,讓「太穩所以太鈍」這個假說本身是可以被檢驗的。承認這個風險並設計出檢驗它的方式,比宣稱不存在這個風險強得多。

AI 對話練習

練習一:選軸演練,被逼到牆角為止

你是一位嚴格的計算生物物理審查者。我是計算化學/材料背景,正在替 Cas9 變體排序流程挑選分析指標。

規則:

  1. 你一次給我一個研究問題(例如「我想知道某個變體是不是讓蛋白對 non-target 股的挽留變弱」)。
  2. 我要回答四件事:我會用哪一個或哪幾個分析、它把哪個維度壓掉了、它的跨 replica 可靠度大約落在哪個等級、以及一個「如果我錯了,我會在資料裡看到什麼」的失敗訊號。
  3. 我答完你才評。評語必須指出我的選擇裡最脆弱的一環,並給出一個能讓我的結論翻盤的具體情境。
  4. 如果我的答案是「我全部都算」,直接駁回,並要求我說明在四條 replica 之下這麼做的統計代價。

請出 6 題,難度遞增。第 5 題請設計成一個「最穩的指標其實答不了這個問題」的情境,第 6 題請設計成一個「兩個分析會給出相反答案」的情境,看我怎麼處理。

練習二:費曼技巧,講清楚積分量為什麼穩

我要向你解釋一件事:為什麼在同一條分子動力學軌跡上,把上萬個原子貢獻積分起來的量(例如介面埋藏面積)跨獨立軌跡非常穩定,而只讀單一位點的量(例如某兩個殘基之間的距離、某個小區域的接觸計數)卻可以差到好幾倍。

你扮演一位統計直覺很好、但完全不懂分子模擬的人。規則:

  1. 我每講完一段,你就追問一個「為什麼」,直到我講到最底層的統計理由為止。
  2. 至少挑戰我一次:「如果只是求和讓誤差變小,那我把很多雜訊指標加起來,是不是就得到一個有意義的指標了?」
  3. 至少挑戰我一次:「相對變異超過 100%,這在數學上是怎麼可能的?是不是你算錯了?」
  4. 如果我用了「因為它是聚合量」這種循環解釋,立刻指出那是換句話說不是解釋。

最後請你用你自己的話重講一次,並標出我原本的解釋裡缺了哪一個環節。

練習三:反向工程一張分析圖

你扮演一位喜歡出陷阱題的方法學課程講師。

規則:

  1. 你描述一張分子動力學分析圖給我(圖的類型、軸是什麼、看起來呈現什麼趨勢、以及方法段裡有寫和沒寫的資訊)。不要給我圖檔,用文字描述就好。
  2. 我要指出三件事:這張圖最可能藏著什麼問題、我會要求作者補哪一項資訊、以及如果那項資訊是我擔心的樣子,這張圖的結論會怎麼改變。
  3. 你評語時要告訴我:我抓到的是不是主要問題,還是我抓到一個次要問題卻放過了致命的那個。

請設計 6 張圖,涵蓋以下陷阱各至少一次:整體轉動沒有移除、把建模補出的區段留在平均值裡、單一軌跡就報逐殘基結論、cutoff 剛好落在會翻轉排序的位置、以及用一條平坦的曲線宣稱已經收斂。最後一張請設計成「其實沒有問題」的對照,看我會不會硬找毛病。