Analysis分析方法
軌跡跑完之後。每個分析在量什麼、什麼時候不該用。
這章的頁面
這章在講什麼
軌跡已經在硬碟上了。這章回答的是接下來那個真正困難的問題:同一份資料可以生出幾十張圖,哪一張的數字有資格被寫進結論?
每一個分析都是一次投影,而投影一定要丟掉東西。你對這件事其實非常熟:同一份自洽波函數,你可以投成 DOS、投成 PDOS、投成 COHP、投成 Bader 電荷、投成電荷密度差分圖。每一種投影回答的問題不同,安靜丟掉的資訊也不同 —— 而且你早就知道其中有一個關鍵的可靠度落差:把整條 PDOS 積分起來得到的 d-band center 很穩,但「某個特定 k 點上某一條能帶的位置」對計算細節極度敏感。這章從頭到尾都在講同一個落差,只是換到軌跡上:把上萬個貢獻積分起來的量穩,只讀單一位點的量散。 你手上的數據把這件事量化到不能再清楚 —— 同一份 5F9R 四條 replica 的軌跡,介面埋藏面積的跨 replica CV 是 2.1%,而 groove 的接觸計數是 145.5%。同一條軌跡、同一個介面,差了將近七十倍。
不要問「這個分析準不準」,先問「這個分析把哪個維度壓掉了」。壓縮方式決定可靠度,可靠度決定它能不能打分。這個順序倒過來,這章的每一個錯誤都會發生。
十二頁分成三個家族,它們之間是遞進不是並列。第一族是幾何壓縮:RMSD 壓掉原子留下時間、RMSF 壓掉時間留下原子、PCA 壓掉維度留下集體運動方向、DCCM 壓成殘基兩兩之間的相關。這四個成本近乎為零,共同的軟肋是全部依賴 superposition 的參考選擇 —— 換個對齊方式答案就會漂。第二族是介面計數:contact map、氫鍵、鹽橋、介面埋藏面積,這四個是同一個介面的四種讀法,可靠度差距卻是這一章最戲劇性的部分(BSA 2.1%、總 protein–DNA 接觸 4.1%、鹽橋 9.5%,但逐位點與稀疏計數一路衝到三位數)。第三族才碰機制:HNH 距離是唯一直接對準決定專一性的那個構形開關的量、自由能地景是唯一碰得到能障也就是碰得到速率的路、MSM 是這十二個裡唯一不必先押注 collective variable 就能碰動力學的框架、MM/PBSA 則是唯一便宜到能對每個候選都算一遍、又直接給出 kcal/mol 的,但它量的是平衡結合而不是專一性。
這章不回答三件事,而且刻意不回答。它不教你怎麼跑出這條軌跡(那在 Molecular Dynamics);它不回答「這個數字對不對得上實驗」,因為那是效度問題,屬於 Benchmark;它也不替你決定哪一個當打分軸,那是 Workflow Design 的收斂點。這章只負責一件事:讓你在動手之前就知道每一個分析的破口在哪。
教授可能問
十二個分析,給我一個分類原則。不要按字母排。點開看參考答案
最有用的分類不是按「算什麼」,是按它壓掉了哪個維度:RMSD 壓原子留時間、RMSF 壓時間留原子、PCA 壓維度留集體方向、contact map 與 BSA 壓個體留總量、自由能地景把時間積分掉但保留了沿著座標的能障(所以它接得上速率)、MSM 則是唯一連時間本身都試圖留下來的。這個分類原則比任何清單好記,因為它同時解釋了可靠度:把很多貢獻加總的量,個別的來來去去會互相抵消;只讀單一位點的量,沒有任何東西可以幫它平均。 你要不要把一個分析放進打分公式,看它落在這條軸的哪一端就有八成的答案了。
BSA 的跨 replica CV 是 2.1%,groove 接觸計數是 145.5%。用物理解釋,不要說是運氣。點開看參考答案
差別在求和的自由度數目與貢獻之間的相關結構。BSA 是把上萬個原子的表面貢獻積分起來,個別殘基今天貼上去、明天鬆開,在總和裡互相抵消;相對漲落大致隨參與貢獻的數目開根號下降,而且介面上的貢獻彼此還是負相關(這裡鬆開、那裡就補上),抵消得比獨立情形更徹底。groove 接觸計數則是一個稀疏計數:它本身數值就小,一兩個接觸的有無就能讓數字翻倍,而 CV 的分母又剛好是那個小平均值,於是同一個絕對波動被放大成三位數的相對波動。所以看到超過 100% 的 CV,第一件事不是丟掉這個量,是先分辨它是真雜訊還是小分母造成的假象 —— 兩者的處置完全不同。
這十二個裡面,有幾個真的碰得到速率?點開看參考答案
兩個分析在同一條軌跡上給出互相矛盾的結論,你怎麼處理?點開看參考答案
先分辨矛盾發生在哪一層。如果一個是聚合量、一個是逐點量,那多半不是矛盾而是可靠度落差,逐點的那個本來就不該拿來下結論。如果兩個都是聚合量,就要檢查它們的共同前提有沒有被違反 —— 最常見的是 superposition 的參考不同、或是 equilibration 的截點不同。真正的矛盾(兩個都穩、前提一致、結論相反)非常罕見,而那反而是最有價值的訊號,通常代表你的物理圖像少了一個維度。最糟的處理方式是挑贏的那個報出來,因為那正是 reviewer 最會抓的行為模式。
Reviewer 可能問
你的 cutoff 與幾何門檻怎麼決定的?做過敏感度掃描嗎?點開看參考答案
這一題幾乎每篇都會被問,因為接觸距離、氫鍵的角度門檻、鹽橋的截斷距離都不是 Hamiltonian 的一部分,是你事後貼上去的判準。沒有掃描等於沒有回答。可防守的做法很簡單:把門檻從一端掃到另一端,看你的排序會不會翻轉。不翻轉才叫結論,會翻轉的叫參數的產物。要特別注意的是絕對數值一定會隨門檻單調變化,那不是問題;問題只在兩條曲線會不會交叉。
你報的相關係數,有沒有被 metric 本身的雜訊壓低?點開看參考答案
會,而且這件事是可以量化的。當你把一個帶雜訊的計算量拿去跟實驗值算相關,觀測到的相關係數會被兩端的可重現性同時打折,數量級上是 ρobs ≈ ρtrue · √(rxx · ryy)。實務後果有兩個方向:一個低相關可能是「這個描述符沒用」,也可能是「這個描述符太吵」,兩者要靠獨立 replica 的可重現性去區分;反過來,這也給了你一個上界 —— 一個 CV 高達 59% 的量,就算它在物理上完美對應到實驗,你也量不到高相關。詳見Metric 可靠性。
你試了十幾個 metric,然後報告其中一個顯著。這是不是多重比較?點開看參考答案
如果沒有事先聲明,那就是。這一問可以整篇打掉,而防線必須建在資料之前而不是之後:分層的依據是跨 replica 的可重現性,不是它跟結果的相關性。 也就是說「哪些 metric 有資格進打分公式」這件事,是在你看到任何變體結果之前、只根據 WT 軌跡的 CV 決定的。這個順序讓你完全不需要為打分軸做多重比較校正,因為篩選用的資訊與檢定用的資訊互相獨立。如果你是先看了結果再挑 metric,那就必須做校正,而且必須說出你試過幾個。
你的 superposition 參考結構是什麼?換一個,你的 PCA 與 DCCM 結論還在嗎?點開看參考答案
第一族的四個分析全部吃這個參數,而它極少被完整寫進 methods。你必須寫出:fit selection 是哪些原子、參考是晶體結構還是軌跡平均結構、有沒有排除末端與建模補出的區段。DCCM 對這一項尤其敏感,因為整體的平移與轉動殘留會製造出全域的假相關。可以防守的做法是報兩種對齊下的結果(全域對齊看整體位移、domain 內對齊看內部變形),並說明結論建立在哪一種上;做不到就至少要在 limitations 明講這個依賴性沒有被檢查。
口試可能問
為什麼不乾脆全部都算,然後用機器學習挑出有預測力的組合?點開看參考答案
因為維度遠大於樣本數。你有十幾個描述符,但獨立的統計單位只有四條 replica、少數幾個變體條件。在這個比例下,任何特徵選擇都會非常有效率地找到雜訊裡的假訊號,而且交叉驗證也救不了 —— 因為你的樣本本身就不獨立。正確的策略是反過來:先用物理與可靠度把候選砍到三到五個,再用等權的簡單公式。 這聽起來比較不厲害,但它是唯一在這個 n 之下能防守的做法。要用機器學習,得先把樣本數提高一到兩個數量級,那是另一個層級的算力預算。
你為什麼把 MM/PBSA 降級卻不刪掉?留著它不會拖累論文嗎?點開看參考答案
因為它在一個明確界定的問題上仍然有用:「這個變體還綁不綁得上」是個是非題,而它答得了。全盤否定是過度矯正,因為削弱非序列專一靜電接觸的那類設計,MM/PBSA 確實看得見。真正要拒絕的是把它當成專一性的排序軸,因為專一性由結合之後的構形檢查點決定,而且更緊的結合反而會壓掉 off-target 受質「先脫離」那條讓專一性成立的路徑。把它定位成必要但不充分的初篩,比刪掉更誠實,也更容易在跨組討論裡取得共識。
這十二個如果只能精通三個,你選哪三個?為什麼是那三個?點開看參考答案
先講一件事:我要選的第三個嚴格說不在這十二個裡面,而那正是我要說的重點。contact map 是介面問題的主力,聚合起來 CV 4.1%,而且它同時給你打分數與一張可拆成 target/non-target/sgRNA 的地圖;自由能地景是唯一碰得到你真正在乎的那個量的路,就算現在跑不起,也必須懂到能判斷別人的結果;第三個是取樣與收斂那一套診斷(區塊平均、跨 replica CV),它是章外的,因為它不是十二選一的選項,是讓其他十一個能不能報出去的前提。選擇的邏輯要講出來:一個負責產生數字、一個負責界定整條路線的天花板、一個負責界定所有數字的作用域 —— 而如果一定要把第三個收回這一章內部,那就換成介面埋藏面積,理由是它 CV 2.1%、可以當所有比較的正規化分母與 QC 閘門。
你的打分軸全都挑最穩的量。會不會因此挑到最沒有資訊量的那些?點開看參考答案
這是這一章最刁也最誠實的一問,答案是有可能,而且目前無法排除。BSA 之所以穩,正是因為它把上萬個貢獻積分掉,而同一個道理讓它看不見介面內部的重排 —— 穩定性與敏感度在這裡是同一個機制的兩面。可以守住的立場有三層:第一,可重現性是效度的上界,所以先過這一關在邏輯上是必要的;第二,這正是為什麼驗證不可略過,只有 ground truth 才能區分「穩而有用」與「穩而遲鈍」;第三,設計上要保留一個可靠度剛好卡在門檻線上、但機制上更貼近高保真變體設計邏輯的軸(例如鹽橋,CV 9.5%,而且 n = 4 讓這個 CV 本身還帶著約四成的相對誤差)當對照,讓「太穩所以太鈍」這個假說本身是可以被檢驗的。承認這個風險並設計出檢驗它的方式,比宣稱不存在這個風險強得多。
AI 對話練習
你是一位嚴格的計算生物物理審查者。我是計算化學/材料背景,正在替 Cas9 變體排序流程挑選分析指標。
規則:
- 你一次給我一個研究問題(例如「我想知道某個變體是不是讓蛋白對 non-target 股的挽留變弱」)。
- 我要回答四件事:我會用哪一個或哪幾個分析、它把哪個維度壓掉了、它的跨 replica 可靠度大約落在哪個等級、以及一個「如果我錯了,我會在資料裡看到什麼」的失敗訊號。
- 我答完你才評。評語必須指出我的選擇裡最脆弱的一環,並給出一個能讓我的結論翻盤的具體情境。
- 如果我的答案是「我全部都算」,直接駁回,並要求我說明在四條 replica 之下這麼做的統計代價。
請出 6 題,難度遞增。第 5 題請設計成一個「最穩的指標其實答不了這個問題」的情境,第 6 題請設計成一個「兩個分析會給出相反答案」的情境,看我怎麼處理。
我要向你解釋一件事:為什麼在同一條分子動力學軌跡上,把上萬個原子貢獻積分起來的量(例如介面埋藏面積)跨獨立軌跡非常穩定,而只讀單一位點的量(例如某兩個殘基之間的距離、某個小區域的接觸計數)卻可以差到好幾倍。
你扮演一位統計直覺很好、但完全不懂分子模擬的人。規則:
- 我每講完一段,你就追問一個「為什麼」,直到我講到最底層的統計理由為止。
- 至少挑戰我一次:「如果只是求和讓誤差變小,那我把很多雜訊指標加起來,是不是就得到一個有意義的指標了?」
- 至少挑戰我一次:「相對變異超過 100%,這在數學上是怎麼可能的?是不是你算錯了?」
- 如果我用了「因為它是聚合量」這種循環解釋,立刻指出那是換句話說不是解釋。
最後請你用你自己的話重講一次,並標出我原本的解釋裡缺了哪一個環節。
你扮演一位喜歡出陷阱題的方法學課程講師。
規則:
- 你描述一張分子動力學分析圖給我(圖的類型、軸是什麼、看起來呈現什麼趨勢、以及方法段裡有寫和沒寫的資訊)。不要給我圖檔,用文字描述就好。
- 我要指出三件事:這張圖最可能藏著什麼問題、我會要求作者補哪一項資訊、以及如果那項資訊是我擔心的樣子,這張圖的結論會怎麼改變。
- 你評語時要告訴我:我抓到的是不是主要問題,還是我抓到一個次要問題卻放過了致命的那個。
請設計 6 張圖,涵蓋以下陷阱各至少一次:整體轉動沒有移除、把建模補出的區段留在平均值裡、單一軌跡就報逐殘基結論、cutoff 剛好落在會翻轉排序的位置、以及用一條平坦的曲線宣稱已經收斂。最後一張請設計成「其實沒有問題」的對照,看我會不會硬找毛病。