怎麼讀一篇 Cas9 MD paperHow to read a Cas9 MD paper
用 reviewer 的眼睛讀:先找取樣,再找對照,最後才看結論。
01一句話只有一句
先讀方法段的取樣量與對照組,再決定要不要相信結論。
02Why should I care?我為什麼要讀這頁
因為你在 DFT 圈已經有一套反射,在 MD 圈還沒有,而你正要寫的是一篇 methodology paper。
看到一篇論文寫「we performed first-principles calculations」,你的眼睛會自動去找:什麼泛函、ENCUT 多少、k-mesh 收斂測試在哪、有沒有 vdW 修正、slab 幾層、真空層多厚、有沒有做 dipole correction。這套反射花了你好幾年建立,而它真正的作用不是找碴,是判斷這篇的數字能不能拿來跟你的比。
你現在讀 Cas9 MD 論文沒有這套反射,於是每一篇看起來都一樣可信。這在此刻特別危險,因為你正在做兩件高度依賴文獻的事。第一,你的 ground truth panel 完全從文獻抽取——抽錯一次是系統性偏差,再多 replica 也救不回來。第二,一篇 methodology paper 若要主張「別人沒報的可靠性我報了」,這個主張成立的前提,是你能精確說出別人報了什麼、沒報什麼,並且說得出來源。
這裡有個常見的陷阱,先講在前面:「既有研究取樣不足」是一個防守不住的主張。 skeens2024 光一個系統就 4 replicas × ~4 μs、四系統合計約 64 μs;論取樣量,多數新進工作都打不贏,而且在「便宜」是硬約束的前提下也不該去打。真正還空著的是更窄、也更少人占的那一句:有 n 不等於有誤差棒——很少有人把每一個 metric 的跨軌跡離散度拆開來報。 分不清這兩句的差別,reviewer 只要舉一篇反例就把整段引言打掉。用「多數研究都沒做」這種沒有分母的句子去撐,他還會順便要你補一張表。
這一頁就是把 DFT 那套反射移植過來。移植完你會發現一件事:MD 論文的可信度幾乎全部藏在方法段與圖說裡,不在結論裡。
03What這是什麼
一篇 Cas9 MD 論文可以拆成六個要素,每一個都直接限制它能支撐多大的結論:起始座標、系統組成、力場與積分設定、取樣、observable 與統計、結論的作用域。
把它們壓成一句可操作的話:
三者取小。一篇跑了 3 μs 但沒有任何對照組的論文,跟一篇對照設計完美但只跑 50 ns 的論文,能支撐的結論一樣小——只是壞在不同地方。
取樣量不是一個數字,是三個。 幾個系統 × 幾條獨立 replica × 每條多長。文獻常見的「aggregate sampling of 2 μs」把三個乘成一個,而這個乘積會誤導:10 × 200 ns 與 1 × 2 μs 的 aggregate 相同,但前者給得出跨軌跡的離散度、後者看得到較慢的事件,兩者回答的問題不同,統計力也不同。看到 aggregate 就要當場拆開。
對照組在 MD 裡有四種常見形式: WT vs variant(完全相同的設定)、on-target vs mismatched 底物、apo vs 複合體、同一系統的不同起始結構或不同力場。一篇沒有任何一種對照的 MD 論文,等於只有一個數據點。一個現成的例子:eSpCas9(1.1) 在 on-target 底物上是 null——它本來就該 null,要看到效應必須換成 mismatched 底物。這個「什麼都沒發生」的結果,只有在你設了底物對照時才讀得出意義;沒有對照的話,它會被誤讀成「這個變體沒效」或「我們的模擬不夠長」。
04Why為什麼重要
因為 MD 的失敗模式跟 DFT 不同,而它只在方法段留下痕跡。
一個收斂良好的 DFT 計算原則上是決定性的:同樣的輸入與收斂參數給同樣的數字,而且收斂性可以用單調的參數掃描來證明——ENCUT 加大、k-mesh 加密,數字趨於穩定,你就結案。MD 給你的每一個數字都是有限樣本的統計估計。誤差的主要來源不是數值精度(那部分用小的 time step 與嚴格的 constraint 就控制住了),而是:你有沒有取樣到那些決定答案的稀有事件,以及你抽到的那幾條路徑有多大機率代表整個系綜。
實際後果一:DFT 論文可以靠收斂測試自我證明;MD 論文只能靠重複自我證明,而重複的代價是線性的 GPU 時數。注意這裡有個不對稱:總取樣時間常常大方地掛在摘要上(「aggregate sampling of 15 μs」很好看),但獨立軌跡數 n 幾乎不會——它會躲在方法段的一個從句,或某張圖 caption 的一行小字裡(「error bars represent standard deviation over three independent simulations」)。摘要秀乘積、方法段藏因子,這正是上一節要你「看到 aggregate 就當場拆」的原因。你得主動去挖。
實際後果二,也是更重要的一點:同一組軌跡可以支撐不同尺度的結論。 你自己的數據已經把這件事量化了。同一批 4 replica × ~87 ns 的 5F9R 三元複合體模擬,聚合量是可比較的(BSA(buried surface area,介面埋藏面積,不是那個血清白蛋白)的變異係數 2.1%、總 protein–DNA 接觸 4.1%、鹽橋 9.5%),但 interface iRMSD(23.9%)、DNA RMSF(59.1%)、groove 接觸計數(145.5%)就是雜訊。也就是說,同一篇論文完全可能在前半段做出可信的結論、在後半段做出無法重現的結論。所以你讀論文要判斷的從來不是「這篇對不對」,而是「這篇的哪一句話撐得住,撐到什麼尺度」。
這一頁(以及整個 MD 領域)會用 CV 指兩件完全不同的事:coefficient of variation(變異係數,SD ÷ mean,上一段那些百分比)與 collective variable(集體變數,enhanced sampling 用來描述反應座標的那個東西,本頁第二層清單裡問的是這個)。兩者在同一篇論文裡同時出現是常態。本頁之後只用中文「變異係數」指前者、只用英文 collective variable 指後者;你自己寫方法段時也建議這樣分,否則審稿人會問你到底在講哪一個。
你要問的不是「這篇 paper 可信嗎」,而是「這篇 paper 的哪一句可信到什麼尺度」。前者無法回答,後者每一篇都答得出來。
05How怎麼做
分三層讀。三層的成本遞增,過不了前一層就不必進下一層。
第一層:五分鐘快篩
不要從摘要讀起。依序找這五件事,找不到就記「未報告」——「未報告」本身就是資訊,而且是你之後做 survey 表格時最有用的那一欄。
- 起始座標。 PDB id 是什麼?晶體、cryo-EM,還是預測結構?有沒有補建缺失區段、補了哪些?——這一條的代價很實在:同一套分析、同一個 metric,用 Chai-1 預測結構起始時,top-8 接觸殘基跨 replica 0/8 共享、ρ ≈ −0.03(等於隨機);換成 5F9R 晶體起始就變成 3/8 共享、pairwise Jaccard 0.48、Spearman +0.77。元兇是起始結構,不是 metric。 一篇論文若用預測結構起始又沒交代,它的逐殘基結論你一個字都不能抄。
- 搜尋 replica、independent、repeat、trials 這幾個字。 搜不到就當 n = 1,並在你的筆記裡明寫「未報告獨立軌跡數」。
- 每條多長、總共多長,兩個數字分開記。 看到 aggregate 就拆。
- 對照組是什麼。 沒有對照組,這篇只能提供假設,不能提供證據——這不是貶低,是作用域。
- 結論的尺度對不對得上取樣的尺度。 摘要若出現逐殘基(residue X)或排序(more stable than)的字眼,回頭確認 n 與誤差;若只是 domain 級的定性描述(HNH is highly flexible),標準可以放寬。
過不了這五關的論文,機制圖像與引言照樣可以讀,但不要把它的數字抄進你的 benchmark。
搜到 replica 之後,你還得知道「幾條算多」。文獻地圖的 MD 那一格目前收 13 篇,其中約半數的紀錄裡查得到明確的獨立軌跡數(2 到 4 條不等,取樣最重的一篇是 4 條 × ~4 μs),其餘則因為紀錄不全或無法取得全文而未能核對。這是一份 13 篇的便利樣本,不是系統性 survey——分母就是這 13,不要拿它當領域統計,也不要拿它去寫 paper(要寫就照 Reviewer Thinking 第一問的規格重做)。當成尺來用的結論只有兩句:2020 年之後報 n 已經是常態,所以「這個領域不跑 replica」講出來會被打;而逐一 metric 的跨軌跡離散度很少有人報,那才是還空著的位置。
第二層:方法段逐項對表
這份清單可以直接抄成一張表,每讀一篇填一列。填完的表本身就是你 methodology paper 的 SI 素材。
- 結構:PDB id、解析度、缺失殘基怎麼補、protonation state 誰決定的(pH 多少、什麼工具)、Mg²⁺ 放了幾顆、放在哪
- 力場:protein(ff14SB?ff19SB?CHARMM36m?)、DNA(OL15?parmbsc1?)、RNA(OL3?)、離子參數、水模型(TIP3P?OPC?)——水模型不是小事,它會系統性地改變表面 loop 的動態與接觸統計
- 積分:time step、有沒有 hydrogen mass repartitioning、constraint 演算法、恆溫器與恆壓器及其耦合常數、PME 與 real-space cutoff、鹽濃度與中和方式
- 平衡:restraint 怎麼一步步放掉、丟掉多少當 equilibration、丟棄的判準是什麼
- 取樣:系統數 × replica 數 × 長度;以及 replica 之間到底差在哪——只換亂數種子、換初始速度、還是換起始構形?三者的統計意義不同,只換種子最弱
- enhanced sampling(若有):方法(GaMD/metadynamics/umbrella/REST2)、collective variable 是什麼、怎麼選的、收斂怎麼證(hysteresis?獨立重跑?reweighting 誤差?)
- observable:定義有沒有精確到原子層級——HNH 距離量的是哪兩個原子?接觸的 cutoff 幾 Å、算重原子還是質心?氫鍵的距離與角度判準是什麼?
- 統計:誤差棒代表什麼?跨 replica 的 SD、block average,還是跨 frame 的 SD?跨 frame 的 SD 幾乎一定是錯的,因為相鄰 frame 高度相關,那個誤差棒會小到失真
成本感:這張表填一篇大約半小時到一小時。它擋掉的是「用一個不可比的數字污染整個 benchmark」,而那個錯誤要用你自己的 GPU 時數去償還。在「便宜」是硬約束的專案裡,這是投報率最高的一小時。
第三層:讀圖,最後才回頭讀摘要
- 每張圖先看 caption 裡的 n 與誤差棒定義,再看曲線。順序反過來你就已經被說服了。
- 看到 representative trajectory 就問:代表性是誰判定的?其他幾條長什麼樣?
- 最後把摘要的每個動詞跟證據對回去。reveals/demonstrates/suggests/is consistent with 需要的證據強度完全不同,而很多論文的摘要動詞比它的取樣量大一號。
「a representative trajectory」——通常等於 n = 1,而且是事後挑的。
「the system was well equilibrated, as judged by the RMSD plateau」——RMSD 平掉只代表沒離開起始盆地,它同時相容於「收斂了」與「被困住了」。
「aggregate sampling of X μs」——沒拆成 n × 長度就無法判斷統計力。
「binding free energies were calculated by MM/PBSA」+報絕對值——絕對值高度依賴內介電常數、鹽濃度與熵項處理,跨論文不可比。
「the CV was chosen to describe the transition」——這裡的 CV 是 collective variable;沒做 hysteresis 或多起點檢查的話,這是事後挑的反應座標。
「we observed a spontaneous transition」——單一事件不是速率,n = 1 的自發轉變給不出任何動力學數字。
「residue X becomes more flexible upon mutation」+單一軌跡——逐殘基加 n = 1,本站反覆警告的組合。
「in excellent agreement with experiment」——先確認比的是同一個量、同一個 assay。
以及這些字的缺席: 全文搜不到 replica/independent/standard error/block,通常代表統計這件事沒被認真對待。
06When什麼時候用
- 要把文獻數字抽進 ground truth panel 或 benchmark 之前。 最必要的場合,沒有例外。
- 要決定跟不跟一組力場或 protocol 的時候。 你的方法段之後會被拿來跟這些論文比,先知道社群的預設值長什麼樣。
- 要判斷一個機制主張值不值得你花 GPU 時數去驗時。(例如「遠端錯配會鎖住 HNH」這個主張。)
- 組會報告或審稿。 用同一份清單講評,你的意見會比「我覺得取樣不夠」有力好幾個等級。
- 寫自己的方法段之前。 反向使用:確保第二層那張表你自己每一格都填得滿。
07When NOT什麼時候別用
- 不要用今天的標準去否決十年前的工作。 為什麼會壞:當年的算力與社群規範不同,GPU-MD 普及之前,單條百 ns 級的軌跡是合理做法;用今天的標準判它死刑,你會連同它的機制骨架一起丟掉,而那個骨架很可能正是你假設的來源。怎麼看出它壞了:你的 related work 只剩最近三到五年的論文,而且沒有任何一篇是你「不完全同意但仍然引用」的。正解:把「機制圖像可否參考」與「數字可否重用」分成兩個獨立評分。
- 不要把「沒報獨立軌跡數」當成「結論是錯的」。 為什麼會壞:這是證據缺席,不是反面證據。把兩者混為一談,作者只要回一句「我們跑了三條,補在 SI」就能整段消掉你的批評,順帶消掉你整篇的可信度。怎麼看出它壞了:把你的批評句唸出來,如果作者用一行 rebuttal 就能解決,那句批評本身就是壞的。正解:改寫成「該結論的作用域無法從現有資訊判定」,並具體列出要補什麼。
- 不要對 enhanced sampling 論文套用 unbiased MD 的取樣標準。 為什麼會壞:metadynamics、GaMD、umbrella sampling 的有效取樣不用牆鐘時間衡量,判準是 collective variable 有沒有涵蓋真正的慢自由度、有沒有 hysteresis、reweighting 的統計誤差多大。你拿「才跑 100 ns」去質疑,會問錯層次,還會暴露你不熟這類方法。怎麼看出它壞了:作者回一句「自由能面在 X ns 之後不再變化」,而你接不下去。正解:改問 collective variable 的選擇理由、不同起點的重現性、誤差怎麼估。
- 不要在自己沒跑過同類系統之前,用絕對數值去質疑別人。 為什麼會壞:RMSF、接觸數、MM/PBSA 的絕對值本來就依賴力場、水模型、長度、cutoff 定義與 fit selection,跨論文比絕對值幾乎一定會製造出假差異。怎麼看出它壞了:你的質疑句裡出現「他們的 RMSF 比我們的高」這種跨設定的直接比較。正解:只比同一套設定下的相對排序,或自己重跑對照組(見 RMSF)。
- 不要用這份清單取代讀懂科學。 為什麼會壞:清單化的閱讀會訓練出「只抓得到方法瑕疵、抓不到想法」的讀者,你的稿子最後會變成一整章 criticism 加上很小的 contribution——而 methodology paper 恰恰需要你先真心理解別人為什麼那樣做。怎麼看出它壞了:你讀完一篇,說得出它跑了幾條軌跡,卻說不出它主張的機制是什麼、也說不出它為什麼那樣設計。正解:每篇讀完先用兩句話寫出「它想解決什麼」,再開始挑——這正是那三欄紀錄存在的理由。
- 不要只把這套讀法用在別人身上。 為什麼會壞:你的稿子會被同一份清單審,而且審你的人很可能就是這些論文的作者。怎麼看出它壞了:你能對別人的方法段挑出十個洞,卻填不滿自己的第二層表格。正解:投稿前,找一個人拿這份清單審你自己的方法段。
08Project Lens跟我的 project 多相關
為什麼是四星而不是五星: 因為它不生產任何新數據,也不是 workflow 上的任何一個 gate。你目前的瓶頸是 metric 可靠性與 ground truth panel,而可靠性那一塊你已經有真東西了——4 replica × ~87 ns 的變異係數分級是自己跑出來的,不是讀出來的。把讀文獻擺到五星,會讓你在該跑模擬的時候一直讀,那是這類專案最常見的拖延形式。
為什麼不是三星或更低:
- 你的 ground truth panel 完全來自文獻。 高保真變體的效應、off-target 資料集的標籤,沒有一項是你能自己測的。抽取品質直接決定 benchmark 品質,而且抽錯是系統性偏差,加 replica 救不回來。
- 本站的核心立場是讀出來的,不是算出來的。 「kinetics 而非平衡結合 ΔG 決定專一性」是本站組織文獻的主軸,也是它與「以平衡結合 ΔΔG 排序」這一類主流做法的分歧所在;支撐它的是構形檢查點的單分子實驗與高保真變體的機制文獻,不是自己的軌跡。要讓這個立場站得住,靠的是精確引用。
- 成本為零。 在「便宜」是硬約束的專案裡,唯一不消耗 GPU 時數的能力提升,優先序自動加分。
- 它是防止重複造輪子的唯一機制。 算力與儲存都有硬性上限,跑錯方向的代價很大,而「這件事別人做過了」只能靠讀來發現。
具體怎麼用: 每讀一篇就當場記下三欄(解決了什麼/留下什麼沒解/跟自己的 workflow 有什麼關係),填不出第三欄的就不收。填不出來通常代表兩件事之一:你其實沒看懂,或它真的跟你無關——兩種情況都該停下來。第一層快篩的結果另外存成一張 survey 表,那張表最後會變成你 paper 裡最難被攻擊的一段。
09Reviewer Thinkingreviewer 會問什麼
你說既有的 Cas9 MD 研究取樣不足,請量化。你 survey 了幾篇?納入準則是什麼?點開看參考答案
先看出這一問預設了一個你根本不該提出的主張。「既有研究取樣不足」防守不了:skeens2024 是 4 系統 × 4 replicas × ~4 μs(約 64 μs),nierzwicki2022 的古典 MD 生產累積約 54 μs(WT 加 6 個突變體,基本配置每系統 3 replicas × ~1 μs)。論 μs 數,新進工作很難站在這個領域的上緣,硬講會被一篇反例打掉。可防守的主張只有更窄的那一句:這些研究報了 n,但很少報每一個 metric 的跨軌跡離散度。
換好主張之後才輪到量化,而且這是「別人沒做我做了」型主張的標準反擊,很致命,因為它把你的賣點變成一個可查核的事實宣稱。唯一能防守的做法是把 survey 做成表格:明確的檢索式與時間範圍、納入與排除準則、每篇的獨立軌跡數與長度、有沒有報跨軌跡離散度。表可以放 SI,但正文一定要給分母。不要寫「多數研究」這種沒有分母的句子,那等於自願把主動權交給 reviewer。
你的 ground truth 從好幾篇不同論文抽出來,量測條件一致嗎?點開看參考答案
不一致,而且你必須自己先說。GUIDE-seq 在活細胞裡量,CIRCLE-seq 與 Digenome-seq 是 cell-free 的試管反應——連「有沒有染色質、有沒有修復機制參與」都不是同一件事,偵測極限與背景也各自不同,跨 assay 比絕對切割頻率沒有意義。可防守的做法:標註每一筆的 assay 來源與是否在細胞內,只在同一 assay 內做 rank-based 比較,再做一次「換一個 assay 當標籤,排序結論會不會翻」的敏感度測試。這個測試很便宜,但做完之後這一段幾乎打不倒。
你為什麼不直接沿用 A 論文的 protocol?你的結果跟他們對得起來嗎?點開看參考答案
逐點列出你偏離的地方與理由,不要含糊帶過。例如:他們報逐殘基接觸、你報聚合量,理由是你的跨 replica 變異係數顯示逐位點量在 38% 以上而聚合量在 10% 以下;他們用 n = 1、你用 4 條。偏離要主動寫在方法段,不要等被問。 至於「對不對得起來」,誠實的答案通常是「絕對值不可比、趨勢可比」,並附上你真正能比的那一部分。
你怎麼確定你沒有挑選支持自己立場的文獻?點開看參考答案
先承認風險是真的:你的主軸是 kinetics 決定專一性,這會讓你系統性地偏好某一類論文。做法有三:事先寫下納入準則;主動列出至少一篇與你立場相左但方法紮實的工作(現成的就有:kleinstiver2016 對 SpCas9-HF1 的解釋是純熱力學式的「非專一結合能過剩」);說明你為什麼仍不採用平衡結合 ΔG 作為主要排序軸,而理由必須是可否證的、且指得出具體量測——liu2020 的 pre-steady-state 動力學顯示 Cas9-HF1 與 HypaCas9 的解旋/R-loop 形成速率跟 WT 差不多,差異壓倒性落在本質切割速率上(on-target 觀測切割速率 SpCas9 1 s⁻¹、HypaCas9 0.028 s⁻¹、Cas9-HF1 0.047 s⁻¹)。同時要主動標出這條反證的作用域:體外、特定底物、三個變體,不是通則。用「證據目前落在這一邊」講,不要用「文獻已經證明」講。
你引用的那篇說「錯配會鎖住 HNH」,你自己的模擬看到了嗎?沒看到為什麼還引?點開看參考答案
分開「引用作為假設來源」與「引用作為證據」。前者完全正當,但文中要寫成假設(we test whether…)。如果你的軌跡沒重現,就直接報告,並列出可能原因:取樣長度不足、底物不同、起始結構不同、力場不同——同時說明你能不能區分這幾種可能。沒重現本身是結果,不是失敗,前提是你有足夠的 replica 撐得起「我們在這個取樣量下沒有觀察到」這句話。
10Common Mistakes最常犯的錯
- 只讀摘要與圖就把結論寫進 related work。 後果:把 n = 1 的敘述當成領域共識,reviewer 一查就破。正解:任何要寫進正文的引用,方法段至少要過第一層五分鐘快篩。
- 把 aggregate simulation time 當成獨立取樣量。 後果:高估別人的統計力,也連帶誤判自己 4 × ~87 ns 在文獻裡的位置。正解:永遠記成 n × 長度 兩個數字,讀別人的、寫自己的都一樣。
- 抄了 observable 的名字卻沒抄它的定義。 後果:你的「HNH 距離」跟他的不是同一個量,數字不可比而且很難察覺。正解:定義要抄到原子與 cutoff;抄不到就寫信問作者,或在文中明說定義不同、不做數值比較。
- 把 MM/PBSA 的絕對值抄進 benchmark。 後果:不同論文的內介電常數、鹽濃度與熵項處理都不同,你會用一堆不可比的數字建出一張看起來很整齊的表。正解:只用同一套設定下的相對排序,見 MM/PBSA。
- 相信「RMSD 平了就是收斂了」。 後果:把「困在起始盆地」誤讀成「已經平衡」,後面所有平均值都建立在一個沒取樣到的系綜上。正解:看跨 replica 的分散度與其他獨立觀測量,見 取樣與收斂。
- 讀完不留結構化紀錄。 後果:三個月後寫 related work 要整批重讀,而且你會記得結論、忘記它的作用域——這是最危險的一種遺忘。正解:當場留下三欄結構化紀錄,並在相關頁面補一條交叉引用。
11Further Reading讀哪幾篇
12Summary三句話
一篇 Cas9 MD 論文能支撐多大的結論,由取樣量、對照組品質與 metric 穩定度三者取小決定,而這三件事全部藏在方法段與圖說裡,不在摘要裡。實務上分三層讀:五分鐘快篩起始結構與獨立軌跡數,逐項對表填力場與統計,最後才回頭檢查摘要的動詞有沒有超賣。這套讀法的用途不是挑別人的錯,是讓你抽進 benchmark 的每一個文獻數字,都清楚自己的作用域在哪。