Cas9 BiologyCas9 生物學

這台分子機器實際上在幹嘛。只講計算會用到的部分。

3 頁
Seven rows of Cas9 biology, each paired with the computational decision it pins down and the specific cost of ignoring it: the directional R-loop zipper fixes where mismatches go, the decoupling of binding and cleavage rules out a binding free energy as the scoring axis, the post-binding checkpoint fixes which observable is needed, the mechanism of high-fidelity variants makes an on-target substrate a designed null, dCas9 acts as a conceptual control, cellular off-target adds chromatin and repair and delivery, and incomplete deposited coordinates force modelled-in residues out of every aggregate.
示意圖(向量繪製) 這章的收錄判準就是中間那一欄:一句生物學如果翻不成一個計算決定,它就不進這章。左欄是事實,中欄是它鎖死的建模選擇,右欄是忽略它的具體代價 —— 七項沒有一項要求你先變成生物學家。

這章的頁面

這章在講什麼

這是全站唯一一章真的在講生物學的地方,而它刻意只講會約束到某個計算決定的那些部分。判準很簡單粗暴:一句生物學如果翻不成「所以我的底物要這樣設計」「所以我的起始結構要選那個」「所以我不能用這根軸打分」,它就不會出現在這裡。CRISPR 的細菌免疫學起源、基因編輯的臨床應用與倫理、細胞內的遞送與 DNA 修復路徑,全部被砍掉了 —— 不是因為不重要,是因為它們決定的是實驗數字,而不是你水盒子裡的任何一個原子。

對你來說,這章的功能等同於電催化裡的基元步驟圖。你不會一上來就畫火山圖,你會先把 HER 拆成 Volmer、Heyrovsky、Tafel 三步,確定 rate-determining step 落在哪一步,才知道該去算哪個中間態的吸附能。這章做的是同一件事:把 Cas9 從結合到切割拆成五步,然後指出專一性不是平均分散在五步裡 —— seed 區的辨識發生在第二步、還反映得到結合強度上,而高保真變體真正拉開差距的那一段辨識,主要落在第三步那個構形檢查點。一旦這件事定下來,「該量什麼」就不再是品味問題,而是被機構圖規定死的。這也是為什麼任何全程以平衡結合 ΔG/ΔΔG 排序的變體篩選漏斗,在專一性這一維上會有結構性盲區 —— 那相當於用初始態的吸附強弱去預測一個由過渡態高度決定的選擇性。

三頁是同一條因果鏈的三個放大倍率,不是三個並列的主題。Cas9 是什麼給你五步驟骨架與「結合與切割是解耦的」這個核心命題;PAM 與 R-loop 把第一、二步放大,解釋為什麼 protospacer 的 20 個位置不等權重,seed 區的錯配讓拉鏈開不了、PAM-distal 的錯配讓拉鏈拉得開卻切不下去;Off-target 與專一性把第三步放大,說清楚四個高保真變體沒有一個是在增強對正確序列的辨識,它們全部在削弱非序列專一的黏著力。讀完這三頁,你手上會多出一個東西:一份「哪些現象該出現、哪些現象出現了就代表我做錯了」的預期清單,而那份清單才是這章真正的產出。

Two parallel lanes applying the same three-move discipline. In the upper lane a branched surface reaction runs from an adsorbed reactant through an intermediate to two products, with the decision marked at the branch and an annotation that the descriptor belongs at the branch intermediate rather than on the reactant's adsorption strength. In the lower lane the five Cas9 steps run from PAM search through R-loop zipping, the conformational checkpoint, cleavage and release, with the checkpoint marked as the branch, a rejected path labelled held but never cut, and a bar showing that an equilibrium binding free energy only reaches the first two steps.
示意圖(向量繪製) 先拆基元步驟、再找出結果在哪一步分岔、最後才挑描述符 —— 這個順序在電催化你早就在用。Cas9 的分岔點在第 3 步的構形檢查點,而平衡結合 ΔG 只覆蓋得到第 1、2 步,所以它排的是「綁不綁得住」,不是「切不切得下去」。

教授可能問

用兩分鐘講完 Cas9 切一次 DNA 的完整過程,不准用我沒問過的名詞。點開看參考答案

標準答案的骨架是五步:sgRNA 先帶著 Cas9 找到 PAM 這個入場券、PI domain 讀到 5′-NGG-3′ 才肯動手;接著 phosphate lock loop 鎖住 target 股上那個 +1 位磷酸、把雙股在 PAM 旁撬開,RNA 從 PAM 端一格一格往遠端配對,拉出 R-loop;配到底之後 REC3 感測 PAM-distal 端的配對品質,決定要不要放行;放行的話 HNH 大幅轉動 docking 到催化位置,HNH 切跟 guide 配對的 target 股、RuvC 切被頂開的 non-target 股;最後產物釋放非常慢。能不能把「第三步是一道檢查點而不是一個自動的下一步」講清楚,是這一問真正在測的東西。

「結合與切割在 Cas9 上是解耦的」—— 這句話為什麼對你的專案是致命的重要?點開看參考答案

因為它直接判定了一整類打分軸出局。一個 off-target 位點可以被牢牢抓住卻永遠不被切,原因是 PAM-distal 端的錯配讓 RNA:DNA 雜合雙股停在拉直而非扭折的構形,REC3 不放行,HNH 就上不了工位。這代表結合強度與切割與否之間沒有單調關係,而任何以 ΔG_bind 或 ΔΔG 排序專一性的漏斗,隱含假設的正是那個不存在的單調關係。在你的專案裡,這句話是整條方法學論證的第一塊磚。

seed 區與 PAM-distal 區的錯配,表現型有什麼不同?這個不對稱從哪裡來?點開看參考答案

不對稱來自 R-loop 是定向拉鏈:從 PAM 端開始配對,一格一格往遠端走。seed 區在拉鏈的起點,那裡的錯配讓拉鏈根本開不了,表現為不結合;PAM-distal 在拉鏈的終點,那裡的錯配不妨礙拉開,卻讓雜合雙股擺不出 REC3 要的扭折構形,表現為結合了卻不切。這個不對稱直接決定你的底物設計:要測構形檢查點,錯配一定要放在 PAM-distal,放在 seed 區你量到的只是「有沒有綁上」。

dCas9 為什麼綁得住卻切不了?這件事對你設計對照組有什麼用?點開看參考答案

dCas9 是把兩個核酸酶的催化殘基都突變掉(RuvC 的 D10A 與 HNH 的 H840A),機器的辨識與結合部分完全保留、只是刀鈍了。它的價值在於它把結合與切割在實驗上拆開來,所以任何「結合強度就等於功能」的直覺,看一眼 dCas9 還能拿來做基因調控就知道站不住。對計算而言它的用途是概念性的對照:如果你的描述符在 dCas9 與 WT 之間看不出差別,那個描述符量到的就純粹是結合,跟切割與否無關。

Reviewer 可能問

你的模擬裡沒有 Mg²⁺ 的催化化學、沒有染色質、沒有細胞內的修復,你憑什麼說你量到的東西對應到 off-target?點開看參考答案

唯一能守住的回答是把連結假設明文寫出來,而不是假裝落差不存在。可以這樣界定:本工作宣稱的是構形檢查點層級的結構統計差異,而不是細胞內的編輯結果;細胞內的 off-target 譜還疊了染色質可及性、修復偏好與遞送效率,這些本工作都不模擬,因此對照的實驗資料應優先取體外系統。把宣稱縮到自己真的量得到的層級,比宣稱大一級然後被逐條拆掉安全得多。

你的 off-target 底物是怎麼設計的?錯配放在哪、放幾個、對照是什麼?點開看參考答案

這一題答不好等於前面全白做。設計必須從 R-loop 的定向性推出來:錯配放在 PAM-distal,並且要有一個 on-target 條件當作已知應該是 null 的對照。eSpCas9(1.1) 在 on-target 底物上本來就該是 null —— 它削弱的是對 non-target 股的靜電抓握,而完全配對的底物上沒有東西可削,所以只在 on-target 上比較 WT 與變體不可能看到效應。錯配的數目與位置最好設計成一個梯度而不是一個點,否則你無法區分「沒有效應」與「效應被單一位置的偶然性吃掉」。

你整條論證建立在「專一性主要由 HNH 構形檢查點決定」這個命題上。它有多少獨立證據?有沒有反面的可能?點開看參考答案

支持它的不是單一實驗,而是幾條互相獨立的線交會:單分子 FRET 在「綁上 DNA」與「切下去」之間找到一個真實的中間態;帶 PAM-distal 錯配的底物上,SpCas9-HF1 與 eSpCas9(1.1) 的 HNH 會被鎖在非活化態;最硬的單一對照是 ΔREC3 —— 切割速率降約 1000 倍,on-target 結合親和力卻接近 WT。要主動承認的限制有兩個:這些觀測集中在少數 guide 序列與少數變體上,序列依賴性沒有被系統掃過;而且「檢查點」是從速率與構形分布反推出來的機制模型,不是直接量到的能障。可防守的寫法是把它當成本工作的工作假說,並且明講它的可證偽預測(錯配放在 PAM-distal 才看得到變體之間的差異,放在 seed 區不會),而不是當成已經定論的事實。 建模補出區段的疑慮屬於另一條線,答案在結構生物學那一章。

你引用的高保真變體排序,是同一批條件下量的嗎?點開看參考答案

不是,而且必須誠實說不是。不同論文的變體是在不同的 guide、不同細胞株、不同量測平台上做出來的,數字不能直接放進同一張散布圖。可以守住的用法有兩種:只用同一篇論文內部的相對排序,或者向實驗合作者要求一組在同一批條件下重測的變體 panel。順帶一個現實提醒:同一個多重突變的高保真變體,在質體遞送下看起來幾乎沒有代價,換成 RNP 格式卻可能掉到個位數百分比的 on-target 活性 —— 「專一性排序」本身就依賴於量測格式,換一個格式排序就可能翻過來。

口試可能問

你為什麼只做 SpCas9?不做其他 orthologue 或 Cas12a 這類系統嗎?點開看參考答案

把理由講成資源配置而不是興趣。SpCas9 有最完整的結構系列、最多的高保真變體、以及最多可用的實驗 off-target 資料,這三件事同時決定了你能不能建 ground truth。換成別的系統,方法或許一樣,但驗證的成本會暴增。代價要一起講:結論的外推性會受限,任何跨 orthologue 的宣稱都必須留給未來工作。 反過來說,如果你的方法學貢獻是「描述符的可重現性基準」,那它天生就是可以搬到別的系統上的,這一點值得在口試裡主動說。

你把整套方法押在構形檢查點上。如果之後有人證明結合強度其實也扮演重要角色,你的論文還剩下什麼?點開看參考答案

這一問在測你的論文架構有沒有單點故障。安全的架構是:主張不寫成「結合不重要」,而寫成「結合是必要但不充分的初篩,專一性的排序需要檢查點層級的量」。這樣即使結合的重要性被上修,你的方法學貢獻 —— 哪些描述符跨獨立軌跡可重現、起始結構怎麼污染下游分析 —— 完全不受影響。把可防守的核心放在方法紀律上,把生物學立場放在動機層而不是結論層。

「只讀計算會用到的生物學」這個策略,你付出的代價是什麼?點開看參考答案

代價是缺少判斷「異常」的直覺。領域內做了五年 Cas9 的人看到一張接觸圖會直接說「這裡不對」,跨領域進來的人只能靠檢查表。這在兩種場合會咬人:跟實驗端討論可行性的時候,以及審稿人用一個你沒讀過的角落知識反駁你的時候。緩解方式不是把整本教科書讀完,而是把每一個計算決定背後的生物學假設寫成明文,讓別人有機會指出你錯在哪 —— 隱藏的假設才是真正危險的假設。

你會想把細胞內的效應納進來嗎?納或不納,各自的代價是什麼?點開看參考答案

納進來的代價是你要處理染色質、修復與遞送,這三件事都不在你的方法能力範圍內,而且會把驗證的門檻拉到需要實驗合作者的層級。不納的代價是你的結論只能對到體外資料,離「實際編輯結果」還隔一層。在算力與人力都是硬約束的前提下,正確的選擇是不納,但要把那道落差明文寫進 limitations,並且在向實驗端提需求時優先要體外的速率資料。 這個回答的重點不是選哪一邊,是能不能把兩邊的代價都講到具體。

AI 對話練習

練習一:把生物學逐條翻成計算約束

你是一位同時做結構生物學與分子模擬的資深研究員。我是計算化學/材料背景,生醫背景接近零。

我要練習一件事:把 Cas9 的生物學事實翻譯成「對我的模擬設計的約束」。

規則:

  1. 你一次給我一個 Cas9 的生物學事實(例如「R-loop 是從 PAM 端定向拉開的」)。
  2. 我要回答三件事:這個事實約束了我的哪一個計算決定、如果我忽略它會出現什麼具體的錯誤結果、以及我要怎麼在分析裡看出自己犯了這個錯。
  3. 我答完你才給評語。評語要指出我漏掉的那一項,並且用一句話說明為什麼那一項最貴。
  4. 如果我的回答只是把你的事實換句話說,直接說「這只是複述,不是約束」。

請給我 8 個事實,難度遞增。第 8 個要是一個「大多數人會誤以為它有計算意涵、但其實沒有」的事實,看我抓不抓得出來。

練習二:向不懂生物的同事解釋為什麼 ΔG 不夠

我要向你解釋:為什麼用平衡結合自由能去排序 Cas9 變體的專一性,是量錯了東西。

你扮演一位資深的計算化學家,做了二十年吸附能與催化選擇性,對生物完全不熟,但對「熱力學 vs 動力學」極度敏感,而且不接受任何無法用他熟悉的語言講清楚的說法。

規則:

  1. 只要我講出一個你無法對應到催化世界的概念,立刻要求我用吸附能、過渡態、選擇性決定步驟這類語言重講。
  2. 只要我的類比在物理上不精確,指出它在哪裡會破。特別留意我有沒有把「構形檢查點」講成「過渡態」而沒說明兩者的差別。
  3. 中途至少挑戰我一次:「既然檢查點也是自由能障,那算自由能不就好了?為什麼你說 ΔG 不行?」
  4. 最後給我一段 60 秒的講法,是你認為我應該怎麼講才對,並標出我原本版本裡最弱的一句。
練習三:設計一組能看出檢查點效應的底物

你是一位嚴格的實驗設計審查者。

背景:我想用分子動力學比較野生型 SpCas9 與幾個高保真變體(例如 SpCas9-HF1、eSpCas9(1.1)、HypaCas9),看能不能用結構描述符分辨它們的專一性差異。已知的關鍵事實是:這些變體對 on-target 與 off-target 的結合親和力與野生型差不多,差別在結合之後的 HNH 構形檢查點;而 R-loop 是從 PAM 端定向拉開的,所以 seed 區與 PAM-distal 區的錯配表現型不同。

請你:

  1. 先問我三個問題,確認我的算力預算、每個條件能跑幾條 replica、以及我打算用什麼描述符。
  2. 然後要求我提出一組底物設計(錯配的位置、數目、以及對照條件),我提出後你逐條挑戰。
  3. 特別針對兩件事挑戰我:我的設計裡有沒有一個「本來就該是 null」的條件,以及我怎麼分辨「沒有效應」與「效應被雜訊蓋掉」。
  4. 最後給我一張最小可行設計表格,並標明如果算力只有一半要先砍哪一格、為什麼砍那一格最不痛。