Level 1 — 知道 Cas9 如何切 DNAThe cutting mechanism

把「一台機器分五步做完一件事」這個圖像刻進腦子。

L1更新 Wed Aug 05 2026 08:00:00 GMT+0800 (台北標準時間)

你現在在哪

L0 給了你一張詞彙表。L1 把那些詞接成一條有時間順序的因果鏈。

這裡有一個對你來說幾乎是免費的認知移轉:Cas9 不是一個開關,是一個催化循環。 你已經非常習慣用循環的方式看事情 —— 吸附、活化、反應、脫附,而且你知道循環裡通常只有一步是速率決定步驟,其他步驟的能量再漂亮都不改變 turnover。Cas9 完全是同一個形狀,只是它的「過渡態」不是一個鍵的伸縮,而是一整塊 domain 轉過去 docking

一旦你把它看成循環,一個問題就自動浮上來,而那個問題正是這整個 project 的支點:專一性住在第幾步?

這一關結束之後,你能做一件你現在做不到的事: 拿到任何一篇 Cas9 計算論文,你能把它的起始結構定位到五步中的某一步,並由此推論它能講什麼、不能講什麼 —— 這個判斷通常在讀完方法段的第一段之後就成立,不必等到 Results。

A blank printable worksheet for reconstructing the five-step Cas9 cycle from memory, with one column per step and rows for the step name, the entry condition, what physically moves, the phenotype when the step is blocked, and whether unbiased molecular dynamics can reach it.
示意圖(向量繪製) 空白學習單,列印下來闔上筆記填。五個欄位是同一台機器的一圈,不是五台機器;最後一列逼你對每一步分別回答「我的 4 × 87 ns 碰不碰得到」。底下三題填完就是這一關的通關條件。

這關要學會什麼

  • 你將能夠不看圖畫出五個步驟,並指出哪一步是專一性的所在、為什麼。
  • 你將能夠說明為什麼 PAM 是先決條件而不是「其中一個判準」,並說出是誰在讀它。
  • 你將能夠解釋 R-loop 是一條定向的拉鏈,並由這個方向性直接推出 seed 區與 PAM-distal 區的不對稱:一邊的錯配讓拉鏈開不了,另一邊的錯配讓拉鏈開得了卻切不下去。
  • 你將能夠指認 SpCas9 的七塊 domain,並說出 HNH 為什麼是特別的一塊:它被插進 RuvC 的序列中間,只靠 L1(765–780)與 L2(906–918)兩條短鉸鏈繫住。
  • 你將能夠看一眼一個 PDB 的成分清單,就說出它落在五步的哪一步,以及從它起跑的模擬不能回答什麼。
  • 你將能夠說出 unbiased MD 碰得到第幾步、碰不到第幾步,並各給一個時間尺度的量級。

依序讀這些

順序的邏輯是:先故事,後零件。 零件表(1368 個殘基怎麼切成七塊)如果先讀,就只是一串無意義的數字區間;等你知道每一塊在五步裡負責什麼,同一串數字才會黏得住。

  1. Cas9 是什麼 — 這次整頁讀完,重點放在 ## How 的那張「哪一步碰得到、要多少錢」對照表。那張表是你之後所有成本判斷的原型。
  2. PAM 與 R-loop — 把第 1、2 步展開。這一頁的價值在於「拉鏈是定向的」這個幾何事實,它會在 L2 直接變成你的底物設計原則。
  3. Cas9 的 domain 架構 — 現在才讀零件表。特別注意 HNH 與它兩條 linker 的編號是重疊的,不是相接的 —— 這個細節不吃任何算力,卻是所有 domain 級聚合量的分母。
  4. 回頭重讀 Cas9 是什麼## When NOT — 那六條在你有了前三項的圖像之後才讀得懂。第一次讀它們像是警語,第二次讀你會發現每一條都在描述一種具體的、你會犯的錯。

三篇原始文獻(挑圖看,不必逐字讀)

2014Crystal Structure of Cas9 in Complex with Guide RNA and Target DNA
Nishimasu H. et al. · Cell doi:10.1016/j.cell.2014.02.001
看它的 domain 邊界圖就好。這是 domain 命名的來源,也是你之後每一次選 `REC3 = 497–713` 這種殘基範圍時真正在引用的東西。
2014Structural basis of PAM-dependent target DNA recognition by the Cas9 endonuclease
Anders C. et al. · Nature doi:10.1038/nature13579
PAM 怎麼被讀出來的結構證據,也是 phosphate lock loop 的來源。讀它是為了讓「入場券」這個比喻變成具體的原子接觸。
2016Structures of a CRISPR-Cas9 R-loop complex primed for DNA cleavage
Jiang F. et al. · Science doi:10.1126/science.aad8282
R-loop 已完成、準備切割的結構,也就是 5F9R。它把第 2 步的終點與第 3 步的起點接起來 —— 而這正是你自己的模擬起跑的地方。

通關檢查表

通關測驗

有一段基因體序列跟你的 sgRNA 完全互補,二十個位置一個錯配都沒有。Cas9 會切它嗎?點開看參考答案

不一定,而且如果它 3′ 側沒有 NGG,答案是不會。

Cas9 搜尋基因體的方式是三維碰撞(不是沿著 DNA 滑行),每次碰撞只問一個問題:這裡有沒有 PAM。 PI domain 的 R1333 與 R1335 從 major groove 直接讀那兩個 G,讀不到就放開、換下一個位置。序列互補在這一步完全不被評估,因為 RNA 根本還沒有機會去配對 —— 雙股要先被撬開(K1107–S1109 那段 phosphate lock loop 抓住 target strand 上介於 PAM 與第 +1 位之間的那個磷酸,把 +1 核苷酸轉出來與 guide RNA 配對),RNA 才進得去。注意被鎖住的是 target strand,不是 non-target strand —— 這是建系統與接觸分析都很容易搞反的一格。

這一題真正要你抓的是順序:辨識不是一次到位的打分,是一串有順序的關卡。 這個結構會在 L2 變成「錯配放在哪裡決定了你看到什麼表現型」,在 L6 變成 funnel 的分層邏輯。

為什麼 protospacer 的 20 個位置不是等權重的?請從幾何講起,不要背結論。點開看參考答案

因為拉鏈是從 PAM 那一端開始拉的。RNA 與 target strand 的配對從 PAM 端起頭,一格一格往遠端推進,non-target strand 被逐步擠出來。這個方向性直接造出兩種完全不同的失敗模式:

  • seed 區(靠 PAM 那幾格)錯配 → 拉鏈根本開不了 → 表現型是不結合
  • PAM-distal 區(遠端)錯配 → 拉鏈拉得開、複合體穩穩坐上去,但 RNA:DNA 雜合雙股的遠端停在拉直(linear)而不是扭折(kinked)的構形,REC3 抓不住,HNH 就上不了工位 → 表現型是結合了卻不切

兩種錯配在「錯了幾個鹼基」這個計數上完全一樣,在生物學上卻是兩件事。任何只數錯配個數的打分,對這個不對稱是盲的。

你的 production 軌跡從 5F9R 完整 R-loop 三元複合體起跑。哪些問題你可以問?哪些不能?點開看參考答案

可以問的: 檢查點已經形成之後,HNH 與 REC3 的局部構形分布如何隨底物的配對品質改變。這是 4 條 replica × 約 87 ns 打得到的尺度。

不能問的: R-loop 如何一格一格拉開、什麼時候會塌回去、Cas9 如何在基因體上搜尋。那些事件落在微秒到毫秒,unbiased MD 在百奈秒尺度上只看得到起始 basin 的寬度。

最重要的操作結論:把「本工作起始於 R-loop 已完成的三元複合體」這句話一字不改寫進 methods。 它會替你擋掉一整類 reviewer 攻擊 —— 因為 reviewer 若沒看到這句話,會預設你在宣稱模擬了整個辨識過程,然後用那個標準來打你。

順帶一個對照:如果你拿 apo 或二元結構去問三元問題,會壞得更徹底。沒有 DNA,REC3 就沒有東西可抓,檢查點的物理根本不存在。你自己的兩組數據剛好是對照:apo 的 HNH RMSF 是 1.86 Å、完整三元是 1.61 Å,同樣都是全域最高,但兩個數字的物理意義完全不同。

HNH 為什麼是這台機器上最特別的一塊 domain?給三個理由。點開看參考答案

一、它的拓樸很怪。 HNH(775–908)不是接在序列尾端的一塊,而是被插進 RuvC 的序列中間,只靠 L1(765–780)與 L2(906–918)兩條短鉸鏈繫住。注意 linker 的編號跟 HNH 是重疊的,這在寫 domain 選擇字串時很容易搞錯。

二、它必須大幅移動才能工作。 沿 H840 到 target 股 scissile phosphate 的距離看,失活態約 30 Å、5F9R 的 pre-catalytic 態約 15 Å,催化態要求側鏈進到個位數 Å(約 4 到 6 Å)。這三個數字的原子選擇不一樣(同一個構形下 Cα 與側鏈可以差好幾 Å),比較之前一定要先統一定義。

三、它在你自己的機器上就看得見。 apo 蛋白 MD 的 HNH RMSF 是 1.86 Å,全域最高,其餘 domain 只有 0.8 到 1.3 Å;完整三元裡 HNH 仍是最高的 1.61 Å。這是你在自己的軌跡裡看見第 3 步存在的第一個證據 —— 但注意它只是必要條件(那塊 domain 得能動),不是專一性本身。

用一個實驗數字說明「結合」與「切割」在 Cas9 上是解耦的。點開看參考答案

把感測器 REC3 整塊刪掉(ΔREC3),切割速率掉約 1000 倍,而對 on-target 的結合親和力仍接近 WT。

這是同一篇論文裡的對照實驗,不牽涉任何變體之間的比較,因此也最難反駁。它一句話就講完了「結合強度與切割能力可以完全脫鉤」這件事,而這正是 L2 要用來質疑整條 ΔG 排序軸的那把刀。

先記住這個數字。 它比任何模擬結果都好用,尤其是在討論打分軸該選什麼的時候 —— 因為它是純實驗證據,不需要任何人先接受某一組 MD 結果。

地圖上的鄰居

這頁用到的名詞