Level 1 — 知道 Cas9 如何切 DNAThe cutting mechanism
把「一台機器分五步做完一件事」這個圖像刻進腦子。
你現在在哪
L0 給了你一張詞彙表。L1 把那些詞接成一條有時間順序的因果鏈。
這裡有一個對你來說幾乎是免費的認知移轉:Cas9 不是一個開關,是一個催化循環。 你已經非常習慣用循環的方式看事情 —— 吸附、活化、反應、脫附,而且你知道循環裡通常只有一步是速率決定步驟,其他步驟的能量再漂亮都不改變 turnover。Cas9 完全是同一個形狀,只是它的「過渡態」不是一個鍵的伸縮,而是一整塊 domain 轉過去 docking。
一旦你把它看成循環,一個問題就自動浮上來,而那個問題正是這整個 project 的支點:專一性住在第幾步?
這一關結束之後,你能做一件你現在做不到的事: 拿到任何一篇 Cas9 計算論文,你能把它的起始結構定位到五步中的某一步,並由此推論它能講什麼、不能講什麼 —— 這個判斷通常在讀完方法段的第一段之後就成立,不必等到 Results。
這關要學會什麼
- 你將能夠不看圖畫出五個步驟,並指出哪一步是專一性的所在、為什麼。
- 你將能夠說明為什麼 PAM 是先決條件而不是「其中一個判準」,並說出是誰在讀它。
- 你將能夠解釋 R-loop 是一條定向的拉鏈,並由這個方向性直接推出 seed 區與 PAM-distal 區的不對稱:一邊的錯配讓拉鏈開不了,另一邊的錯配讓拉鏈開得了卻切不下去。
- 你將能夠指認 SpCas9 的七塊 domain,並說出 HNH 為什麼是特別的一塊:它被插進 RuvC 的序列中間,只靠 L1(765–780)與 L2(906–918)兩條短鉸鏈繫住。
- 你將能夠看一眼一個 PDB 的成分清單,就說出它落在五步的哪一步,以及從它起跑的模擬不能回答什麼。
- 你將能夠說出 unbiased MD 碰得到第幾步、碰不到第幾步,並各給一個時間尺度的量級。
依序讀這些
順序的邏輯是:先故事,後零件。 零件表(1368 個殘基怎麼切成七塊)如果先讀,就只是一串無意義的數字區間;等你知道每一塊在五步裡負責什麼,同一串數字才會黏得住。
- Cas9 是什麼 — 這次整頁讀完,重點放在
## How的那張「哪一步碰得到、要多少錢」對照表。那張表是你之後所有成本判斷的原型。 - PAM 與 R-loop — 把第 1、2 步展開。這一頁的價值在於「拉鏈是定向的」這個幾何事實,它會在 L2 直接變成你的底物設計原則。
- Cas9 的 domain 架構 — 現在才讀零件表。特別注意 HNH 與它兩條 linker 的編號是重疊的,不是相接的 —— 這個細節不吃任何算力,卻是所有 domain 級聚合量的分母。
- 回頭重讀 Cas9 是什麼 的
## When NOT— 那六條在你有了前三項的圖像之後才讀得懂。第一次讀它們像是警語,第二次讀你會發現每一條都在描述一種具體的、你會犯的錯。
三篇原始文獻(挑圖看,不必逐字讀)
通關檢查表
通關測驗
有一段基因體序列跟你的 sgRNA 完全互補,二十個位置一個錯配都沒有。Cas9 會切它嗎?點開看參考答案
不一定,而且如果它 3′ 側沒有 NGG,答案是不會。
Cas9 搜尋基因體的方式是三維碰撞(不是沿著 DNA 滑行),每次碰撞只問一個問題:這裡有沒有 PAM。 PI domain 的 R1333 與 R1335 從 major groove 直接讀那兩個 G,讀不到就放開、換下一個位置。序列互補在這一步完全不被評估,因為 RNA 根本還沒有機會去配對 —— 雙股要先被撬開(K1107–S1109 那段 phosphate lock loop 抓住 target strand 上介於 PAM 與第 +1 位之間的那個磷酸,把 +1 核苷酸轉出來與 guide RNA 配對),RNA 才進得去。注意被鎖住的是 target strand,不是 non-target strand —— 這是建系統與接觸分析都很容易搞反的一格。
這一題真正要你抓的是順序:辨識不是一次到位的打分,是一串有順序的關卡。 這個結構會在 L2 變成「錯配放在哪裡決定了你看到什麼表現型」,在 L6 變成 funnel 的分層邏輯。
為什麼 protospacer 的 20 個位置不是等權重的?請從幾何講起,不要背結論。點開看參考答案
因為拉鏈是從 PAM 那一端開始拉的。RNA 與 target strand 的配對從 PAM 端起頭,一格一格往遠端推進,non-target strand 被逐步擠出來。這個方向性直接造出兩種完全不同的失敗模式:
- seed 區(靠 PAM 那幾格)錯配 → 拉鏈根本開不了 → 表現型是不結合。
- PAM-distal 區(遠端)錯配 → 拉鏈拉得開、複合體穩穩坐上去,但 RNA:DNA 雜合雙股的遠端停在拉直(linear)而不是扭折(kinked)的構形,REC3 抓不住,HNH 就上不了工位 → 表現型是結合了卻不切。
兩種錯配在「錯了幾個鹼基」這個計數上完全一樣,在生物學上卻是兩件事。任何只數錯配個數的打分,對這個不對稱是盲的。
你的 production 軌跡從 5F9R 完整 R-loop 三元複合體起跑。哪些問題你可以問?哪些不能?點開看參考答案
可以問的: 檢查點已經形成之後,HNH 與 REC3 的局部構形分布如何隨底物的配對品質改變。這是 4 條 replica × 約 87 ns 打得到的尺度。
不能問的: R-loop 如何一格一格拉開、什麼時候會塌回去、Cas9 如何在基因體上搜尋。那些事件落在微秒到毫秒,unbiased MD 在百奈秒尺度上只看得到起始 basin 的寬度。
最重要的操作結論:把「本工作起始於 R-loop 已完成的三元複合體」這句話一字不改寫進 methods。 它會替你擋掉一整類 reviewer 攻擊 —— 因為 reviewer 若沒看到這句話,會預設你在宣稱模擬了整個辨識過程,然後用那個標準來打你。
順帶一個對照:如果你拿 apo 或二元結構去問三元問題,會壞得更徹底。沒有 DNA,REC3 就沒有東西可抓,檢查點的物理根本不存在。你自己的兩組數據剛好是對照:apo 的 HNH RMSF 是 1.86 Å、完整三元是 1.61 Å,同樣都是全域最高,但兩個數字的物理意義完全不同。
HNH 為什麼是這台機器上最特別的一塊 domain?給三個理由。點開看參考答案
一、它的拓樸很怪。 HNH(775–908)不是接在序列尾端的一塊,而是被插進 RuvC 的序列中間,只靠 L1(765–780)與 L2(906–918)兩條短鉸鏈繫住。注意 linker 的編號跟 HNH 是重疊的,這在寫 domain 選擇字串時很容易搞錯。
二、它必須大幅移動才能工作。 沿 H840 到 target 股 scissile phosphate 的距離看,失活態約 30 Å、5F9R 的 pre-catalytic 態約 15 Å,催化態要求側鏈進到個位數 Å(約 4 到 6 Å)。這三個數字的原子選擇不一樣(同一個構形下 Cα 與側鏈可以差好幾 Å),比較之前一定要先統一定義。
三、它在你自己的機器上就看得見。 apo 蛋白 MD 的 HNH RMSF 是 1.86 Å,全域最高,其餘 domain 只有 0.8 到 1.3 Å;完整三元裡 HNH 仍是最高的 1.61 Å。這是你在自己的軌跡裡看見第 3 步存在的第一個證據 —— 但注意它只是必要條件(那塊 domain 得能動),不是專一性本身。
用一個實驗數字說明「結合」與「切割」在 Cas9 上是解耦的。點開看參考答案
把感測器 REC3 整塊刪掉(ΔREC3),切割速率掉約 1000 倍,而對 on-target 的結合親和力仍接近 WT。
這是同一篇論文裡的對照實驗,不牽涉任何變體之間的比較,因此也最難反駁。它一句話就講完了「結合強度與切割能力可以完全脫鉤」這件事,而這正是 L2 要用來質疑整條 ΔG 排序軸的那把刀。
先記住這個數字。 它比任何模擬結果都好用,尤其是在討論打分軸該選什麼的時候 —— 因為它是純實驗證據,不需要任何人先接受某一組 MD 結果。