Level 6 — 知道如何設計 workflowDesigning your own workflow

把前面所有東西接成一條你自己能防守的流程。

L6更新 Wed Aug 05 2026 08:00:00 GMT+0800 (台北標準時間)

你現在在哪

整張地圖的收斂點。 前六關給了你零件,這一關只做一件事:組裝順序

而你已經知道順序錯了要付什麼。第一輪完整三元用 Chai-1 預測結構當起點,整批 replica 跑完之後才發現逐殘基 top-8 是 0/8 共享、ρ ≈ −0.03,等於擲骰子;換 5F9R 晶體起點重跑才變成 3/8 共享、Jaccard 0.48、Spearman +0.77。決定這個結果的是第 1 步的一個選擇,但你是在第 4 步才知道。

這個形狀你在材料領域見過:high-throughput screening funnel —— 便宜的 descriptor 先篩,貴的計算再驗證,最後才進實驗。差別只有一個,而且很致命:材料 funnel 的 descriptor 通常已經在大量系統上跟更高階的計算或實驗對過;你的 descriptor 一個實驗答案都還沒對過。 所以 L6 的產出不是「一條更好的 funnel」,是一條知道自己還沒被驗證的 funnel —— 而後者才是 methodology paper 唯一守得住的東西。

這一關結束之後,你能做兩件你現在做不到的事: 在白紙上畫出你自己的七步流程,標出每一步的成本量級、失敗模式與引爆點;以及在同行或 reviewer 面前,為每一個選擇說出理由,包含「這一步目前還沒有證據」。

A printable blank worksheet with two header fields, a seven-row table whose columns are step name, input to output, cost order, failure mode and the step at which the mistake detonates, plus closing fields for the three hard rules and for drawing the freeze line.
示意圖(向量繪製) 列印下來自己填。七步流程的重點不是背得出名字,是每一步都說得出輸入、輸出、成本量級、失敗模式,以及那個錯誤會在第幾步才引爆——最後一欄才是這張表存在的理由。上方兩格先寫「你要防守的那一句話」與停損條件,因為它們決定了下面七列該怎麼填。
L6 的核心紀律,只有三條

先把 WT 跑到有誤差棒,再碰任何變體。 只讓跨 replica CV 低於 10% 的聚合量進打分公式。 在看到任何變體結果之前,凍結打分規則與驗證端點。

這關要學會什麼

  • 你將能夠畫出七步流程,並對每一步說出輸入、輸出、成本量級、失敗模式、以及它會在第幾步引爆(第 1 步的錯誤在第 4 步引爆,第 5 步的錯誤在整篇稿子上引爆)。
  • 你將能夠說出為什麼 Validation 設計必須排在 Ranking 前面,並舉出一個具體反例。
  • 你將能夠設計打分公式的形狀:以 WT 為參考態、用 WT 的雜訊尺度無因次化、跨兩個底物條件取雙差,並說明權重為什麼必須事前凍結在一份規格檔裡。
  • 你將能夠向實驗端開出一張具體的要求清單,且每一項都說得出「為什麼我需要它」。
  • 你將能夠回答那幾個一定會被問的 reviewer 問題,並分辨哪幾題有數據答案、哪幾題只能靠限縮宣稱來守。
  • 你將能夠誠實描述一條 pipeline 缺的是什麼:驗證端點還沒閉環的時候,預測力是零證據,不是負面證據。
  • 你將能夠在幾條候選方向裡選一條,寫下你要防守的那一句話,並為它定義一個明文的停損條件。

依序讀這些

這四頁就是流程本身:全圖 → 前段 → 中段 → 後段。每一頁都要對得出「這一步的錯誤會在第幾步引爆」。

  1. Workflow 全圖 — 七步、每一步的成本量級、以及「哪一步的錯誤在哪一步引爆」。
  2. 從 PDB 到軌跡 — 第 1、2 步。所有決定都幾乎不花算力,卻幾乎每一個都不可逆。
  3. 分析與打分 — 第 3、4、6 步。三層架構:QC 層做二元閘門不打分、打分層只收綠燈聚合量、機制敘事層可以講故事但不進分數。
  4. 驗證與實驗合作 — 第 5、7 步。主要端點必須是功能與速率,SPR/BLI 這類平衡結合只能當健康檢查閘門。

三篇原始文獻(各對應流程的一端)

2016Structures of a CRISPR-Cas9 R-loop complex primed for DNA cleavage
Jiang F. et al. · Science doi:10.1126/science.aad8282
你 production 系統起點座標(5F9R)本身的來源。要在方法段寫清楚「為什麼從這個構形開始」,就得知道它捕捉的是 R-loop 已形成、準備切割的狀態。
2017Enhanced proofreading governs CRISPR–Cas9 targeting accuracy
Chen J.S. et al. · Nature doi:10.1038/nature24268
決定**驗證端點該量什麼**的那一篇。它用 smFRET 抓到結合與切割之間的構形檢查點,並給出一個乾淨到近乎粗暴的對照:把整個 REC3 domain 刪掉(ΔREC3),對 on-target 底物的結合親和力仍接近 WT,cleavage rate 卻掉了約 1000 倍。注意這是 domain 刪除、不是點突變,所以 ΔREC3 本身不是你會拿去篩的候選;它的價值在於把「結合強度與切割能力可以完全脫鉤」證得最乾淨 —— 也就是為什麼排序軸與驗證端點都不能只有 ΔG。
2017CIRCLE-seq: a highly sensitive in vitro screen for genome-wide CRISPR-Cas9 nuclease off-targets
Tsai S.Q. et al. · Nature Methods 14(6):607-614 doi:10.1038/nmeth.4278
讀它是為了知道下游的 ground truth 長什麼樣、有什麼偵測極限。你的排序表最終要對上這類數據 —— 先知道它的解析度,才不會設計出一個實驗端量不出來的預測。

通關檢查表

通關測驗

你有 5 個候選 metric 與 8 個變體。Reviewer 問:「你怎麼避免過擬合到自己的測試集?」點開看參考答案

先自己把自由度算出來,再回答。 5 個 metric 的權重組合,配上 8 個點的排序 —— 光是權重就足以湊出你想要的任何排序。承認這件事,比假裝沒有這個問題強得多。

然後給出唯一有效的防線:預先登記。 把可調的東西全部列出來(metric 選擇、權重、CV 閾值、軌跡長度、replica 數、底物設計),逐一標明哪些是在看到變體結果之前凍結的,凍結的證據是什麼(有時間戳的 commit)。

還有兩個免費的加強: 只報一個主 metric,其他全放補充材料;留一部分資料當 holdout,從頭到尾一次都不看,最後才拿出來跑一遍 —— 動了就不能再回頭調。

最後一個測誠信的問題你要能正面回答:「你總共看了幾個版本才決定報這一個?」如果答案大於 1 而你沒有做多重比較校正,這個結果就是探索性的,照實把結論降級。

算力突然加倍了。你要加軌跡長度、加 replica,還是加底物條件?點開看參考答案

依序是:加 replica → 加錯配底物條件 → 最後才加長度。

為什麼 replica 第一: n 是所有結論的瓶頸。而小 n 的偏誤是單向的 —— 逐殘基 top-8 一致性在 n = 2 時看起來 6/8 很漂亮,加到 n = 4 掉到 3/8。小 n 只會讓你太樂觀。而且平均值的相對誤差是 CV/√n,加 replica 直接買到誤差棒。

為什麼底物條件第二: 底物決定了效應存不存在。在 on-target 底物上比較高保真變體,是在量一個設計上就該是零的差 —— 再多的算力也變不出訊號。

為什麼長度最後: 長度只買到單條軌跡時間平均的收斂,而你關心的量(聚合接觸、BSA)在幾十 ns 就已經取樣到合理的平均值。真正需要長度的是 HNH 完整構形轉換,但那個缺口是好幾個數量級:文獻走完這條路用的是累計約 15 μs 的加速取樣,你的 4 × 87 ns 合計約 350 ns 而且完全沒有加速。加倍在這個尺度上等於沒動。

推論: 算力吃緊時,正確的做法是縮小系統或縮短長度來換 replica 數,不是縮 replica 數來換長度。

為什麼不能先把變體排序好,再去找一個能驗證這個排序的實驗?點開看參考答案

因為那是事後合理化,而且 reviewer 抓得到。

具體反例值得背下來: 如果你先排序再選驗證端點,你會很自然地選 SPR 或 BLI —— 因為它們最容易拿到、最快、最便宜。而 SPR/BLI 量的是平衡結合親和力,恰好是唯一無法驗證專一性的端點:SpCas9-HF1、eSpCas9(1.1)、HypaCas9 對 on-target 與 off-target 的結合親和力跟 WT 差不多,差別全在結合之後的構形檢查點。

所以順序是:驗證端點決定打分公式該長什麼樣,而不是反過來。 主要端點必須是功能與動力學量(cleavage rate、editing efficiency、time-resolved engagement),平衡結合只能當健康檢查閘門(確認變體還綁得上)。

這一步不花算力,卻是全流程唯一沒有備援的一步 —— 一旦你看過變體結果,就再也無法誠實回答「權重是事前還是事後決定的」。

寫出你在論文裡要防守的那一句話。給兩個版本,並說明在什麼證據狀態下該選哪一個。點開看參考答案

保守版(可防守): 我們界定了一組便宜的 MD 描述符在 Cas9 三元複合體上的可重現性邊界與適用範圍,並示範起始結構的選擇會如何污染下游的逐殘基分析。不宣稱新生物學,只界定便宜方法的可用邊界。

野心版(需驗證): 我們提出並校準了一個以構形檢查點為基礎的 Cas9 專一性排序軸,它在已知高保真變體上勝過平衡結合自由能。

在只有 reliability 證據、還沒有任何 validity 證據的階段,能防守的只有保守版。 理由很清楚:可重現性只證明一個量「穩」,不證明它「準」;只要表上那些綠燈的量還沒跟任何實驗答案對過,野心版所需要的那一步就還沒完成 —— 它要的是第 7 步閉環。

而這個選擇不是文字風格問題。 一旦寫下「不宣稱新生物學、只界定便宜方法的可用邊界」,整篇的 scope、Results 的取捨與投稿目標就全部跟著定下來。這個決定要在寫第一句 abstract 之前做,不是在拿到實驗數據之後。 因為如果你的主張是保守版,一個 null 的預測結果仍然有用(它排除了一整類描述符);如果是野心版,null 就是致命的。

用一句話誠實描述一條處在這個階段的 pipeline,然後說明為什麼這句話值錢。點開看參考答案

「metric 的可靠性可以先結案,metric 的效度要另外開一輪。」

這句話值錢有兩個理由。

第一,它把三層東西分開了。 已驗證層:跨 replica 可重現的 metric 分層與起始結構對照。條件受限的部分證據層:HNH 作為動態熱點的多方法交會。純假設層:所有關於構形描述符預測力的陳述。把三層混講是這個階段最大的風險 —— 而在「便宜」是硬約束的路線上,誠實的分層就是唯一能防守的資產。

第二,它直接決定下一塊算力該花在哪裡。 既然瓶頸是效度不是可靠性,那麼下一筆錢就不該花在把已經綠燈的量跑得更穩,而該花在能產生效度證據的地方 —— 也就是能讓效應真的存在的實驗條件,加上一組有已知答案可以對照的樣本。

順帶記住這一類 pipeline 最誠實的一句限制:在第 7 步閉環之前,整條流程的預測力是零證據 —— 不是負面證據,是還沒有證據。 這兩者的差別,reviewer 分得出來。

地圖上的鄰居

這頁用到的名詞