Level 6 — 知道如何設計 workflowDesigning your own workflow
把前面所有東西接成一條你自己能防守的流程。
你現在在哪
整張地圖的收斂點。 前六關給了你零件,這一關只做一件事:組裝順序。
而你已經知道順序錯了要付什麼。第一輪完整三元用 Chai-1 預測結構當起點,整批 replica 跑完之後才發現逐殘基 top-8 是 0/8 共享、ρ ≈ −0.03,等於擲骰子;換 5F9R 晶體起點重跑才變成 3/8 共享、Jaccard 0.48、Spearman +0.77。決定這個結果的是第 1 步的一個選擇,但你是在第 4 步才知道。
這個形狀你在材料領域見過:high-throughput screening funnel —— 便宜的 descriptor 先篩,貴的計算再驗證,最後才進實驗。差別只有一個,而且很致命:材料 funnel 的 descriptor 通常已經在大量系統上跟更高階的計算或實驗對過;你的 descriptor 一個實驗答案都還沒對過。 所以 L6 的產出不是「一條更好的 funnel」,是一條知道自己還沒被驗證的 funnel —— 而後者才是 methodology paper 唯一守得住的東西。
這一關結束之後,你能做兩件你現在做不到的事: 在白紙上畫出你自己的七步流程,標出每一步的成本量級、失敗模式與引爆點;以及在同行或 reviewer 面前,為每一個選擇說出理由,包含「這一步目前還沒有證據」。
先把 WT 跑到有誤差棒,再碰任何變體。 只讓跨 replica CV 低於 10% 的聚合量進打分公式。 在看到任何變體結果之前,凍結打分規則與驗證端點。
這關要學會什麼
- 你將能夠畫出七步流程,並對每一步說出輸入、輸出、成本量級、失敗模式、以及它會在第幾步引爆(第 1 步的錯誤在第 4 步引爆,第 5 步的錯誤在整篇稿子上引爆)。
- 你將能夠說出為什麼 Validation 設計必須排在 Ranking 前面,並舉出一個具體反例。
- 你將能夠設計打分公式的形狀:以 WT 為參考態、用 WT 的雜訊尺度無因次化、跨兩個底物條件取雙差,並說明權重為什麼必須事前凍結在一份規格檔裡。
- 你將能夠向實驗端開出一張具體的要求清單,且每一項都說得出「為什麼我需要它」。
- 你將能夠回答那幾個一定會被問的 reviewer 問題,並分辨哪幾題有數據答案、哪幾題只能靠限縮宣稱來守。
- 你將能夠誠實描述一條 pipeline 缺的是什麼:驗證端點還沒閉環的時候,預測力是零證據,不是負面證據。
- 你將能夠在幾條候選方向裡選一條,寫下你要防守的那一句話,並為它定義一個明文的停損條件。
依序讀這些
這四頁就是流程本身:全圖 → 前段 → 中段 → 後段。每一頁都要對得出「這一步的錯誤會在第幾步引爆」。
- Workflow 全圖 — 七步、每一步的成本量級、以及「哪一步的錯誤在哪一步引爆」。
- 從 PDB 到軌跡 — 第 1、2 步。所有決定都幾乎不花算力,卻幾乎每一個都不可逆。
- 分析與打分 — 第 3、4、6 步。三層架構:QC 層做二元閘門不打分、打分層只收綠燈聚合量、機制敘事層可以講故事但不進分數。
- 驗證與實驗合作 — 第 5、7 步。主要端點必須是功能與速率,SPR/BLI 這類平衡結合只能當健康檢查閘門。
三篇原始文獻(各對應流程的一端)
通關檢查表
通關測驗
你有 5 個候選 metric 與 8 個變體。Reviewer 問:「你怎麼避免過擬合到自己的測試集?」點開看參考答案
先自己把自由度算出來,再回答。 5 個 metric 的權重組合,配上 8 個點的排序 —— 光是權重就足以湊出你想要的任何排序。承認這件事,比假裝沒有這個問題強得多。
然後給出唯一有效的防線:預先登記。 把可調的東西全部列出來(metric 選擇、權重、CV 閾值、軌跡長度、replica 數、底物設計),逐一標明哪些是在看到變體結果之前凍結的,凍結的證據是什麼(有時間戳的 commit)。
還有兩個免費的加強: 只報一個主 metric,其他全放補充材料;留一部分資料當 holdout,從頭到尾一次都不看,最後才拿出來跑一遍 —— 動了就不能再回頭調。
最後一個測誠信的問題你要能正面回答:「你總共看了幾個版本才決定報這一個?」如果答案大於 1 而你沒有做多重比較校正,這個結果就是探索性的,照實把結論降級。
算力突然加倍了。你要加軌跡長度、加 replica,還是加底物條件?點開看參考答案
依序是:加 replica → 加錯配底物條件 → 最後才加長度。
為什麼 replica 第一: n 是所有結論的瓶頸。而小 n 的偏誤是單向的 —— 逐殘基 top-8 一致性在 n = 2 時看起來 6/8 很漂亮,加到 n = 4 掉到 3/8。小 n 只會讓你太樂觀。而且平均值的相對誤差是 CV/√n,加 replica 直接買到誤差棒。
為什麼底物條件第二: 底物決定了效應存不存在。在 on-target 底物上比較高保真變體,是在量一個設計上就該是零的差 —— 再多的算力也變不出訊號。
為什麼長度最後: 長度只買到單條軌跡時間平均的收斂,而你關心的量(聚合接觸、BSA)在幾十 ns 就已經取樣到合理的平均值。真正需要長度的是 HNH 完整構形轉換,但那個缺口是好幾個數量級:文獻走完這條路用的是累計約 15 μs 的加速取樣,你的 4 × 87 ns 合計約 350 ns 而且完全沒有加速。加倍在這個尺度上等於沒動。
推論: 算力吃緊時,正確的做法是縮小系統或縮短長度來換 replica 數,不是縮 replica 數來換長度。
為什麼不能先把變體排序好,再去找一個能驗證這個排序的實驗?點開看參考答案
因為那是事後合理化,而且 reviewer 抓得到。
具體反例值得背下來: 如果你先排序再選驗證端點,你會很自然地選 SPR 或 BLI —— 因為它們最容易拿到、最快、最便宜。而 SPR/BLI 量的是平衡結合親和力,恰好是唯一無法驗證專一性的端點:SpCas9-HF1、eSpCas9(1.1)、HypaCas9 對 on-target 與 off-target 的結合親和力跟 WT 差不多,差別全在結合之後的構形檢查點。
所以順序是:驗證端點決定打分公式該長什麼樣,而不是反過來。 主要端點必須是功能與動力學量(cleavage rate、editing efficiency、time-resolved engagement),平衡結合只能當健康檢查閘門(確認變體還綁得上)。
這一步不花算力,卻是全流程唯一沒有備援的一步 —— 一旦你看過變體結果,就再也無法誠實回答「權重是事前還是事後決定的」。
寫出你在論文裡要防守的那一句話。給兩個版本,並說明在什麼證據狀態下該選哪一個。點開看參考答案
保守版(可防守): 我們界定了一組便宜的 MD 描述符在 Cas9 三元複合體上的可重現性邊界與適用範圍,並示範起始結構的選擇會如何污染下游的逐殘基分析。不宣稱新生物學,只界定便宜方法的可用邊界。
野心版(需驗證): 我們提出並校準了一個以構形檢查點為基礎的 Cas9 專一性排序軸,它在已知高保真變體上勝過平衡結合自由能。
在只有 reliability 證據、還沒有任何 validity 證據的階段,能防守的只有保守版。 理由很清楚:可重現性只證明一個量「穩」,不證明它「準」;只要表上那些綠燈的量還沒跟任何實驗答案對過,野心版所需要的那一步就還沒完成 —— 它要的是第 7 步閉環。
而這個選擇不是文字風格問題。 一旦寫下「不宣稱新生物學、只界定便宜方法的可用邊界」,整篇的 scope、Results 的取捨與投稿目標就全部跟著定下來。這個決定要在寫第一句 abstract 之前做,不是在拿到實驗數據之後。 因為如果你的主張是保守版,一個 null 的預測結果仍然有用(它排除了一整類描述符);如果是野心版,null 就是致命的。
用一句話誠實描述一條處在這個階段的 pipeline,然後說明為什麼這句話值錢。點開看參考答案
「metric 的可靠性可以先結案,metric 的效度要另外開一輪。」
這句話值錢有兩個理由。
第一,它把三層東西分開了。 已驗證層:跨 replica 可重現的 metric 分層與起始結構對照。條件受限的部分證據層:HNH 作為動態熱點的多方法交會。純假設層:所有關於構形描述符預測力的陳述。把三層混講是這個階段最大的風險 —— 而在「便宜」是硬約束的路線上,誠實的分層就是唯一能防守的資產。
第二,它直接決定下一塊算力該花在哪裡。 既然瓶頸是效度不是可靠性,那麼下一筆錢就不該花在把已經綠燈的量跑得更穩,而該花在能產生效度證據的地方 —— 也就是能讓效應真的存在的實驗條件,加上一組有已知答案可以對照的樣本。
順帶記住這一類 pipeline 最誠實的一句限制:在第 7 步閉環之前,整條流程的預測力是零證據 —— 不是負面證據,是還沒有證據。 這兩者的差別,reviewer 分得出來。