Learning Path學習路徑
L0 → L6 七道關卡。不知道從哪開始,就從這裡開始。
這章的頁面
這章在講什麼
這是全站唯一有順序的一章。 其他十章都是參考書:你有問題才翻,翻完就走。這一章是路線圖,只回答三個問題 —— 我現在在哪、下一步該讀什麼、以及什麼時候可以停下來開始動手。第三個問題最容易被忽略,但它才是這章存在的理由:一張沒有終點標記的地圖,會讓人一直讀下去而永遠不敢開檔案。
七道關卡的順序不是隨便排的,它跟你當年學 DFT 的順序幾乎是同一個形狀。L0 到 L1 先建立「這台機器在幹嘛」的圖像,等於你先知道 Kohn-Sham 方程在解什麼,還沒碰任何參數。L2 把「Cas9 很酷」翻譯成一個真正的科學問題 —— 它會切錯地方,而且高保真變體修的不是結合強度而是構形檢查點。這一關是整張地圖的轉軸:跳過它,後面選的每一根打分軸都會選錯,就像還不知道自己要算吸附能就先去挑贗勢。L3 換一個世界,從電子結構跳到古典力場,重點不是學會跑 MD,是搞清楚你換掉了什麼、換到了什麼。L4 是工具箱,十二種分析各自量什麼、什麼時候不該用。L5 是判準 —— 你怎麼知道這個數字不是雜訊。它對應到你熟悉的 ENCUT 與 k-mesh 收斂測試,但只在習慣的層次上對應:DFT 的收斂是決定論的、可單調逼近,曲線變平就能停;MD 的取樣收斂是統計的,一條變平的曲線可能只代表幾條軌跡一起困在同一個盆地裡,所以判準要換成跨獨立軌跡的分歧程度。L6 才把前面全部接成一條你自己能防守的流程。
這章不回答的東西同樣重要。它不教任何一個分析怎麼算(那在 Analysis),不告訴你該做哪個題目(不在本站範圍內),也沒有作業與考試 —— 每一關只有一份通關檢查表,勾完就算過。它更不是一條必須從頭走到尾的隧道:如果你已經跑過 MD,L3 可以二十分鐘掃過去。但 L2 與 L5 這兩關不能跳。 它們的共通點是都不產生「我學會一個新技能」的快感,只產生判斷力,所以是最常被跳過、也是跳過之後最貴的兩關。
教授可能問
你現在在第幾關?講一個你目前答不出來的問題給我聽。點開看參考答案
這一問在測自我定位的誠實度,答「我在 L4」是沒有用的答案。有用的答案長這樣:「我大致在 L4,十二個分析我都知道在量什麼,但我還說不出為什麼 BSA 的跨 replica CV 是 2.1% 而 DNA RMSF 是 59.1%,也就是我還不知道穩定性的來源是什麼 —— 這代表我其實還沒進 L5。」能指出自己知識的邊界落在哪一條線上,比多背三個名詞有價值得多。
如果只能跳過一關,你會跳哪一關?為什麼 L2 不能跳?點開看參考答案
L4 的十二個分析,你能用一句話講出它們的分類原則嗎?點開看參考答案
你覺得走完 L6 的產出是什麼?一張流程圖嗎?點開看參考答案
不是。流程圖是副產品,真正的產出是一句你敢在審查現場防守的話,以及支撐那句話所需要的最小證據集合。如果走完 L6 交出來的是一張漂亮的圖,卻說不出「這條流程量得到什麼、量不到什麼、我憑什麼相信它」,那就是還沒走完。L6 的通關標準是:有人問「為什麼是四條 replica 不是兩條」的時候,你能給出數據而不是慣例。
Reviewer 可能問
你的模擬跑了多長、幾條獨立軌跡?為什麼那個量就夠?點開看參考答案
這是走到 L5 才答得出來的問題,而它幾乎一定會被問。你的專案有現成的答案:4 replica × 約 87 ns,535,265 atoms 的完整 R-loop 三元複合體。但關鍵不在數字本身,而在你能不能用這個取樣量去界定結論的作用域 —— 聚合量(BSA 2.1%、總 protein–DNA 接觸 4.1%)跨 replica 穩定,可以承擔排序責任;DNA RMSF 59.1%、逐位點距離 38 到 46%、groove 接觸計數 145.5% 落在 noise tier,只能當定性敘述。答「我們跑了業界慣例的長度」是最糟的答案,因為它把責任推給一個不存在的慣例。
你的 metric 為什麼選這幾個?有沒有做過對參數選擇的敏感度檢查?點開看參考答案
只走到 L4 的人會答「因為文獻都這樣做」,而 reviewer 想聽的是選擇依據與穩健性。cutoff、fit selection、氫鍵的角度門檻,這些都是你事後貼上去的判準而不是 Hamiltonian 的一部分,所以掃描它們是必要成本不是加分項。檢查的形狀很簡單:把 cutoff 從一端掃到另一端,看你的排序會不會翻轉;不會翻轉才叫結論,會翻轉的叫參數的產物。
你的對照組是什麼?有沒有一個本來就應該是 null 的條件?點開看參考答案
這是 L5 的核心,也是最容易整篇被打掉的一題。最現成的例子就是 eSpCas9(1.1):它在 on-target 底物上本來就該是 null,要看到效應必須換成帶 PAM-distal 錯配的底物。一個設計良好的研究會主動安排一個「如果這裡出現訊號就代表我的流程有問題」的條件,而不是只安排會出現訊號的條件。
你的起始結構從哪來?換一個起始結構結論還在嗎?點開看參考答案
這一問在 AI 預測結構普及之後已經變成標準題。你的專案有配對對照可以直接回答:同一套 metric、同一套分析流程,從 Chai-1 預測結構起跑得到 0/8 共享、ρ ≈ −0.03(等同隨機),換成 5F9R 晶體結構起跑變成 3/8 共享、pairwise Jaccard 0.48、Spearman +0.77。元兇是起始結構不是 metric。 答得出這一題,代表你至少走完了 L3 與 L5。
口試可能問
你為什麼選 MD 這條路,而不是 docking 或純機器學習?點開看參考答案
要把三條路的成本與可及性一起講。純序列的機器學習需要的是資料規模,那是別人的資產不是你的;docking 與單點打分便宜,但它只給一個靜態構形下的分數,而 Cas9 的專一性發生在結合之後的構形檢查點,那正是靜態方法最看不見的地方。MD 是唯一在你的算力預算內、又碰得到構形分布的手段。但要誠實加一句:它碰得到分布,碰不到 μs 到 ms 的速率,所以宣稱要縮到你真的量得到的範圍。
這條路你打算走多久?如果只有三個月要拿出東西,你砍哪一關?點開看參考答案
可以砍的是 L4 的廣度(只留下打分層會用到的那四五個分析)與 L3 的實作深度(直接沿用現成的建系統腳本)。不能砍的是 L2 與 L5:砍掉 L2 你會量錯東西,砍掉 L5 你交出來的數字沒有誤差棒,兩者的共同後果都是三個月之後要全部重來。時間壓力下正確的做法是縮小範圍而不是降低標準 —— 少跑幾個變體,但每一個都有跨 replica 的誤差棒。
從計算材料背景跳過生物學直接學分析,代價是什麼?點開看參考答案
代價非常具體:會有能力算出一堆數字,卻還沒有能力判斷哪個數字對應到真實的生物事件。舉一個真的會發生的例子 —— 在 on-target 底物上比較 WT 與 eSpCas9(1.1),算出來沒有差別;不懂生物學你會以為是方法失敗,懂的話你會知道那本來就該是 null,差異只在錯配底物上才出現。生物學在這個專案裡的功能不是背景知識,是實驗設計的約束條件。
走完這七關之後,跨領域者跟領域內資深研究者差在哪裡?該怎麼補?點開看參考答案
誠實的答案是差在直覺與失敗經驗:領域內的人一眼看得出一張圖不對勁,跨領域者要靠檢查表。補的方式不是多讀論文,是把檢查表寫得比那份直覺更明確 —— 這正好是這條路線的定位。方法紀律(跨 replica 的可重現性報告)本來就是計算材料背景帶得過來的優勢,所以正確的策略是在自己有優勢的維度上競爭,而不是假裝自己有五年的生物直覺。
AI 對話練習
你是一位嚴格但友善的口試委員,專長是計算生物物理。我是計算化學/材料背景(熟 DFT、VASP、吸附能、電催化),生醫背景接近零,正在學 Cas9 的計算研究。
請用「一次只問一題」的方式,出 10 個由淺到深的問題來測我的程度。順序大致對應以下七個層級:L0 Cas9 是什麼、L1 它怎麼切 DNA、L2 專一性問題是什麼、L3 MD 在模擬什麼、L4 各種軌跡分析、L5 benchmark 與可靠性、L6 workflow 設計。
規則:
- 一次只問一題,等我回答完再問下一題,不要預先列出全部問題。
- 我答錯或含糊時,先指出具體錯在哪,再問一個更基礎的問題往回退。
- 我答對時,直接往上加難度。
- 不要給我鼓勵性的空話。
十題結束後,請給我三樣東西:(a) 我目前卡在哪一關,用一句話說明判斷依據;(b) 三個我最需要補的洞,按「補起來的投資報酬率」排序;(c) 每個洞我該讀什麼、以及一個可以自我檢驗是否補起來的具體問題。
我要向你解釋一個概念:為什麼 Cas9 的專一性主要不是「結合強度」的問題,而是結合之後的構形檢查點問題。
請你扮演一位完全不懂生物、但邏輯非常嚴格的計算材料研究生。規則:
- 我每講完一段,你只能做三件事之一 —— 指出我用了一個沒有定義過的名詞、指出我的因果推論有跳步、或指出我講的東西無法從我前面說過的東西推出來。
- 只要出現上述任何一項,立刻打斷我,不要等我講完。
- 不要幫我補完我沒講清楚的部分,也不要展示你自己的知識。
- 如果我用了類比,追問這個類比在哪裡會失效。
我全部講完之後,請列出:我漏掉的關鍵環節、我講錯的地方、以及一個「如果我真的懂了就應該答得出來」的追問。
你是一位務實、討厭空泛計畫的資深計算組 PI,研究方向是 Cas9 的計算篩選。
我的條件:計算化學/材料背景,熟 DFT 與 VASP,生醫背景接近零;每週可投入的時數我等一下告訴你;算力是一張消費級 GPU,加上叢集上一個小額的並行配額(同時只有個位數的 job),儲存空間也有限。目標是建立一套便宜、可大量篩選的 Cas9 computational workflow,最後寫成一篇 methodology paper。
請先問我三個問題把條件問清楚(包含我每週的可用時數),然後給我一份分階段的學習與執行計畫。計畫必須滿足:
- 每個階段都要有一個可檢驗的產出,不能只寫「讀完某某主題」。
- 明確標出哪些階段可以壓縮、哪些不能,並說明壓縮的代價。
- 標出每個階段的算力成本量級(不用精確數字,用「零/一晚/一週機時」這種量級)。
- 最後給我一個停損條件:什麼情況下我應該放棄目前的主線改走備案。
計畫給完之後,請針對我最可能低估的那個階段挑戰我一次。