MODULE CALC 5 — CALCULUS IN ML & TRADING

應用:ML 與交易裡的微積分

這是微積分這一層的第五關(共五關),也是收尾的一關: 前四關把工具擺好(斜率面積梯度規則與鏈式), 這一關把它們接回你真的會遇到的三個場合:機器學習、交易、以及日常決策。
三個互動各對應一個工具:選擇權的 Delta / Gamma(一階與二階導數)、 softmax 與交叉熵(e 與 ln)、log 報酬的期望值(積分)。
這一關是微積分 05,不算在主線十六關裡。它不教新的微積分 —— 每一個式子都指回前面某一關的某一節。梯度下降那一段刻意不重做: 最佳化 01 ⑤⑥ 已經有完整的互動。

① 這關在解什麼問題:那些工具到底出現在哪裡

前四關給了你什麼 導數關 ②:斜率與線性近似。 積分關 ④:面積 = 機率、期望值 = 積分。 多變量關 ③:二階導數決定彎向哪邊。 規則關 ③④:鏈式法則與反向傳播。
四關的例子都取自這套教材自己的前面關卡(09、12、13、14、15)。 這一關換成外面的世界:同樣四個工具,換到 ML 論文、選擇權報價、投組報告裡的樣子。

三個領域 × 四個工具,一張表

下面這張表就是這一關的地圖。每一格都是「同一個工具換一個場合」

工具ML / AI交易 / 量化生活
一階導數
「動一點差多少」
損失對權重的梯度(訓練的每一步) Delta:選擇權對標的價格的斜率;債券的 duration ( 「多睡一小時,隔天效率差多少」
邊際效益都是導數
二階導數
「彎向哪邊、彎多兇」
學習率能開多大(曲率越大越要小步) Gamma:Delta 自己的變化率;債券的 convexity ( 「加班到第幾小時開始不划算」
報酬遞減就是二階為負
e 與 ln
「乘法變加法」
softmax(把分數變機率)、 交叉熵 −ln p log 報酬(相加就是複利)、對數刻度看價格 複利、半衰期、「感覺上的差別是比例不是差額」
積分 / 期望值
「一整段加起來」
期望損失、連續分布下的 loss(積分 = 加權平均) E[ln R]:長期成長率;風險 = 期望值周圍的散開 ( 「平均通勤時間」「這台冷氣一年電費」
鏈式法則
「一層套一層」
反向傳播規則關 ④ 敏感度串接:利率 → 折現因子 → 價格 「匯率換兩次」「油價 → 運費 → 售價」

最後一列已經在 規則關 ④ 講完,這一關不重複; 這一頁做的是前四列裡標了節號的那四格。

本頁符號對照表

這一頁的符號都是領域慣例,不是新的數學:

符號唸法它其實是什麼哪一節
ΔDelta 就是一階導數 dV/dS:標的價格動 1 元,選擇權價值動多少。 (大寫 Δ 在這裡是名字,不是「有限的差」)
ΓGamma 就是二階導數 d²V/dS²:Delta 自己的變化率 多變量關 ③ 的 f″
softmaxsoft max 把幾個任意實數變成加起來等於 1 的正數ezi ÷ Σezj
CEcross entropy(交叉熵) 分類問題的損失:−ln p正確類別猜對的機率越高,損失越低
E[·]expectation of 期望值機率統計 01 ④ 的加權平均, 連續版就是 積分關 ④ 那條積分
Φ大寫 Phi 標準常態的累積機率機率統計 02 ④ 那條 S 形曲線)。 這一頁用 Simpson 現場積出來 ·

整頁只有兩個真正的新名詞:Delta 與 Gamma,而它們就是 f′ 與 f″。 這是這一關存在的理由 —— 領域名詞比數學多,但數學只有那幾個。

微積分這一層有五關,你在第 05 關

五關沒有先後綁定(除了多變量關與規則關預設你讀過導數關)。這一關預設你讀過 導數積分規則三關:

它回答什麼誰在用
導數「這一點斜多少」最佳化 01 的梯度、最佳化 02 的影子價格、最佳化 03 的「導數設 0」、基礎 01 量過的 eˣ 斜率
積分「這一段總共多少」機率統計 02 的面積 = 機率、機率統計 05 的尾巴、機率統計 01 的臨界值、期望值
多變量「兩個以上的變數怎麼斜」最佳化 01 ⑤ 的 ∇f、最佳化 01 ④ 的凸性、最佳化 03 ⑦ 的 2Cw、最佳化 02 的相切
規則「不算極限,直接寫下導數」02 ⑤ 的 2x、機率統計 05 ⑤ 的 λe−λt、反向傳播
應用(你在這裡)「這些工具在 ML 與交易的哪裡」選擇權 Delta / Gamma、softmax 與交叉熵、log 報酬的期望

這一關是出口:讀完之後回頭看 實戰頁 ③ 的 log 報酬、 最佳化 03 關的權重配置,那些式子就不再是「照做」了。

這一關刻意不做的兩件事

① 不重做梯度下降。最佳化 01 ⑤⑥ 已經有完整的互動(拖起點、調學習率、看它滾下坡、看它震盪), 而梯度是誰算的在 規則關 ④這一頁只補「損失函數自己長什麼樣」(③ 節)。

② 不教金融工程。② 節會用到選擇權的定價公式,但公式怎麼來的完全不重要 —— 它在這裡的身分只是「一條算得出來的曲線」,好讓你在上面量斜率與曲率。 (那條公式需要隨機微積分,跟這一層的東西是兩回事。)

這一關的全部內容,一句話

Delta 是 f′、Gamma 是 f″、softmax 是 e 的正規化、交叉熵是 −ln、期望值是積分。 五個聽起來很專業的詞,全部是前四關的東西換了名字。

每一節都會現場對帳:領域公式算一次、微積分的土方法量一次,兩邊必須相等。

② 交易的導數:Delta 是斜率,Gamma 是斜率的斜率

導數關與多變量關給了你什麼 導數關 ②:斜率 = 切線 = 割線在 h → 0 的極限, 程式裡用中央差分量。同關 ④:切線可以拿來預測附近的值, 但走遠了會系統性偏掉,偏多少由二階導數決定多變量關 ③:二階導數的量法 ((f(x+h) − 2f(x) + f(x−h)) / h²)。
這一節只做一件事:把那兩個東西改叫 Delta 與 Gamma

選擇權在這裡的身分:一條算得出來的曲線

買一張買權(call option)= 買到「未來可以用固定價格 K 買進某個東西」的權利。到期時它值多少很簡單:市價高於 K 就賺差價,低於 K 就作廢max(S − K, 0),就是圖上那條灰虛折線)。

但到期之前它不是那條折線,而是一條平滑的曲線 —— 因為還有時間, 「現在低於 K」不代表到期還低於 K。這一節用的定價公式(Black–Scholes) 你完全不需要看懂,它在這裡的身分只有一個:一條可以拖著量斜率的曲線

Δ = dV/dS   Γ = d²V/dS² = dΔ/dS V —— 選擇權現在的價值(圖上那條橘線的高度)。
S —— 標的現在的價格(橫軸)。
Δ(Delta)—— 就是一階導數:標的漲 1 元,選擇權大約漲 Δ 元。 買權的 Δ 一定在 0 與 1 之間。
Γ(Gamma)—— 就是二階導數,也就是「Δ 自己的斜率」。 Γ 大 ⇒ Δ 變得快 ⇒ 用 Δ 做的線性預測很快就失效導數關 ④ 那條「誤差 ≈ ½f″·(步子)²」)。
這兩張圖在幹嘛
你會看到什麼:上下兩張圖共用同一條橫軸(標的價格 S)。 上圖是橘線=選擇權價值 V(S)灰虛折線=到期時的價值 max(S−K, 0)桃紅直線=在你站的位置的切線,它的斜率就是 Delta。 下圖是藍線Delta 自己畫成一條曲線桃紅短線=Delta 曲線在同一點的切線, 它的斜率就是 Gamma。兩張圖的綠點永遠在同一個 S 上。
你可以動什麼:拖上圖的綠點換標的價格; 剩餘時間 T 滑桿(0.02 ~ 1 年);三顆按鈕跳到 價平S = K = 100)、深價外(70)、深價內(130)。
要看出什麼: 讀數盤的 Delta 與 Gamma 都是左邊公式算、右邊現場量,永遠對得上。 深價外(S=70)Delta 只有 0.03 —— 標的漲 1 元,選擇權幾乎不動; 深價內(S=130)Delta 0.95 —— 幾乎跟著標的一比一動。 ③ Gamma 在價平附近最大(下圖的 Delta 曲線在那裡最陡), 兩邊都趨近 0。 把 T 調到 0.02(快到期), Delta 曲線會擠成一個接近垂直的階梯 —— Gamma 爆掉, 那就是「到期前的選擇權很難對沖」的數學原因。

選擇權價值 V(S) 到期時的價值 切線(上圖斜率=Δ、下圖斜率=Γ) Delta 曲線 你站的位置 S
剩餘時間 T(年)
跳到某個價位
現在這一格在說

Delta 對沖:這就是「切線只在附近可信」的錢版本

假設你賣了一張買權,怕標的漲。買 Δ 股標的就能把「漲一點」的風險抵掉 —— 因為選擇權漲 Δ × 1 元、你手上的股票也漲 Δ × 1 元。 這叫 Delta 對沖,它就是導數關 ④ 那條 f(x) ≈ f(a) + f′(a)(x−a) 拿去下單。

問題是它只在附近成立。標的走遠了,Δ 自己會變(那就是 Gamma), 你手上的股數就不對了 —— 所以要重新調整Gamma 越大,越要頻繁調整(讀數盤那一列「往上 1 元:切線估 vs 真值」 就是誤差的現場量測,它大約等於 ½Γ·1²)。

同一件事在 最佳化 02 關坑 4 是「λ 走遠就低估」、 在 機率統計 02 ⑨ 是「E 穿不過非線性」—— 三個場合,同一個二階項

債券也有一模一樣的兩個名字

債券的價格對殖利率的斜率叫 duration(存續期間), 那條斜率自己的變化率叫 convexity(凸性)。 它們就是這一節的 Δ 與 Γ,只是橫軸換成利率。

所以「利率升 1%,債價跌多少」的標準算法 ΔP ≈ −D·Δy + ½·C·(Δy)² 就是 導數關 ④ 的線性近似再多留一項二階 —— 多留那一項的理由,跟 Delta 對沖要考慮 Gamma 完全一樣。

「凸性」這個詞你在 最佳化 01 ④ 也見過 (那裡講的是「碗形保證往下走到得了谷底」)。同一個字、同一個二階導數,兩個領域各用一次。

Delta 不是「到價的機率」

常見的說法是「Delta 0.55 代表有 55% 的機率到期會賺」。 那是巧合式的近似,不是定義。Delta 的定義就只有一句: dV/dS,價值對價格的斜率。

(真的很接近的那個量是另一個數字 Φ(d₂),跟 Delta Φ(d₁) 差一點。這一頁不展開,只提醒你別把兩件事混成一件。)

一階導數 + 二階導數在交易裡就是這兩個希臘字母。 下一節換工具:把 eln 接到機器學習的損失函數上。

③ ML 的 e 與 ln:softmax 把分數變機率,交叉熵是 −ln p

基礎 01 關與規則關給了你什麼 基礎 01 ①②ez 永遠是正的、而且單調遞增。 基礎 01 ④ea+b = eaeb導數關 ③(ez)′ = ez(ln p)′ = 1/p規則關 ③④:鏈式法則與反向傳播。
這一節把這幾條組起來,變成分類模型的最後一層與損失函數 —— 也就是 ChatGPT 吐出下一個字之前做的那個動作。

問題:模型吐出來的是分數,不是機率

分類模型(包含語言模型)最後一層吐出來的是幾個任意實數,叫 logits (例如 2.0, 1.0, 0.1)。它們可能是負的、加起來也不等於 1, 所以不能直接當機率用。要把它們變成機率,需要一個函數做兩件事: ① 全部變正的、② 加起來等於 1

pi = ezi ÷ ( ez1 + ez2 + … + ezn ) 這個函數叫 softmax。分子 ezi 負責「變正」(基礎 01 ①:指數永遠是正的);
分母把所有分子加起來,負責「加起來等於 1」(每一項都除以總和,總和自然變 1)。
為什麼是 e 而不是別的正函數?三個理由: ① e 的性質最乾淨(導數關 ③:微分之後是自己); ② z 差 1 就是機率比例e 倍 (基礎 01 ④ 的「相加變相乘」); ③ 跟 ln 互逆,所以配上 −ln p 當損失時 梯度會化簡到非常漂亮(下面)。
名字的來歷:它是「soft 版本的 max」—— 最大的那個 z 拿到最多機率,但不是贏者全拿。

有了機率,就要一個損失來說「猜得多爛」。分類問題的標準損失是交叉熵

CE = − ln p正確類別 白話:只看你給「正確答案」那一類多少機率,取 ln,加個負號
為什麼負號:機率是 0 ~ 1,ln 在這一段是負的 (基礎 01 ②),加負號讓損失變正的。
兩個端點:p = 1(完全確定而且對)→ −ln 1 = 0零損失p → 0(把正確答案判成不可能)→ −ln p → ∞損失無上限
這個不對稱是故意的:「很有信心卻答錯」要被罰得非常重。
這兩張圖在幹嘛
你會看到什麼:上圖三根柱子=三個類別的機率 (柱子上方是機率、下方是你給的 logit), 綠框那一根是正確答案。 下圖是紫線=損失曲線 −ln p紅點停在「正確類別現在的機率」那一點 —— 它的高度就是這一筆的損失
你可以動什麼:三根 logit 滑桿(−4 ~ 6); 三顆按鈕換哪一類是正確答案; 「三個一起平移」那顆按鈕把三個 logits 同時加 2(頂到上限就同時減 2)。
要看出什麼: 三個機率永遠加起來等於 1.000000(讀數盤第四列)。 按「三個一起平移」:機率一個都沒變 —— softmax 只看 logits 之間的,不看絕對大小。 把正確類別的 logit 拉高,紅點往右滑、損失往 0 掉; 拉低到機率 0.01 附近,損失衝到 4.6 —— 那條曲線在左邊是垂直的。 把兩個 logit 拉成一樣高:兩邊機率各半,這時損失是 −ln 0.5 = 0.693

機率 p(柱高) 正確答案那一類 損失曲線 −ln p 這一筆的損失
logit z₁(A)
logit z₂(B)
logit z₃(C)
正確答案是哪一類
現在這一格在說

平移不變:為什麼「三個一起平移」機率不變

把每個 zi 都加上同一個常數 c, 分子變成 ezi+c = ezi·ec基礎 01 ④ 的「相加變相乘」),分母也同樣多一個 ec —— 上下對消,機率完全一樣

這條性質不是冷知識,它是實作上的必要手段

ezz = 800 就 overflow 成 Infinity,然後 ∞/∞ 變成 NaN,整個訓練炸掉。 所有正式的 softmax 實作都會先減掉最大的那個 logitzi − max z):機率一模一樣, 但最大的指數變成 e0 = 1,永遠不會爆。

同理,正式實作也不會先算 p 再取 lnp 太小時 ln 0 = −∞), 而是把兩步合成一個 log_softmaxln pi = zi − ln Σezj這行式子就是 基礎 01 ④ 那條「除法變相減」。

為什麼這一對特別漂亮:梯度剛好是 p − y

softmax + 交叉熵合起來的時候,損失對 logits 的梯度化簡成一個乾淨到不像話的式子

∂CE / ∂zi = pi − yi yi = 正確答案那一類是 1、其他是 0。
白話:「你猜的機率」減掉「正確答案」。猜對的那一類梯度是 p − 1(負的 → 要把那個 logit 調高), 其他類是 p(正的 → 要調低)。
怎麼來的:CE = −ln pp 微分得 −1/p導數關 ③), pz 微分用商規則 + 鏈式 (規則關 ②③), 兩個乘起來的時候 1/p 跟 p 對消,剩下 p − y

這就是 規則關 ④ 那條反向鏈的第一格∂L/∂z 算出來之後,往前每一層再乘一次局部斜率,就是反向傳播。 而「梯度 = 猜的 − 真的」也解釋了訓練的直覺:錯多少,就往回推多少

如果換一個損失(例如平方誤差),這個對消就不會發生,梯度會多出一個 p(1−p) 因子 —— 機率接近 0 或 1 時它幾乎是 0, 學不動(那正是 規則關 ④ 的「梯度消失」)。 softmax 配交叉熵是為了避開這件事,不是傳統。

機率不等於信心

softmax 給你一個加起來 1 的數字組,但它不保證那些數字誠實。 深度網路普遍過度自信(給 0.99 但實際正確率只有 0.8), 這叫校準(calibration)問題 —— 要另外處理(溫度調整之類)。

「加起來是 1」是算術保證,「說得準」不是。 這跟 機率統計 01 ⑨ 那句「估計值本身有不確定性」是同一種警覺。

這一節的全部微積分只有兩條:e 的性質與 ln 的導數。下一節換最後一個工具:積分。

④ 積分的期望:E[ln R] 與「風險是期望值周圍的散開」

積分關與基礎 01 關給了你什麼 積分關 ④:期望值就是一條積分 (E[T] = ∫ t·f(t) dt,權重是那一小條的面積), 而且它不是「一半機率」的位置基礎 01 ⑦⑨實戰 ③: 報酬要取 ln 才能相加。
這一節把兩件事疊起來:對「log 報酬」取期望值 —— 那是量化交易裡唯一真正代表「長期成長率」的數字。

先講清楚兩個報酬

一期的總報酬倍數寫成 R(漲 3% 就是 R = 1.03)。它的 lnlog 報酬X = ln R。兩者的差別是相乘 vs 相加

n 期的總報酬 = R1·R2·…·Rn ⟹  ln(總報酬) = X1 + X2 + … + Xn 左邊是相乘(實戰 ② 那句「要說幾倍,不要說差幾塊」), 右邊取 ln 之後變成相加(基礎 01 ④)。
為什麼這件事重要:能相加的東西才能用期望值與變異數那一整套工具 —— 機率統計 03 關Var(X+Y)機率統計 02 ⑥ 的中央極限定理,全部只對「相加」成立。
所以量化的標準做法是:先取 ln、再談期望與波動

假設 log 報酬服從常態分布 N(μ, s²)機率統計 02 ⑥ 給了理由:很多小影響加起來會長成常態)。 這一節要算的三個量全部是積分:

E[ln R] = ∫ x·f(x) dx = μ  ·  P(ln R < 0) = ∫−∞0 f(x) dx  ·   E[R] = ∫ ex·f(x) dx = eμ + s²/2 第一條:log 報酬的期望值,也就是「平均而言每期的成長速度」。
第二條:虧錢的機率 —— ln R < 0 等價於 R < 1基礎 01 ②:ln 在 1 那裡穿過 0)。 它就是圖上紅色那塊面積,跟 機率統計 02 ④Φ 是同一件事。
第三條:倍數本身的期望值。注意它不等於 eμ —— 多出來的 es²/2 就是 機率統計 02 ⑨ 那句「E[exp Y] ≠ exp(E[Y])」的因子。
這張圖在幹嘛
你會看到什麼:紫色曲線=log 報酬的密度 f(x)(橫軸是每期的 log 報酬,不是價格)、 紅色填色ln R < 0虧錢)那一塊、 綠色填色=賺錢那一塊、 藍色三角標=期望值 E[ln R] = μ 落在橫軸的位置、 兩條灰虛線μ ± s散開的範圍,也就是風險)。
你可以動什麼:μ 滑桿(−0.02 ~ 0.06,每期平均 log 報酬)、 s 滑桿(0.02 ~ 0.20,波動);三顆按鈕跳到 基準(μ=0.01、s=0.05)、波動三倍(s=0.15)、沒有優勢(μ=0)。
要看出什麼: 讀數盤四列都是左邊現場積、右邊公式算,永遠對得上。 把 s 從 0.05 拉到 0.15(μ 不動): E[R] 從 1.0113 變大到 1.0215, 但幾何平均 eμ 一直是 1.0101 —— 多出來的全是波動貢獻的假象 同一個動作讓虧錢機率從 42% 升到 47%: 波動不會讓你更賺,只會讓你更抖 把 μ 調成 0:虧錢機率剛好 50%,期望 log 報酬 0 —— 長期不賺不賠,即使 E[R] > 1 看起來像在賺。

log 報酬的密度 虧錢(ln R < 0) 賺錢 期望值 μ μ ± s(風險)
每期平均 log 報酬 μ
波動 s
現在這一格在說

算術平均與幾何平均:波動吃掉的那一塊

上面第 ② 個觀察值得單獨講,因為它是量化裡最容易被誤導的地方:

μ = 0.01 固定E[R](算術平均) eμ(幾何平均)虧錢機率
s = 0.051.0113141.01005042.07 %
s = 0.101.0151131.01005046.02 %
s = 0.151.0214771.01005047.34 %

中間那一欄完全不動,因為長期的複利成長率由 E[ln R] = μ 決定,跟波動無關; 左邊那一欄卻隨著波動一路變大 —— 那個「變大」不會進到你的帳戶裡。 這個現象在交易上叫波動拖累(volatility drag)。

「風險」在這一頁的定義:期望值周圍的散開

整套教材從 02 關 就在做同一件事: 期望值說「大概在哪」,標準差說「大概散多開」。 這一節的 s 就是 log 報酬的標準差, 而它在圖上是兩條灰虛線的距離

所以「風險」在這裡不是「會不會賠」這種模糊的感覺,而是一個可以量的東西: 同樣的 μ,s 越大 ⇒ 單期結果離 μ 越遠 ⇒ 虧錢機率越高(上表第三欄)。 最佳化 03 關把「最小化這個散開」當成目標函數、 機率統計 03 ⑥ 告訴你多資產的散開怎麼合成 (wᵀCw)—— 那一整套的地基就是這一節這條積分。

實務上這一節會怎麼被用掉
  • 年化:log 報酬可以相加,所以 n 期的期望是 、 變異數是 n·s²(獨立的話)—— 所以波動年化要乘 √n,不是 n機率統計 03 ② 的「變異數相加、標準差不相加」)。
  • 比較策略:兩個策略的 E[R] 一樣但 s 不同時, s 小的那個長期一定跑贏(因為 μ = ln E[R] − s²/2 比較大)。 這就是「夏普比率」那類指標想抓的東西。
  • 別把 E[R] 當成長期成長率: 回測報告裡「平均月報酬 2%」如果是算術平均, 長期實際成長會低於它,差多少就是上表那個 es²/2

這一段全部踩在 積分關 ④ 那條 E[T] = ∫ t·f(t) dt 上 —— 只是把 t 換成 ln R換的是語境,不是數學。

⑤ 這關回答了什麼

Delta 跟 Gamma 到底是什麼?為什麼要看第二個?

Delta = 一階導數 dV/dS,Gamma = 二階導數 d²V/dS²Delta 回答「標的漲 1 元,選擇權漲多少」; Gamma 回答「Delta 自己變得多快」。

要看第二個的理由跟 導數關 ④ 一樣: 用 Delta 做的預測(與對沖)只在附近成立,走遠了誤差大約是 ½Γ·(走多遠)²。Gamma 大的地方(價平、快到期) Delta 變得極快,對沖要一直重調 —— 的下圖把 「Delta 曲線有多陡」直接畫出來了。

softmax 為什麼要用 e?可以用別的嗎?

要的只有兩件事:全部變正、加起來等於 1,所以理論上任何正函數都行。 選 e 有三個實際理由(): ① 它的導數最乾淨(微分之後是自己); ② logits 差 1 就是機率比例差 e 倍,差值有一致的意義; ③ 跟 ln 互逆,所以配上 −ln p 當損失時 梯度剛好化簡成 p − y

第三點是關鍵:換成別的組合,那個對消就不會發生,梯度會多一個 p(1−p) 因子,在 p 接近 0 或 1 的時候幾乎是 0 ——學不動

交叉熵為什麼是 −ln p?把機率壓到 0 會怎樣?

因為 ln 在 0 ~ 1 之間是負的,加負號讓損失變正; 而且它剛好給出想要的形狀:p = 1 損失 0、p → 0 損失 → ∞

「壓到 0」的後果就是損失爆炸:p = 0.01 時損失 4.6、p = 0.001 時 6.9。 這個不對稱是設計出來的 —— 模型「很有信心卻答錯」要被罰得非常重。 實作上為了避免真的算到 ln 0 = −∞, 會用 log_softmax 把兩步合成一步( 的工程框)。

E[ln R] 跟 E[R] 差在哪?為什麼交易看前者?

因為長期的複利成長率是 E[ln R],不是 E[R]。 n 期的總報酬是相乘,取 ln 之後才變相加 —— 而期望值與變異數那一整套工具只對「相加」成立 (機率統計 03 ②)。

兩者的差距是 es²/2:μ = 0.01 固定, s 從 0.05 拉到 0.15,E[R] 從 1.0113 變成 1.0215, 但幾何平均一直是 1.0101( 那張表)。 那個變大是波動貢獻的假象,不會進帳戶 —— 這叫波動拖累。 它跟 機率統計 02 ⑨E[exp Y] ≠ exp(E[Y]) 是同一件事。

「風險」在這裡到底是什麼?

期望值周圍的散開,也就是 log 報酬的標準差 s —— 圖上那兩條灰虛線的距離。

它不是「會不會賠」的感覺,而是可以量的東西:同樣的 μ, s 越大,單期結果離 μ 越遠、虧錢機率越高(42% → 47%)。 02 關的標準差、 機率統計 03 ⑥wᵀCw最佳化 03 ⑤ 的有效邊界,講的都是這一個量。

微積分這五關跟主線十六關的關係是什麼?

這一組自己編 01–05,但整組不算在主線十六關裡,因為它們沒有引入新的線性代數或機率概念 —— 它們補的是主線十六關一直在用、但沒有命名的那套動作:

  • 導數:13 的梯度、14 的影子價格、15 的「導數設 0」、 基礎 01 ⑥ 量過的 ex 斜率。
  • 積分:機率統計 02 的「面積 = 機率」、機率統計 05 的尾巴、機率統計 01 的臨界值、期望值。
  • 多變量:最佳化 01 ⑤ 的 ∇f、 最佳化 01 ④ 的凸性、最佳化 03 ⑦ 的 2Cw
  • 規則:02 ⑤ 的 2x、 機率統計 05 ⑤ 的 λe−λt、以及反向傳播。
  • 應用(這一關):反過來 —— 它不補主線十六關的債, 而是把工具帶到主線十六關以外的地方(ML、交易),讓你看到同一批數學換了名字還是它。

所以讀法是:卡在主線十六關某一節 → 去對應那一關;想知道學了能幹嘛 → 來這一關。 全景收束在 全景 01 關,真實案例在 實戰頁

從這裡去哪裡

你是為了機器學習來的:路線是 規則關 ③④(鏈式與反向傳播)→ 這裡的 (損失函數)→ 最佳化 01 ⑤⑥ (更新那一步)→ 多變量關 ④(學習率為什麼有上限)。

你是為了交易來的:這裡的 之後,往 最佳化 03 關(權重怎麼配)與 實戰頁(一張真白板從價格算到 20 / 80)。

你是為了把微積分補完來的:五關到這裡結束。 回 全景 01 關的驗收測驗, 或從 概念地圖挑下一個還沒點開的格子。