應用:ML 與交易裡的微積分
這是微積分這一層的第五關(共五關),也是收尾的一關:
前四關把工具擺好(斜率、面積、
梯度、規則與鏈式),
這一關把它們接回你真的會遇到的三個場合:機器學習、交易、以及日常決策。
三個互動各對應一個工具:選擇權的 Delta / Gamma(一階與二階導數)、
softmax 與交叉熵(e 與 ln)、log 報酬的期望值(積分)。
這一關是微積分 05,不算在主線十六關裡。它不教新的微積分 ——
每一個式子都指回前面某一關的某一節。梯度下降那一段刻意不重做:
最佳化 01 ⑤⑥ 已經有完整的互動。
① 這關在解什麼問題:那些工具到底出現在哪裡
前四關給了你什麼
導數關 ②:斜率與線性近似。
積分關 ④:面積 = 機率、期望值 = 積分。
多變量關 ③:二階導數決定彎向哪邊。
規則關 ③④:鏈式法則與反向傳播。
四關的例子都取自這套教材自己的前面關卡(09、12、13、14、15)。
這一關換成外面的世界:同樣四個工具,換到 ML 論文、選擇權報價、投組報告裡的樣子。
下面這張表就是這一關的地圖。每一格都是「同一個工具換一個場合」:
| 工具 | ML / AI | 交易 / 量化 | 生活 |
|---|---|---|---|
| 一階導數 「動一點差多少」 |
損失對權重的梯度(訓練的每一步) | Delta:選擇權對標的價格的斜率;債券的 duration (②) | 「多睡一小時,隔天效率差多少」 邊際效益都是導數 |
| 二階導數 「彎向哪邊、彎多兇」 |
學習率能開多大(曲率越大越要小步) | Gamma:Delta 自己的變化率;債券的 convexity (②) | 「加班到第幾小時開始不划算」 報酬遞減就是二階為負 |
| e 與 ln 「乘法變加法」 |
softmax(把分數變機率)、 交叉熵 −ln p(③) | log 報酬(相加就是複利)、對數刻度看價格 | 複利、半衰期、「感覺上的差別是比例不是差額」 |
| 積分 / 期望值 「一整段加起來」 |
期望損失、連續分布下的 loss(積分 = 加權平均) | E[ln R]:長期成長率;風險 = 期望值周圍的散開 (④) | 「平均通勤時間」「這台冷氣一年電費」 |
| 鏈式法則 「一層套一層」 |
反向傳播(規則關 ④) | 敏感度串接:利率 → 折現因子 → 價格 | 「匯率換兩次」「油價 → 運費 → 售價」 |
最後一列已經在 規則關 ④ 講完,這一關不重複; 這一頁做的是前四列裡標了節號的那四格。
本頁符號對照表
這一頁的符號都是領域慣例,不是新的數學:
| 符號 | 唸法 | 它其實是什麼 | 哪一節 |
|---|---|---|---|
| Δ | Delta | 就是一階導數 dV/dS:標的價格動 1 元,選擇權價值動多少。 (大寫 Δ 在這裡是名字,不是「有限的差」) | ② |
| Γ | Gamma | 就是二階導數 d²V/dS²:Delta 自己的變化率 | ②;多變量關 ③ 的 f″ |
| softmax | soft max | 把幾個任意實數變成加起來等於 1 的正數: ezi ÷ Σezj | ③ |
| CE | cross entropy(交叉熵) | 分類問題的損失:−ln p正確類別。 猜對的機率越高,損失越低 | ③ |
| E[·] | expectation of | 期望值:機率統計 01 ④ 的加權平均, 連續版就是 積分關 ④ 那條積分 | ④ |
| Φ | 大寫 Phi | 標準常態的累積機率(機率統計 02 ④ 那條 S 形曲線)。 這一頁用 Simpson 現場積出來 | ② · ④ |
整頁只有兩個真正的新名詞:Delta 與 Gamma,而它們就是 f′ 與 f″。 這是這一關存在的理由 —— 領域名詞比數學多,但數學只有那幾個。
微積分這一層有五關,你在第 05 關
五關沒有先後綁定(除了多變量關與規則關預設你讀過導數關)。這一關預設你讀過 導數、積分、 規則三關:
| 關 | 它回答什麼 | 誰在用 |
|---|---|---|
| 導數 | 「這一點斜多少」 | 最佳化 01 的梯度、最佳化 02 的影子價格、最佳化 03 的「導數設 0」、基礎 01 量過的 eˣ 斜率 |
| 積分 | 「這一段總共多少」 | 機率統計 02 的面積 = 機率、機率統計 05 的尾巴、機率統計 01 的臨界值、期望值 |
| 多變量 | 「兩個以上的變數怎麼斜」 | 最佳化 01 ⑤ 的 ∇f、最佳化 01 ④ 的凸性、最佳化 03 ⑦ 的 2Cw、最佳化 02 的相切 |
| 規則 | 「不算極限,直接寫下導數」 | 02 ⑤ 的 2x、機率統計 05 ⑤ 的 λe−λt、反向傳播 |
| 應用(你在這裡) | 「這些工具在 ML 與交易的哪裡」 | 選擇權 Delta / Gamma、softmax 與交叉熵、log 報酬的期望 |
① 不重做梯度下降。最佳化 01 ⑤⑥ 已經有完整的互動(拖起點、調學習率、看它滾下坡、看它震盪), 而梯度是誰算的在 規則關 ④。 這一頁只補「損失函數自己長什麼樣」(③ 節)。
② 不教金融工程。② 節會用到選擇權的定價公式,但公式怎麼來的完全不重要 —— 它在這裡的身分只是「一條算得出來的曲線」,好讓你在上面量斜率與曲率。 (那條公式需要隨機微積分,跟這一層的東西是兩回事。)
Delta 是 f′、Gamma 是 f″、softmax 是 e 的正規化、交叉熵是 −ln、期望值是積分。 五個聽起來很專業的詞,全部是前四關的東西換了名字。
每一節都會現場對帳:領域公式算一次、微積分的土方法量一次,兩邊必須相等。
② 交易的導數:Delta 是斜率,Gamma 是斜率的斜率
導數關與多變量關給了你什麼
導數關 ②:斜率 = 切線 = 割線在 h → 0 的極限,
程式裡用中央差分量。同關 ④:切線可以拿來預測附近的值,
但走遠了會系統性偏掉,偏多少由二階導數決定。
多變量關 ③:二階導數的量法
((f(x+h) − 2f(x) + f(x−h)) / h²)。
這一節只做一件事:把那兩個東西改叫 Delta 與 Gamma。
選擇權在這裡的身分:一條算得出來的曲線
買一張買權(call option)= 買到「未來可以用固定價格 K 買進某個東西」的權利。到期時它值多少很簡單:市價高於 K 就賺差價,低於 K 就作廢 (max(S − K, 0),就是圖上那條灰虛折線)。
但到期之前它不是那條折線,而是一條平滑的曲線 —— 因為還有時間, 「現在低於 K」不代表到期還低於 K。這一節用的定價公式(Black–Scholes) 你完全不需要看懂,它在這裡的身分只有一個:一條可以拖著量斜率的曲線。
S —— 標的現在的價格(橫軸)。
Δ(Delta)—— 就是一階導數:標的漲 1 元,選擇權大約漲 Δ 元。 買權的 Δ 一定在 0 與 1 之間。
Γ(Gamma)—— 就是二階導數,也就是「Δ 自己的斜率」。 Γ 大 ⇒ Δ 變得快 ⇒ 用 Δ 做的線性預測很快就失效 (導數關 ④ 那條「誤差 ≈ ½f″·(步子)²」)。
—
—
假設你賣了一張買權,怕標的漲。買 Δ 股標的就能把「漲一點」的風險抵掉 —— 因為選擇權漲 Δ × 1 元、你手上的股票也漲 Δ × 1 元。 這叫 Delta 對沖,它就是導數關 ④ 那條 f(x) ≈ f(a) + f′(a)(x−a) 拿去下單。
問題是它只在附近成立。標的走遠了,Δ 自己會變(那就是 Gamma), 你手上的股數就不對了 —— 所以要重新調整。 Gamma 越大,越要頻繁調整(讀數盤那一列「往上 1 元:切線估 vs 真值」 就是誤差的現場量測,它大約等於 ½Γ·1²)。
同一件事在 最佳化 02 關坑 4 是「λ 走遠就低估」、 在 機率統計 02 ⑨ 是「E 穿不過非線性」—— 三個場合,同一個二階項。
債券的價格對殖利率的斜率叫 duration(存續期間), 那條斜率自己的變化率叫 convexity(凸性)。 它們就是這一節的 Δ 與 Γ,只是橫軸換成利率。
所以「利率升 1%,債價跌多少」的標準算法 ΔP ≈ −D·Δy + ½·C·(Δy)² 就是 導數關 ④ 的線性近似再多留一項二階 —— 多留那一項的理由,跟 Delta 對沖要考慮 Gamma 完全一樣。
「凸性」這個詞你在 最佳化 01 ④ 也見過 (那裡講的是「碗形保證往下走到得了谷底」)。同一個字、同一個二階導數,兩個領域各用一次。
常見的說法是「Delta 0.55 代表有 55% 的機率到期會賺」。 那是巧合式的近似,不是定義。Delta 的定義就只有一句: dV/dS,價值對價格的斜率。
(真的很接近的那個量是另一個數字 Φ(d₂),跟 Delta Φ(d₁) 差一點。這一頁不展開,只提醒你別把兩件事混成一件。)
一階導數 + 二階導數在交易裡就是這兩個希臘字母。 下一節換工具:把 e 與 ln 接到機器學習的損失函數上。
③ ML 的 e 與 ln:softmax 把分數變機率,交叉熵是 −ln p
基礎 01 關與規則關給了你什麼
基礎 01 ①②:ez 永遠是正的、而且單調遞增。
基礎 01 ④:ea+b = eaeb。
導數關 ③:(ez)′ = ez、
(ln p)′ = 1/p。
規則關 ③④:鏈式法則與反向傳播。
這一節把這幾條組起來,變成分類模型的最後一層與損失函數 ——
也就是 ChatGPT 吐出下一個字之前做的那個動作。
問題:模型吐出來的是分數,不是機率
分類模型(包含語言模型)最後一層吐出來的是幾個任意實數,叫 logits (例如 2.0, 1.0, 0.1)。它們可能是負的、加起來也不等於 1, 所以不能直接當機率用。要把它們變成機率,需要一個函數做兩件事: ① 全部變正的、② 加起來等於 1。
分母把所有分子加起來,負責「加起來等於 1」(每一項都除以總和,總和自然變 1)。
為什麼是 e 而不是別的正函數?三個理由: ① e 的性質最乾淨(導數關 ③:微分之後是自己); ② z 差 1 就是機率比例差 e 倍 (基礎 01 ④ 的「相加變相乘」); ③ 跟 ln 互逆,所以配上 −ln p 當損失時 梯度會化簡到非常漂亮(下面)。
名字的來歷:它是「soft 版本的 max」—— 最大的那個 z 拿到最多機率,但不是贏者全拿。
有了機率,就要一個損失來說「猜得多爛」。分類問題的標準損失是交叉熵:
為什麼負號:機率是 0 ~ 1,ln 在這一段是負的 (基礎 01 ②),加負號讓損失變正的。
兩個端點:p = 1(完全確定而且對)→ −ln 1 = 0,零損失; p → 0(把正確答案判成不可能)→ −ln p → ∞,損失無上限。
這個不對稱是故意的:「很有信心卻答錯」要被罰得非常重。
—
—
平移不變:為什麼「三個一起平移」機率不變
把每個 zi 都加上同一個常數 c, 分子變成 ezi+c = ezi·ec (基礎 01 ④ 的「相加變相乘」),分母也同樣多一個 ec —— 上下對消,機率完全一樣。
ez 在 z = 800 就 overflow 成
Infinity,然後 ∞/∞ 變成 NaN,整個訓練炸掉。
所有正式的 softmax 實作都會先減掉最大的那個 logit
(zi − max z):機率一模一樣,
但最大的指數變成 e0 = 1,永遠不會爆。
同理,正式實作也不會先算 p 再取 ln
(p 太小時 ln 0 = −∞),
而是把兩步合成一個 log_softmax:
ln pi = zi − ln Σezj。
這行式子就是 基礎 01 ④ 那條「除法變相減」。
softmax + 交叉熵合起來的時候,損失對 logits 的梯度化簡成一個乾淨到不像話的式子:
白話:「你猜的機率」減掉「正確答案」。猜對的那一類梯度是 p − 1(負的 → 要把那個 logit 調高), 其他類是 p(正的 → 要調低)。
怎麼來的:CE = −ln p 對 p 微分得 −1/p(導數關 ③), p 對 z 微分用商規則 + 鏈式 (規則關 ②③), 兩個乘起來的時候 1/p 跟 p 對消,剩下 p − y。
這就是 規則關 ④ 那條反向鏈的第一格: ∂L/∂z 算出來之後,往前每一層再乘一次局部斜率,就是反向傳播。 而「梯度 = 猜的 − 真的」也解釋了訓練的直覺:錯多少,就往回推多少。
如果換一個損失(例如平方誤差),這個對消就不會發生,梯度會多出一個 p(1−p) 因子 —— 機率接近 0 或 1 時它幾乎是 0, 學不動(那正是 規則關 ④ 的「梯度消失」)。 softmax 配交叉熵是為了避開這件事,不是傳統。
softmax 給你一個加起來 1 的數字組,但它不保證那些數字誠實。 深度網路普遍過度自信(給 0.99 但實際正確率只有 0.8), 這叫校準(calibration)問題 —— 要另外處理(溫度調整之類)。
「加起來是 1」是算術保證,「說得準」不是。 這跟 機率統計 01 ⑨ 那句「估計值本身有不確定性」是同一種警覺。
這一節的全部微積分只有兩條:e 的性質與 ln 的導數。下一節換最後一個工具:積分。
④ 積分的期望:E[ln R] 與「風險是期望值周圍的散開」
積分關與基礎 01 關給了你什麼
積分關 ④:期望值就是一條積分
(E[T] = ∫ t·f(t) dt,權重是那一小條的面積),
而且它不是「一半機率」的位置。
基礎 01 ⑦⑨ 與 實戰 ③:
報酬要取 ln 才能相加。
這一節把兩件事疊起來:對「log 報酬」取期望值 ——
那是量化交易裡唯一真正代表「長期成長率」的數字。
先講清楚兩個報酬
一期的總報酬倍數寫成 R(漲 3% 就是 R = 1.03)。它的 ln 叫 log 報酬: X = ln R。兩者的差別是相乘 vs 相加:
為什麼這件事重要:能相加的東西才能用期望值與變異數那一整套工具 —— 機率統計 03 關的 Var(X+Y)、 機率統計 02 ⑥ 的中央極限定理,全部只對「相加」成立。
所以量化的標準做法是:先取 ln、再談期望與波動。
假設 log 報酬服從常態分布 N(μ, s²) (機率統計 02 ⑥ 給了理由:很多小影響加起來會長成常態)。 這一節要算的三個量全部是積分:
第二條:虧錢的機率 —— ln R < 0 等價於 R < 1(基礎 01 ②:ln 在 1 那裡穿過 0)。 它就是圖上紅色那塊面積,跟 機率統計 02 ④ 的 Φ 是同一件事。
第三條:倍數本身的期望值。注意它不等於 eμ —— 多出來的 es²/2 就是 機率統計 02 ⑨ 那句「E[exp Y] ≠ exp(E[Y])」的因子。
—
—
算術平均與幾何平均:波動吃掉的那一塊
上面第 ② 個觀察值得單獨講,因為它是量化裡最容易被誤導的地方:
| μ = 0.01 固定 | E[R](算術平均) | eμ(幾何平均) | 虧錢機率 |
|---|---|---|---|
| s = 0.05 | 1.011314 | 1.010050 | 42.07 % |
| s = 0.10 | 1.015113 | 1.010050 | 46.02 % |
| s = 0.15 | 1.021477 | 1.010050 | 47.34 % |
中間那一欄完全不動,因為長期的複利成長率由 E[ln R] = μ 決定,跟波動無關; 左邊那一欄卻隨著波動一路變大 —— 那個「變大」不會進到你的帳戶裡。 這個現象在交易上叫波動拖累(volatility drag)。
整套教材從 02 關 就在做同一件事: 期望值說「大概在哪」,標準差說「大概散多開」。 這一節的 s 就是 log 報酬的標準差, 而它在圖上是兩條灰虛線的距離。
所以「風險」在這裡不是「會不會賠」這種模糊的感覺,而是一個可以量的東西: 同樣的 μ,s 越大 ⇒ 單期結果離 μ 越遠 ⇒ 虧錢機率越高(上表第三欄)。 最佳化 03 關把「最小化這個散開」當成目標函數、 機率統計 03 ⑥ 告訴你多資產的散開怎麼合成 (wᵀCw)—— 那一整套的地基就是這一節這條積分。
- 年化:log 報酬可以相加,所以 n 期的期望是 nμ、 變異數是 n·s²(獨立的話)—— 所以波動年化要乘 √n,不是 n (機率統計 03 ② 的「變異數相加、標準差不相加」)。
- 比較策略:兩個策略的 E[R] 一樣但 s 不同時, s 小的那個長期一定跑贏(因為 μ = ln E[R] − s²/2 比較大)。 這就是「夏普比率」那類指標想抓的東西。
- 別把 E[R] 當成長期成長率: 回測報告裡「平均月報酬 2%」如果是算術平均, 長期實際成長會低於它,差多少就是上表那個 es²/2。
這一段全部踩在 積分關 ④ 那條 E[T] = ∫ t·f(t) dt 上 —— 只是把 t 換成 ln R。換的是語境,不是數學。
⑤ 這關回答了什麼
Delta 跟 Gamma 到底是什麼?為什麼要看第二個?
Delta = 一階導數 dV/dS,Gamma = 二階導數 d²V/dS²。Delta 回答「標的漲 1 元,選擇權漲多少」; Gamma 回答「Delta 自己變得多快」。
要看第二個的理由跟 導數關 ④ 一樣: 用 Delta 做的預測(與對沖)只在附近成立,走遠了誤差大約是 ½Γ·(走多遠)²。Gamma 大的地方(價平、快到期) Delta 變得極快,對沖要一直重調 —— ② 的下圖把 「Delta 曲線有多陡」直接畫出來了。
softmax 為什麼要用 e?可以用別的嗎?
要的只有兩件事:全部變正、加起來等於 1,所以理論上任何正函數都行。 選 e 有三個實際理由(③): ① 它的導數最乾淨(微分之後是自己); ② logits 差 1 就是機率比例差 e 倍,差值有一致的意義; ③ 跟 ln 互逆,所以配上 −ln p 當損失時 梯度剛好化簡成 p − y。
第三點是關鍵:換成別的組合,那個對消就不會發生,梯度會多一個 p(1−p) 因子,在 p 接近 0 或 1 的時候幾乎是 0 ——學不動。
交叉熵為什麼是 −ln p?把機率壓到 0 會怎樣?
因為 ln 在 0 ~ 1 之間是負的,加負號讓損失變正; 而且它剛好給出想要的形狀:p = 1 損失 0、p → 0 損失 → ∞。
「壓到 0」的後果就是損失爆炸:p = 0.01 時損失 4.6、p = 0.001 時 6.9。
這個不對稱是設計出來的 —— 模型「很有信心卻答錯」要被罰得非常重。
實作上為了避免真的算到 ln 0 = −∞,
會用 log_softmax 把兩步合成一步(③ 的工程框)。
E[ln R] 跟 E[R] 差在哪?為什麼交易看前者?
因為長期的複利成長率是 E[ln R],不是 E[R]。 n 期的總報酬是相乘,取 ln 之後才變相加 —— 而期望值與變異數那一整套工具只對「相加」成立 (機率統計 03 ②)。
兩者的差距是 es²/2:μ = 0.01 固定, s 從 0.05 拉到 0.15,E[R] 從 1.0113 變成 1.0215, 但幾何平均一直是 1.0101(④ 那張表)。 那個變大是波動貢獻的假象,不會進帳戶 —— 這叫波動拖累。 它跟 機率統計 02 ⑨ 的 E[exp Y] ≠ exp(E[Y]) 是同一件事。
「風險」在這裡到底是什麼?
期望值周圍的散開,也就是 log 報酬的標準差 s —— ④ 圖上那兩條灰虛線的距離。
它不是「會不會賠」的感覺,而是可以量的東西:同樣的 μ, s 越大,單期結果離 μ 越遠、虧錢機率越高(42% → 47%)。 02 關的標準差、 機率統計 03 ⑥ 的 wᵀCw、 最佳化 03 ⑤ 的有效邊界,講的都是這一個量。
微積分這五關跟主線十六關的關係是什麼?
這一組自己編 01–05,但整組不算在主線十六關裡,因為它們沒有引入新的線性代數或機率概念 —— 它們補的是主線十六關一直在用、但沒有命名的那套動作:
- 導數:13 的梯度、14 的影子價格、15 的「導數設 0」、 基礎 01 ⑥ 量過的 ex 斜率。
- 積分:機率統計 02 的「面積 = 機率」、機率統計 05 的尾巴、機率統計 01 的臨界值、期望值。
- 多變量:最佳化 01 ⑤ 的 ∇f、 最佳化 01 ④ 的凸性、最佳化 03 ⑦ 的 2Cw。
- 規則:02 ⑤ 的 2x、 機率統計 05 ⑤ 的 λe−λt、以及反向傳播。
- 應用(這一關):反過來 —— 它不補主線十六關的債, 而是把工具帶到主線十六關以外的地方(ML、交易),讓你看到同一批數學換了名字還是它。
所以讀法是:卡在主線十六關某一節 → 去對應那一關;想知道學了能幹嘛 → 來這一關。 全景收束在 全景 01 關,真實案例在 實戰頁。