一、 在機器學習中,期望值
(Expectation) 與 平均數 (Mean) 並非孤立的統計概念,而是貫穿以下核心知識鏈的支柱:
- L231 統計地基:
離散機率期望值 ── 用以推估電子郵件 CTR 點擊次數等伯努力試驗期望。
- L231 機制與原理:
偏差-變異分解 (Bias-Variance Decomposition) ── 評估模型期望損失。
- L233 評估指標:
調和平均數 ── F1-Score 指標設計的核心,防範類別不平衡預估失真。
二、 費曼式三大核心考點學術拆解
考點 1:離散機率分佈的期望值本質
費曼直覺想:
期望值就是「如果你重複做這件事無窮多次,平均每次會得到多少結果」。它是一個機率加權的平均值,不代表任何單一次實驗會剛好得到這個數值。
E[X] = Sum( x_i * P(X = x_i) )
在行銷或點擊率預估 (CTR) 中:
- 若進行 10 次獨立 email 發送,每次被點擊的機率 p = 0.2,則我們預期的點擊次數(期望值)為: E[X] = n * p = 10 * 0.2 = 2 (次)。
- 這告訴我們模型的基準預期線。但在單次具體實驗中,我們算得「恰好有點擊3次」的機率 P(X=3) = 0.2013。兩者在概念上是期望線與機率分佈點的對位。
考點 2:期望損失與偏差-變異分解 (Bias-Variance Decomposition)
費曼直覺想:
想像你在射飛鏢。
- 偏差 (Bias): 代表你飛鏢射出的「平均位置」與「紅心(真實值)」的距離。如果平均偏得很遠,代表你的技術有系統性誤差(欠擬合,模型太簡單)。
- 變異
(Variance):
代表你每次射出飛鏢之間的「散亂程度」。如果你射得滿靶都是,雖然平均起來可能在中央,但太不穩定了(過擬合,模型對數據抖動太敏感)。
Expected Generalization Error = Bias^2 +
Variance + Irreducible Noise
💡 費曼除錯提示 (防過擬合與欠擬合)
- 高 Bias(偏差): 預測平均值偏離真實值。解法:增加特徵、提升模型複雜度(如加深神經網路)、減少正則化。
- 高 Variance(變異): 預測值波動巨大。解法:引入 L1/L2 正則化(Weight Decay)、使用 Dropout、增加數據量或進行資料擴增 (Data Augmentation)。
考點 3:F1-Score 為什麼非要用「調和平均數」?
費曼直覺想:
假設你要評估一個學生的文理綜合能力。如果用「算術平均數」,一個國文 100 分、數學 0 分的學生,平均有 50 分,看起來還行。但這顯然是個「偏科戰士」。
「調和平均數」的邏輯是:只要其中一科考 0
分,你的綜合分數就是 0 分。它強烈懲罰偏科。
F1-Score = 2 * (Precision * Recall) /
(Precision + Recall)
🚨 實戰避坑案例
題目若宣稱 F1-score = (Precision + Recall) / 2,這只是單純的算術平均,為嚴重概念錯誤的干擾項。 因為若 Precision = 1.0 且 Recall = 0.01(模型只預測一筆且正確,漏掉 99% 的詐欺行為),算術平均仍有 0.505,但調和平均 F1-Score 會降至 0.0198,真實反映了模型的缺陷。
三、 三種平均數指標總結
平均數類型 | 數學計算公式 | 對極端值的敏感性 | 機器學習應用場景 |
算術平均數 (Arithmetic Mean) | (A + B) / 2 | 極易受極端大值拉伸 | KNN 距離計算、特徵中心化 (mean=0)、MAE 損失函數 |
幾何平均數 (Geometric Mean) | sqrt(A * B) | 偏向數值較小的一側 | ROC 曲線綜合評估、多指標複合增長率 |
調和平均數 (Harmonic Mean) | 2 / (1/A + 1/B) | 強烈受極小值支配 | F1-Score (Precision 與 Recall 的權衡指 標) |
期望值 影音資訊
經典機率分佈 影音資訊
PMF、PDF、CDF 影音資訊
敍述性分析->診斷性分析->預測性分析->指示性分析 影音資訊
#################################################################
下面資訊為: 考點2補充
變異數 (Variance) 數學公式推導與物理直覺報告
## 一、 變異數 (Variance) 數學公式推導
在統計學與機器學習中,設隨機變數為 Y = f_hat(x),代表模型在特定輸入點 x 處的預測值。由於每次訓練所使用的資料集 D 是隨機抽樣的,因此模型的預測值 f_hat(x) 也是一個隨機變數。
我們定義變異數為預測值圍繞其期望值 E[Y] 的期望平方偏差:
Var(Y) = E[ (Y - E[Y])^2 ]
### 1. 展開括號項 (Algebraic Expansion)
首先,展開期望值算子內部的平方項:
(Y - E[Y])^2 = Y^2 - 2 * Y * E[Y] + (E[Y])^2
### 2. 套用期望值算子 (Linearity of Expectation)
將期望值算子 E[...] 引入展開後的每一項。依據期望值的線性性質(E[A + B] = E[A] + E[B] 且 E[c * A] = c * E[A],其中 c 為常數):
E[ (Y - E[Y])^2 ] = E[ Y^2 - 2 * Y * E[Y] + (E[Y])^2 ]
= E[ Y^2 ] - E[ 2 * Y * E[Y] ] + E[ (E[Y])^2 ]
### 3. 常數提取與化簡 (Simplification of Constants)
在此步驟中,一個至關重要的統計物理認知是:E[Y] 本身是一個確定的數值(常數),它不再是一個隨機變數。因此:
• 在第二項中,2 與 E[Y] 皆為常數,可以移到期望值算子外部:
E[ 2 * Y * E[Y] ] = 2 * E[Y] * E[Y] = 2 * (E[Y])^2
• 在第三項中,(E[Y])^2 本身就是一個常數,常數的期望值等於常數本身:
E[ (E[Y])^2 ] = (E[Y])^2
### 4. 代入合併
將上述化簡結果代回原式:
Var(Y) = E[ Y^2 ] - 2 * (E[Y])^2 + (E[Y])^2
Var(Y) = E[ Y^2 ] - (E[Y])^2
推導結論:
變異數的本質即為「預測值平方的期望值」減去「預測值期望值的平方」。
即:Var(f_hat(x)) = E[ f_hat(x)^2 ] - (E[ f_hat(x) ])^2
──────
## 二、 期望值與變異之關連性 (Expectation vs. Variance)
我們可以用「重力中心(重心)」與「旋轉慣量(散佈度)」來理解期望值與變異數的關係:
低變異 (Low Variance):預測值緊密圍繞重心
[ * *x* * ] --> 穩定、敏感度低 (對訓練集擾動不敏感)
高變異 (High Variance):預測值離散分佈在重心兩側
[ * * x * * ] --> 不穩定、敏感度高 (對訓練集擾動極度敏感,過擬合)
(註:x 代表期望值 E[Y])
1. 期望值 E[Y] (重心): 代表模型預測的「平均對齊線」。如果我們訓練 1000 個結構相同但訓練資料不同的模型,這 1000 個模型對同一個樣本 x 預測的平均值就是期望值。
2. 變異數 Var(Y) (散佈度): 代表這 1000 個模型預測值彼此之間的「分歧程度」。如果大家預測得差不多,變異數就很小;如果有的預測極大、有的極小,變異數就極大。
──────
## 三、 科學對位實務舉例 (CTR 廣告預估場景)
設我們有一封電子郵件,其真實的點擊率 (True CTR) 為 f(x) = 0.20。
現在我們有兩個模型,分別在 5 個不同的隨機訓練集上進行訓練,並對此郵件進行 CTR 預估。
### 1. 模型 A:簡單線性迴歸 (高偏差 Bias,低變異 Variance)
• 5 次隨機訓練後的預測值 Y_A:[0.14, 0.15, 0.15, 0.16, 0.15]
• 計算期望值 E[Y_A]:
E[Y_A] = (0.14 + 0.15 + 0.15 + 0.16 + 0.15) / 5 = 0.75 / 5 = 0.15
• 計算偏差平方 Bias^2:
Bias^2 = (E[Y_A] - f(x))^2 = (0.15 - 0.20)^2 = (-0.05)^2 = 0.0025
• 計算變異數 Var(Y_A):
Var(Y_A) = E[ (Y_A - E[Y_A])^2 ]
= ( (0.14-0.15)^2 + (0.15-0.15)^2 + (0.15-0.15)^2 + (0.16-0.15)^2 + (0.15-0.15)^2 ) / 5
= ( 0.0001 + 0 + 0 + 0.0001 + 0 ) / 5 = 0.0002 / 5
= 0.00004
### 2. 模型 B:深層神經網路 (低偏差 Bias,高變異 Variance)
• 5 次隨機訓練後的預測值 Y_B:[0.05, 0.35, 0.10, 0.30, 0.20]
• 計算期望值 E[Y_B]:
E[Y_B] = (0.05 + 0.35 + 0.10 + 0.30 + 0.20) / 5 = 1.00 / 5 = 0.20
• 計算偏差平方 Bias^2:
Bias^2 = (E[Y_B] - f(x))^2 = (0.20 - 0.20)^2 = 0 (完美無偏差)
• 計算變異數 Var(Y_B):
Var(Y_B) = E[ (Y_B - E[Y_B])^2 ]
= ( (0.05-0.20)^2 + (0.35-0.20)^2 + (0.10-0.20)^2 + (0.30-0.20)^2 + (0.20-0.20)^2 ) / 5
= ( (-0.15)^2 + (0.15)^2 + (-0.10)^2 + (0.10)^2 + 0 ) / 5
= ( 0.0225 + 0.0225 + 0.0100 + 0.0100 + 0 ) / 5 = 0.0650 / 5
= 0.013
### 3. 科學對位總結 (Feynman Comparison)
• 模型 A (簡單模型): 雖然預測值的平均期望值 (0.15) 偏離了真實值 (0.20),產生了較高的偏差 (0.0025);但它的變異數極低 (0.00004)。這代表它非常穩定,換了訓練資料也不會亂抖動(低敏感度,欠擬合)。
• 模型 B (複雜模型): 雖然平均期望值 (0.20) 完美命中真實值,偏差為 0;但其變異數高達 0.013(是模型 A 的 325 倍!)。這代表它對訓練資料集高度敏感,極易將訓練集中的隨機噪聲當成規律學進去,導致預估值大起大落(高敏感度,過擬合)。