臺灣「政府資料開放平台」(data.gov.tw)與各部會開放資料庫(如內政部 SEGIS、交通部 TDX、衛福部、財政部、環境部等)累積了涵蓋社會、經濟、交通、公衛與地理環境的巨量數據。
以下為GEMINI SPARK協助依OPEN DATA平台列舉 10 個具代表性、跨不同機器學習(Machine Learning)範式的實戰應用範例,完整涵蓋時間序列、監督式學習(迴歸/分類)、非監督式分群、異常檢測、圖神經網絡、關聯規則、推薦系統、生存分析與 NLP 語意分析。
1. 「全台 PM2.5 與空污擴散預測」——時間序列與時空注意力機制
臺灣開放資料源:環境部《空氣品質監測網》(AQI 歷史與即時監測資料)+ 氣象署《自動氣象站觀測資料》
應用主題:預測未來 24~72 小時全台各測站 PM2.5 濃度變化,並發布區域季節性空污預警。
特徵欄位(Features):
PM2.5,PM10,SO2,NO2,O3(空氣污染物濃度)wind_speed,wind_direction(風速、風向向量)temperature,relative_humidity(氣溫、相對濕度)boundary_layer_height(混合層高度)
ML 演算法:LSTM / Temporal Fusion Transformer (TFT) / Prophet。
深度科學對位剖析:
數學直覺:空氣品質具備強烈的「時空自相關(Spatio-Temporal Autocorrelation)」與「滯後效應(Lag Effect)」。Temporal Fusion Transformer 透過自注意力機制(Self-Attention)自動辨識主要驅動因子(例如境外污染傳輸 vs. 本地風速沉降),並針對氣象特徵進行動態門控(Gated Residual Network, GRN):
業務與政策解讀:協助環保局提前調控大型工廠降載降排,並提供民眾與學校作為戶外活動規劃依據。
2. 「雙北中古屋與預售屋房價估價」——監督式迴歸與特徵可解釋性 (XAI)
臺灣開放資料源:內政部《不動產買賣實價登錄開放資料》
應用主題:建立自動化估價模型(Automated Valuation Model, AVM),精準預測房屋總價與單價,評估房市透明度。
特徵欄位(Features):
building_age(屋齡)total_area(建物移轉總面積)floor_ratio(所在樓層 / 總樓層)dist_to_mrt(距離最近捷運站距離)has_elevator(有無電梯)main_building_ratio(主建物占總面積比率)
ML 演算法:XGBoost / LightGBM 迴歸 + SHAP (SHapley Additive exPlanations)。
深度科學對位剖析:
數學直覺:房價特徵間存在高度非線性交互作用(例如:在北市核心區「屋齡 40 年」影響較小,但在郊區影響極大)。利用 Shapley 值進行邊際貢獻分解, quantify 捷運溢價(Premium Effect)與屋齡衰減的非線性拐點:
業務與政策解讀:銀行可用於房屋抵押貸款核貸風險評估,民眾可獲得客觀透明的購屋參考價格。
3. 「臺灣家庭消費結構與經濟階層分型」——非監督式分群與降維
臺灣開放資料源:行政院主計總處《家庭收支調查》(Survey of Family Income and Expenditure)
應用主題:剖析臺灣不同收入階層家庭在食品、住房、醫療、教育與休閒上的支出分配比例,進行生活型態分群。
特徵欄位(Features):
disposable_income(可支配所得)food_share(食品非酒精飲料支出占比 - 昂格爾係數)housing_utilities_share(住宅服務與水電瓦斯占比)medical_share(醫療保健支出占比)education_leisure_share(教育與休閒文化占比)
ML 演算法:Z‑Score 標準化 → PCA → K‑Means++ / GMM
深度科學對位剖析:
數學直覺:消費金額數量級差異大(所得數十萬 vs. 娛樂支出數千),需先以 Z-Score 標準化,再透過主成分分析(PCA)將高維消費維度降至 2~3 個正交軸(如「生存負擔指數」與「生活品質享受指數」),避免多重共線性並在保留最高變異數(Explained Variance)前提下進行 K-Means++ 中心點初始化。
業務與政策解讀:幫助政府制定精準的補貼與稅制政策,並提供零售與金融業進行顧客分層(Customer Segmentation)精準行銷。
4. 「道路事故高風險熱點與危險行為檢測」——異常檢測
臺灣開放資料源:內政部警政署 / 交通部《道路交通事故(A1與A2類)開放資料》
應用主題:從全台數十萬筆交通事故紀錄中,識別出非典型事故模式與極端危險路口。
特徵欄位(Features):
latitude,longitude(事故地點 WGS84 座標)time_hour(事故發生時段)weather_condition(天候狀態)road_type(道路型態:交叉路口/單向道/彎道)vehicle_types(涉案車輛種類組合)casualty_count(傷亡人數)
ML 演算法:孤立森林(Isolation Forest) / Local Outlier Factor (LOF)。
深度科學對位剖析:
數學直覺:Isolation Forest 利用隨機分割超平面孤立數據點。在特徵空間中,極端高風險事故或特殊工程瑕疵路口屬於少數且差異大的異常點,其在樹結構中的平均切割路徑長度 $h(x)$ 顯著較短:
$$s(x, n) = 2^{-\frac{E(h(x))}{c(n)}}$$
業務與政策解讀:交通局可針對高風險路口優化號誌時相與道路設計(如設置左轉專用道或路口縮小工程)。
5. 「YouBike 2.0 車站調度與跨站流動」——圖神經網絡 (GNN) 與空間網絡分析
臺灣開放資料源:交通部 TDX 運輸資料流通服務《公共自行車 YouBike 即時與歷史借還車資料》
應用主題:預測全台各 YouBike 站點未來 30 分鐘的「無車可借」與「無位可還」機率,優化車輛調度動線。
特徵欄位(Features):
station_location(站點經緯度座標)net_flow(淨借還車流量)station_capacity(站點總柱數)mrt_proximity(距離鄰近捷運站距離)rain_flag(即時降雨標記)
ML 演算法:時空圖卷積網絡(Spatio-Temporal Graph Convolutional Networks, ST-GCN)。
深度科學對位剖析:
數學直覺:站點之間的騎行軌跡形成有向加權圖 $G=(V, E, A)$,拉普拉斯矩陣 $L = D - A$ 刻畫了站點間的拓撲連通性。ST-GCN 在空間維度使用圖卷積提取站點間的轉乘網絡關係,在時間維度使用 1D 卷積捕捉流量趨勢:
業務與政策解讀:調度團隊可進行精準車輛補給分配,降低熱點站點滿位或空站率。
6. 「慢性病共病路徑與健保用藥模式」——關聯規則挖掘 (Association Rule Mining)
臺灣開放資料源:衛福部中央健康保險署《門診與住院醫療申報公開統計資料》
應用主題:挖掘臺灣中高齡族群常見慢性病(如高血壓、高血脂、高血糖)之間的共病發展路徑與併發症組合。
特徵欄位(Features):
age_group(年齡層)icd10_codes(主要與次要國際疾病分類代碼組合)drug_classes(處方藥物種類)department(就醫科別)
ML 演算法:FP-Growth 演算法(計算 Support, Confidence, Lift)。
深度科學對位剖析:
數學直覺:FP-Growth 構建 FP-Tree 避免了頻繁項集產生過程中的大量候選集生成。透過提升度(Lift)判定兩種疾病同框出現若 Lift > 1 表示
與 正相關。 科學意義:若 Lift > 1 表示 A
與B 正相關。 若 $\text{Lift}(\text{糖尿病} \rightarrow \text{慢性腎臟病}) > 2$,代表糖尿病患者並發腎臟病的機率遠高於隨機期望值。
業務與政策解讀:輔助國健署推動慢性病整合門診,提早介入高風險併發症患者的健康管理。
7. 「國旅景點與藝文展演智慧推薦」——混合式推薦系統
臺灣開放資料源:文化部《全國藝文活動資訊開放服務》+ 觀光署《臺灣旅宿與觀光景點開放資料》
應用主題:根據旅客的個人偏好、造訪歷史與當前季節地點,推薦個人化的國旅行程與展演活動。
特徵欄位(Features):
user_interests(使用者偏好標籤:戶外自然、歷史古蹟、親子展覽)spot_category(景點/展演分類)ticket_price(門票價格)stay_duration(預計停留時間)spatial_distance(距離使用者當前位置距離)
ML 演算法:混合式推薦系統(Hybrid Recommender System):基於內容過濾(Content-Based Filter) + 隱性矩陣分解(Matrix Factorization / SVD)。
深度科學對位剖析:
數學直覺:將使用者偏好與景點特徵映射至低維隱含因子空間(Latent Factor Space),利用奇異值分解(SVD)近似預測未造訪景點的隱含喜好評分:
業務與政策解讀:促進在地觀光與文化產業發展,紓解連假熱門景點人潮,引導旅客至潛力私房景點。
8. 「臺灣新創與中小企業存續壽命分析」——生存分析 (Survival Analysis)
臺灣開放資料源:經濟部商業發展署《公司設立登記》與《公司解散/廢止登記開放資料》
應用主題:評估不同產業、資本額與設立地區的中小企業在成立 1~5 年內的生存機率與歇業風險。
特徵欄位(Features):
business_duration_months(企業存續月數 / 時間至事件)is_dissolved(是否已解散廢止 / 右刪截標記 Censoring)capital_amount(登記資本額)industry_code(所營事業項目分類)location_county(設立縣市)director_share_ratio(董監事持股比例)
ML 演算法:Cox 比例風險模型(Cox Proportional Hazards Model) / 隨機生存森林(Random Survival Forests)。
深度科學對位剖析:
數學直覺:商業登記資料中許多企業至今仍正常營運(右刪截數據 Right-Censored Data)。Cox 模型透過估算風險函數(Hazard Function),量化資本額與產業類別對風險比率(Hazard Ratio)的影響:
業務與政策解讀:協助中小企業信用保證基金(信保基金)優化融資擔保審核機制,並指導青年創業輔導政策。
9. 「電商與消費爭議申訴自動分流」——NLP 自然語言處理與文本分類
臺灣開放資料源:行政院消費者保護處《消費爭議申訴案件統計資料》
應用主題:對消費者的文字申訴內容進行自動化語意分析,迅速判定爭議類別(如退換貨拒絕、個資洩露、廣告不實)與急迫性等級。
特徵欄位(Features):
complaint_text(申訴事由摘要與經過文字)dispute_amount(爭議金額)industry_type(申訴對象產業分類)
ML 演算法:Taiwanese-BERT / RoBERTa 繁體中文預訓練模型 + TF-IDF + Logistic Regression Baseline。
深度科學對位剖析:
數學直覺:繁體中文文本經由 BERT 雙向 Transformer 編碼器處理,透過多頭自注意力機制(Multi-Head Self-Attention)擷取上下文語意向量(Contextualized Embeddings),精準識別「退款遭拒」、「假冒賣家」等關鍵爭點詞彙:
業務與政策解讀:消保官與地方政府可實現申訴案件的自動化優先級分流,提升消費爭議處理效率。
10. 「全台鄉鎮市區少子高齡化與地方創生潛力」——多變量空間降維與綜合評估
臺灣開放資料源:內政部《SEGIS 社會經濟資料庫 / 鄉鎮市區社會經濟指標》
應用主題:評估全台 368 個鄉鎮市區的人口結構、經濟活力與醫療資源,劃分「地方創生優先區」與「高發展潛力區」。
特徵欄位(Features):
aging_index(老化指數)birth_rate(粗出生率)doctors_per_10k(每萬人醫師數)tax_revenue_per_cap(人均地方稅收)college_pop_ratio(大專以上人口比例)net_migration_rate(人口淨遷入率)
ML 演算法:PCA 主成分分析 + UMAP 非線性降維可視化 + Hierarchical Agglomerative Clustering (分層階層分群)。
深度科學對位剖析:
數學直覺:10+ 個社會經濟變數間存在高度多重共線性(Multicollinearity)。利用特徵值分解(Eigendecomposition)將協方差矩陣轉化為互相正交的主成分(PC1 代表「都市化與經濟強度」,PC2 代表「人口老齡化程度」),再結合 UMAP 在低維空間保持流形(Manifold)局部與全域結構。
業務與政策解讀:國家發展委員會(國發會)可用於精準撥補地方創生預算,引導企業投資偏鄉。
💡 總結對照表(Summary Matrix)
| 序號 | 臺灣開放資料源 | 應用主題 | 核心機器學習演算法 | 機器學習範式 (ML Paradigm) |
| 1 | 環保部 AQI / 氣象署觀測 | 全台 PM2.5 / AQI 空污預測 | Temporal Fusion Transformer (TFT) | 時空時間序列預測 |
| 2 | 內政部實價登錄 | 雙北中古屋/預售屋房價估價 | XGBoost / LightGBM + SHAP | 監督式迴歸與可解釋 AI |
| 3 | 主計總處家庭收支調查 | 臺灣家庭消費結構與經濟階層分型 | PCA + K-Means++ / GMM | 非監督式降維與分群 |
| 4 | 警政署/交通部 A1A2 事故 | 道路事故高風險熱點與危險行為檢測 | Isolation Forest / LOF | 異常檢測 (Anomaly Detection) |
| 5 | 交通部 TDX YouBike 資料 | YouBike 2.0 車站即時調度與流量 | Spatio-Temporal GCN (ST-GCN) | 圖神經網絡 (GNN) |
| 6 | 健保署醫療申報統計 | 慢性病共病路徑與健保用藥模式 | FP-Growth 演算法 | 關聯規則挖掘 |
| 7 | 文化部藝文 / 觀光署景點 | 國旅景點與藝文展演智慧推薦 | Hybrid (SVD + Content-Based) | 推薦系統 (Recommender System) |
| 8 | 經濟部公司設立與解散登記 | 新創與中小企業生存壽命分析 | Cox Proportional Hazards Model | 生存分析 (Survival Analysis) |
| 9 | 消保處消費爭議申訴統計 | 消費爭議申訴文本自動分流 | Taiwanese-BERT / RoBERTa | 自然語言處理 (NLP) 分類 |
| 10 | 內政部 SEGIS 鄉鎮市區指標 | 鄉鎮市區少子高齡化與地方創生潛力 | PCA + UMAP + 分層階層分群 | 多變量降維與分群 |