2026年8月10日 星期一

機器學習提示詞參考資訊(以GEMINI SPARK工具,找尋台灣開放資料集OPEN DATA)


臺灣「政府資料開放平台」(data.gov.tw)與各部會開放資料庫(如內政部 SEGIS、交通部 TDX、衛福部、財政部、環境部等)累積了涵蓋社會、經濟、交通、公衛與地理環境的巨量數據。

以下為GEMINI SPARK協助依OPEN DATA平台列舉 10 個具代表性、跨不同機器學習(Machine Learning)範式的實戰應用範例,完整涵蓋時間序列、監督式學習(迴歸/分類)、非監督式分群、異常檢測、圖神經網絡、關聯規則、推薦系統、生存分析與 NLP 語意分析

1. 「全台 PM2.5 與空污擴散預測」——時間序列與時空注意力機制

  • 臺灣開放資料源:環境部《空氣品質監測網》(AQI 歷史與即時監測資料)+ 氣象署《自動氣象站觀測資料》

  • 應用主題:預測未來 24~72 小時全台各測站 PM2.5 濃度變化,並發布區域季節性空污預警。

  • 特徵欄位(Features)

    • PM2.5, PM10, SO2, NO2, O3(空氣污染物濃度)

    • wind_speed, wind_direction(風速、風向向量)

    • temperature, relative_humidity(氣溫、相對濕度)

    • boundary_layer_height(混合層高度)

  • ML 演算法LSTM / Temporal Fusion Transformer (TFT) / Prophet

  • 深度科學對位剖析

    • 數學直覺:空氣品質具備強烈的「時空自相關(Spatio-Temporal Autocorrelation)」與「滯後效應(Lag Effect)」。Temporal Fusion Transformer 透過自注意力機制(Self-Attention)自動辨識主要驅動因子(例如境外污染傳輸 vs. 本地風速沉降),並針對氣象特徵進行動態門控(Gated Residual Network, GRN):


  • 業務與政策解讀:協助環保局提前調控大型工廠降載降排,並提供民眾與學校作為戶外活動規劃依據。

2. 「雙北中古屋與預售屋房價估價」——監督式迴歸與特徵可解釋性 (XAI)

  • 臺灣開放資料源:內政部《不動產買賣實價登錄開放資料》

  • 應用主題:建立自動化估價模型(Automated Valuation Model, AVM),精準預測房屋總價與單價,評估房市透明度。

  • 特徵欄位(Features)

    • building_age(屋齡)

    • total_area(建物移轉總面積)

    • floor_ratio(所在樓層 / 總樓層)

    • dist_to_mrt(距離最近捷運站距離)

    • has_elevator(有無電梯)

    • main_building_ratio(主建物占總面積比率)

  • ML 演算法XGBoost / LightGBM 迴歸 + SHAP (SHapley Additive exPlanations)

  • 深度科學對位剖析

    • 數學直覺:房價特徵間存在高度非線性交互作用(例如:在北市核心區「屋齡 40 年」影響較小,但在郊區影響極大)。利用 Shapley 值進行邊際貢獻分解, quantify 捷運溢價(Premium Effect)與屋齡衰減的非線性拐點:

  • 業務與政策解讀:銀行可用於房屋抵押貸款核貸風險評估,民眾可獲得客觀透明的購屋參考價格。

3. 「臺灣家庭消費結構與經濟階層分型」——非監督式分群與降維

  • 臺灣開放資料源:行政院主計總處《家庭收支調查》(Survey of Family Income and Expenditure)

  • 應用主題:剖析臺灣不同收入階層家庭在食品、住房、醫療、教育與休閒上的支出分配比例,進行生活型態分群。

  • 特徵欄位(Features)

    • disposable_income(可支配所得)

    • food_share(食品非酒精飲料支出占比 - 昂格爾係數)

    • housing_utilities_share(住宅服務與水電瓦斯占比)

    • medical_share(醫療保健支出占比)

    • education_leisure_share(教育與休閒文化占比)

  • ML 演算法:Z‑Score 標準化 → PCA → K‑Means++ / GMM

  • 深度科學對位剖析

    • 數學直覺:消費金額數量級差異大(所得數十萬 vs. 娛樂支出數千),需先以 Z-Score 標準化,再透過主成分分析(PCA)將高維消費維度降至 2~3 個正交軸(如「生存負擔指數」與「生活品質享受指數」),避免多重共線性並在保留最高變異數(Explained Variance)前提下進行 K-Means++ 中心點初始化。

  • 業務與政策解讀:幫助政府制定精準的補貼與稅制政策,並提供零售與金融業進行顧客分層(Customer Segmentation)精準行銷。

4. 「道路事故高風險熱點與危險行為檢測」——異常檢測

  • 臺灣開放資料源:內政部警政署 / 交通部《道路交通事故(A1與A2類)開放資料》

  • 應用主題:從全台數十萬筆交通事故紀錄中,識別出非典型事故模式與極端危險路口。

  • 特徵欄位(Features)

    • latitude, longitude(事故地點 WGS84 座標)

    • time_hour(事故發生時段)

    • weather_condition(天候狀態)

    • road_type(道路型態:交叉路口/單向道/彎道)

    • vehicle_types(涉案車輛種類組合)

    • casualty_count(傷亡人數)

  • ML 演算法孤立森林(Isolation Forest) / Local Outlier Factor (LOF)

  • 深度科學對位剖析

    • 數學直覺:Isolation Forest 利用隨機分割超平面孤立數據點。在特徵空間中,極端高風險事故或特殊工程瑕疵路口屬於少數且差異大的異常點,其在樹結構中的平均切割路徑長度 $h(x)$ 顯著較短:

      $$s(x, n) = 2^{-\frac{E(h(x))}{c(n)}}$$
  • 業務與政策解讀:交通局可針對高風險路口優化號誌時相與道路設計(如設置左轉專用道或路口縮小工程)。

5. 「YouBike 2.0 車站調度與跨站流動」——圖神經網絡 (GNN) 與空間網絡分析

  • 臺灣開放資料源:交通部 TDX 運輸資料流通服務《公共自行車 YouBike 即時與歷史借還車資料》

  • 應用主題:預測全台各 YouBike 站點未來 30 分鐘的「無車可借」與「無位可還」機率,優化車輛調度動線。

  • 特徵欄位(Features)

    • station_location(站點經緯度座標)

    • net_flow(淨借還車流量)

    • station_capacity(站點總柱數)

    • mrt_proximity(距離鄰近捷運站距離)

    • rain_flag(即時降雨標記)

  • ML 演算法時空圖卷積網絡(Spatio-Temporal Graph Convolutional Networks, ST-GCN)

  • 深度科學對位剖析

    • 數學直覺:站點之間的騎行軌跡形成有向加權圖 $G=(V, E, A)$,拉普拉斯矩陣 $L = D - A$ 刻畫了站點間的拓撲連通性。ST-GCN 在空間維度使用圖卷積提取站點間的轉乘網絡關係,在時間維度使用 1D 卷積捕捉流量趨勢:

  • 業務與政策解讀:調度團隊可進行精準車輛補給分配,降低熱點站點滿位或空站率。

6. 「慢性病共病路徑與健保用藥模式」——關聯規則挖掘 (Association Rule Mining)

  • 臺灣開放資料源:衛福部中央健康保險署《門診與住院醫療申報公開統計資料》

  • 應用主題:挖掘臺灣中高齡族群常見慢性病(如高血壓、高血脂、高血糖)之間的共病發展路徑與併發症組合。

  • 特徵欄位(Features)

    • age_group(年齡層)

    • icd10_codes(主要與次要國際疾病分類代碼組合)

    • drug_classes(處方藥物種類)

    • department(就醫科別)

  • ML 演算法FP-Growth 演算法(計算 Support, Confidence, Lift)。

  • 深度科學對位剖析

    • 數學直覺:FP-Growth 構建 FP-Tree 避免了頻繁項集產生過程中的大量候選集生成。透過提升度(Lift)判定兩種疾病同框出現若 Lift > 1 表示 正相關。

    • 科學意義:若 Lift > 1 表示 A與B  正相關。

    • $\text{Lift}(\text{糖尿病} \rightarrow \text{慢性腎臟病}) > 2$,代表糖尿病患者並發腎臟病的機率遠高於隨機期望值。

  • 業務與政策解讀:輔助國健署推動慢性病整合門診,提早介入高風險併發症患者的健康管理。

7. 「國旅景點與藝文展演智慧推薦」——混合式推薦系統

  • 臺灣開放資料源:文化部《全國藝文活動資訊開放服務》+ 觀光署《臺灣旅宿與觀光景點開放資料》

  • 應用主題:根據旅客的個人偏好、造訪歷史與當前季節地點,推薦個人化的國旅行程與展演活動。

  • 特徵欄位(Features)

    • user_interests(使用者偏好標籤:戶外自然、歷史古蹟、親子展覽)

    • spot_category(景點/展演分類)

    • ticket_price(門票價格)

    • stay_duration(預計停留時間)

    • spatial_distance(距離使用者當前位置距離)

  • ML 演算法混合式推薦系統(Hybrid Recommender System):基於內容過濾(Content-Based Filter) + 隱性矩陣分解(Matrix Factorization / SVD)。

  • 深度科學對位剖析

    • 數學直覺:將使用者偏好與景點特徵映射至低維隱含因子空間(Latent Factor Space),利用奇異值分解(SVD)近似預測未造訪景點的隱含喜好評分:

  • 業務與政策解讀:促進在地觀光與文化產業發展,紓解連假熱門景點人潮,引導旅客至潛力私房景點。

8. 「臺灣新創與中小企業存續壽命分析」——生存分析 (Survival Analysis)

  • 臺灣開放資料源:經濟部商業發展署《公司設立登記》與《公司解散/廢止登記開放資料》

  • 應用主題:評估不同產業、資本額與設立地區的中小企業在成立 1~5 年內的生存機率與歇業風險。

  • 特徵欄位(Features)

    • business_duration_months(企業存續月數 / 時間至事件)

    • is_dissolved(是否已解散廢止 / 右刪截標記 Censoring)

    • capital_amount(登記資本額)

    • industry_code(所營事業項目分類)

    • location_county(設立縣市)

    • director_share_ratio(董監事持股比例)

  • ML 演算法Cox 比例風險模型(Cox Proportional Hazards Model) / 隨機生存森林(Random Survival Forests)

  • 深度科學對位剖析

    • 數學直覺:商業登記資料中許多企業至今仍正常營運(右刪截數據 Right-Censored Data)。Cox 模型透過估算風險函數(Hazard Function),量化資本額與產業類別對風險比率(Hazard Ratio)的影響:

  • 業務與政策解讀:協助中小企業信用保證基金(信保基金)優化融資擔保審核機制,並指導青年創業輔導政策。

9. 「電商與消費爭議申訴自動分流」——NLP 自然語言處理與文本分類

  • 臺灣開放資料源:行政院消費者保護處《消費爭議申訴案件統計資料》

  • 應用主題:對消費者的文字申訴內容進行自動化語意分析,迅速判定爭議類別(如退換貨拒絕、個資洩露、廣告不實)與急迫性等級。

  • 特徵欄位(Features)

    • complaint_text(申訴事由摘要與經過文字)

    • dispute_amount(爭議金額)

    • industry_type(申訴對象產業分類)

  • ML 演算法Taiwanese-BERT / RoBERTa 繁體中文預訓練模型 + TF-IDF + Logistic Regression Baseline

  • 深度科學對位剖析

    • 數學直覺:繁體中文文本經由 BERT 雙向 Transformer 編碼器處理,透過多頭自注意力機制(Multi-Head Self-Attention)擷取上下文語意向量(Contextualized Embeddings),精準識別「退款遭拒」、「假冒賣家」等關鍵爭點詞彙:

  • 業務與政策解讀:消保官與地方政府可實現申訴案件的自動化優先級分流,提升消費爭議處理效率。

10. 「全台鄉鎮市區少子高齡化與地方創生潛力」——多變量空間降維與綜合評估

  • 臺灣開放資料源:內政部《SEGIS 社會經濟資料庫 / 鄉鎮市區社會經濟指標》

  • 應用主題:評估全台 368 個鄉鎮市區的人口結構、經濟活力與醫療資源,劃分「地方創生優先區」與「高發展潛力區」。

  • 特徵欄位(Features)

    • aging_index(老化指數)

    • birth_rate(粗出生率)

    • doctors_per_10k(每萬人醫師數)

    • tax_revenue_per_cap(人均地方稅收)

    • college_pop_ratio(大專以上人口比例)

    • net_migration_rate(人口淨遷入率)

  • ML 演算法PCA 主成分分析 + UMAP 非線性降維可視化 + Hierarchical Agglomerative Clustering (分層階層分群)

  • 深度科學對位剖析

    • 數學直覺:10+ 個社會經濟變數間存在高度多重共線性(Multicollinearity)。利用特徵值分解(Eigendecomposition)將協方差矩陣轉化為互相正交的主成分(PC1 代表「都市化與經濟強度」,PC2 代表「人口老齡化程度」),再結合 UMAP 在低維空間保持流形(Manifold)局部與全域結構。

  • 業務與政策解讀:國家發展委員會(國發會)可用於精準撥補地方創生預算,引導企業投資偏鄉。

💡 總結對照表(Summary Matrix)

序號臺灣開放資料源應用主題核心機器學習演算法機器學習範式 (ML Paradigm)
1環保部 AQI / 氣象署觀測全台 PM2.5 / AQI 空污預測Temporal Fusion Transformer (TFT)時空時間序列預測
2內政部實價登錄雙北中古屋/預售屋房價估價XGBoost / LightGBM + SHAP監督式迴歸與可解釋 AI
3主計總處家庭收支調查臺灣家庭消費結構與經濟階層分型PCA + K-Means++ / GMM非監督式降維與分群
4警政署/交通部 A1A2 事故道路事故高風險熱點與危險行為檢測Isolation Forest / LOF異常檢測 (Anomaly Detection)
5交通部 TDX YouBike 資料YouBike 2.0 車站即時調度與流量Spatio-Temporal GCN (ST-GCN)圖神經網絡 (GNN)
6健保署醫療申報統計慢性病共病路徑與健保用藥模式FP-Growth 演算法關聯規則挖掘
7文化部藝文 / 觀光署景點國旅景點與藝文展演智慧推薦Hybrid (SVD + Content-Based)推薦系統 (Recommender System)
8經濟部公司設立與解散登記新創與中小企業生存壽命分析Cox Proportional Hazards Model生存分析 (Survival Analysis)
9消保處消費爭議申訴統計消費爭議申訴文本自動分流Taiwanese-BERT / RoBERTa自然語言處理 (NLP) 分類
10內政部 SEGIS 鄉鎮市區指標鄉鎮市區少子高齡化與地方創生潛力PCA + UMAP + 分層階層分群多變量降維與分群