2026年8月10日 星期一

機器學習提示詞參考資訊(以GEMINI SPARK工具,找尋台灣開放資料集OPEN DATA)

臺灣「政府資料開放平台」(data.gov.tw)與各部會開放資料庫(如內政部 SEGIS、交通部 TDX、衛福部、財政部、環境部等)累積了涵蓋社會、經濟、交通、公衛與地理環境的巨量數據。

以下為GEMINI SPARK協助依OPEN DATA平台列舉 10 個具代表性、跨不同機器學習(Machine Learning)範式的實戰應用範例,完整涵蓋時間序列、監督式學習(迴歸/分類)、非監督式分群、異常檢測、圖神經網絡、關聯規則、推薦系統、生存分析與 NLP 語意分析

1. 「全台 PM2.5 與空污擴散預測」——時間序列與時空注意力機制

  • 臺灣開放資料源:環境部《空氣品質監測網》(AQI 歷史與即時監測資料)+ 氣象署《自動氣象站觀測資料》

  • 應用主題:預測未來 24~72 小時全台各測站 PM2.5 濃度變化,並發布區域季節性空污預警。

  • 特徵欄位(Features)

    • PM2.5, PM10, SO2, NO2, O3(空氣污染物濃度)

    • wind_speed, wind_direction(風速、風向向量)

    • temperature, relative_humidity(氣溫、相對濕度)

    • boundary_layer_height(混合層高度)

  • ML 演算法LSTM / Temporal Fusion Transformer (TFT) / Prophet

  • 深度科學對位剖析

    • 空氣質量預測不能僅依賴統計相關性,必須符合質量守恆定律(Mass Conservation Law)與流體力學對流擴散方程(Advection-Diffusion Equation

      • Deterministic Evaluation Oracle 驗證預測結果是否違背物理下限(濃度不能為負數 )。
      • Ground Truth 驗核法: 讀取真實測站之物理傳感器(Beta Attenuation Monitor)次日回傳之物理測量數據(),計算 MAE RMSE,而非僅以模型 Loss 調降作為成功指標。

  • 業務與政策解讀:協助環保局提前調控大型工廠降載降排,並提供民眾與學校作為戶外活動規劃依據。

  • https://data.moenv.gov.tw/dataset/detail/AQX_P_488

2. 「雙北中古屋與預售屋房價估價」——監督式迴歸與特徵可解釋性 (XAI)

  • 臺灣開放資料源:內政部《不動產買賣實價登錄開放資料》

  • 應用主題:建立自動化估價模型(Automated Valuation Model, AVM),精準預測房屋總價與單價,評估房市透明度。

  • 特徵欄位(Features)

    • building_age(屋齡)

    • total_area(建物移轉總面積)

    • floor_ratio(所在樓層 / 總樓層)

    • dist_to_mrt(距離最近捷運站距離)

    • has_elevator(有無電梯)

    • main_building_ratio(主建物占總面積比率)

  • ML 演算法XGBoost / LightGBM 迴歸 + SHAP (SHapley Additive exPlanations)

  • 深度科學對位剖析

    • 數學直覺:房價特徵間存在高度非線性交互作用(例如:在北市核心區「屋齡 40 年」影響較小,但在郊區影響極大)。利用 Shapley 值進行邊際貢獻分解, quantify 捷運溢價(Premium Effect)與屋齡衰減的非線性拐點:

    •  Shapley Value 可驗證邊界: 依據合作賽局理論,特徵貢獻度必須符合效率公理(Efficiency Axiom,即各特徵 Shapley 值之和必須嚴格等於模型預測值與基準值之差:
    • Ground Truth 驗核法: 比對土地登記簿謄本物理移轉紀錄與銀行實際鑑價結果(Appraisal Reports),驗證邊界條件(如屋齡不可為負,坪數必須與地政局登記資料 100% 吻合)。

    •  業務與政策解讀:銀行可用於房屋抵押貸款核貸風險評估,民眾可獲得客觀透明的購屋參考價格。

3. 「臺灣家庭消費結構與經濟階層分型」——非監督式分群與降維

  • 臺灣開放資料源:行政院主計總處《家庭收支調查》(Survey of Family Income and Expenditure)

  • 應用主題:剖析臺灣不同收入階層家庭在食品、住房、醫療、教育與休閒上的支出分配比例,進行生活型態分群。

  • 特徵欄位(Features)

    • disposable_income(可支配所得)

    • food_share(食品非酒精飲料支出占比 - 昂格爾係數)

    • housing_utilities_share(住宅服務與水電瓦斯占比)

    • medical_share(醫療保健支出占比)

    • education_leisure_share(教育與休閒文化占比)

  • ML 演算法:Z‑Score 標準化 → PCA → K‑Means++ / GMM

  • 深度科學對位剖析

    • 數學直覺:消費金額數量級差異大(所得數十萬 vs. 娛樂支出數千),需先以 Z-Score 標準化,再透過主成分分析(PCA)將高維消費維度降至 2~3 個正交軸(如「生存負擔指數」與「生活品質享受指數」),避免多重共線性並在保留最高變異數(Explained Variance)前提下進行 K-Means++ 中心點初始化。

    • PCA 之主成分向量必須為協方差矩陣之特徵向量,嚴格滿足特徵值分解方程式:

    • Ground Truth 驗核法: 分群邊界不得超越實體經濟可支配所得上限(物理凸包邊界 Constraints)。以中央銀行戶口統計與財政部綜所稅申報數據(Aggregated Tax Ground Truth)進行交叉交叉查核。

  • 業務與政策解讀:幫助政府制定精準的補貼與稅制政策,並提供零售與金融業進行顧客分層(Customer Segmentation)精準行銷。

4. 「道路事故高風險熱點與危險行為檢測」——異常檢測

  • 臺灣開放資料源:內政部警政署 / 交通部《道路交通事故(A1與A2類)開放資料》

  • https://tdx.transportdata.tw/

  • 應用主題:從全台數十萬筆交通事故紀錄中,識別出非典型事故模式與極端危險路口。

  • 特徵欄位(Features)

    • latitude, longitude(事故地點 WGS84 座標)

    • time_hour(事故發生時段)

    • weather_condition(天候狀態)

    • road_type(道路型態:交叉路口/單向道/彎道)

    • vehicle_types(涉案車輛種類組合)

    • casualty_count(傷亡人數)

  • ML 演算法孤立森林(Isolation Forest) / Local Outlier Factor (LOF)

  • 深度科學對位剖析

    • 數學直覺:Isolation Forest 利用隨機分割超平面孤立數據點。在特徵空間中,極端高風險事故或特殊工程瑕疵路口屬於少數且差異大的異常點,其在樹結構中的平均切割路徑長度 $h(x)$ 顯著較短:

      $$s(x, n) = 2^{-\frac{E(h(x))}{c(n)}}$$
    • Ground Truth 驗核法: 以警政署實體派案紀錄(A1 死亡 / A2 受傷筆錄)作為 Ground Truth,而非模型計算出的 Outlier Score。
  • 業務與政策解讀:交通局可針對高風險路口優化號誌時相與道路設計(如設置左轉專用道或路口縮小工程)。

5. 「YouBike 2.0 車站調度與跨站流動」——圖神經網絡 (GNN) 與空間網絡分析

  • 臺灣開放資料源:交通部 TDX 運輸資料流通服務《公共自行車 YouBike 即時與歷史借還車資料》

  • 應用主題:預測全台各 YouBike 站點未來 30 分鐘的「無車可借」與「無位可還」機率,優化車輛調度動線。

  • 特徵欄位(Features)

    • station_location(站點經緯度座標)

    • net_flow(淨借還車流量)

    • station_capacity(站點總柱數)

    • mrt_proximity(距離鄰近捷運站距離)

    • rain_flag(即時降雨標記)

  • ML 演算法時空圖卷積網絡(Spatio-Temporal Graph Convolutional Networks, ST-GCN)

  • 深度科學對位剖析

    • 數學直覺:站點之間的騎行軌跡形成有向加權圖 $G=(V, E, A)$,拉普拉斯矩陣 $L = D - A$ 刻畫了站點間的拓撲連通性。ST-GCN 在空間維度使用圖卷積提取站點間的轉乘網絡關係,在時間維度使用 1D 卷積捕捉流量趨勢:

  • 業務與政策解讀:調度團隊可進行精準車輛補給分配,降低熱點站點滿位或空站率。

6. 「慢性病共病路徑與健保用藥模式」——關聯規則挖掘 (Association Rule Mining)

  • 臺灣開放資料源:衛福部中央健康保險署《門診與住院醫療申報公開統計資料》

  • 應用主題:挖掘臺灣中高齡族群常見慢性病(如高血壓、高血脂、高血糖)之間的共病發展路徑與併發症組合。

  • 特徵欄位(Features)

    • age_group(年齡層)

    • icd10_codes(主要與次要國際疾病分類代碼組合)

    • drug_classes(處方藥物種類)

    • department(就醫科別)

  • ML 演算法FP-Growth 演算法(計算 Support, Confidence, Lift)。

  • 深度科學對位剖析

    • 數學直覺:FP-Growth 構建 FP-Tree 避免了頻繁項集產生過程中的大量候選集生成。透過提升度(Lift)判定兩種疾病同框出現若 Lift > 1 表示 正相關。

    • 科學意義:若 Lift > 1 表示 A與B  正相關。

    • $\text{Lift}(\text{糖尿病} \rightarrow \text{慢性腎臟病}) > 2$,代表糖尿病患者並發腎臟病的機率遠高於隨機期望值。

    • Ground Truth 驗核法: 對齊臨床醫學指引(Clinical Practice Guidelines)與 ICD-10 官方診斷標準,排除申報代碼錯置(Upcoding)之偽異常相關

  • 業務與政策解讀:輔助國健署推動慢性病整合門診,提早介入高風險併發症患者的健康管理。

7. 「國旅景點與藝文展演智慧推薦」——混合式推薦系統

  • 臺灣開放資料源:文化部《全國藝文活動資訊開放服務》+ 觀光署《臺灣旅宿與觀光景點開放資料》

  • 應用主題:根據旅客的個人偏好、造訪歷史與當前季節地點,推薦個人化的國旅行程與展演活動。

  • 特徵欄位(Features)

    • user_interests(使用者偏好標籤:戶外自然、歷史古蹟、親子展覽)

    • spot_category(景點/展演分類)

    • ticket_price(門票價格)

    • stay_duration(預計停留時間)

    • spatial_distance(距離使用者當前位置距離)

  • ML 演算法混合式推薦系統(Hybrid Recommender System):基於內容過濾(Content-Based Filter) + 隱性矩陣分解(Matrix Factorization / SVD)。

  • 深度科學對位剖析

    • 數學直覺:將使用者偏好與景點特徵映射至低維隱含因子空間(Latent Factor Space),利用奇異值分解(SVD)近似預測未造訪景點的隱含喜好評分:

    • Ground Truth 驗核法: 以景點實體門票刷卡數與電信信令(Cell Phone Location Data)驗證景點實際造訪率。
  • 業務與政策解讀:促進在地觀光與文化產業發展,紓解連假熱門景點人潮,引導旅客至潛力私房景點。

8. 「臺灣新創與中小企業存續壽命分析」——生存分析 (Survival Analysis)

  • 臺灣開放資料源:經濟部商業發展署《公司設立登記》與《公司解散/廢止登記開放資料》

  • 應用主題:評估不同產業、資本額與設立地區的中小企業在成立 1~5 年內的生存機率與歇業風險。

  • 特徵欄位(Features)

    • business_duration_months(企業存續月數 / 時間至事件)

    • is_dissolved(是否已解散廢止 / 右刪截標記 Censoring)

    • capital_amount(登記資本額)

    • industry_code(所營事業項目分類)

    • location_county(設立縣市)

    • director_share_ratio(董監事持股比例)

  • ML 演算法Cox 比例風險模型(Cox Proportional Hazards Model) / 隨機生存森林(Random Survival Forests)

  • 深度科學對位剖析

    • 數學直覺:商業登記資料中許多企業至今仍正常營運(右刪截數據 Right-Censored Data)。Cox 模型透過估算風險函數(Hazard Function),量化資本額與產業類別對風險比率(Hazard Ratio)的影響:

    • Ground Truth 驗核法: 必須嚴格處理右刪截數據(Right-Censored Data),不得將未解散企業直接剔除。
    • 以稅籍登記(營業中/停業/歇業)之公示狀態作為物理 SSoT 查核點。
  • 業務與政策解讀:協助中小企業信用保證基金(信保基金)優化融資擔保審核機制,並指導青年創業輔導政策。

9. 「電商與消費爭議申訴自動分流」——NLP 自然語言處理與文本分類

  • 臺灣開放資料源:行政院消費者保護處《消費爭議申訴案件統計資料》

  • 應用主題:對消費者的文字申訴內容進行自動化語意分析,迅速判定爭議類別(如退換貨拒絕、個資洩露、廣告不實)與急迫性等級。

  • 特徵欄位(Features)

    • complaint_text(申訴事由摘要與經過文字)

    • dispute_amount(爭議金額)

    • industry_type(申訴對象產業分類)

  • ML 演算法Taiwanese-BERT / RoBERTa 繁體中文預訓練模型 + TF-IDF + Logistic Regression Baseline

  • 深度科學對位剖析

    • 數學直覺:繁體中文文本經由 BERT 雙向 Transformer 編碼器處理,透過多頭自注意力機制(Multi-Head Self-Attention)擷取上下文語意向量(Contextualized Embeddings),精準識別「退款遭拒」、「假冒賣家」等關鍵爭點詞彙:

  • 業務與政策解讀:消保官與地方政府可實現申訴案件的自動化優先級分流,提升消費爭議處理效率。

10. 「全台鄉鎮市區少子高齡化與地方創生潛力」——多變量空間降維與綜合評估

  • 臺灣開放資料源:內政部《SEGIS 社會經濟資料庫 / 鄉鎮市區社會經濟指標》

  • 應用主題:評估全台 368 個鄉鎮市區的人口結構、經濟活力與醫療資源,劃分「地方創生優先區」與「高發展潛力區」。

  • 特徵欄位(Features)

    • aging_index(老化指數)

    • birth_rate(粗出生率)

    • doctors_per_10k(每萬人醫師數)

    • tax_revenue_per_cap(人均地方稅收)

    • college_pop_ratio(大專以上人口比例)

    • net_migration_rate(人口淨遷入率)

  • ML 演算法PCA 主成分分析 + UMAP 非線性降維可視化 + Hierarchical Agglomerative Clustering (分層階層分群)

  • 深度科學對位剖析

    • 數學直覺:10+ 個社會經濟變數間存在高度多重共線性(Multicollinearity)。利用特徵值分解(Eigendecomposition)將協方差矩陣轉化為互相正交的主成分(PC1 代表「都市化與經濟強度」,PC2 代表「人口老齡化程度」),再結合 UMAP 在低維空間保持流形(Manifold Preservation)局部與全域結構; 低維空間距離必須最大程度保持高維空間的模糊集合交叉熵(Fuzzy Set Cross Entropy)。

    • Ground Truth 驗核法: 結合國發會實際撥款補貼清冊與戶政司每季實質人口淨移入數據進行對齊驗證。
  • 業務與政策解讀:國家發展委員會(國發會)可用於精準撥補地方創生預算,引導企業投資偏鄉。

💡 總結對照表(Summary Matrix)

序號臺灣開放資料源應用主題核心機器學習演算法機器學習範式 (ML Paradigm)
1環保部 AQI / 氣象署觀測全台 PM2.5 / AQI 空污預測Temporal Fusion Transformer (TFT)時空時間序列預測
2內政部實價登錄雙北中古屋/預售屋房價估價XGBoost / LightGBM + SHAP監督式迴歸與可解釋 AI
3主計總處家庭收支調查臺灣家庭消費結構與經濟階層分型PCA + K-Means++ / GMM非監督式降維與分群
4警政署/交通部 A1A2 事故道路事故高風險熱點與危險行為檢測Isolation Forest / LOF異常檢測 (Anomaly Detection)
5交通部 TDX YouBike 資料YouBike 2.0 車站即時調度與流量Spatio-Temporal GCN (ST-GCN)圖神經網絡 (GNN)
6健保署醫療申報統計慢性病共病路徑與健保用藥模式FP-Growth 演算法關聯規則挖掘
7文化部藝文 / 觀光署景點國旅景點與藝文展演智慧推薦Hybrid (SVD + Content-Based)推薦系統 (Recommender System)
8經濟部公司設立與解散登記新創與中小企業生存壽命分析Cox Proportional Hazards Model生存分析 (Survival Analysis)
9消保處消費爭議申訴統計消費爭議申訴文本自動分流Taiwanese-BERT / RoBERTa自然語言處理 (NLP) 分類
10內政部 SEGIS 鄉鎮市區指標鄉鎮市區少子高齡化與地方創生潛力PCA + UMAP + 分層階層分群多變量降維與分群

2026年8月9日 星期日

機器學習提示詞參考資訊(以GEMINI SPARK工具)

機器學習參考Gemini Spark提示詞:日本總務省統計局(Statistics Bureau of Japan )公開資訊,找尋日常生活,可供機器學習的10個範例,供深度科學對位剖析解說

日本 e‑Stat 十大機器學習實戰範例

以下列出 10 個具備生活化場景、涵蓋不同機器學習(ML)範式的實戰範例。每個範例包含生活化主題、e‑Stat 官方調查名稱、特徵欄位、ML 任務與演算法、科學與數學直覺剖析(已去除 LaTeX 數學符號),以及業務與政策解讀。

1. 宇都宮 vs. 靜岡:餃子與拉麵的季節消費預測

  • e‑Stat 數據源:家計調査
  • 生活化主題:解析不同城市對特定食物(餃子、拉麵、鰻魚、冰淇淋)的月度消費金額變化與季節性特徵。
  • 特徵欄位:monthly_gyoza_exp、monthly_ramen_exp、avg_temp、household_size、holiday_count。
  • ML 任務與演算法:時間序列預測(Prophet / SARIMAX)+動態時間規整(DTW)分群。
  • 數學直覺說明:
    DTW 透過非線性拉伸時間軸,計算兩條時間序列形狀的最佳對齊距離。
  • 業務與生活解讀:零售商與連鎖餐飲可精準規劃區域供應鏈備貨週期,預測極端氣候對消費支出的衝擊。
  • 數學直覺:經典歐氏距離無法處理相位相移(例如:某城市的冰淇淋消費高峰因氣候延後一個月)。DTW 透過非線性拉伸時間軸(Warping Path),計算兩條時間序列形狀的最佳對齊距離:
      • 科學意義:利用 DTW 進行時間序列分群,可識別出「氣候驅動型消費城市」與「節慶/觀光驅動型消費城市」。
    • 業務與生活解讀:零售商與連鎖餐飲業可精準規劃區域供應鏈備貨週期,並預測極端氣候對消費支出的衝擊。

2. 日本「空家」問題:住宅廢棄風險評估

  • e‑Stat 數據源:住宅・土地統計調査
  • 生活化主題:評估城鄉各地住宅空置的風險因子,協助尋找便宜古民家改建或投資物件。
  • 特徵欄位:building_age、structure_type、dist_to_station、seismic_standard、owner_age。
  • ML 任務與演算法:二分位分類 / 風險迴歸(LightGBM / XGBoost)+SHAP 解釋。
  • 數學直覺說明:
    SHAP 值計算每個特徵對模型預測的邊際貢獻,類似博弈論中的 Shapley 值。
      ,計算每個特徵對邊際預測值的貢獻量:

      • 科學意義:解決樹狀模型(Tree Ensembles)黑盒問題,
      • quantify 究竟是「建物老舊」還是「遠離車站」才是造成空屋的主因。
  • 業務與生活解讀:地方政府可精準發放空屋修繕補助;投資者可快速篩選潛力物件。

3. 日本現代人的 24 小時:工作、育兒與休閒的 WLB 分型

  • e‑Stat 數據源:社会生活基本調査
  • 生活化主題:分析不同世代、性別與職業者的一日時間分配,評估 Work‑Life Balance。
  • 特徵欄位:sleep_hours、work_hours、housework_childcare、leisure_hobby、child_age_group。
  • ML 任務與演算法:非監督 Latent Class Analysis (LCA) 或 Random Forest 多標籤分類。
  • 數學直覺說明:將 24 小時(1440 分鐘)視為常數約束,透過混合模型找出時間分配的隱藏分群。
  • 業務與生活解讀:協助企業規劃彈性工時與居家辦公制度,為健身房與線上課程平台定位黃金行銷時段。

4. 全國物價地圖:便當與牛乳最便宜的地方

  • e‑Stat 數據源:小売物価統計調査
  • 生活化主題:比較日本各市町村日常必備品(鮮奶、便當、租金、電費)的價格指數,繪製生活成本壓力圖。
  • 特徵欄位:milk_price_1L、bento_price、rent_per_m2、electricity_basic_fee。
  • ML 任務與演算法:孤立森林異常檢測+DBSCAN 空間密度分群。
  • 數學直覺說明:孤立森林利用隨機分割平面孤立資料點,異常點在樹中所需的分割深度較短。Isolation Forest 利用隨機分割超平面孤立數據點。異常點(如離島或極端高物價區)在樹中所需的分割深度  顯著較短:

  • 業務與生活解讀:協助移居者評估實際生活負擔,零售業制定區域差異化定價策略。

5. 電車通勤地獄:首都圈流向分析

  • e‑Stat 數據源:国勢調査
  • 生活化主題:解析東京、關西等首都圈各市町村之間的日夜人口流動與通勤流量。
  • 特徵欄位:origin_pop、dest_jobs、spatial_distance、transit_fare。
  • ML 任務與演算法:重力模型或圖神經網路(GCN)。
  • 數學直覺說明:將市町村視為圖的節點,通勤流量為邊,GCN 透過鄰接矩陣進行特徵聚合。將市町村視為圖形網絡(Graph)的節點 ,通勤流量視為邊 GCN 透過鄰接矩陣  進行節點特徵的卷積聚合:

  • 業務與生活解讀:辨識「睡覺都市」與「核心業務區」,支援鐵道公司優化班次與廣告投放。

6. 斜槓與副業潮:誰想換工作或兼職?

  • e‑Stat 數據源:就業構造基本調査
  • 生活化主題:剖析影響日本上班族想轉職、增加副業或退職的核心因素。
  • 特徵欄位:annual_income、weekly_work_hours、employment_type、commute_time、has_side_job。
  • ML 任務與演算法:CatBoost 分類器+Permutation Feature Importance。
  • 數學直覺說明:CatBoost 採用有序目標編碼防止資料洩漏,提升類別特徵表現。
  • 業務與生活解讀:HR 可評估員工離職風險;平台可提升職缺推薦精準度。

7. 購物通路選擇行為:超市 vs. 超商 vs. 藥妝店

  • e‑Stat 數據源:全国消費実態調査
  • 生活化主題:分析日本家庭在不同購物通路間的購物籃組合。
  • 特徵欄位:channel_type、item_category、payment_method、discount_flag。
  • ML 任務與演算法:FP‑Growth 關聯規則挖掘。
  • 數學直覺說明:計算項目集之間的支持度、置信度與提升度(Lift),Lift > 1 表示正相關。計算項目集之間的支持度(Support)、置信度(Confidence)與提升度(Lift):
  • 科學意義:若 ,代表消費者在藥妝店購買醫藥品時,順便購買食品的行為並非隨機,而是顯著正相關。

  • 業務與生活解讀:解釋藥妝店超市化現象,指導店面陳列與交叉促銷。

8. 就業韌性:失業率波動分析

  • e‑Stat 數據源:労働力調査
  • 生活化主題:追蹤月度失業率、非正規就業比例與休業者人數,分析經濟衝擊下的復原力。
  • 特徵欄位:unemployment_rate、non_regular_ratio、active_job_openings_ratio、female_labor_participation。
  • ML 任務與演算法:貝氏結構性時間序列(BSTS)+STL 分解。
  • 數學直覺說明:將觀測值分解為趨勢、季節性與回歸項的線性組合。將時間序列觀測值  分解為趨勢(Trend )、季節性(Seasonal )與回歸項(Regression ):

  • 業務與生活解讀:評估政府就業補助政策的因果效應,協助產業預判勞動力短缺時點。

9. 理想移居小鎮推薦系統

  • e‑Stat 數據源:統計で見る市区町村の姿
  • 生活化主題:為尋求地方移住的家庭或遠距工作者推薦最佳居住地點。
  • 特徵欄位:pediatric_clinics_per_cap、park_area_per_cap、elementary_school_pupils、crime_rate_per_1k、local_tax_revenue。
  • ML 任務與演算法:k‑近鄰 + 餘弦相似度 + 使用者權重 Softmax 調整。
  • 數學直覺說明:將城市特徵映射至高維向量,根據使用者偏好計算加權餘弦相似度。將各市町村特徵標準化後映射至高維向量空間,根據使用者對各指標偏好權重向量 ,計算加權餘弦相似度:

  • 業務與生活解讀:可開發地方創生配對 APP,對接希望遠離大都市但需優質教育資源的家庭。

10. 巷弄咖啡廳與居酒屋生存期分析

  • e‑Stat 數據源:個人企業経済調査
  • 生活化主題:分析日本個人經營餐飲店、零售店、美容院等微型事業的存續年限與倒閉風險。
  • 特徵欄位:business_duration_years、is_closed、operating_cost_ratio、owner_age、has_successor。
  • ML 任務與演算法:Cox 比例風險模型或生存隨機森林。
  • 數學直覺說明:生存函數 S(t) 表示事業體存活超過時間 t 的機率,Cox 模型估算風險函數。生存函數  表示事業體存活超過時間  的機率。Cox 模型估算風險函數(Hazard Function):

  • 業務與生活解讀:協助創業者進行財務評估,金融機構可建立微型貸款風險審核模型。

總結對照表

序號e‑Stat 調查生活化場景核心演算法ML 範式
1家計調査城市食物消費預測Prophet / DTW時間序列 & 非監督分群
2住宅・土地統計調査空屋風險評估LightGBM + SHAP監督式分類/迴歸
3社会生活基本調査24 小時生活分型LCA / GMM非監督機率模型
4小売物価統計調査全國物價地圖Isolation Forest + DBSCAN異常檢測 & 密度分群
5国勢調査首都圈通勤流向GCN圖學習 / 空間交互
6就業構造基本調査斜槓與副業分析CatBoost監督式分類
7全国消費実態調査購物通路選擇行為FP‑Growth關聯規則學習
8労働力調査失業率韌性分析BSTS時間序列分解/因果推論
9統計で見る市区町村の姿理想移居小鎮推薦k‑NN + 餘弦相似度推薦系統 / 向量檢索
10個人企業経済調査微型店鋪生存期評估Cox Model生存分析

其它參考資訊:

2026年8月8日 星期六

Bayes貝氐定理

 Bayes 貝氏定理記錄

1️⃣ 觀察(Observation)

變數含義數值
D    罹患該疾病(Disease)
¬D    未罹患該疾病(Not Disease)         
+    篩檢結果陽性
P(D)    先驗機率(疾病盛行率)0.01 (1 %),基本盤(根據歷史經驗的原始信心)
P(¬D)    未罹患的先驗機率0.99
P(+|D)    靈敏度(真陽性率)0.99
P(+|¬D)    偽陽性率0.05

說明:互斥與完備性只在同一條件下成立,  在固定條件下,
事件的所有可能結果必須滿足完備性(加總為 1)。
例如:
  • 在條件 D 下:
  P(+|D) + P(-|D) = 1  (陽性或陰性必有其一)

  • 在條件 ¬D 下:
  P(+|¬D) + P(-|¬D) = 1
  但 P(+|D) 與 P(+|¬D) 分別屬於不同的條件,不構成互斥且完備的事件集合,因此它們不必相加等於 1。

貝氏公式(Bayes’ Theorem)

 P(D|+) = (P(+|D) * P(D)) / (P(+|D) * P(D) + P(+|¬D) * P(¬D)) 
 P(+|D) * P(D) = 0.99 × 0.01 = 0.0099 
 0.0099 + 0.05 × 0.99 = 0.0594 
 P(D|+) = 0.0099 / 0.0594 ≈ 0.1667 (16.67 %) 
└─正向定錨
    ├─貝氏公式
    │   ├─分子 = 0.99×0.01 = 0.0099
    │   └─分母 = 0.0099 + 0.05×0.99 = 0.0594
    ├─計算結果 = 0.0099 / 0.0594 ≈ 0.1667
    └─罹病機率 ≈ 16.7%(正確答案)

Bayes (A / B 形式表示方式)

1️⃣ 原始貝氏公式

P(D|+) = (P(+|D) * P(D)) / (P(+|D) * P(D) + P(+|¬D) * P(¬D))

2️⃣ Math De‑Tox數學去毒(零 LaTeX/數學符號排版):映射至 P(A|B) 形式

P(A|B) = P(B|A) * P(A) / P(B)

  • A ↔ D(罹患疾病)
  • B ↔ +(篩檢結果陽性

P(D|+) = P(+|D) * P(D) / P(+)
P(+) = P(+|D) * P(D) + P(+|¬D) * P(¬D)

後驗機率(Posterior)=概似度(Likelihood)*先驗機率(Prior) / 邊際機率(Evidence即證據B發生總機率)

3️⃣ 以 甲、乙、丙、丁 對應記號表示

記號  原始意義
甲        
乙  
 P(+|D) (靈敏度)
P(D) (先驗機率)
P(+|¬D) (偽陽性率)
P(¬D) (未罹患的先驗 = 1‑P(D))
P(D|+) = (甲 * 乙) / (甲 * 乙 + 丙 * 丁)

4️⃣ 數值代入示例

甲 = 0.99   (靈敏度)
乙 = 0.01   (疾病盛行率)
丙 = 0.05   (偽陽性率)
丁 = 0.99   (1‑B)

P(D|+) = (0.99 * 0.01) / (0.99 * 0.01 + 0.05 * 0.99)
        = 0.0099 / 0.0594 ≈ 0.1667 (16.7%)


貝氏公式的推導與全機率展開:   

Step 1 – 條件機率定義          P(A|B) = P(A∧B) / P(B)

Step 2 – 從 P(B|A) 逆推聯合機率
P(B|A) = P(A∧B) / P(A)      ⇒  P(A∧B) = P(B|A)·P(A)
P(B|A) = P(A and B) / P(A)  ⇒  P(A and B) = P(B|A) * P(A)

Step 3 – 代入 Step 1 的分子     P(A|B) = (P(B|A) * P(A)) / P(B)

Step 4 – 全機率展開分母         P(B) = P(B|A) * P(A) + P(B|not A) * P(not A)

全機率定理(Law of Total Probability)展開分母: 分母 P(+) 包含所有可能出現陽性的情況。

在實務中,陽性僅來自兩個互斥且覆蓋樣本空間的來源:

  • 真病患的陽性(真陽性)
    P(D and +) = P(+ given D) * P(D)
  • 健康者的陽性(偽陽性
    P(not D and +) = P(+ given not D) * P(not D)

因此根據全機率定理:

P(+) = P(D and +) + P(not D and +)
     = P(+ given D) * P(D) + P(+ given not D) * P(not D)

提醒:大腦最常漏掉右半部 P(+ given not D) * P(not D)。

若疾病盛行率 P(D) 很低,即使偽陽性率小,健康人口的龐大基數,仍會使此項顯著放大。

最終公式 P(A|B) = (P(B|A) * P(A)) / (P(B|A) * P(A) + P(B|not A) * P(not A))

其它機器學習參考資訊:VGG16 Arachitectural & Layer Types

Gemini Spark 在IPHONE上設定 天氣概況產出結果至GOOGLE行事曆

情境:為了測試在IPHONE手機上,可否正常執行Gemini SPARK,可於該對話窗格中,下達PROMPT定時☃️🌞天氣概況查詢,如下: 請協助每天至中央氣象署 查詢南部地區 天氣概況 ,自動每天上午05:00 主動將查詢結果 發送到我的GOOGLE 行事曆上。

💜執行處理結果:

已更新您的每日排程設定!

更新後的排程詳情:

 名稱:新增南部每日天氣至Google行事曆

 時間:每天上午約 05:00

 執行內容:

1. 自動查詢當天中央氣象署的南部地區天氣預報與概況(包含氣溫、降雨機率、天氣狀況與穿著建議)。

2. 自動在您的 Google 行事曆新增當天行程(標題:「今日南部天氣概況」),並將詳細氣象報告填入行程描述中。

3. 同時在對話介面中發送確認播報。


💜執行狀態審查確認指令:

在同樣GEMINI SPARK對話窗格中,下達PROMTP(如下藍色部分):

請幫我確認目前自動捉取排程位於何處? 請以科學對位方式,詳細解說明何設與更正。

目前排程運行位置與狀態

您的自動天氣排程目前登記於 Gemini 個人助理排程管理服務(Schedules Service) 中,由系統後端時鐘發送器持續監控與觸發。

 排程識別碼 (Schedule ID):⁠957d8e1f-af5c-40b8-b0ab-4374554cad92⁠

 目前狀態:啟用中 (⁠STATUS_ACTIVE⁠)

科學對位與架構解說 (Scientific Alignment)

排程系統運作採用三元對位架構(觸發時序 (Trigger event)  執行邏輯 (Logic unit) 輸出端點(Output endpoint)):

1.觸發時序對位: Cron:0 5 * * * (時區: Asia / Kaohsiung)

2.執行邏輯對位:檢索中央氣象署(CWA)最新資料;結構化分析(氣溫、雨率、穿著建議)

3.輸出端點對位:Google行事曆API(主日曆primary);Gemini Chat對話框

💢注意事項:筆者IPHONE中,已裝有GOOGLE 行事曆,且與SPARK對話窗權限登入,同屬一個帳號測試,如果沒有安裝Google Calendar或 登入帳號各自獨立不同,或許無法正常執行。

💢更多參考應用:以 Gemini Spark 作為「大腦與決策核心」(如:主動分析 Gmail 郵件、行事曆與 Google Tasks,語意判斷行程重疊與優先順序,自動排定最佳每日時間區塊(Time-blocking)),iOS 捷徑 僅作為「腳與執行工具(執行硬體控制與系統 API)」,iPHONE手機真正發揮常駐型 AI Agent 的語意理解、主動排程與跨平台整合實力,請列舉生活常用十個功能STEP BY STEP詳細(Feynman手法)解說。

💢我想要搭車自{{出發點}},至{{目的地}},請協助找尋近半年GOOGLE相關交通工具搭車平均時間,找出最適合的轉乘交通工具,請具體以科學對位方式列出各種客觀數據,並詳細專業陳述最理想之交通工具動線評估各動線詳細指南,請先要求使用者輸入地點

💢我要去{{目的地),請以目前GOOGLE導航定位點為出發起點(各方案均需以GOOGLE MAP詳列出來),要搭大眾交通工具、請提供搭乘方式,估算路徑與預計各方案耗費時間及預估費用,請先輸入您要到的{{目的地}}

相關參考:

AI(Gemini、ChatGPT)試作,生成一位老師,輔助ShortCuts捷徑 操作教學設定

2026年8月4日 星期二

用AI輔助學習台語(含日語版)

情境:Gemini查詢台語發音時,外加 繁體中文翻譯 + AI互動模式後,GEMINI自行跳出台語教學提示詞;而如果是日文與台語同時學習者,可以切換成日文版之提示詞。

💜中文版台語學習之PROMPT提示詞:

Google Gemini 對話設定指令(複製下方文字貼給 AI)

「請你扮演一位耐心、親切的台學語老師。接下來我們用台語對話(如果與古詞有關連的台語,請再以備註方式進行補充強化教學,如:古詞源流與深意:


這個詞保留了相當古老的漢語及閩南語社會結構稱謂。在傳統農業社會中,家族倫理至關重要,「序大」相對的詞是「序細」(sī-sè,指晚輩、小孩)。),

請你的每一句回覆都包含兩個部分:

1. 白話字或漢字台語(附上台羅拼音),

2. 對應的中文翻譯。如果我的台語講得不標準或有錯,請溫和地糾正我並教我正確的說法。

我們現在就開始吧!」  ,請先由 序大人 開始 (我想要用臺語,教長輩們 人工智慧(AI)。 ->Guá siūnn-kue beh iōng Tâi-gí kà sī-tuā-lâng AI」


🏯日文版台語學習之PROMPT提示詞:

「あなたは忍耐強く、親切な台湾語の先生役を務めてください。これから台湾語で会話をしましょう(もし古語や由来に関係する台湾語があれば、以下のように『古語の由来と深い意味』として補足・強化教育を行ってください。例:この言葉は相当古い漢語や閩南語の社会構造の呼び方を残しています。伝統的な農耕社会では家族倫理が極めて重要であり、『序大』の対義語は『序細』(sī-sè、目下の人、子供)です)。


あなたの返信はすべて、以下の2つの部分を含めてください:

1. 白話字または漢字の台湾語(台羅ローマ字付き)

2. 対応する繁体字中国語および日本語の翻訳

もし私の台湾語の発音が不正確だったり間違っていたりする場合は、優しく訂正し、正しい言い方を教えてください。


それでは、始めましょう!」


今回の最初の話題:「序大(目上の人、長輩)」に対して、台湾語で長輩たちに人工知能(AI)を教えたいです。(「Guá siūnn-kue beh iōng Tâi-gí kà sī-tuā-lâng AI」)



相關資源:

臺灣主權AI訓練語料庫


2026年8月1日 星期六

本地端MARKDOWN檔,轉換成HTML 或 PDF檔工具

情境: 因筆者使用Google Antigravity CLI 產出大部分是以文字狀態格式,但有時候ASCII文字產出內容,文字可讀性不佳(如有表格會有偏移情形),故可安裝本地端PANDOC、Weasyprint套件(含相依Mingw64 / GTK 執行環境 軟件),安裝本地端處理MARKDOWN格式軟體,轉換成可讀性較高之PDF格式,以下為作業系統、PYTHON呼叫及相依函式庫如 Pango、Cairo、GDK Pixbuf 的載入狀態 關係梳理:

Windows 上 Python、WeasyPrint(CSS 轉 PDF 引擎)與 Mingw64/GTK 的相依套件關係

1. Windows OS 與 DLL 載入機制

  • Windows Loader 會依序在 程式所在目錄 → 系統目錄 → PATH 搜尋 .dll
  • 若相依的 DLL 不在這些路徑,會出現 FileNotFoundError 0x7e

2. Python 與 CFFI(橋接層)

  • WeasyPrint 以 Python 為外層,但核心排版功能依賴 Pango、Cairo、GObject
  • CFFI 在 import weasyprint 時會呼叫 LoadLibrary 去載入 libpango-1.0-0.dlllibgobject-2.0-0.dll 等。
  • Python 3.8+ 加強了 DLL 搜尋安全,導致只能在標準路徑找到外部 DLL。

3. Mingw64 / GTK 執行環境

  • 需要透過 MSYS2 安裝 mingw-w64-x86_64-* 套件,產生 Windows 版的 .dll
  • 依賴樹狀結構 (需系統底層 C 庫(Cairo, Pango, GDK-PixBuf)):
    • WeasyPrint → libpango-1.0-0.dll
    • libpango → libgobject-2.0-0.dll、libcairo-2.dll
    • cairo → libpng、libjpeg、fontconfig、harfbuzz 等。
  • 因此必須把 C:\msys64\mingw64\bin 加入 PATH,一次性解決所有子依賴。

4. 常見錯誤對照表

錯誤訊息 根本原因 解決方案
cannot load library libgobject-2.0-0 缺少 glib2 套件或未在 PATH pacman -S mingw-w64-x86_64-glib2 並加入 PATH
cannot load library libpango-1.0-0 缺少 pango 套件 pacman -S mingw-w64-x86_64-pango
ImportError: cannot import name 'cairo' 缺少 cairo 套件 pacman -S mingw-w64-x86_64-cairo

5. 測試步驟

  1. 檢查 DLL

    where libgobject-2.0-0.dll
    where libpango-1.0-0.dll
  2. 顯示 WeasyPrint 系統資訊

    weasyprint --info
  3. HTML→PDF 測試

    weasyprint "data:text/html,<h1>Hello</h1>" test.pdf
  4. Python 測試

    from weasyprint import HTML
    HTML(string="<h1>Hello</h1>").write_pdf("test2.pdf")
    print("PDF 轉檔成功!")
  5.  Pandoc 測試  (安裝 winget install JohnMacFarlane.Pandoc)

            pandoc --version

   pandoc "C:\MARKDOWN_2_PDF.md"  

                -f markdown -t html  

               -o "C:\MARKDOWN_2_PDF.html"

相關KEYWORD資訊:

MSYS2,

將易偏移的 ASCII 藝術圖,系統能透過 結構分析 與  GfmTableFormatter 模組,自動將其轉化為符合 GitHub Flavored Markdown (GFM),增加文件可讀性