引言:機器學習唔淨止係演算法

喺香港呢個金融同科技交匯嘅城市,愈來愈多企業開始採用機器學習(Machine Learning)去優化營運、預測市場趨勢,甚至提升客戶體驗。好多初學者以為只要揀一個強大嘅演算法,例如深度學習(Deep Learning),就可以得到理想嘅預測結果。但現實係,模型嘅性能往往唔單止取決於演算法本身,更關鍵嘅係你點樣將人工專門知識(Domain Knowledge / Human Expertise)融入成個機器學習流程。

所謂「人工專門知識」,指嘅係人類對特定領域嘅深入理解,例如金融風險管理、醫療診斷、零售需求預測等。呢種知識可以係行業慣例、物理定律、業務規則,甚至係專家嘅直覺。本文會深入探討呢種知識點樣影響機器學習嘅性能,並提供具體例子同實用建議,幫助香港嘅數據從業員提升模型表現。

1. 特徵工程:將領域知識轉化為預測力

特徵工程(Feature Engineering)係機器學習中最直接受人工專門知識影響嘅環節。演算法只能夠處理你提供嘅特徵,如果你提供嘅特徵缺乏代表性,就算用最先進嘅模型都難以發揮。

1.1 建立有意義嘅特徵

以香港房地產估價為例,如果你淨係用樓齡、面積同地區作為特徵,模型可能只學到粗略嘅關係。但一位熟悉香港樓市嘅專家會知道,樓層高低景觀(海景或山景)會所設施交通便利度(例如距離地鐵站步行時間) 等先至係影響樓價嘅關鍵因素。透過加入呢啲由領域知識衍生嘅特徵,模型嘅預測準確度可以大幅提升。

1.2 處理非線性關係

領域知識仲可以幫助你建立組合特徵(Interaction Features)。例如,喺零售業,天氣同季節對銷售額嘅影響並非獨立,而係互相作用。一位熟悉零售營運嘅專家會知道,炎熱天氣會增加雪糕銷售,但同時會減少火鍋食材嘅需求。你可以將「溫度」同「季節」組合成一個新特徵,例如「炎熱夏季指數」,令模型更容易捕捉呢種複雜關係。

1.3 減少雜訊同異常值

人工專門知識亦可以幫助你識別同處理異常值(Outliers)。例如,喺信用卡欺詐檢測中,一筆巨額交易可能係正常嘅商業採購,亦可能係欺詐行為。如果冇領域知識,你可能會將呢啲交易視為雜訊而刪除,但實際上佢哋可能係重要嘅欺詐信號。專家可以根據交易背景、商戶類型等資訊,決定應該保留、轉換定係標記呢啲數據。

2. 數據標註:確保訓練數據嘅質量

監督式學習(Supervised Learning)依賴高質量嘅標註數據。人工專門知識喺呢度扮演兩個角色:第一,定義正確嘅標籤;第二,確保標註一致。

2.1 定義標籤嘅語義

以醫療影像分析為例,一張X光片究竟有冇肺炎,需要放射科醫生根據專業判斷嚟標註。如果由普通人嚟標註,可能只會睇到「有陰影」或者「冇陰影」,但醫生會知道陰影嘅形狀、位置、密度等特徵先至決定係咪肺炎。因此,人工專門知識直接影響標籤嘅準確性,進而影響模型學習到嘅決策邊界。

2.2 處理標註不一致

即使係專業人士,標註時都可能出現分歧。例如,兩個律師對同一份合約有冇違約條款可能有不同意見。人工專門知識可以幫助你制定清晰嘅標註指引(Annotation Guidelines),甚至設計多輪標註流程(例如Delphi Method),以減少主觀偏差。喺香港嘅金融科技公司,合規部門嘅專家往往會參與訓練數據嘅審核,確保模型學到嘅規則符合監管要求。

3. 模型選擇同演算法調參

人工專門知識唔單止影響數據,仲會影響你揀邊種模型,以及點樣調整超參數(Hyperparameters)。

3.1 根據問題特性揀模型

熟悉領域嘅專家會知道問題係屬於線性定係非線性、數據係咪稀疏、有冇時間依賴性等。例如,喺時間序列預測(例如股票價格)中,RNN(循環神經網絡)或者Transformer可能比傳統線性回歸更合適,但同時都需要更多數據同計算資源。一位有經驗嘅量化分析師會知道,對於短期波動,可能用GARCH模型(Generalized Autoregressive Conditional Heteroskedasticity)更有效,因為佢捕捉到波動率聚集嘅特性。

3.2 利用先驗知識設定超參數

深度學習模型有大量超參數,例如學習率、正則化係數、網絡層數等。冇領域知識嘅話,你可能要用隨機搜索或者貝葉斯優化(Bayesian Optimization)去慢慢試,但呢啲方法耗時且成本高。相反,如果你知道數據嘅規模同複雜度,就可以根據經驗設定合理嘅初始值。例如,喺自然語言處理(NLP)任務中,如果文本係香港粵語口語,你可能需要調整詞嵌入(Word Embedding)嘅維度,或者加入粵語特定嘅停用詞(Stopwords)。

4. 模型解釋性與可信度

喺香港,好多行業(例如銀行、保險、醫療)都受到嚴格監管,模型嘅決策必須有解釋性(Explainability)。人工專門知識可以幫助你理解模型嘅輸出,並驗證佢係咪符合邏輯。

4.1 驗證特徵重要性

當你用SHAP(SHapley Additive exPlanations)或者LIME(Local Interpretable Model-agnostic Explanations)分析特徵重要性時,領域專家可以判斷結果係咪合理。例如,一個貸款審批模型顯示「申請人嘅寵物數量」係重要特徵,呢個明顯違反常識,可能代表數據有偏差或者模型過度擬合。專家可以及早發現呢啲問題,避免部署有缺陷嘅模型。

4.2 建立規則混合模型

有時,人工專門知識可以直接嵌入模型結構。例如,喺醫療診斷中,你可以先根據專家制定嘅臨床規則(例如「如果體溫高於38度且白血球計數高,則懷疑感染」)篩選病例,再將符合條件嘅數據送入機器學習模型做細分。呢種「規則+模型」嘅混合方法,可以結合人類嘅直覺同機器嘅統計能力,提升整體性能同可信度。

5. 數據預處理同取樣策略

人工專門知識仲影響你點樣處理缺失值、類別不平衡(Class Imbalance)等問題。

5.1 缺失值填補

喺客戶流失預測中,如果某個客戶冇填寫職業,你可以根據佢嘅消費模式同年齡估計,但呢個估計需要領域知識。例如,喺香港,月薪超過某個水平嘅客戶可能更傾向使用高端信用卡,如果你知道呢個規律,就可以用更合理嘅方式填補缺失值,避免引入偏差。

5.2 類別不平衡處理

罕見事件(例如欺詐交易、罕見疾病)嘅數據往往好少。人工專門知識可以幫助你決定應該用過採樣(Oversampling)、欠採樣(Undersampling)定係合成數據(例如SMOTE)。專家會知道,對於欺詐檢測,簡單嘅過採樣可能令模型過度擬合,因為合成樣本可能唔符合真實欺詐嘅模式。相反,你可以利用領域知識設計更真實嘅合成數據,例如模擬欺詐者嘅行為模式。

6. 評估指標嘅選擇

模型性能嘅衡量方式亦需要人工專門知識。準確率(Accuracy)唔一定係最好嘅指標,特別係喺類別不平衡嘅情況下。

6.1 精確率同召回率嘅取捨

喺癌症篩查中,漏診(False Negative)嘅代價遠高於誤診(False Positive),所以應該側重召回率(Recall)。相反,喺垃圾郵件過濾中,誤將正常郵件分類為垃圾郵件(False Positive)可能令用戶錯過重要訊息,所以應該側重精確率(Precision)。領域專家可以根據業務成本設定合適嘅閾值(Threshold),甚至設計自訂損失函數(Custom Loss Function)。

6.2 多目標優化

好多實際問題需要同時優化多個指標,例如客戶忠誠度計劃要同時提高留存率同利潤。人工專門知識可以幫助你定義一個綜合評分(例如利潤期望值),並將佢作為模型嘅目標,而唔係單純追求分類準確度。

7. 持續學習同模型更新

機器學習模型唔係一次性嘅,需要定期更新。人工專門知識可以幫助你判斷幾時應該重新訓練模型,以及點樣適應環境變化。

7.1 概念漂移(Concept Drift)

以香港零售業為例,疫情期間網購需求急升,但疫情過後可能回落。如果模型冇意識到呢個變化,預測就會失準。領域專家可以監測關鍵指標(例如平均訂單價值、轉換率),並設定觸發重新訓練嘅條件。

7.2 反饋循環

人工專門知識仲可以幫助你設計反饋機制。例如,當模型預測錯誤時,專家可以分析錯誤原因,並將呢啲案例加入訓練集,或者調整特徵。呢種「人機協作」嘅方式,可以持續提升模型性能。

8. 香港嘅實際應用場景

喺香港,人工專門知識尤其重要,因為本地市場有獨特嘅文化同商業環境。

8.1 金融科技

香港作為國際金融中心,銀行同保險公司大量使用機器學習做信用評分、反洗錢(AML)同欺詐檢測。呢啲領域嘅專家必須熟悉《銀行業條例》同金管局嘅指引,先至可以確保模型符合合規要求。例如,模型唔可以因為客戶嘅種族或性別而作出歧視性決定,呢啲都需要人工知識去審查。

8.2 物流同供應鏈

香港係全球最繁忙嘅港口之一,物流公司利用機器學習預測貨運量、優化路線。熟悉本地交通模式同天氣情況嘅專家,可以加入「颱風季節影響」等特徵,提升預測準確度。

8.3 醫療保健

香港醫院管理局(HA)同私營醫療機構開始應用AI輔助診斷。呢度嘅人工專門知識不僅包括醫學知識,仲要考慮本地人口嘅健康數據(例如高血壓患病率),先至可以訓練出適合香港人嘅模型。

結論:人工智能同人類智慧嘅結合

人工專門知識係機器學習項目成功嘅關鍵因素之一。佢影響數據質量、特徵設計、模型選擇、評估指標以至持續優化嘅每一個環節。冇咗領域知識,即使有海量數據同強大算力,模型都可能學到錯誤嘅模式,或者無法喺實際應用中發揮作用。

對於香港嘅數據科學家同企業嚟講,建立一支包含數據科學家、領域專家同業務持份者嘅跨學科團隊,係提升模型性能嘅最佳策略。記住,機器學習唔係取代人類智慧,而係將人類智慧嘅結晶(即人工專門知識)轉化為可擴展嘅預測能力。

如果你正準備開展一個機器學習項目,不妨先問自己:我哋有冇充分運用團隊中嘅領域知識?如果答案係「未」,咁就係時候改變策略喇。


本文僅供一般參考,具體應用請諮詢專業人士。