應用商業智慧技術於信用卡
違約風險之預測
國立政治大學統計研究所
李俊毅 林孟寬
*
*
報告大綱
緒論
研究方法
研究結果
結論與建議
*
*
緒論
研究動機:
嚴重的卡奴問題
多仰賴國外顧問公司發展的模型
研究目的:
建構出一套完全符合自身銀行客戶特性的信用卡評分模型流程
*
*
緒論
研究問題與範圍:
資料來源
某銀行2000年1月1日~2002年6月30日的資料
資料內容
申請資料檔、繳款紀錄檔。
總共有1,220個變數,502,333筆原始資料
*
*
研究方法:CRISP-DM
DATA MINING
執行階段
商業理解
資料理解
資料準備
建模
評估
發佈
資料源
DATA MINING
處理流程
*
*
商業理解(BusinessUnderstanding)
建構「審核客戶期」的信用卡評分模型
信用卡評分模型=分類模型
*
*
資料理解(Data Understanding)
違約戶定義
繳款期間曾經有逾期60天(M2)以上未繳之卡戶
目前違約率高低?
原始資料中違約率約%
*
*
建模流程圖
選擇~
原始資料~
清除遺漏值、異常值
資料轉換
Over-Sampling
訓練組
測試組
建模
評估
評估
*
*
資料準備(Data Preparation)
選擇合理的建模變數
基本資料
性別、教育程度、職業別…
與銀行往來的資料
是否申請結餘代償、有沒有使用扣款服務…
金融聯合徵信中心(JCIC)的資料
被查詢總家數、延遲月數比率…
*
*
資料準備(Data Preparation)
選擇合理的建模時間
時間間隔取為12個月至18個月(THOMAS,1992)
01年4月1號開始,01年6月30號結束
模型的預測長度為一年,資料剩餘29,645筆
清除遺漏值、異常值
刪除遺漏值的資料
刪除工作年資的異常值
資料清理後,資料剩餘29,503筆
資料準備(Data Preparation)
資料轉換
連續型轉成離散型:被查詢總家數…
合併變項太多之變數:職業別…
透過簡單圖形描述與分析後,與違約無顯著關聯的變數不予考慮:婚姻別…
*
*
*
*
類型
變數名稱
資料類型
個人資料
教育別
類別型(2類)
性別
旗標型
行業別
類別型(3類)
職稱別
類別型(3類)
工作年資
類別型(5類)
緊急聯絡人與正卡關係
類別型(4類)
與銀行往來紀錄
是否申請結餘代償
旗標型
是否使用扣款帳號
旗標型
金融聯合徵信中心
延遲月數比率
連續型
循還月數比率
連續型
近一年M2次數
類別型
近期是否逾期
旗標型
負債所得比
連續型
有效卡張數
類別型(3類)
被查詢總家數
類別型(4類)
*
*
建模(Modeling)
精細抽樣(Over-Sampling)
稀有資料比例調整到15%~35% (Berry&Linoff,2000)
正常戶抽取率10%,違約戶抽取率100%
調整後,違約戶:正常戶=1:3,樣本剩餘3,743筆
將資料分成訓練組與測試組
避免過度學習(Over-fitting)
將資料隨機分成70%訓練組(2,621)與30%測試組(1,122)
建模方法選擇
羅吉斯迴歸、決策樹、類神經網路
*
*
評估模型(Evaluation)
增益圖(lift chart)
*
*
結論與建議
本研究以羅吉斯迴歸模型為最終模型。
(一)基本資料:
「教育別」:大專以上違約機率低於國高中以下。
「性別」:女性違約機率低於男性。
「行業別」:違約機率高低,依序為高、中、低違約風險群。
「職稱別」:違約機率高低,依序為高、中、低違約風險群。
「工作年資」:工作年資越久,違約機率越低。
「緊急聯絡人與正卡關係」:關係為配偶或父母兄弟姐妹的違約機率較低,關係為子女或配偶父母的違約機率較高。
*
*
結論與建議
(二) 與銀行往來紀錄:
「是否申請結餘代償」:沒申請結餘代償的違約機率較低。
「是否使用扣款帳號」:使用扣款帳號的違約機率較低。
(三)金融聯合徵信中心:
「延遲月數比率」:延遲月數比率越高違約機率越高。
「循還月數比率」:循還月數比率越高違約機率越高。
「近一年M2次數」:近一年M2次數越多,違約機率越高。
「近期是否逾期」:近期逾期,違約機率越高。
「負債所得比」:負債所得比越高,違約機率越高。
「有效卡張數」:有效卡張數0張,違約機率較高。
「被查詢總家數」:被查詢總家數越多,違約機率越高。
*
*
結論與建議
給發卡銀行建議
力求資料的完善性
交叉銷售
給後續研究者建議
拓展客戶期
管理帳戶期
感謝您的聆聽~
*
*
*
*