ArchSummit全球架构师峰会
深圳站2016
社交数据的征信探索之路
潘宣良 腾讯 SNG
潘宣良,腾讯SNG 社交网络运营部高级工程师
• 计算机学士、工商管理硕士,国际PMP项目管理
师
• 超过10年商业智能相关的数据分析及挖掘经验,
曾长期在咨询公司从事决策分析项目的实施和管
理工作,曾担纲招商银行总行、中信银行信用卡
中心、中国移动、中国联通、平安集团、南京广
电、香港赛马会等大型企业商业智能分析项目的
项目经理或核心成员,有较为丰富的信用风险管
理、客户生命周期管理、精准营销模型构建和大
数据分析处理等开发及项目管理经验
• 目前专注于互联网征信体系建设,基于社交大数
据开展个人信用风险的分析与探索
目录
社交征信的背景
社交征信的建设
社交征信的应用
目录
社交征信的背景
社交征信的建设
社交征信的应用
美国征信体系
机构征信 个人征信
资本市场信用 普通市场信用 个人及小企业信用
• Standard &
Poor
• Moody’s
• Fitch
Dun &
Bradstreet
• Experian
• Equifax
• Trans Union
Fico VS ZestFinance
• 85%有信贷记录人群
• 银行数据
• 逻辑回归
• 15-50个变量
• 15%无信贷记录人群
• 第三方、网络行为数据
• 机器学习
• 几千上万个变量
• “将Google算法带入征
信领域”
1980年 2010年
信息化 寡头市场
市场化 格局稳定
美国征信体系
起步阶段
• 规模小
• 业务少
平台化尝试
• 央行推行贷款证
• 各地建设征信体
系
平台化形成
• 央行主导
• 系统建立
• 条例规范建设
• 征信民企成立
市场化阶段
• 互联网金融爆发
• 78家企业征信机构
备案完成
• 8家机构获批开展个
人征信准备工作
• 芝麻信用
• 腾讯征信
• 拉卡拉信用
• 深圳前海征信中心
• 中诚信
• 中智诚征信
• 北京华道征信
• 1988年,第一家信用评级公
司“上海远东资信”成立
• 1991年,深圳贷款证制度正式
颁布执行
• 1991年、1995年,央行总行分
两次向全国组织推行贷款证
• 1994年,邓白氏进入中国
• 2006年3月,央行设立征信中心
• 2013年3月,首部征信行业法规
《征信管理条例》开始实施,12月
央行制定的《征信机构管理》正式
施行
• 央行在2015年1月5日印发了
《关于做好个人征信业务准备工作
的通知》,要求八家机构做好个人
征信业务的准备工作
国内征信发展历程
风险管理是一个整体
信息不对称是导致风险产生的重要原因
数据、业务、经验的有机结合,持续动态的交互过程
三者缺一不可
风险
管理
数据
经验业务
风险管理是核心
1、你是谁?是你在借钱吗? √ 欺诈管理
2、借多少钱是你还得起的? √ √ 还款能力
3、愿意还吗? √ 还款意愿
4、还款稳定性有多高? √ 还款能力和意愿的稳定性
5、如果不还怎么找到你?怎
么让你还?
√ 贷后管理
注: PD: Probability of Default,违约概率 EAD: Exposure at Default,违约风险敞口 LGD: Loss Given Default,违约损失率
风险管理的目标
QQ月活跃账户数亿
微信月活跃账户数亿
QQ空间月活跃账户数亿
央行征信系统
有信贷记录
系统收录亿自然人
2千万企业及其它组织
有信贷记录亿
有信用评分
有信用评分亿
社交数据能否对央行征信形成一定的补充?
覆盖人群广,数据维度多
大规模实时数据处理能力
算法模型积累较多
社交网络数据难以模拟,在
反欺诈方面有天然优势
互联网金融爆发式增长,征
信需求越来越大
大量的用户没有被央行征信
系统覆盖,空间大
缺乏信贷相关核心数据
数据类型多,处理难度大
缺乏统一的数据标准和规范
数据孤岛现象严重
账号复杂,一人多号情况多
行业对社交征信的认可
互联网业务变化快,数据稳
定性挑战较大
优势
劣势 机会
风险
社交征信SWOT分析
目录
社交征信的背景
社交征信的建设
社交征信的应用
社交征信
数据 模型 平台
支柱一 支柱二 支柱三
社交征信建设的三大支柱
支柱一:数据
解决方案分析主体业务问题
信用风险
虚假借款人 反欺诈
借款人违约 信用评估
当前及未来收入
资产水平
违约收益
违约成本
个人品性
行业、单位、职位…
还款能力
还款意愿
好友亲密度
好友经济状况
房产、车产、信贷…
贷款收入比例…
迁移成本、贷款需求、社会
地位、社交圈质量及稳定性…
教育水平、社交影响力、小善
小恶、兴趣爱好、理性程度…
关系类别、联系密切度…
各亲密好友还款能力评估…
信贷业务及用户的分析
年龄性别
职业
收入
婚姻状况
居住状况
信贷记录
抚养人数
工作年限
传统征信数据维度
付账的历史35%
个人当前欠账情况
30%
个人信用历史长度
15%
新的信用活动
10%
拥有各种信用
情况10%
传统信用评分的核心要素
• QQ
• 月活跃亿
• 最高同时在线亿
• QQ空间
• 月活跃亿
人口属性
年龄
性别
地域
家乡
关系链
QQ群
QQ关系链
QQ社交数据
维度
移动互联网
LBS
手机APP
移动设备
游戏
端游
页游
手游
社交&音乐
说说
相册
QQ音乐 增值业务
QQ会员
黄钻
绿钻
QQ秀
QQ社交数据维度
用户画像建设需要解决的核心问题:
如何充分利用腾讯各种丰富的数据资源及之间的联系
如何使用户画像适应各种不同的应用场景(广告定向、业
务推荐、信用评分)
如何高效的处理海量的用户数据(超过10亿的QQ用户,
超过千亿级别的各类日志数据)
QQ用户画像建设
QQ用户画像建设
用户画像建设的解决方案:
针对不同的底层数据类型设计特定的挖掘算法,挖掘用户
的行为特征,形成底层标签。综合考虑不同数据来源的,
形成更上层的抽象用户标签
建立完善的用户画像标签体系结构,从不同维度、粒度对
用户进行描述
搭建用户画像挖掘系统,基于大规模存储和机器学习计算
平台,定期对全量用户数据进行计算和挖掘,并提供用户
标签的使用和查询服务
QQ用户画像建设
• 原理
– 社交网络中常出现整体松散、局
部抱团的现象
– 将用户个人网络中局部抱团的好
友找出来,往往对应着用户不同
的人际交往圈
– 智能梳理关系链类型,刻画用户
的好友结构
– 加深对用户社交行为的理解,刻
画用户的沟通偏好
– 捕捉用户的状态变化,刻画用户
的沟通稳定性
• 应用价值
大学同学
高中同学
初中同学
家人
社团关系链-圈子
正常的社交圈子
聚类系数:
不正常的社交圈子
聚类系数:0
恶意加好友发广告
利用传统图论的理论知识以及社交网络的前沿技术,计算出能够度量每个 QQ 用
户在社交网络中的角色、重要程度、影响力等有价值的变量,主要包括:
• 双向好友数(度量用户对社交的喜爱程度)
• 一度网络的聚类系数、半径、直径以及平均距离(度量用户周边社交环境的健
康度);
• 介数(度量用户对周边社交环境的重要程度)
• 核数(度量用户在周边好友中的核心程度)
社团关系链-拓扑
• 原理
– 用户根据自身的兴趣、行业
等特点自发组成群组
– 同一群组的群成员通常具有
某个共同点
– 梳理用户加入的兴趣群可挖
掘用户兴趣
– 梳理用户加入的行业交流群
可挖掘用户行业
• 应用价值
社团关系链-群组
基础画像-学历
思路1:利用QQ好友关系链挖掘
学历,通过用户之间的备注生成
有属性的图,生成学历圈
存在问题:专科同学会被标注为大
学同学,如何区分专科圈,本科圈
?
思路2:利用QQ群判断学历,对
用户的群进行学历群分类
存在问题:如何识别学历相关群?
如何识别教师等学校员工?
思路3:汇总各社群学历,并利用
关系链,自然人进行扩散修正
存在问题:如何调整不同社群的汇
总权重?如何确定扩散权重和方向
?
思路及问题
学历画像覆盖的用户量超过亿,经真实数据验证,准确率超过82%,覆
盖率超过90%。其中识别在校大学生2000w+,群体准确率超过90%,学校
准确率85%,覆盖率达到70%
基础画像-学历
基础画像-行业
思路1:根据用户加入的QQ群文
本及其他UGC进行文本分类
存在问题:加入群只能反映相关兴
趣,与职业并无绝对关系
思路2:判断用户工作地点,并根
据工作地点推测用户行业
存在问题:同一工作地点可能存在
多种不同工作行业
思路3:利用同事间好友关系网络
进行行业标签传播
存在问题:好友关系类型比较复杂
,无法确定是否为同事
思路及问题
基础画像-行业
利用社交数据挖掘输出的行业画像,除了在信用风险评估方面发挥重要作
用,在广告精准投放上也取得了显著效果。在实际广告应用的实验中,结
合行业画像定向的目标用户群体,其CTR提升比超过200%
支柱二:模型
自然人计算模型的基本假设:
同时在线假设
• 同一设备登录的号码对可能属于同一自然人
• 同一自然人的号码同时在线
互斥假设
• 包括异地互斥和消息互斥,排除异地同时在线、互发消
息的号码对
自然人计算效果(准确率:%;覆盖率:%)
QQ账户体系自然人模型
QQ社
交评分
兴趣爱
好
社交与
人脉
支付能
力
游戏偏
好
账户安
全
QQ社交评分模型体系
基础变量:
共构造约数千个基础变量
衍生变量:
累计共衍生变量过万个
变量探索:
通过探索及变量分析,确
定待选变量用于模型构建
中间模型:
共开发了几十个基础子模
型,使用的变量超过百个
最终模型:
通过模型融合构建最终评
级模型
信用模型建设
模型库
线性模型:
LR/Lasso/SVM/Liblinear/…
非线性模型:
DT/ XGBoost/GBDT/…
模型效果
• 经过严格的数据验证和应用实践,基于QQ社交数据建立
的信用评分模型性能表现良好,各项模型性能指标均达
到行业较高水平
支柱三:平台
腾讯大数据平台发展历程
大数据平台套件:数据分析+机器学习双引擎
数据分析引擎 机器学习引擎
IDE Lhotse
MR
SparkSQL
资源调度管理(CPU、GPU)
Pig Hive
分布式存储(HDFS、Hbase、Ceph)
Angel
Mariana
(支持Caffe、
MxNet、
Tensorflow)
ML Graph
Tesla
Spark
强大的计算平台支撑
强大的计算平台支撑
资源调度
Gaia
业
务
在
线
系
统
存储
HDFS/PG/HBase/…
离线计算
MR
实时计算
TRC
数据产品
精准推荐/秒级监控/多维分析/
用户画像/…数据接入
数据分发
5万亿条
20000台
200P
15P 万亿条
5
0
0
万
次
任
务
调
度&
工
作
流
Lhotse100亿次
单租户(公有云/专有云)
数据采集
TDbank
数据存储
HDFS/TPG/HBase/…
数据计算
TDW/TRC/…
数据展示/分析
黄金眼/IDEA
光学识别银行征信 舆情分析 人群画像精准推荐
大数据模型及算法
分析模型库/挖掘模型库
多租户(公有云)
腾讯大数据信息
用户画像/行为属性/社交属性
人脸识别大数据应用
基础云服务
大数据处理
大数据挖掘
合作伙伴/SI/ISV
基于腾讯云搭建包含大数据处理、挖掘、应用能力的大数据一站式服务平台,重点面
向政企、行业客户,应用腾讯大数据信息,联合第三方形成数据流通集市,优势形成
差异化竞争,引入合作伙伴,共建生态。
腾讯大数据产品形态
目录
社交征信的背景
社交征信的建设
社交征信的应用
审批授信新客户获取 客户管理 催收和收回
申请审批
额度调整
核销
初始额度
贷款发放
早期预警
催收
低效资产
风险定价
预批核
新客户
审批
接受/拒绝
初始额度
客户管理
低效资产
早期预警
额度调整
风险定价
续约
催收
早期催收
晚期催收
催收管道
何种方式
外包
扩大客户群
• 寻找目标群
体
• 如何定位潜
在客户/ 目标
客户
续约
QQ数据支撑微众信贷客户生命周期管理
微粒贷应用
有连接的地方,就有信用
信用,即是财富
可用于需要建立信任,促成交易/合作的所有场景
– 金融
– 婚介/交友
– 招聘
– 租赁
– 预付费/押金
– 赊账
– 游戏付费
– 业务流程优化,如免短免验等
– ……
社交征信拥有广泛的应用场景