社交数据在征信领域的应用探索
刘黎春 SNG, 腾讯
• 社交征信背景
• 腾讯社交网络数据
• 个体用户画像研究
• 社团圈子研究
• 模型建设及应用
社交征信背景
传统征信相关机构
数据的采集和提供
• 独特的数据源
• 初步的数据挖掘
数据公司
征信公司 征信使用方
数据整合和挖掘
• 多维度的数据源整合
• 征信模型建设、服务提供
• 征信解决方案提供
征信解决方案的应用
• 银行
• P2P贷款机构
美国著名征信公司
美国征信体系
机构征信 个人征信
资本市场信用 普通市场信用 个人及小企业信用
• Standard & Poor
• Moody’s
• Fitch
Dun & Bradstreet • Experian
• Equifax
• Trans Union
Fico VS ZestFinance
• 85%有信贷记录人群
• 银行数据
• 逻辑回归
• 15-50个变量
• 15%无信贷记录人群
• 第三方、网络行为数据
• 机器学习
• 几千上万个变量
1980年 2010年
信息化 寡头市场
市场化 格局稳定
国内征信发展历程
起步阶段
• 规模小
• 业务少
平台化尝试
• 央行推行贷款证
• 各地建设征信体
系
平台化形成
• 央行主导
• 系统建立
• 条例规范建设
• 征信民企成立
市场化阶段
• 互联网金融爆发
• 78家企业征信机构
备案完成
• 8家机构获批开展
个人征信准备工作
• 芝麻信用
• 腾讯征信
• 拉卡拉信用
• 深圳前海征信中心
• 中诚信
• 中智诚征信
• 北京华道征信
• 1988年,第一家信用评级公
司“上海远东资信”成立
• 1991年,深圳贷款证制度正式颁
布执行
• 1991年、1995年,央行总行分两
次向全国组织推行贷款证
• 1994年,邓白氏进入中国
• 2006年3月,央行设立征信中心
• 2013年3月,首部征信行业法规
《征信管理条例》开始实施,12月
央行制定的《征信机构管理》正式
施行
• 央行在2015年1月5日印发了
《关于做好个人征信业务准备工作
的通知》,要求八家机构做好个人
征信业务的准备工作
QQ月活跃账户数亿
微信月活跃账户数亿
QQ空间月活跃账户数亿
央行征信系统
有信贷记录
系统收录亿自然人
2千万企业及其它组织
有信贷记录亿
有信用评分
有信用评分亿
社交数据能否对央行征信
形成一定的补充?
交易
数据
社交
数据
社交数据能不能用来做征信?
vs
社交数据与信用评级有关系吗?
交易数据天然具备金融属性,社交数据有吗?
社交数据非结构化程度高,怎么挖掘并有效使用?
腾讯社交网络数据
年龄性别
职业
收入
婚姻状况
居住状况
信贷记录
抚养人数
工作年限
传统征信分析维度
人口属性
年龄
性别
地域
家乡
关系链
QQ群
QQ关系链
数据现状
移动互联网
LBS
手机APP
移动设备
游戏
端游
页游
手游
社交&音乐
说说
相册
QQ音乐
增值业务
QQ会员
黄钻
绿钻
QQ秀
• QQ
• 月活跃亿
• 最高同时在线亿
• QQ空间
• 月活跃亿
QQ社交数据现状
覆盖人群广,数据维度多
大规模实时数据处理能力
算法模型积累较多
社交网络数据难以模拟,在
反欺诈方面有天然优势
互联网金融爆发式增长,征
信需求越来越大
大量的用户没有被央行征信
系统覆盖,空间大
缺乏信贷相关核心数据
数据类型多,处理难度大
缺乏统一的数据标准和规范
数据孤岛现象严重
账号复杂,一人多号情况多
行业对社交征信的认可
互联网业务变化快,数据稳
定性挑战较大
社交征信SWOT分析
优势
劣势 机会
风险
个体用户画像研究
用户画像主要挑战
1. 如何充分利用腾讯各种丰富的数据资源及之间的联系
社交网络 用户群组LBS日志 多媒体数据 登录IPUGC文本
2. 如何使用户画像适应各种不同的应用场景
推荐
系统
市场
营销
广告
定向
信用
评分
3. 如何高效的处理海量的用户数据(超过10亿的QQ用户,
超过千亿级别的各类日志数据)
用户画像解决方案
1. 针对不同的底层数据类型设计特定的挖掘算法,挖掘用户的行为特征,形成底
层标签。综合考虑不同数据来源的,形成更上层的抽象用户标签
2. 建立完善的用户画像标签体系结构,从不同维度、粒度对用户进行描述。
3. 搭建用户画像挖掘系统,基于大规模存储和机器学习计算平台,定期对全
量用户数据进行计算和挖掘,并提供用户标签的使用和查询服务。
相册说说 APP文本 群文本
TDW数据仓库
操作行为 LBS数据关系链原始
数据层
数据处理层 结构化数据统计 文本分词 LBS与POI匹配
模型训练
与预测层
基于Hadoop,Spark和GraphLab等计算平台
无监督模型:
word2vec,
LDA,社区发现
半监督模型:
标签传播
监督模型:LR, Kernel
SVM, Random Forest
标签汇总层 不同算法、数据来源得到标签进行汇总
标签应用层 TDW 离线查询 HBase 实时查询(理论峰值40w/s)
外部数据
用户画像系统架构
语料库
业务相关语料
Qzone
文本分词
ansj
中科院分词算法
MapReduce
语义训练
word2vec
自然语言词库
Google开源工具
word转换成vector
基于vector开展后续工作
K-means
为分类样本提供参考
样本标注
正负样本
文本聚类
mahout
分类器训练
LR/SVM
libsvm/liblinear
分类器参数调整
Kernel 引入
AB test
分类器部署
实时/大规模
效果评估
人工审核
机器自动分类
自主学习进化
QQ群
support
自定义词库
主题发现
每天处理5600万条说
说,3000万相册标题,
讲述4500万人的故事
用户画像文本挖掘系统
用户画像行业挖掘
思路1:根据用户加入
的QQ群文本及其他
UGC进行文本分类
存在问题:加入群只能
反专业业相关兴趣,与
职业并无绝对关系
思路2:判断用户工作
地点,并根据工作地
点推测用户行业
存在问题:同一工作地
点可能存在多种不同工
作行业
思路3:利用同事间好
友关系网络进行行业
标签传播
存在问题:好友关系类
型比较复杂,无法确定
是否为同事
工作地点
该地点工作的用户及社交网络
Community Detection
(FastGreedy算法)
工作社团1 工作社团2
群文本分类
IT行业 金融行业
LBS数据挖掘
根据工作社团的特殊
性,将部分用户的行
业标签扩散给全体社
团成员
名称、简介、公告等
思路及问题 解决方案
用户画像挖掘结果
收入兴趣
轨迹 婚姻
社交
行为
人口属性
诚信品牌
文化
体育
结构化数据统计
文本分类
LBS数据挖掘
社交网络传播扩散
社团圈子研究
• 首次使用网络拓扑进行智能分圈
• 好友分圈+圈子识别+圈友识别 -> 圈子
基于个人中心网络的关系链挖掘,QQ圈子
QQ圈子的应用
大学同学
高中同学
初中同学
家人
• 基于用户QQ圈子的好友备注分组,
挖掘学历信息
• 经验证,QQ学历数据覆盖率为
74%,其中普通全日制和脱产的
用户准确度均超过90%
社交网络拓扑的应用
用户
好友关系
交互行为
社交
健康度传统图论理论知识
用户行为轨迹系统
– 双向好友数
– 聚类系数、直径
– 介数
– 核数
个人
影响力
模型建设及应用
自然人计算模型的基本假设:
同时在线假设
• 同一设备登录的号码对可能属于同一自然人
互斥假设
• 包括异地互斥和消息互斥,排除异地同时在线、互发消
息的号码对
自然人计算效果(准确率:%;覆盖率:%)
自然人计算
基础变量:
共构造约1200个基础变量
衍生变量:
累计共衍生变量约1万
变量探索:
通过探索及IV分析,确定
待选变量约1500个
中间模型:
共开发了9个中间模型,模
型使用的变量共52个
最终模型:
通过LR模型构建最终评级
模型
变量衍生与模型结果
• 关系链组建偏好
• 沟通对象
• 沟通稳定性
• 游戏偏好
• 关系链拓扑结构
• QQ空间
• 群
• 设备安全
• 账户综合信息
模型整体效果
• 模型具有较好的区分能力
• 模型在不同时点分数分布较稳定
稳定性
提升效果
微粒贷应用
Thank you