网络搜索指数与汽车销量关系研究
网络搜索指数与汽车销量关系研
搜索引擎已经成为消费者决策过程中信息搜索和评价过程的起点,根据在 CNNIC 调查社
区进行的搜索营销调查显示,有 77%的互联网用户在购买产品之前会上网搜索信息[1]。
网民的搜索需求在一定程度上反映了他们的关注点和意图,而网络搜索数据正是对网民搜
索需求的客观记录。网络搜索数据的这一特性使其能够映射用户实际生活中的行为特点,
并影响企业经营和政府管理方式,成为目前研究大数据的主要方向之一。
本文以我国汽车市场为背景,研究网络搜索数据与汽车销量之间的关系。之所以选择
汽车作为研究对象,是因为汽车产品属性复杂并且要求较大资金投入,消费者在购买汽车
时会对汽车产品各种属性进行仔细考察和评估。不仅如此,汽车也是研究消费者外部搜索
相关文献中最为常用的产品对象之一[2]。
1 研究意义与思路
11 研究意义
网络搜索数据的利用价值已经得到了学术界的广泛关注。国外学者在房地产[3]、就业
[4]、股票[5]、汽车和旅游[6]等众多领域都验证了谷歌搜索数据的作用。但是在中国,百
度是应用最多的搜索引擎,因而用百度搜索指数研究中国的社会经济行为更符合实际情况
。任乐通过计算相关系数、确定领先阶数并合成百度搜本文由论文联盟
收集整理索指数,实证了北京市搜索数据与月旅游客流量之间的相
关关系[7];袁庆玉等从网络关键词搜索数据与汽车销量的角度建立了理论基础框架,采用
综合赋权法对关键词进行提取,预测了汽车销量[8]
但是对国内现有研究而言,利用网络搜索数据预测用户需求仍属于一个新的研究领域,并
没有形成系统的研究体系,还存在以下不足:(1)对于关键词的选取还存在争议。多数
研究是直接指定关键词,或者是结合百度自动生成的关键词来提取指数,并没有考虑关键
词能否代表用户实际的网络搜索行为。(2)预测模型多采用时间序列的静态回归或者是
对短面板数据的建模,不利于控制不同个体间的差异,也不利于准确地反映和刻画在时间
推移的过程中网络搜索数据对销售影响的动态变化。
为弥补现有研究存在的不足,本文在关键词选择和模型设定上都作出了改进,目的是
验证网络搜索数据如何反映当前的汽车销量并预测未来的销量变化趋势。本文的主要工作
是:提出了一套结构化的流程来提取网络搜索数据关键词,并应用于我国汽车市场的研究
。该流程为网络搜索数据在其他领域的研究提供了参考。
12 研究思路
本文的研究思路如下:①对汽车销量预测和网络搜索数据应用的相关研究进行梳理,
总结出现有研究存在的不足;②以 2007-2015 年国内市场的汽车销量为研究对象,基于
文本挖掘技术,提出一套结构化的流程,获得网络搜索数据的关键词,用于提取出百度搜
索指数;③为避免百度搜索指数和汽车销量之间存在伪回归的可能性,对变量做了单位根
检验和格兰杰因果检验;④基于 108 个月的长面板数据,建立百度搜索指数与汽车销量
的固定效应模型,据此验证网络搜索数据如何反映当前的销量;⑤采用滚动窗口的方式预
测最近 12 个月的汽车销量,来检验网络搜索数据的预测效力。
2 文献综述
21 有关汽车销量预测的相关研究
关于国内汽车销量的预测,从以往的相关研究来看,学者从定性和定量两个方面进行
了相关研究。在定性方面,如:门峰等针对我国汽车产业的发展方向进行研究,认为我国
汽车产业已经成为国民经济的重要支柱产业,并预测未来 5~10 年是我国由汽车工业大
国向汽车工业强国转变的重要时期[9];王莉分析了国际金融危机给中国汽车行业带来的总
体影响[10]。定量方面的研究则可以分为两个层面:一是单方法预测法(包括多元回归分
析法、时间序列预测法、神经网络分析法),如:陈欢通过定性灰色预测模型的方法对汽
车销量进行了预测[11],该方法能够反映复杂数据的非线性和汽车销量数据自身的规律性
,但对历史数据过于依赖,历史数据越多,预测结果越可靠;郭顺生等基于时间序列
ARMA 模型对中国汽车的月销量数据进行预测[12];汪玉秀等综合汽车颜色、排量及版本
类型 3 个因素,建立了马尔科夫过程的 4S 店汽车销量预测模型(预测绝对误差均小于
5%)[13]。二是组合预测方法,如:李响等基于 ARMA 模型与 RBF 神经网络相结合的混
合模型预测了天津市日汽车销量,认为组合模型相对于单一的预测模型有较高的预测精度
[14];蔡宾等采用改进差分进化算法和灰色模型对几个主要汽车品牌的销量进行了预测,
并对汽车销量的发展趋势作出了判断[15];李莉通过建立灰色模型和马尔科夫模型相结合
的组合预测模型预测了我国小排量汽车的销量,该模型整合了 GM(1,1)模型处理光滑
序列的有效性和灰色马尔科夫链处理随机序列的有效性,反映出了数据序列的发展趋势
[16]。
无论是传统的定性预测方法,还是定量预测都只能依赖于历史数据,但历史数据具有
很强的延迟性,而且其预测的粒度较大,一般为汽车销量的年度数据。另外,与传统的预
测方法相比,人工智能建模方法虽然预测精度较高,但也存在算法复杂性高,应用广泛性
和对原始数据的变化趋势依赖性较强等缺陷和不足。
22 基于网络搜索数据的经济类、社会类行为相关性研究目前基于网络搜索数据的经
济社会类行为预测已成为各领域学者们研究的一个新的热点,并在国内外都取得了一定的
研究成果。在宏观经济领域,Vosen 等利用网络搜索趋势也对家庭支出做出了预测[17];
Choi 等研究如何利用网络搜索数据预测短期经济价值,文中的例子包括房地产、失业索赔
、旅游目的地规划和消费者信心[18]。在社会领域,Ripberger 等使用网络 Query 搜索数据
对公众的注意力进行衡量,取得了良好效果[19]。国内学者张崇等揭示了网络搜索数据与
居民消费价格指数(CPI)之间存在一定的相关关系和先行滞后关系,并取得了良好的预
测效果[20]。董倩等发现网络搜索数据不但能够较好地预测房价指数,而且能够分析经济
主体行为的趋势与规律,有一定的时效性[21]。孙毅等对相关研究进行了综述,提出基于
网络搜索数据的相关性研究是典型的交叉研究,而对于网络搜索数据与经济行为之间的相
关性的机理分析、关键词的选择和数据处理模型选择是需要解决的关键问题[22]。
网络搜索数据也开始用来预测汽车销量。Du 等发现从谷歌搜索数据中对 38 个主要汽
车品牌提取出来的 7 大趋势可以从品牌层面解释美国市场 74%的汽车销量[23]。国内学者
王炼等以百度搜索指数为数据基础,探讨网络搜索在我国汽车市场的预测作用,结果显示
网络搜索数据对汽车销量具有显著的正向影响,研究还发现,在其他传统指标的数据无法
获得时,网络搜索数据依然能够发挥重要预测作用[24]。但王炼等是对短面板数据进行建
模回归,数据量较少,不利于刻画百度搜索指数与社会经济活动的动态变化,也不能确定
变量之间是否存在着长期的均衡关系。
综上所述,虽然网络搜索数据可以作为传统数据的良好补充来实现对市场需求的预测
,但仍有以下方面可以改进:(1)该领域的很多研究都是以谷歌趋势为数据源。虽然谷
歌是全球最大的搜索引擎,但依然存在很多像中国这样的国家偏向于使用本地的搜索引擎
,因而应用百度搜索指数研究我国市场需求更符合实际情况。(2)在确定获取百度搜索
指数的关键词上,并没有一个系统化、统一的的方法。之前的研究普遍都是手动指定关键
词,或者是利用百度自动生成的词。在本文中,我们基于文本挖掘技术,提出了一个结构
化的流程来确定检索关键词,可以真实地反映出用户网络搜索的习惯。(3)以往的研究
大都采用时间序列数据,或是短面板数据,不利于检验更复杂的行为模型。本文收集了国
内市场最近 9 年的汽车月度销量数据,采用长面板数据建模,可以准确地反映和刻画在时
间长期推移的过程中网络搜索数据对销售影响的动态变化。
3 实证分析
31 数据来源
311 汽车销量
本文的汽车销量数据来源于搜狐网站汽车频道(http∥
该数据为月度更新数据。为了研究网络搜索数据与汽车销量之间的长期相关关系,我们选
取的时间段为 2007 年 1 月至 2015 年 12 月,共 108 个月。考虑到车型数据在此期间的
持续可获得性,我们将连续 12 个月无销量的车型排除。最终,我们收集了 55 款车型在
此期间的国内市场月度销量数据。
312 网络搜索
本文使用的网络搜索数据源于百度搜索指数。百度()是全球最大的中文
搜索引擎,截至 2015 年第三季度,百度在国内的市场份额达到 823%,远超过其后的“谷
歌中国”(79%)、搜狗(48%)、360 搜索(38%)[25]。百度搜索指数是以百度网页搜
索为基础的免费海量数据分析服务,可以反映不同关键词在过去一段时间里的“用户关注
度”。用户关注度以数千万网民在百度的搜索量为数据基础,以关键词为统计对象,代表
了各个关键词在百度网页搜索中的搜索频次,每天更新 1 次。图 1 是网络搜索数据的 1
个示例。显示的是两款车型“普力马”和“福美来”在 2015 年用户关注度的变化趋势。可以看
到,在 2015 年的大部分时间里,“福美来”受关注程度要高于“普力马”,在 2 月初,“普力
马”的用户关注度大幅上升而超过“福美来”,而在 6 月份以后,“普力马”的受关注程度又始
终低于“福美来”。
32 遴选关键词
在研究汽车销量与百度搜索指数之间关系的过程中,选取恰当的网络搜索关键词是非
常重要的,直接影响研究结果的可靠性。一方面,由于汽车是属性复杂并且要求较大资金
投入的产品,消费者在购买汽车时会对汽车的各种属性进行仔细考察和评估。另一方面,
根据 CNNIC 调查社区开展的搜索营销调查结果,有 77%的互联网用户在购买产品前会上
网搜索信息[1]。考虑到这一点,我们选取了用户活跃度最高的汽车论坛——汽车之家论坛
来提取关键词。为了准确地反映消费者考虑购买汽车并上网搜索信息时所采用的搜索词,
我们采取以下详细步骤来确定搜索关键词。
321 确定基本词条
我们根据搜狐网站汽车频道(http:∥
及“品牌名+车型名”的组合(如:A4L 以及奥迪 A4L)来作为最初的基本词条。
322 获取基本词条的近义词
在汽车之家论坛(http:∥
开发的软件程序,采用抓取网页的方式收集了论坛帖子的内容。为了更准确地确定关键词
,我们用文本挖掘技术找出基本词条的同义词。具体过程为:先对抓取后的文本语料进行
Jieba 分词;利用深度学习的 Word2vec 模型对分好词的语料做训练,把词转化为向量空
间模型的形式;然后结合 TF-IDF 算法和余弦相似度算法找出与基本词条相似的词条(对于
延伸词条我们不予考虑,如 A4L 油耗),即近义词。对找出来的近义词继续做训练,重复
多次,总共得到了 452 个词条。经过结构化查询语言(SQL)去重后得到了 318 个词条
。
323 选取论坛高频词条
对每一词条我们都在论坛的文本中统计出词频,并选取词频较多的词作为百度搜索指
数中检索的目标关键词。对于仍有歧义的词条,我们会加上品牌名来作为目标检索关键词
,如“金刚”,目标词则为“吉利金刚”。类似的例子还包括“雨燕”、“北斗星”、“高尔夫”等。
324 确定最终搜索词条
对目标词在百度搜索指数中进行检索,我们选取在百度指数中排名最高的词作为关键
词。对于仍不能确定排名的词,我们再选取其与销量之间在不同滞后期 0~6 期皮尔逊相
关系数最高的词作为搜索关键词。最终得到了 55 款车型可各自用于百度指数检索的惟一
关键词。
对每一个关键词指数我们都计算了其与销量在 0~12 滞后期的皮尔逊相关系数,表
1 是关键词的百度搜索指数与销量之间基于最大皮尔逊相关系数的滞后阶数。可以看出滞
后期普遍集中在 0~2 期,且其中大多数滞后期都为 0 期。对该现象可能的解释是:尽管
现实当中消费者在最终购买前可能会产生几个月的信息搜索和评价过程,但是他们搜索的
数量和强度都比较小,直到在购买的前 1 个月其搜索数量会达到 1 个临界点。
4 百度搜索指数与汽车销量的关系
41 单位根检验
本文选择实际汽车销量(S)为因变量,以百度搜索指数(B)为自变量。为了减少异
方差对检验结果带来的影响,本文数据全部对数处理(lnS,lnB),这样处理也是考虑到
了销量和搜索指数的偏斜分布。进行对数处理还有一个好处是,在解释估计结果时能够以
百分比变化而非绝对值的变化解释搜索的预测作用。
由于本文的样本数据均为面板数据,和时间序列数据一样,为了保证变量的平稳性和
避免伪回归现象,在建立计量经济学模型之前要对变量进行单位根检验和协整检验。常用
的面板数据单位根检验方法有 LLC 检验、PP 检验、IPS 检验和 ADF 检验等,本文采用这
4 种方法同时进行检验,检验结果如表 2 所示,由于检验原理不同,不同检验方法的结果
不尽相同,本文以 4 种方法结果一致为准,得到汽车销量和网络搜索指数在所有情况下都
为水平平稳。由于协整检验的目的是看一组非平稳序列的线性组合是否具有协整关系[26]
,所以本文不再对汽车销量和网络搜索数据做协整检验,而直接进入 Granger 因果检验。
42 格兰杰因果检验
从实际生活来看,消费者会在购买汽车前上网搜索信息,那么网络搜索发生在购买汽
车之前,也即百度搜索指数是汽车销量的原因,为了验证实际数据能否支撑该结论,必须
进行格兰杰因果检验,检验的前提条件是数据平稳。从网络搜索到汽车购买,实际产出滞
后期有 0~2 个月,但本研究以网络搜索数据对汽车销量的预测为目的,对同期影响不作
考虑。因此本文在进行格兰杰因果检验时将滞后期设定为 1~2 期,结果如表 3 所示
从格兰杰因果检验的结果看,在滞后 1 期和 2 期的情况下网络搜索指数与汽车销量存在着
双向互动的因果关系。但格兰杰因果检验度量对汽车销量进行预测时,网络搜索数据的前
期信息对均方误差 MSE 减少的贡献要大于另外一种情况。因此网络搜索数据对汽车销量
具有预测作用。
51 模型设定
采用面板数据分析网络搜索与销量关系时,首先需要用 F 检验来分析是采用混合回归
还是面板数据,结果发现本文应该采用面板数据。在研究它们的关系时很有可能会产生遗
漏相关变量的问题。在回归模型中,遗漏重要的相关变量是导致内生性的主要原因。因为
一旦这个被遗漏的变量同时与因变量和目标自变量相关,那么目标自变量与随机扰动项的
无关性假定就不再成立,这时如果用最小二乘估计,目标自变量的估计就是有偏的。出于
此考虑,本文首先采用固定效应模型对面板数据做估计,由此来控制由于遗漏变量而产生
的内生性影响,用固定效应模型控制截面变异也是面板数据模型对于截面数据模型的一大
优势所在,而且 Hausman 检验的结果也拒绝了采用随机效应模型来建模。考虑到销量与
网络搜索之间存在滞后期,在该模型当中,使用前一期搜索指数和前两期搜索指数作为自
变量,以检验前 1 个月网络搜索和前两期搜索是否都能够预测销量。对车型 i 在时间 t 的
销量有如下模型:
图 2 为福克斯三厢实际销量数据和预测销量数据的对比图,其中 lnS 为实际销量数据
的对数值,lnF1、lnF2 分别为提前 1 个月和 2 个月的预测。从对比图可以看出,百度搜索
指数与汽车销量结合程度较好,模型预测效果很好。该结果再次体现了网络搜索数据的预
测效力。图 2 福克斯三厢实际销量数据与预测数据对比图
按照 Hyndman[28]提出的方法,本文选择平均绝对误差(MAE)作为评价预测效力的
指标。平均绝对误差的单位与因变量的单位一致,易于解释。此外,本文还计算了预测值
的均方根误差(RMSE),因为这一指标比平均绝对误差对异常值更加敏感,同时使用能
够更加全面地评价模型的预测效力。考虑到要反映误差大小的相对值,本文又计算了不受
量纲影响的平均相对误差 MPE
预测结果显示在表 5 当中,模型预测效果很好,加入百度搜索指数之后模型的拟合优度和
预测精度都有了提高,这和格兰杰因果检验百度搜索指数是汽车销量的原因一致。对比网
络搜索提前 1 个月和提前 2 个月的预测误差,可看出总体差别不大,提前 1 个月的百度
搜索指数预测效果要略优于提前 2 个月的预测。表 5 各预测期样本外预测误差结果
误差指标 MAERMSE〖〗MPE 提前 1 个月 098315790342 提前 2 个月
0986158003426 结语
本文用文本挖掘技术,对汽车之家论坛帖子提取关键词,以关键词的百度搜索指数为
数据基础,研究了网络搜索数据与我国汽车销量之间的关系,发现:①网络搜索数据与汽
车销量之间存在着长期均衡关系,且网络搜索数据可以解释汽车销量 76%的方差;②可以
用提前 1 个月或 2 个月的网络搜索数据,对我国汽车销量做预测。
本文的理论意义在于:①基于文本挖掘技术,提出了结构化的流程确定搜索数据关键
词,为网络搜索数据在其他领域的研究提供了参考;②对近 9 年的长面板数据建立模型,
检验了网络搜索数据对汽车销量的预测作用。本文的实践意义在于:在不依赖历史销量数
据的情况下,可以预测中国市场的汽车销量变动情况,有利于汽车企业制定相关营销策略
和调整生产计划,同时也为政府部门制定相关政策提供了参考。
本文的研究局限体现在:采用固定效应模型来探索网络搜索数据对我国汽车销量的影
响,在预测效果上还可以使用其他模型来完善。另一方面,本文是基于汽车之家论坛来确
定网络检索的关键词,但在以后的研究上可以考虑综合如微信、微博、博客等其他社交媒
体来全方位捕捉消费者的在线行为足迹