← 上一章📖 目录下一章 →

第六章 数据如何分析:统计分析方法


章首:数据到手之后,如何让数据"说话"

数据采集解决的是"有没有"的问题,统计分析解决的则是"数据在说什么"。第5章把5467份年报、7589条评论、61410条面板"汇"了进来——但数据自己不会说话:一串词频数字摆在眼前,它既不会告诉你哪家公司转型更彻底,也不会告诉你哪笔贷款更可能违约。让数据开口的,是统计。 中国信息通信研究院在《大数据白皮书》中指出,数据只有经过处理与分析,才能从"资源"转化为"价值"[1];这个转化的中间环节,就是统计分析。

统计分析并非新事物——它几乎与人类文明同龄。早在公元前六世纪,毕达哥拉斯学派便提出了"万物皆数":数是一切事物的本原,宇宙的秩序可以被数所度量、所表达。毕达哥拉斯发现音程的和谐源于弦长的整数比例,天体运行的规律可以化为数的关系——这是人类最早用数学把握世界的宣言,也是"让数据说话"最古老的思想源头[12]。两千五百年来,这个信念从未中断:从毕达哥拉斯用数揭示音程的比例,到Pearson用统计量刻画数据的关系,再到今天实训平台上的一键分析——变的只是工具,不变的是"用数理解世界"这一根本信念。但今天的变化依然深刻:过去需要手算数天的统计量,现在在实训平台上"一键可得";过去只能抽样推算的结论,现在可以基于全量数据直接检验。本书配套ABI实训平台上的三个应用,恰好展示了统计分析的三种典型任务:数字化转型指数应用把"多维词频"压缩成一个可比较的指数(多元统计),信贷违约风险分析把"借款人特征"映射成违约概率(分类预测),股票估值应用把"行情与财务数据"变成内在价值与风险度量(金融计量)。三种任务,三种方法,背后是同一条统计学的认知链条——从数据到结论,中间必须经过方法的检验。

本章沿这条链条展开:第一节讲多元统计——用描述统计认识数据、用相关分析发现关系、用主成分分析压缩维度,以数字化转型指数为例;第二节讲分类预测——用logistic回归把特征变成概率,以信贷违约风险为例;第三节讲金融计量——用CAPM、DDM、FCFF与VaR回答"值多少钱、险不险",以股票估值为例。三节对应三大平台应用,全部可在线复现。

统计学的谱系在此刻显得格外清晰:Pearson在1901年提出用"最接近的直线与平面"拟合数据点云,奠定了主成分分析的思想雏形[2];Hotelling在1933年将其发展为完整的主成分分析方法[3];Berkson在1944年把logistic函数引入生物测定,开启了分类概率建模的先河[4];半个世纪后,Sharpe的资本资产定价模型[5]与Gordon的股利贴现模型[6]为金融资产的"定价"提供了范式。百年统计方法,今天在零代码平台上"一键运行"——方法没有变老,它只是换了个舞台。

在正式展开之前,值得先想清楚一个元问题:统计为什么"必须"存在? 因为数据本身不会自带结论——同样一组数字,可能支持完全相反的判断,取决于你问什么问题、用什么方法。词频高的公司一定是转型标兵吗?逾期两次的申请人一定高风险吗?低市盈率的股票一定便宜吗?每一个"一定"都暗藏统计陷阱:可能是量纲差异在作怪、可能是样本不平衡在误导、可能是风险定价在失灵。统计方法的价值,恰恰在于把"我觉得"变成"数据显示"——它不保证结论正确,但保证结论可检验、可复现、可质疑。这正是本书反复强调的"平台负责算,你负责懂"在方法论层面的完整含义。

还有一个值得品味的事实:本章三个平台应用,恰好对应统计学的三次"任务升级"——认识世界(多元统计:数据长什么样、变量什么关系)、预判未来(分类预测:这件事会不会发生)、给价值与风险定价(金融计量:它值多少、险不险)。三次升级,本质上是问题本身的层层递进:从"是什么"到"会不会",再到"值多少"。读者学完本章,当明白方法之间自有脉络,真正可以迁移的是一条认知主线:任何数据问题,先辨其类属,再择其方法。


第一节 多元统计分析:以数字化转型指数为例

这一节的核心主张:多元统计回答的是"多个变量如何共同作用"——描述统计让你认识数据,相关分析让你发现关系,主成分分析让你压缩维度;数字化转型指数正是这三步的完整落地:从33个词频指标到1个可比较的指数。

从描述统计说起:先认识数据

任何统计分析的第一步,都是描述统计——用少数指标概括一组数据的全貌。数字化转型指数应用的词频库(5467家上市公司2024年报,本书自建)中,"数字技术应用"维度的词频均值约120,而"人工智能"维度均值仅约20[7]——这个差距本身就是信息:它说明上市公司在年报里谈论"数字化应用"远比谈论"人工智能"频繁。但只看均值远远不够:报告均值务必同时报告标准差——两家均值相同的公司,一家词频稳定、一家忽高忽低,风险特征完全不同。

描述统计的指标家族可以按功能分成三组,每一组回答一个不同的问题。集中趋势回答"数据大致在什么位置":均值(易受极端值影响)、中位数(稳健)、众数(分类数据适用)——词频分布通常右偏(少数公司词频极高),此时中位数比均值更能代表"典型公司"。离散程度回答"数据波动有多大":标准差、四分位距IQR、极差——它衡量的是数据的"稳定性",这在对比行业时格外重要:两个行业均值相近,可能一个内部齐整、一个两极分化。分布形态回答"数据长什么样":偏度(是否对称)、峰度(是否尖峭)——它揭示了数据中是否存在被均值"掩盖"的极端结构。描述统计的全部价值,在于用三组指标把一张几千行的表"压缩"成可以读懂的全貌。

描述统计解决"数据长什么样",推断统计解决"结论可不可信",而多元统计解决的是更高一层的问题——多个变量之间是什么关系。在指数构建的场景里,这个问题具体化为:五个词频维度(人工智能、大数据、云计算、区块链、数字技术应用)之间是彼此独立,还是存在共同的变动规律?如果它们高度相关,能否压缩成一个综合指标?

相关分析:发现变量间的关系

回答"变量之间是否有关系",最常用的工具是皮尔逊相关系数——它度量两个变量线性相关的方向与强度,取值在-1到1之间:正值表示同向变动,负值表示反向变动,绝对值越接近1表示关系越强。这一方法源于Pearson在1901年的工作[2],至今仍是多元统计的基石。

在使用相关分析时,有三个判断习惯值得建立。第一,相关不等于因果:云计算词频与指数高度相关,并不等于"多谈云计算就推动了转型"——可能两者同受"公司规模"这一共同因素驱动。第二,相关系数对异常值敏感:一家词频异常高的公司,可能把整个相关系数"拉偏"——这正是本书第五章所讲的数据质量保障(异常值检测)在分析前的价值。第三,只看相关系数不够,还要看散点图:两个变量可能相关系数接近0,却存在明显的非线性关系(如U形)——相关系数捕捉不到这种模式。统计方法永远要配合"看图",这是探索性数据分析(EDA)的基本纪律——这一纪律由统计学家John Tukey在1977年的《探索性数据分析》(Exploratory Data Analysis)中确立:任何正式统计建模之前,先通过图形探索数据[13]。它最著名的实证支撑来自Anscombe在1973年构造的经典例子:四组数据的均值、方差、相关系数与回归线几乎完全相同,画出来却是直线、抛物线、带离群点与被单点拉动四种截然不同的形态[14]——只看统计量,四个数据集无法区分;只有看图,真相才浮现。先画图、再算数、数图互证,是数据科学的基本纪律。

在数字化转型指数平台上,打开"维度相关性"功能(数字化转型指数平台),可以实测五个维度与指数的相关系数:云计算技术0.5572、人工智能技术0.414、区块链技术0.5631、大数据技术0.2454、数字化应用0.5798——全部为正且多数在0.4以上,说明五个维度与指数同向变动、相关性显著。这一结果揭示了一个关键事实:五个词频维度同声相应、同气相求,共同指向"数字化转型"这一潜在特质。 这正是PCA可以施展的前提——如果变量之间毫无相关,压缩就无从谈起。

主成分分析:把多维压缩成一维

主成分分析(Principal Component Analysis,PCA)回答的问题是:如何用少数几个新变量,尽可能多地保留原始多个变量的信息? 它的思想朴素而深刻:在数据点云中找到方差最大的投影方向——第一主成分;再找与它正交的、方差次大的方向——第二主成分,以此类推。Hotelling在1933年发表的论文中给出了完整的数学框架[3],此后PCA成为多指标合成的主流工具。

五个词频维度
人工智能 · 大数据 · 云计算
区块链 · 数字技术应用

描述统计
均值与标准差
量纲差异显现

相关分析
皮尔逊相关系数
维度间同向变动

标准化
Z-score消除量纲

PCA降维
第一主成分载荷赋权

指数合成
0—100可比较刻度

行业对比 · 公司趋势
邮政37.74 · 茅台6.22

图6-1 多元统计三步走:描述→相关→降维→指数

在指数构建中,PCA的具体用法是:对标准化后的词频矩阵执行PCA,取第一主成分的载荷(各词频指标在第一主成分上的系数)作为权重,合成综合得分。这一赋权方式与"专家打分"有着本质区别:专家打分,权重取决于打分者的主观判断;PCA赋权,权重由数据自身的结构所决定——权重大的指标,正是五个词频中共同变动最核心的部分。这与第7章指数构建的完整链路(词频→标准化→PCA→指数合成)一脉相承,本章聚焦的是方法本身:为什么标准化是PCA的前置工序、为什么取第一主成分。

先回答"为什么必须标准化":PCA找的是"方差最大的方向",而方差对量纲极其敏感——如果"数字技术应用"词频均值约120、"人工智能"仅约20,未标准化时前者对总方差的贡献天然更大,PCA会被高频维度"绑架"。标准化(Z-score)把每列变为均值0、标准差1后,五个维度在降维中才"平等发言"。不标准化,PCA就变成了"比谁数字大"的比赛——这是PCA使用中最常见、也最隐蔽的错误。

再回答"为什么取第一主成分":主成分按方差贡献从大到小排列,第一主成分解释了数据中最大的变异。在指数构建的场景里,第一主成分载荷的正负与大小,刻画了五个词频维度的"共同因子"——这个共同因子,在业务上就是"数字化转型程度"。当然,第一主成分并非永远足够:当第一主成分方差贡献率偏低(如不足50%)时,说明维度间结构松散,需要结合第二主成分或重新审视指标体系——方法的选择,永远要回到数据本身去检验。

指数合成与行业对比:让数字可比较

得到各企业的综合得分后,做两步收尾:指数合成——把得分线性变换为0—100的指数值;归一化——保证不同行业、不同年份可比。最终,每家上市公司都有一个数字化转型指数。平台实测的行业均值显示:邮政业37.74、软件和信息技术服务业36.85、互联网和相关服务业26.89、文化艺术业22.35、体育19.46(2025年报口径,平台实测)[7]——行业之间的差距,就是多元统计"压缩"出来的可比较刻度:词频无法直接比较(量纲不同),指数可以。指数还支持时间维度上的比较:输入一家公司代码,可以看到它1999—2025年的指数走势(如贵州茅台2025年指数6.22),以及它所在行业的平均走势——一家公司的转型轨迹,在时间轴上被完整地"画"了出来。

在平台上验证:多元统计三步走

打开数字化转型指数平台(数字化转型指数平台),输入一家公司代码(如600519 贵州茅台),查看它的历年指数走势与统计分析:最高指数38.08、最低指数0.00、平均指数10.22、指数增长+6.22(2025年指数6.22)。五个维度与指数的相关系数(云计算0.5572、人工智能0.414、区块链0.5631、大数据0.2454、数字化应用0.5798)与行业均值(邮政业37.74、软件和信息技术服务业36.85、互联网和相关服务26.89),则来自数字化转型指数API的维度相关与行业概览端点。你会看到:一个数字背后,是描述统计、相关分析、主成分分析三层方法的接力。

图6-2 上市公司数字化转型指数查询系统页面渲染:按股票代码查询历年指数趋势

图6-2 上市公司数字化转型指数查询系统页面渲染

第二节 分类预测建模:以信贷违约风险为例

这一节的核心主张:分类预测回答的是"这件事会不会发生"——logistic回归把借款人特征映射成违约概率,是可解释性最强的分类模型之一;信贷违约风险分析正是"特征→概率→决策"的标准范式。

从多元统计到分类预测

多元统计回答"变量之间什么关系",分类预测回答"这个人会不会违约"——后者是前者的延伸:把"关系"变成"判断"。信贷场景是分类预测最经典的舞台:银行收到一笔贷款申请,要回答的问题是"这笔贷款违约的概率有多大"。模型给出的答案,是一个介于0与1之间的概率值,从而避免了"放行或拒绝"的非此即彼——概率化的输出,让决策有了灰度空间:概率低于30%放行、高于60%拒绝、中间地带人工审核。

这里需要先厘清一个概念:分类预测与前面的指数构建,同属"从数据到结论"的统计建模,但目标形态不同。指数构建输出的是连续得分(0—100,用于排序与比较),分类预测输出的是类别概率(0—1,用于判断与决策)——一个回答"程度",一个回答"会不会"。理解这个区别,你就知道该把问题归入哪一类方法:比高低用指数,做判断用概率。

logistic回归:把特征变成概率

分类预测的模型很多,logistic回归(逻辑回归)是其中可解释性最强的:它直接把多个特征(收入、负债、逾期次数、征信查询次数……)的线性组合,通过logistic函数映射到0—1区间,输出违约概率。这一方法的数学形式由Berkson在1944年引入统计学[4],此后成为生物医学、金融风控等领域分类建模的标准工具——Hosmer与Lemeshow在2000年出版的《Applied Logistic Regression》系统总结了logistic回归的方法论,至今仍是该领域的经典教材[8]

logistic回归的数学形式值得写出来感受一下:设特征为X₁、X₂……Xₖ,模型先计算线性组合 Z = β₀ + β₁X₁ + β₂X₂ + … + βₖXₖ,再用logistic函数 p = 1 / (1 + e⁻ᶻ) 把Z映射到0—1区间——Z越大,违约概率p越接近1;Z越小,p越接近0。这个"先线性组合、再S形映射"的结构,让模型同时拥有了两个优点:线性部分的系数β可直接解读(每个特征对违约概率的拉动方向与强度一目了然),输出又是概率(天然适合决策阈值)。

p < 30%30% p < 60%p 60%

借款人特征
26个:金额·收入·逾期
征信查询·负债·用途

线性组合
Z = β₀ + β₁X₁ + …

logistic函数
p = 1/(1 + e⁻ᶻ)

违约概率p
0—1区间

概率阈值判断

🟢 低风险
建议通过

🟡 中风险
人工审核

🔴 高风险
建议拒绝

图6-3 logistic回归:从特征到违约概率再到决策

logistic回归的独特价值在于"可解释":每一个特征都有一个系数β,系数越大,该特征对违约概率的拉动越强——这在监管严格的信贷场景中至关重要:银行拒绝一笔贷款,必须说得清"为什么"。平台实测的特征重要性排序(逻辑回归下为|β|排序)显示,贷款金额、收入、逾期次数等特征位居前列——这些系数就是模型说出的"理由"。相比之下,随机森林等树模型精度可能更高,但"为什么拒贷"难以追溯。可解释性,是风控模型的硬约束,也是logistic回归在信贷场景不可替代的原因。

类别不平衡:违约样本太少了怎么办

信贷数据有一个天然难题:违约样本稀少。平台实测的训练集里,违约样本占比仅约2%——如果直接建模,模型会"偷懒":全部预测为"不违约"也有98%的准确率,但这样的模型毫无用处。解决办法是过采样:SMOTE(合成少数类过采样技术)在少数类样本之间插值生成新样本,把违约样本平衡到约50%[9]。Chawla等人在2002年提出SMOTE,至今仍是处理类别不平衡的主流方法[9]"准确率会骗人"是风控建模的第一课:样本不平衡时,准确率形同虚设,须以召回率(违约的客户被抓住多少)与AUC(模型区分能力)为准绳。

但过采样也带来一个必须正视的问题:SMOTE生成的样本,本质上是"插值"合成的,现实中并无对应的真实违约事件。它解决的是"模型见过足够多违约样本"的训练问题,却无法凭空增加现实中违约事件的信息量。因此,过采样后的模型必须回到真实测试集上验证——平台的做法正是如此:SMOTE只在训练集上应用,测试集(1999条真实样本)保持原样,模型的预测违约率(实测约12.86%)才是真实数据上的表现。这是"数据增强"与"数据造假"的分界线:增强的是训练过程,检验的永远是真实数据。

模型好不好,还要看评估指标。二分类模型的评估有四个基本指标:准确率(预测正确的比例,但样本不平衡时会"骗人")、精确率(预测为违约中真正违约的比例,衡量"抓得准")、召回率(真正违约中被抓出来的比例,衡量"抓得全")、AUC(ROC曲线下面积,衡量模型区分违约与不违约的整体能力,与阈值无关)。风控场景的取舍通常是:宁可"错杀"(精确率低一点),不可"漏网"(召回率必须高)——放过一个违约者造成的损失,远大于误拒一个优质客户。这提示我们:指标的选择背后是业务的价值判断,统计方法始终服务于业务目标,次序不可颠倒。

在平台上验证:信贷违约风险分析

打开信贷违约风险分析平台(https://zhenyuonline.cn/credit-prediction/),左侧选择"逻辑回归(Logistic)"模型——平台已内置逻辑回归与随机森林两个模型,默认逻辑回归。在"手动输入评估"页填写一个申请人的特征(贷款金额、期限、月收入、逾期次数、征信查询次数、总负债等),点击"评估信贷风险",平台返回三组结果:违约概率(如0.55%)、风险等级(🟢低风险/🟡中风险/🔴高风险)、审核建议(建议通过/需人工审核/建议拒绝),并给出Top10重要风险特征(逻辑回归下为特征系数的绝对值)。再切换到"测试集批量查看",观察1999条测试样本的预测违约率与高风险申请列表;最后在"模型概览"对比逻辑回归与随机森林的特征重要性排序——你会发现:逻辑回归的系数直接给出了"哪个特征在推动风险",而随机森林的树结构难以这样直接解读。 把模型切换到"随机森林",重新评估同一笔申请——概率会变化,但"为什么"变得模糊了。你会理解:一个"建议拒绝"的按钮背后,是logistic回归把26个特征压缩成一个概率,再按阈值转化为决策的完整链条。

图6-4 信贷违约风险分析平台页面渲染:逻辑回归违约概率与风险等级

图6-4 信贷违约风险分析平台页面渲染

第三节 金融计量与估值:CAPM、DDM、FCFF与VaR

这一节的核心主张:金融计量回答的是"值多少钱、险不险"——CAPM给风险定价,DDM与FCFF给价值定量,VaR给风险一个数字;股票估值应用把四者串成"行情→参数→估值→判断"的完整链路。

从概率到定价:金融计量的任务

前两节解决了"数据在说什么"(描述与相关)与"会发生什么"(分类预测),金融计量则回答更深一层的问题:"它值多少钱?风险有多大?" 金融资产没有"标准答案",只有"模型答案"——股价30元的茅台,是贵还是便宜?需要模型。金融计量就是"用统计方法给资产定价与度量风险"的学科,其核心工具是半个多世纪前确立的经典模型。

CAPM:给风险定价

资本资产定价模型(CAPM)回答"必要收益率r该是多少":r = Rf + β × (Rm − Rf)——Rf是无风险利率,Rm是市场收益率,β是股票对市场波动的敏感度。Sharpe在1964年提出这一模型,其核心洞见是:投资者承担的风险分两类——可分散的个股风险(不该有额外回报)与不可分散的系统风险(该有额外回报),β度量的正是系统风险[5]β>1的股票波动大于市场(进攻型),β<1的股票波动小于市场(防守型)——这个判断直接进入估值与风险测评。在股票估值平台上,β由近180天个股与沪深300的协方差计算,并做了贝叶斯收缩(样本越少越向市场均值1.0收缩),确保小样本下的稳健性。贝叶斯收缩的哲学值得体会:数据不足时,模型选择"相信市场平均"而非"相信有限样本"——这是统计中"先验"思想的朴素应用,也是小样本环境下避免过度拟合的通用策略。

DDM与FCFF:给价值定量

有了必要收益率r,下一步是给价值定量。DDM(股利贴现模型) 的基本思想:股票的价值等于其未来所有股利的现值之和。对稳定分红的公司,模型简化为戈登增长模型:V = D₁ / (r − g)——D₁是下期预期股利,g是股利增长率[6]FCFF(自由现金流贴现模型) 则把视角从"股利"扩展到"公司全部自由现金流":EV = FCFF₁ / (WACC − g),再减去净债务得到股权价值——它适用于不分红或分红不稳定的公司。两个模型互为补充:DDM看股东拿到手的钱,FCFF看公司整体创造的价值。

这里藏着一个值得品味的细节:所有估值模型,本质上都是"把未来折回现在"。为什么未来的100元不如现在的100元值钱?因为钱有时间价值——现在的100元可以投资生息,未来的100元要承担不确定性。折现率r就是"时间价格"的度量:r越高,未来的钱折回现在越少,估值越低。这也解释了为什么高增长公司(g大)估值反而可能失效:当g接近甚至超过r时,折现公式的分母趋近于零,估值会爆炸式增长——模型在提醒你:永续高增长是不现实的假设,这正是平台对高ROE股(如宁德时代)显示N/A的原因。

行情数据
实时价格 · 财务参数

β计算
180天协方差+贝叶斯收缩

CAPM
r = Rf + β×(Rm−Rf)
给风险定价

DDM
V = D₁/(r−g)
股利贴现

FCFF
EV = FCFF₁/(WACC−g)
自由现金流

综合估值
均值 · 对比现价

判断:低估/合理/高估
+ β·波动率风险画像

图6-5 金融计量估值链:CAPM给风险定价,DDM/FCFF给价值定量

平台实测贵州茅台(600519):DDM估值1383.65元、CAPM估值3558.98元、FCFF估值2699.95元、综合估值2547.53元,当前价约1300元,判定"低估"(diff≈96%)——三个模型给出了不同视角的价值锚点,综合判断避免单一模型的盲区[10]。值得强调的是,模型之间的差异本身就是信息:DDM只认股利(茅台分红稳定,估值保守),CAPM用收益贴现(估值激进),FCFF覆盖全部现金流(居中)——三个模型的分歧,恰好暴露了各自假设的边界。

VaR:给风险一个数字

价值之外,还要回答"险不险"。VaR(Value at Risk,在险价值) 度量"在给定置信水平下,未来一定时期内资产的最大可能损失"——例如"95%置信水平下,日VaR为2%"表示:有95%的把握,明天亏损不超过组合价值的2%。Jorion在2007年出版的《Value at Risk》系统阐述了VaR的参数法、历史模拟法与蒙特卡洛模拟法,使其成为金融机构风险管理的行业标准[11]

三种方法的思路各不相同,值得辨析:参数法假设收益率服从正态分布,用均值与标准差(波动率)直接算出分位数——计算最快,但"肥尾"(极端值比正态分布更常见)会让它低估风险;历史模拟法不做分布假设,直接用过去N天的实际收益率排序取分位数——简单直观,但依赖历史数据覆盖了足够的极端情形;蒙特卡洛模拟法用随机数生成大量可能路径,模拟组合的未来损益分布——最灵活,也最昂贵。VaR的价值在于把"风险"这个模糊概念变成一个数字——管理层可以据此设定风险限额,监管机构可以据此要求资本充足。但VaR也有众所周知的盲区:它度量的是"正常市场下的最大损失",回答不了"百年一遇的危机亏多少"——这是事后被多次证明的教训,也是压力测试(情景分析)存在的理由。

在股票估值平台上,β与波动率是VaR参数法的输入变量:β衡量系统性风险(相对市场),波动率衡量整体风险(自身波动)——理解这两个参数,就理解了VaR的计算逻辑。估值告诉你"值多少",风险度量告诉你"险不险"——完整的金融分析,两者缺一不可。

在平台上验证:估值与风险测评

打开股票估值平台(https://zhenyuonline.cn/stock-valuation/),输入"600519"(贵州茅台),观察自动估值流程:数据采集(实时行情与财务参数从何处来)、β计算(180天协方差与贝叶斯收缩)、模型计算(DDM/CAPM/FCFF三个模型的结果)、综合判断(综合估值2547.53元 vs 现价,判定低估)。再输入一只高β的科技股对比:观察β不同如何改变估值结论与风险画像——这就是CAPM在真实数据上的样子。 再打开"教学"页,查看DDM与CAPM的公式卡片、动态参数说明与常见误区,用Agent对话问一句"为什么宁德时代显示N/A?"——模型会解释:高ROE股的增长率g可能高于折现率r,单阶段模型失效。你会看到:估值的要义,在于用模型回答"这个价格合理吗"——CAPM给风险定价,DDM/FCFF给价值定量,VaR给风险一个数字。

图6-6 股票估值平台页面渲染:DDM/CAPM/FCFF综合估值与风险画像

图6-6 股票估值平台页面渲染

章末小结与追问

本章回答了"数据到手之后,怎么让数据说话"这个核心问题。第一节建立多元统计的方法链——描述统计认识数据(均值、标准差)、相关分析发现关系(皮尔逊相关系数,指数五维度与指数正相关0.41—0.58)、主成分分析压缩维度(PCA第一主成分载荷赋权,Hotelling 1933),以数字化转型指数为例,从33个词频指标到1个0—100指数。第二节建立分类预测的范式——logistic回归把特征变成概率(Berkson 1944、Hosmer & Lemeshow 2000),SMOTE解决类别不平衡(Chawla 2002),以信贷违约风险为例,从26个特征到违约概率与风险等级。第三节建立金融计量的框架——CAPM给风险定价(Sharpe 1964)、DDM与FCFF给价值定量(Gordon 1959)、VaR给风险一个数字(Jorion 2007),以股票估值为例,从行情数据到综合估值与风险画像。统计分析方法千千万,本质只有一件事:让数据经过方法的检验,变成可信的结论。

把三节放在一起看,会浮现一个贯穿全章的判断:方法的威力,系于"问题与方法是否匹配"。多元统计适合"多变量如何共同作用",分类预测适合"事件会不会发生",金融计量适合"资产值多少、险不险"——用错了场景,再精密的方法也会给出误导性的答案。这提醒我们:数智分析的第一能力,在于判断"眼前的问题属于哪一类";至于会调用多少种方法,倒在其次。平台的零代码化让"调用方法"变得极其廉价,反而让"选择方法"的判断变得空前珍贵——这正是第一章所说"从工具到技能"在统计层面的回响:工具负责算,你负责懂。

这条链的思想源头可以追溯到统计学的奠基时刻:Pearson在1901年种下的主成分思想[2],今天在数字化转型指数里长成5467家企业的得分;Berkson在1944年引入的logistic函数[4],今天在信贷平台上决定一笔贷款的去留;Sharpe在1964年写下的定价公式[5],今天在估值平台上回答"茅台贵不贵"。方法的寿命,比工具长得多——平台会迭代,公式不会过时。 而本书所倡导的零代码实训,正是要让这些百年方法走下学术神坛、走进每一个普通学习者的工具箱:不要求你推导公式,但要求你理解每个按钮背后的道理——理解了道理,你才真正拥有了方法。

留三个问题给你想一想:

  1. 数字化转型指数的五个词频维度与指数全部正相关(0.41—0.58)——这个结果说明了什么?如果某个维度与指数负相关,你会怎么处理?
  2. 信贷数据违约样本占比约2%,SMOTE把它平衡到50%——过采样会不会引入"假数据"?你怎么判断过采样后的模型是否可信?
  3. 茅台综合估值2547元、现价约1300元,模型判定"低估"——但市场为什么不买账?模型与市场谁错了?估值模型的边界在哪里?

参考文献

  1. [1] 中国信息通信研究院. 大数据白皮书[R]. 北京: 中国信息通信研究院, 2019.
  2. [2] Pearson K. On lines and planes of closest fit to systems of points in space[J]. The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science, 1901, 2(11): 559-572.
  3. [3] Hotelling H. Analysis of a complex of statistical variables into principal components[J]. Journal of Educational Psychology, 1933, 24(6): 417-441.
  4. [4] Berkson J. Application of the logistic function to bio-assay[J]. Journal of the American Statistical Association, 1944, 39(227): 357-365.
  5. [5] Sharpe W F. Capital asset prices: A theory of market equilibrium under conditions of risk[J]. The Journal of Finance, 1964, 19(3): 425-442.
  6. [6] Gordon M J. Dividends, earnings, and stock prices[J]. The Review of Economics and Statistics, 1959, 41(2): 99-105.
  7. [7] 数字化转型指数项目. 基于SmartBI的上市公司数字化转型指数可查询报告大数据平台项目报告[R]. 2026.(第十六届三创赛商务大数据分析实战赛获奖作品,见数字教材"参赛获奖"附录)
  8. [8] Hosmer D W, Lemeshow S. Applied Logistic Regression[M]. 2nd ed. New York: John Wiley & Sons, 2000.
  9. [9] Chawla N V, Bowyer K W, Hall L O, et al. SMOTE: Synthetic minority over-sampling technique[J]. Journal of Artificial Intelligence Research, 2002, 16: 321-357.
  10. [10] 股票估值应用. 实训平台 stock-valuation 实测数据[EB/OL]. 2026-08-18.
  11. [11] Jorion P. Value at Risk: The New Benchmark for Managing Financial Risk[M]. 3rd ed. New York: McGraw-Hill, 2007.
  12. [12] Heath T L. A History of Greek Mathematics[M]. Oxford: Clarendon Press, 1921.
  13. [13] Tukey J W. Exploratory Data Analysis[M]. Reading: Addison-Wesley, 1977.
  14. [14] Anscombe F J. Graphs in statistical analysis[J]. The American Statistician, 1973, 27(1): 17-21.

数据与平台:本章实训绑定 zhenyuonline.cn 三大真实应用——数字化转型指数平台、信贷违约风险分析平台、股票估值平台。页面渲染图均为平台实测截图。