简介:这份SPSS相关分析与回归分析PPT课件面向统计学、数据分析初学者及需要完成课程作业或论文实证的高校学生,帮助系统掌握变量间关系的测度与建模方法。课件围绕相关分析与回归分析两大主线展开,涵盖函数关系与统计关系的区分、线性与非线性相关类型、散点图绘制、Pearson与Spearman及Kendall三种相关系数的计算与检验,以及回归模型的适用性检验、参数检验和非线性回归等内容,并配有SPSS菜单操作步骤与人均GDP与移动电话普及率等应用举例。资源包共1个pptx文件,约348KB,结构紧凑,按概述、相关分析、回归分析等模块逐页推进,共68页,便于课堂讲授或自学对照。目前已有94人学习,适合希望用一份课件快速理清相关与回归分析知识框架、并同步掌握SPSS操作路径的读者参考使用。
1. 从一份 68 页课件说起:相关分析与回归分析到底在解决什么问题
很多人第一次打开 SPSS 的相关分析菜单,是被导师或业务方一句“看看这两个变量有没有关系”推过去的。点完Analyze -> Correlate -> Bivariate,出来一张相关系数矩阵,看到 0.83 就以为大功告成,结果被追问“控制了收入之后还相关吗”“这个关系是线性的吗”就答不上来。这份 68 页的 SPSS 相关分析与回归分析课件,价值恰恰在于它把这条链路拆得很细:先讲相关关系与函数关系的区别,再讲散点图与相关系数,接着是偏相关、回归模型检验、适用性判断,最后落到非线性回归。
它适合三类人:一是统计课要交作业、需要照着菜单一步步复现的学生;二是做用户增长、运营分析,手里有 Excel 或 CSV 但不确定该用 Pearson 还是 Spearman 的从业者;三是已经会用lm()但想搞清楚 SPSS 输出表里每个数字含义的人。核心结论先摆在这:相关分析只回答“强弱和方向”,回归分析才回答“变化多少”,而偏相关回答的是“排除干扰后还剩多少”。三者不能互相替代,选错方法比算错数字更致命。
2. 相关分析:散点图、Pearson 与 Spearman 的选型逻辑
2.1 先画散点图,再谈相关系数
课件里把“绘制散点图”放在“计算相关系数”之前,这个顺序不是排版随意。相关系数是一个被压缩成单值的指标,它会掩盖非线性、离群点和分组结构。Anscombe 四组数据就是经典反例:四组数据的相关系数都约等于 0.816,但散点图形状完全不同。所以正确流程是先用图形看形态,再用系数定量。
SPSS 里的操作路径是Graphs -> Legacy Dialogs -> Scatter/Dot -> Simple Scatter。把自变量放 X 轴、因变量放 Y 轴,如果数据里有省份、行业这类分类字段,可以放进Set Markers by,用不同颜色区分;想把省份名称直接标在点上,放进Label Cases by。这一步做完,你至少能判断三件事:关系是不是单调、有没有明显的弯折、有没有一两个点孤零零地飘在外面。
2.2 Pearson、Spearman、Kendall 怎么选
课件把三种相关系数的适用场景讲得很清楚,但实际选型时容易混。判断依据是变量的测量尺度,而不是“哪个结果显著用哪个”。
| 相关系数 | 适用数据类型 | 前提假设 | 典型场景 |
|---|---|---|---|
| Pearson | 定距/定比连续变量 | 线性关系、近似正态、无极端值 | 人均 GDP 与移动电话普及率 |
| Spearman | 定序变量,或连续但非正态 | 单调关系即可 | 年龄段与收入段、职称与受教育年限 |
| Kendall | 定序变量,样本量较小 | 单调关系,基于一致对 | 小样本排序一致性、评委打分 |
Pearson 的公式是协方差除以两个标准差的乘积,本质是标准化后的共变程度。Spearman 则是把原始值换成秩之后再算 Pearson,所以它对极端值不敏感,只要单调关系成立就能捕捉。Kendall 用的是“一致对”和“非一致对”的差值,样本量小的时候比 Spearman 更稳健,但计算量随 n 平方增长。
2.3 用 SPSS 语法批量算相关系数
菜单点一次只能出一张表,做多组变量时用语法更省事。下面这段语法同时输出 Pearson 和 Spearman,并带上均值、标准差和协方差:
CORRELATIONS /VARIABLES=GDP phone_penetration income consumption /PRINT=TWOTAIL NOSIG /STATISTICS=DESCRIPTIVES XPROD /MISSING=PAIRWISE. NONPAR CORR /VARIABLES=age income education /PRINT=SPEARMAN TWOTAIL NOSIG /MISSING=PAIRWISE./PRINT=TWOTAIL NOSIG表示输出双尾检验但隐藏显著性标记,适合先看整体;/STATISTICS=DESCRIPTIVES XPROD会额外给出均值、标准差、离差平方和与协方差,方便手算验证;/MISSING=PAIRWISE是成对剔除缺失值,比整行剔除保留更多样本,但要注意不同变量对的 n 可能不同。NONPAR CORR是专门算非参数相关的命令,/PRINT=SPEARMAN指定输出 Spearman,换成KENDALL就是 Kendall。
2.4 相关系数检验与 p 值的正确读法
课件强调“抽样的随机性、样本容量小”会导致样本相关不能直接推断总体相关,所以必须做检验。SPSS 输出里每个系数后面跟着Sig.,就是相伴概率 p。判断规则是:p ≤ α 拒绝零假设(总体零相关),p > α 不能拒绝。输出里的*表示 p ≤ 0.05,**表示 p ≤ 0.01,**比*更可靠。
这里有个常见误用:把 p 值当成相关强度的证据。p 小只说明“不太可能是零相关”,不代表关系强。样本量上万时,r = 0.05 也可能显著。所以报告时要同时给 r 和 p,再结合散点图。另外,课件特别提醒极端值的影响:(1,1)(2,2)(3,3)(4,4)(5,5)(6,1)这组数据 r 只有 0.33,但去掉最后一个点就是完全正相关。遇到这种情况,先查数据录入错误,再考虑用 Spearman 或稳健方法。
3. 偏相关分析:控制混杂变量后的“净相关”
3.1 虚假相关是怎么产生的
课件举了两个例子:小学生速算比赛里身高和分数的相关,其实受年龄影响;商品需求量和价格的相关,混入了消费者收入的作用。这类“看起来相关、实际是第三个变量在推动”的现象就是虚假相关。偏相关的作用,就是在统计上把控制变量“固定住”,再看两个目标变量还剩多少相关。
一阶偏相关的公式是:
r_xy.z = (r_xy - r_xz * r_yz) / sqrt((1 - r_xz^2)(1 - r_yz^2))分子是原始相关减去两条“绕路”相关的乘积,分母是两条绕路的残差标准化。直观理解:先把 x 和 y 各自对 z 做回归,取残差,再算两个残差的相关。控制变量越多,阶数越高,公式越复杂,但 SPSS 会直接算。
3.2 SPSS 偏相关操作与语法
菜单路径是Analyze -> Correlate -> Partial。把要分析的两个变量放进Variables,把控制变量放进Controlling for。语法版本:
PARTIAL CORR /VARIABLES=demand price BY income /SIGNIFICANCE=TWOTAIL /STATISTICS=DESCRIPTIVES /MISSING=LISTWISE./VARIABLES=demand price BY income里,BY前面是目标变量对,后面是控制变量。/STATISTICS=DESCRIPTIVES输出均值、标准差和样本量,方便判断控制后样本是否骤减。/MISSING=LISTWISE是整行剔除,偏相关对缺失值敏感,因为每个控制变量都要参与计算,成对剔除会导致不同阶数的样本不一致,所以这里用整行剔除更稳妥。
3.3 偏相关结果的解读边界
偏相关输出的是r、自由度df和Sig.。自由度等于 n - 2 - 控制变量个数。解读时要注意:控制变量本身如果和目标变量高度共线,偏相关会不稳定,甚至出现符号反转。比如收入和价格高度相关时,控制收入后需求量和价格的偏相关可能从负变正,这不是数据错了,而是“净效应”和“总效应”本来就可以不同。
提示:偏相关只能控制你测量到的变量。没测到的混杂因素,偏相关无能为力。所以报告偏相关时,要说明控制了哪些变量,以及为什么选这些变量。
4. 线性回归:模型检验、适用性与 SPSS 输出精读
4.1 从相关到回归:表达式与最小二乘
相关分析给出 r,回归分析给出方程y = b0 + b1*x1 + ... + bk*xk + e。SPSS 用最小二乘法估计系数,目标是让残差平方和最小。菜单路径Analyze -> Regression -> Linear,把因变量放Dependent,自变量放Independent(s)。语法:
REGRESSION /DESCRIPTIVES MEAN STDDEV CORR SIG N /MISSING LISTWISE /STATISTICS COEFF OUTS R ANOVA CHANGE /CRITERIA=PIN(.05) POUT(.10) /NOORIGIN /DEPENDENT consumption /METHOD=ENTER income age education./METHOD=ENTER是强制进入法,所有自变量同时进入,适合理论驱动的研究;/STATISTICS=COEFF OUTS R ANOVA CHANGE输出系数、模型摘要、方差分析表和 R 方变化量;/CRITERIA=PIN(.05) POUT(.10)是逐步回归的进入和剔除标准,用 ENTER 时不生效,但保留着方便切换。
4.2 模型检验三张表怎么读
SPSS 回归输出核心是三张表。第一张Model Summary给 R、R 方、调整 R 方和标准误。R 方是解释的变异比例,调整 R 方惩罚了自变量个数,做多元回归时看调整 R 方更靠谱。第二张ANOVA给 F 统计量和Sig.,检验的是“所有系数是否同时为零”,F 显著只说明模型整体有用,不代表每个自变量都显著。第三张Coefficients给每个变量的 B、标准误、Beta、t 和Sig.。B 是未标准化系数,带单位;Beta 是标准化系数,可以跨变量比较相对重要性。
课件里提到的“回归模型的适用性检验”,在 SPSS 里主要看残差。Plots选项里勾选Histogram和Normal probability plot看正态性,勾选ZRESID对ZPRED看残差是否随机分布。如果残差图呈喇叭形,说明方差不齐;呈 U 形,说明线性假设不成立,该考虑非线性项了。
4.3 多重共线性与异常值排查
多元回归最容易踩的坑是共线性。SPSS 在Statistics里勾选Collinearity diagnostics,会输出 VIF 和 Tolerance。经验规则:VIF > 10 或 Tolerance < 0.1 就要警惕。处理办法是删掉冗余变量、合并变量,或者改用岭回归、主成分回归。
异常值用Casewise diagnostics看,默认标记标准化残差超过 ±3 的个案。发现异常值先别急着删,查清楚是录入错误还是真实极端情况。真实极端值可以考虑稳健回归,或者单独报告敏感性分析。
REGRESSION /MISSING LISTWISE /STATISTICS COEFF OUTS R ANOVA COLLIN TOL /CRITERIA=PIN(.05) POUT(.10) /NOORIGIN /DEPENDENT consumption /METHOD=ENTER income age education /RESIDUALS DURBIN HISTOGRAM(ZRESID) NORMPROB(ZRESID) /CASEWISE PLOT(ZRESID) OUTLIERS(3).COLLIN TOL输出共线性诊断,DURBIN输出 Durbin-Watson 统计量检验残差自相关(接近 2 为佳),CASEWISE OUTLIERS(3)列出标准化残差超过 3 的个案。
5. 非线性回归与模型比较:从多项式到曲线估计
5.1 什么时候该放弃线性模型
残差图出现系统性弯曲、散点图明显不是直线、理论上有饱和或加速效应时,线性模型就不够用了。课件提到的多项式回归、指数回归、对数回归,在 SPSS 里对应Analyze -> Regression -> Curve Estimation。这个菜单可以一次拟合线性、对数、二次、三次、指数、幂等多种曲线,并输出各自的 R 方,方便比较。
CURVEFIT /VARIABLES=demand price /CONSTANT /MODEL=LINEAR QUADRATIC CUBIC EXPONENTIAL LOGARITHMIC POWER /PLOT FIT./MODEL后面列出要拟合的曲线类型,/PLOT FIT会画出拟合曲线叠加在散点图上。输出里比较各模型的 R 方和 F 值,但要注意:不同曲线类型的因变量变换方式不同,R 方不能直接跨类型比较。比如指数模型实际拟合的是ln(y),它的 R 方是变换后的,和线性模型的 R 方不在同一尺度。稳妥做法是看拟合图,或者把预测值还原到原始尺度再算 RMSE。
5.2 多项式回归的阶数与过拟合
多项式回归用y = b0 + b1*x + b2*x^2 + ...逼近曲线。阶数越高拟合越灵活,但过拟合风险越大。常见做法是先用二次项看有没有显著改善,再考虑三次。SPSS 里可以用Transform -> Compute Variable生成x**2、x**3,再放进线性回归;也可以直接用 Curve Estimation 的 QUADRATIC、CUBIC。
判断是否过拟合,看调整 R 方是否随阶数增加而持续上升,以及高阶项系数是否显著。如果三次项不显著、调整 R 方也没提升,就退回二次。另一个技巧是中心化:把 x 减去均值再平方,可以降低高阶项和低阶项之间的共线性,让系数更稳定。
5.3 用嵌套模型 F 检验比较拟合优度
比较两个嵌套模型(比如线性 vs 二次),不能只看 R 方变大,要用 F 检验。公式是:
F = ((RSS_small - RSS_big) / (df_small - df_big)) / (RSS_big / df_big)SPSS 线性回归的R Square Change表在/STATISTICS=CHANGE时输出,直接给出 R 方变化量、F 变化量和显著性。操作上分两步:第一步只放线性项,第二步加入二次项,看 Change Statistics 里的Sig. F Change。如果小于 0.05,说明二次项带来了显著改善。
注意:非线性回归的系数解释和线性不同。二次项系数为正表示开口向上,为负表示开口向下,拐点在
-b1/(2*b2)。报告时要结合业务含义说明拐点位置,而不是只报显著性。
5.4 一个可复现的完整流程
把上面的步骤串起来,一个完整的分析流程是:先Graphs -> Scatter看形态;用CORRELATIONS算 Pearson 和 Spearman;有混杂变量就上PARTIAL CORR;确定线性关系后用REGRESSION建模型,读 Model Summary、ANOVA、Coefficients 三张表,查 VIF 和残差图;残差有弯曲就转CURVEFIT比较曲线,或用多项式加项做嵌套 F 检验。每一步都保留语法文件,换一批数据只需改/VARIABLES和/DEPENDENT,这是用 SPSS 做可复现分析最省力的方式。
本文还有配套的精品资源,点击获取