news 2026/9/19 18:55:54

SPSS相关分析与回归分析:从散点图到非线性模型的完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
SPSS相关分析与回归分析:从散点图到非线性模型的完整指南

简介:这份SPSS相关分析与回归分析PPT课件面向统计学、数据分析初学者及需要完成课程作业或论文实证的高校学生,帮助系统掌握变量间关系的测度与建模方法。课件围绕相关分析与回归分析两大主线展开,涵盖函数关系与统计关系的区分、线性与非线性相关类型、散点图绘制、Pearson与Spearman及Kendall三种相关系数的计算与检验,以及回归模型的适用性检验、参数检验和非线性回归等内容,并配有SPSS菜单操作步骤与人均GDP与移动电话普及率等应用举例。资源包共1个pptx文件,约348KB,结构紧凑,按概述、相关分析、回归分析等模块逐页推进,共68页,便于课堂讲授或自学对照。目前已有94人学习,适合希望用一份课件快速理清相关与回归分析知识框架、并同步掌握SPSS操作路径的读者参考使用。

1. 从一份 68 页课件说起:相关分析与回归分析到底在解决什么问题

很多人第一次打开 SPSS 的相关分析菜单,是被导师或业务方一句“看看这两个变量有没有关系”推过去的。点完Analyze -> Correlate -> Bivariate,出来一张相关系数矩阵,看到 0.83 就以为大功告成,结果被追问“控制了收入之后还相关吗”“这个关系是线性的吗”就答不上来。这份 68 页的 SPSS 相关分析与回归分析课件,价值恰恰在于它把这条链路拆得很细:先讲相关关系与函数关系的区别,再讲散点图与相关系数,接着是偏相关、回归模型检验、适用性判断,最后落到非线性回归。

它适合三类人:一是统计课要交作业、需要照着菜单一步步复现的学生;二是做用户增长、运营分析,手里有 Excel 或 CSV 但不确定该用 Pearson 还是 Spearman 的从业者;三是已经会用lm()但想搞清楚 SPSS 输出表里每个数字含义的人。核心结论先摆在这:相关分析只回答“强弱和方向”,回归分析才回答“变化多少”,而偏相关回答的是“排除干扰后还剩多少”。三者不能互相替代,选错方法比算错数字更致命。

2. 相关分析:散点图、Pearson 与 Spearman 的选型逻辑

2.1 先画散点图,再谈相关系数

课件里把“绘制散点图”放在“计算相关系数”之前,这个顺序不是排版随意。相关系数是一个被压缩成单值的指标,它会掩盖非线性、离群点和分组结构。Anscombe 四组数据就是经典反例:四组数据的相关系数都约等于 0.816,但散点图形状完全不同。所以正确流程是先用图形看形态,再用系数定量。

SPSS 里的操作路径是Graphs -> Legacy Dialogs -> Scatter/Dot -> Simple Scatter。把自变量放 X 轴、因变量放 Y 轴,如果数据里有省份、行业这类分类字段,可以放进Set Markers by,用不同颜色区分;想把省份名称直接标在点上,放进Label Cases by。这一步做完,你至少能判断三件事:关系是不是单调、有没有明显的弯折、有没有一两个点孤零零地飘在外面。

2.2 Pearson、Spearman、Kendall 怎么选

课件把三种相关系数的适用场景讲得很清楚,但实际选型时容易混。判断依据是变量的测量尺度,而不是“哪个结果显著用哪个”。

相关系数适用数据类型前提假设典型场景
Pearson定距/定比连续变量线性关系、近似正态、无极端值人均 GDP 与移动电话普及率
Spearman定序变量,或连续但非正态单调关系即可年龄段与收入段、职称与受教育年限
Kendall定序变量,样本量较小单调关系,基于一致对小样本排序一致性、评委打分

Pearson 的公式是协方差除以两个标准差的乘积,本质是标准化后的共变程度。Spearman 则是把原始值换成秩之后再算 Pearson,所以它对极端值不敏感,只要单调关系成立就能捕捉。Kendall 用的是“一致对”和“非一致对”的差值,样本量小的时候比 Spearman 更稳健,但计算量随 n 平方增长。

2.3 用 SPSS 语法批量算相关系数

菜单点一次只能出一张表,做多组变量时用语法更省事。下面这段语法同时输出 Pearson 和 Spearman,并带上均值、标准差和协方差:

CORRELATIONS /VARIABLES=GDP phone_penetration income consumption /PRINT=TWOTAIL NOSIG /STATISTICS=DESCRIPTIVES XPROD /MISSING=PAIRWISE. NONPAR CORR /VARIABLES=age income education /PRINT=SPEARMAN TWOTAIL NOSIG /MISSING=PAIRWISE.

/PRINT=TWOTAIL NOSIG表示输出双尾检验但隐藏显著性标记,适合先看整体;/STATISTICS=DESCRIPTIVES XPROD会额外给出均值、标准差、离差平方和与协方差,方便手算验证;/MISSING=PAIRWISE是成对剔除缺失值,比整行剔除保留更多样本,但要注意不同变量对的 n 可能不同。NONPAR CORR是专门算非参数相关的命令,/PRINT=SPEARMAN指定输出 Spearman,换成KENDALL就是 Kendall。

2.4 相关系数检验与 p 值的正确读法

课件强调“抽样的随机性、样本容量小”会导致样本相关不能直接推断总体相关,所以必须做检验。SPSS 输出里每个系数后面跟着Sig.,就是相伴概率 p。判断规则是:p ≤ α 拒绝零假设(总体零相关),p > α 不能拒绝。输出里的*表示 p ≤ 0.05,**表示 p ≤ 0.01,***更可靠。

这里有个常见误用:把 p 值当成相关强度的证据。p 小只说明“不太可能是零相关”,不代表关系强。样本量上万时,r = 0.05 也可能显著。所以报告时要同时给 r 和 p,再结合散点图。另外,课件特别提醒极端值的影响:(1,1)(2,2)(3,3)(4,4)(5,5)(6,1)这组数据 r 只有 0.33,但去掉最后一个点就是完全正相关。遇到这种情况,先查数据录入错误,再考虑用 Spearman 或稳健方法。

3. 偏相关分析:控制混杂变量后的“净相关”

3.1 虚假相关是怎么产生的

课件举了两个例子:小学生速算比赛里身高和分数的相关,其实受年龄影响;商品需求量和价格的相关,混入了消费者收入的作用。这类“看起来相关、实际是第三个变量在推动”的现象就是虚假相关。偏相关的作用,就是在统计上把控制变量“固定住”,再看两个目标变量还剩多少相关。

一阶偏相关的公式是:

r_xy.z = (r_xy - r_xz * r_yz) / sqrt((1 - r_xz^2)(1 - r_yz^2))

分子是原始相关减去两条“绕路”相关的乘积,分母是两条绕路的残差标准化。直观理解:先把 x 和 y 各自对 z 做回归,取残差,再算两个残差的相关。控制变量越多,阶数越高,公式越复杂,但 SPSS 会直接算。

3.2 SPSS 偏相关操作与语法

菜单路径是Analyze -> Correlate -> Partial。把要分析的两个变量放进Variables,把控制变量放进Controlling for。语法版本:

PARTIAL CORR /VARIABLES=demand price BY income /SIGNIFICANCE=TWOTAIL /STATISTICS=DESCRIPTIVES /MISSING=LISTWISE.

/VARIABLES=demand price BY income里,BY前面是目标变量对,后面是控制变量。/STATISTICS=DESCRIPTIVES输出均值、标准差和样本量,方便判断控制后样本是否骤减。/MISSING=LISTWISE是整行剔除,偏相关对缺失值敏感,因为每个控制变量都要参与计算,成对剔除会导致不同阶数的样本不一致,所以这里用整行剔除更稳妥。

3.3 偏相关结果的解读边界

偏相关输出的是r、自由度dfSig.。自由度等于 n - 2 - 控制变量个数。解读时要注意:控制变量本身如果和目标变量高度共线,偏相关会不稳定,甚至出现符号反转。比如收入和价格高度相关时,控制收入后需求量和价格的偏相关可能从负变正,这不是数据错了,而是“净效应”和“总效应”本来就可以不同。

提示:偏相关只能控制你测量到的变量。没测到的混杂因素,偏相关无能为力。所以报告偏相关时,要说明控制了哪些变量,以及为什么选这些变量。

4. 线性回归:模型检验、适用性与 SPSS 输出精读

4.1 从相关到回归:表达式与最小二乘

相关分析给出 r,回归分析给出方程y = b0 + b1*x1 + ... + bk*xk + e。SPSS 用最小二乘法估计系数,目标是让残差平方和最小。菜单路径Analyze -> Regression -> Linear,把因变量放Dependent,自变量放Independent(s)。语法:

REGRESSION /DESCRIPTIVES MEAN STDDEV CORR SIG N /MISSING LISTWISE /STATISTICS COEFF OUTS R ANOVA CHANGE /CRITERIA=PIN(.05) POUT(.10) /NOORIGIN /DEPENDENT consumption /METHOD=ENTER income age education.

/METHOD=ENTER是强制进入法,所有自变量同时进入,适合理论驱动的研究;/STATISTICS=COEFF OUTS R ANOVA CHANGE输出系数、模型摘要、方差分析表和 R 方变化量;/CRITERIA=PIN(.05) POUT(.10)是逐步回归的进入和剔除标准,用 ENTER 时不生效,但保留着方便切换。

4.2 模型检验三张表怎么读

SPSS 回归输出核心是三张表。第一张Model Summary给 R、R 方、调整 R 方和标准误。R 方是解释的变异比例,调整 R 方惩罚了自变量个数,做多元回归时看调整 R 方更靠谱。第二张ANOVA给 F 统计量和Sig.,检验的是“所有系数是否同时为零”,F 显著只说明模型整体有用,不代表每个自变量都显著。第三张Coefficients给每个变量的 B、标准误、Beta、t 和Sig.。B 是未标准化系数,带单位;Beta 是标准化系数,可以跨变量比较相对重要性。

课件里提到的“回归模型的适用性检验”,在 SPSS 里主要看残差。Plots选项里勾选HistogramNormal probability plot看正态性,勾选ZRESIDZPRED看残差是否随机分布。如果残差图呈喇叭形,说明方差不齐;呈 U 形,说明线性假设不成立,该考虑非线性项了。

4.3 多重共线性与异常值排查

多元回归最容易踩的坑是共线性。SPSS 在Statistics里勾选Collinearity diagnostics,会输出 VIF 和 Tolerance。经验规则:VIF > 10 或 Tolerance < 0.1 就要警惕。处理办法是删掉冗余变量、合并变量,或者改用岭回归、主成分回归。

异常值用Casewise diagnostics看,默认标记标准化残差超过 ±3 的个案。发现异常值先别急着删,查清楚是录入错误还是真实极端情况。真实极端值可以考虑稳健回归,或者单独报告敏感性分析。

REGRESSION /MISSING LISTWISE /STATISTICS COEFF OUTS R ANOVA COLLIN TOL /CRITERIA=PIN(.05) POUT(.10) /NOORIGIN /DEPENDENT consumption /METHOD=ENTER income age education /RESIDUALS DURBIN HISTOGRAM(ZRESID) NORMPROB(ZRESID) /CASEWISE PLOT(ZRESID) OUTLIERS(3).

COLLIN TOL输出共线性诊断,DURBIN输出 Durbin-Watson 统计量检验残差自相关(接近 2 为佳),CASEWISE OUTLIERS(3)列出标准化残差超过 3 的个案。

5. 非线性回归与模型比较:从多项式到曲线估计

5.1 什么时候该放弃线性模型

残差图出现系统性弯曲、散点图明显不是直线、理论上有饱和或加速效应时,线性模型就不够用了。课件提到的多项式回归、指数回归、对数回归,在 SPSS 里对应Analyze -> Regression -> Curve Estimation。这个菜单可以一次拟合线性、对数、二次、三次、指数、幂等多种曲线,并输出各自的 R 方,方便比较。

CURVEFIT /VARIABLES=demand price /CONSTANT /MODEL=LINEAR QUADRATIC CUBIC EXPONENTIAL LOGARITHMIC POWER /PLOT FIT.

/MODEL后面列出要拟合的曲线类型,/PLOT FIT会画出拟合曲线叠加在散点图上。输出里比较各模型的 R 方和 F 值,但要注意:不同曲线类型的因变量变换方式不同,R 方不能直接跨类型比较。比如指数模型实际拟合的是ln(y),它的 R 方是变换后的,和线性模型的 R 方不在同一尺度。稳妥做法是看拟合图,或者把预测值还原到原始尺度再算 RMSE。

5.2 多项式回归的阶数与过拟合

多项式回归用y = b0 + b1*x + b2*x^2 + ...逼近曲线。阶数越高拟合越灵活,但过拟合风险越大。常见做法是先用二次项看有没有显著改善,再考虑三次。SPSS 里可以用Transform -> Compute Variable生成x**2x**3,再放进线性回归;也可以直接用 Curve Estimation 的 QUADRATIC、CUBIC。

判断是否过拟合,看调整 R 方是否随阶数增加而持续上升,以及高阶项系数是否显著。如果三次项不显著、调整 R 方也没提升,就退回二次。另一个技巧是中心化:把 x 减去均值再平方,可以降低高阶项和低阶项之间的共线性,让系数更稳定。

5.3 用嵌套模型 F 检验比较拟合优度

比较两个嵌套模型(比如线性 vs 二次),不能只看 R 方变大,要用 F 检验。公式是:

F = ((RSS_small - RSS_big) / (df_small - df_big)) / (RSS_big / df_big)

SPSS 线性回归的R Square Change表在/STATISTICS=CHANGE时输出,直接给出 R 方变化量、F 变化量和显著性。操作上分两步:第一步只放线性项,第二步加入二次项,看 Change Statistics 里的Sig. F Change。如果小于 0.05,说明二次项带来了显著改善。

注意:非线性回归的系数解释和线性不同。二次项系数为正表示开口向上,为负表示开口向下,拐点在-b1/(2*b2)。报告时要结合业务含义说明拐点位置,而不是只报显著性。

5.4 一个可复现的完整流程

把上面的步骤串起来,一个完整的分析流程是:先Graphs -> Scatter看形态;用CORRELATIONS算 Pearson 和 Spearman;有混杂变量就上PARTIAL CORR;确定线性关系后用REGRESSION建模型,读 Model Summary、ANOVA、Coefficients 三张表,查 VIF 和残差图;残差有弯曲就转CURVEFIT比较曲线,或用多项式加项做嵌套 F 检验。每一步都保留语法文件,换一批数据只需改/VARIABLES/DEPENDENT,这是用 SPSS 做可复现分析最省力的方式。

本文还有配套的精品资源,点击获取

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 18:53:32

Unity Shader Graph 水体流动实战:Flow Map 原理与 UV 偏移避坑指南

1. 水体流动效果的核心思路与方案选型1.1 为什么选择 Flow Map 而不是滚动 UV刚接触水体效果的朋友&#xff0c;第一反应往往是给水面贴图加一个随时间递增的 UV 偏移&#xff0c;也就是常说的UV Scroll。这个做法确实简单&#xff0c;一行Time节点乘上速度再Add到UV上就完事了…

作者头像 李华
网站建设 2026/9/19 18:50:00

Proxmox VE装完Web界面打不开?网络配置排查与修复指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/19 18:49:44

Vue样式隔离实战:scoped原理、边界与工程化落地策略

1. 样式事故现场&#xff1a;一个数字角标引发的故事我接手一个中后台管理项目两周后&#xff0c;某天运营反馈说“数字角标跑到了侧边栏上”。那个本该死死在“待办列表”右上角的小红点&#xff0c;不知道什么时候开始出现在左侧导航栏的某些菜单项旁边&#xff0c;而且形态不…

作者头像 李华
网站建设 2026/9/19 18:49:29

SSM+Vue实战:NBA球队管理系统设计与实现全攻略

1. 选题思路与整体设计&#xff1a;为什么NBA球队管理系统适合做毕设1.1 选题背景与核心需求拆解如果你的毕设题目是"NBA球队管理系统"&#xff0c;第一反应可能是&#xff1a;这不就是一个普通的增删改查项目吗&#xff1f;确实&#xff0c;从功能上看它绕不开登录、…

作者头像 李华