简介:SPSS相关性分析入门PDF适合数据分析初学者与科研人员,系统梳理了连续与分类变量组合下的五种核心方法:线性回归、独立样本T检验、逻辑回归、列联表分析及描述性统计,每种方法均涵盖适用条件、菜单操作步骤和输出结果解读。文档以清晰路径演示从菜单选择到结果解读的全过程,并针对非线性关系、均值中央化、Levene方差齐性检验、Hosmer-Lemeshow拟合度、Pearson卡方显著性等关键点给出操作提示,且附有独立样本T检验和卡方检验的输出示例,指导读者关注t值、B值、显著性水平等统计量的含义。资源为单份PDF文档,体积仅95KB,内容紧凑精炼,重点突出,可直接在线阅读或打印学习。目前已有1707人学习下载,适合正在撰写论文、进行课题研究或日常数据探索的读者快速掌握相关性分析的SPSS操作要点,节省摸索时间。
1. 为什么说SPSS是相关性分析的入门标准答案
“相关性分析”是数据分析里出现频率最高的词,但真正动手时很多人先在 Excel 里面算出一个裸系数,紧接着就问:这个数到底有没有统计意义?SPSS 从一开始就用“双变量相关”菜单给出了完整答案,把皮尔逊、斯皮尔曼、肯德尔三种系数放在同一个对话框里,还顺手把双尾显著性、样本量和缺失值的处理方式一起输出出来。对刚接触统计的人来说,这种“边点菜单边理解假设”的路径,比直接写代码更友好,而且同样的操作逻辑可以直接迁移到方差分析和回归建模中去。下面按最小可用流程推进:数据如何录入、系数如何选、对话框怎么配置、输出怎么读、报告中怎么写,最后用偏相关补上“控制第三个变量”的延伸能力。
2. 数据整理与SPSS录入规范:影响相关分析结果的准备环节
相关性分析对“数据的形状”非常敏感。常见场景是,从 Excel 里面导出的问卷数据第一行是题目标题,后面还混着“平均值”这样的统计行,甚至一个单元格里放着“3分”这种带单位的文本。直接导入 SPSS 后,变量类型会变成字符串,相关性菜单里能选变量,输出结果却是空的,或者把文本当成分类编码。所以这一章先讲清楚 SPSS 数据视图的结构要求,再把变量类型和缺失值这两件最容易被忽略的事情处理掉。
2.1 数据结构的硬性要求:一行一条记录、一列一个变量
相关性分析的输入是若干个连续或有序变量,输出是它们的两两关联程度。SPSS 计算相关矩阵时,按变量名去读列数据,如果表格里混了汇总行,某列突然出现一个“平均”字符串,SPSS 就会把这个变量的类型判定为字符串,后续要做数值分析就只能重新编码。整理数据的标准做法是:
- 删除标题行、空行、备注栏、公式生成的合计行;
- 每一行只能是一个样本,每一列只能是一个变量;
- 变量名用字母或简单中文,不要带空格、百分号、括号;
- 性别、地区这类分类变量,如果要做相关分析,先转换为数值编码,例如“男=1,女=0”。
检查文件里是否还有“全选”“合计”这类字符串单元格。SPSS 在导入时对整列推断类型,只要出现一个非数字值,整列就会被视为字符串。
| 检查项 | 正确做法 | 常见错误 |
|---|---|---|
| 行列结构 | 一行一个样本,一列一个变量 | 把多次测量或多个时间点放进同一行 |
| 变量类型 | 数值型变量,测量尺度明确 | 用字符串表示“高中/大专/本科” |
| 备注与汇总 | 只保留变量名,删掉统计行 | 把“平均分”等统计量写在表格底部 |
这一步做完之后,再用 SPSS 打开数据文件,就不容易出现“变量显示为 $ 字符串”的问题。
2.2 在变量视图中定义测量尺度:标度、有序、名义
导入数据后,需要进入“变量视图”确认三样东西:变量名、类型、测量尺度。测量尺度直接决定后面能使用哪种相关系数。SPSS 把测量尺度分为三类:标度对应连续数值,适合皮尔逊相关;有序对应等级数据,适合斯皮尔曼或肯德尔相关;名义对应类别编码,不能直接用于相关分析。
用语法批量修改测量尺度的方式是:
VARIABLE LEVEL age income score (SCALE). VARIABLE LEVEL rank_edu (ORDINAL).这段语法把age、income、score三个变量统一设置为标度。score如果是问卷得分,只要题目数量足够多、得分分布不严重偏态,也可以按标度处理。VARIABLE LEVEL是 SPSS 中直接设置测量级别的命令,执行后数据视图里会显示对应的图标。rank_edu这类学历顺序编码适合定为ORDINAL,因为它只有等级含义,没有固定间隔。
2.3 缺失值怎么看:成对删除与列表式删除的差异
相关分析默认采用成对删除缺失值,SPSS 输出表中每个配对组合的“个案数”都可能不一样。例如 A 变量有 120 个样本,B 变量有 115 个,做 A 和 B 的相关分析时,SPSS 只使用两个变量都非缺失的那部分样本,其他变量拿不到的数据不影响这一对的计算。这个做法的优点是保留信息,缺点是每对样本的样本量不完全一致。
语法层面通过/MISSING=PAIRWISE来控制,想换成列表式删除就写/MISSING=LISTWISE。做相关性分析时我通常保留成对删除,因为结果更贴近“当前这两个变量到底有多少有效配对”。
DESCRIPTIVES /VARIABLES=age income score /STATISTICS=MEAN STDDEV MIN MAX.执行这段语法之前,先运行一次描述统计,看一下四个变量的样本量。如果发现某一变量的个案数特别少,要回头检查数据录入是否漏掉了整列数据。描述统计能帮你把数据质量问题和后面的统计推断分开,避免相关性结果被少量缺失值带偏。
在写报告时,如果相关矩阵中不同配对的个案数不一样,需要在方法部分注明“使用成对删除处理缺失值”,审稿人才能理解为什么个案数不一致。
3. 相关性系数怎么选:皮尔逊、斯皮尔曼与肯德尔
SPSS 相关分析提供了三种系数,但默认总是先勾上皮尔逊。最常踩的坑,是数据明明只有五个等级的打分,还在用皮尔逊相关系数硬算,最后得到一个虚高的相关系数。这一章把三种系数的适用条件写清楚,并给出一个可以对照的表格。
3.1 皮尔逊相关:基于线性关系与变差距离
皮尔逊相关考察两个连续变量的线性关联。它的公式本质是协方差除以两个变量的标准差乘积,所以对异常值非常敏感,要求两个变量近似服从正态分布、方差不要悬殊太大。严谨的操作习惯是先做散点图看看形态,如果没有明显异常点,再跑皮尔逊。业务场景里,年龄与收入、广告费用与销售额这类近似连续的数值变量,适合用皮尔逊。
3.2 Spearman相关性分析:秩次计算与非正态数据
斯皮尔曼相关不拿原始数值直接计算,而是把两个变量分别排名,再对排名计算皮尔逊相关。这意味着函数关系即使不是直线而是单调上升或下降,斯皮尔曼的检验效果也很好。两个变量明显非正态、有成断位、或其中一个只能排序无法精确测量时,优先用斯皮尔曼。很多教材里的 Spearman相关性分析 操作,就是基于秩次转换的皮尔逊计算,因此它适用于更多现实数据,比如客户满意度打分与复购频次这一类偏态明显的变量。
3.3 肯德尔相关:并列值多时的保守选择
肯德尔 tau-b 与斯皮尔曼同样是秩序相关,但在数据出现大量并列值时更加稳定。当问卷调查的大量打分都集中在同一个分数上,或者有两个评价者给一组对象打分,并列优势显著时,肯德尔比斯皮尔曼更可靠。样本量很小、又是等级变量时,也常用肯德尔。
3.4 三种系数的选型参照表
| 系数 | 变量类型 | 前提条件 | 典型场景 |
|---|---|---|---|
| 皮尔逊 r | 连续变量 | 线性关系、近似正态、无极端值 | 销售额与广告支出 |
| 斯皮尔曼 ρ | 连续或有序 | 单调关系,不要求正态 | 满意度等级与月消费频次 |
| 肯德尔 τ-b | 有序变量 | 并列值多、样本量小 | 两个评分者打分的一致性 |
如果只是为了“看看有没有关系”,并且变量里混着标度和有序两类,我一般会把皮尔逊和斯皮尔曼同时输出,比较两者结论是否一致。若两者方向一致、显著性相近,结果就比较可信;如果皮尔逊不显著而斯皮尔曼显著,多半说明关系是非线性的,需要进一步画出散点图确认是否存在 U 形关系。
这里用语法直接输出斯皮尔曼相关系数:
NONPAR CORR /VARIABLES=rank_edu satisfaction /PRINT=SPEARMAN TWOTAIL SIG /MISSING=PAIRWISE.其中NONPAR CORR是非参数相关分析过程,/PRINT=SPEARMAN明确要求输出斯皮尔曼系数,TWOTAIL表示双尾显著性检验。这个命令不计算皮尔逊系数,适合你已经决定采用秩相关的场景。
4. 用SPSS跑相关性分析的具体操作步骤:菜单与语法对照
SPSS 给用户提供了两条路径:菜单对话框适合第一次分析,语法面板适合重复执行同一个分析过程。这一章以“双变量相关”对话框为中心,把每一步的参数选择写成明确的操作,并附上语法命令,方便后续换成自己的数据时直接复制修改。
4.1 打开双变量相关对话框
菜单路径是“分析 → 相关 → 双变量”。在弹出的对话框中,左侧显示变量列表,把需要分析的连续变量选中后点击箭头,移动到右侧的“变量”框中。
如果变量比较多,建议先只放主营业务相关的三到五个核心变量。把二十个变量全部放进对话框,输出会是一张 20×20 的矩阵,阅读成本高,还会产生大量无关的显著性检验,增加多重比较误报的风险。一次分析三到五个变量,结果更容易解释。
4.2 相关系数、显著性检验和标记相关项的参数设置
在“相关系数”区域,SPSS 默认勾选“皮尔逊”。如果你需要斯皮尔曼或肯德尔,可以只勾选对应的系数,也可以同时勾选皮尔逊进行对比。但同时勾选三种系数时,输出表会同时出现三种统计量的数值,本质上它们背后的前提条件不同,全部输出反而干扰阅读。我更建议按数据特征只选一种主要的。
“显著性检验”默认是“双尾”,SPSS 每次都会输出精确的 P 值。如果你有明确的方向假设,选择“单尾”会得到更小的 P 值,但必须事先在数据分析计划中写清楚,数据出来之后再去改单双尾,统计上不严谨。“标记显著性相关性”建议勾选,它会在小于 0.05 的相关系数旁标一个星号,小于 0.01 的标两个星号。
4.3 一个最小可用语法:CORRELATIONS 命令与参数解释
把上述设置落到语法里,形成这样一段命令:
CORRELATIONS /VARIABLES=age income satisfaction /PRINT=TWOTAIL SIG /MISSING=PAIRWISE.CORRELATIONS是执行双变量相关分析的过程关键字;/VARIABLES后接待分析的变量列表,一次可以写多个变量,最终输出所有变量的两两相关矩阵;/PRINT=TWOTAIL表示输出双侧显著性,SIG表示把显著性数值写进结果表;/MISSING=PAIRWISE表示缺失值采用成对删除策略。
| 参数 | 含义 | 建议 |
|---|---|---|
/PRINT=TWOTAIL | 输出双侧显著性检验结果 | 默认使用 |
SIG | 在结果表输出 P 值 | 保持开启 |
/MISSING=PAIRWISE | 成对删除缺失值 | 相关分析常用策略 |
假设现在需要同时分析两组变量,一组是“年龄、收入”,一组是“满意度、收入”,可以分行放置:
CORRELATIONS /VARIABLES=age income /VARIABLES=satisfaction income /PRINT=TWOTAIL SIG /MISSING=PAIRWISE.执行后会输出两个相关矩阵,每个矩阵只包含当前变量组内的两两关系。这个做法的好处是控制输出规模,缺点是不再生成一个完整的全局矩阵,分析时需要注意看准是哪个矩阵。
4.4 用“粘贴”功能把菜单操作转成语法
在对话框点击“粘贴”按钮,SPSS 会把当前选择翻译成一段语法并插入语法窗口,然后按运行就能重复执行。新手建议养成点“粘贴”而不是直接点“确定”的习惯:这样能回看自己刚才到底做了哪些选择,也能在下次打开 SPSS 时直接调用同一段语法,避免重复调整。
菜单路径和语法是同一回事,菜单帮你找命令,语法帮你记录分析过程。长期做数据分析,保留语法文件的价值比保留输出文件更高,因为换一份新数据,只需要改变量名,重新运行一次就能得到完整结果。
5. 结果怎么读:相关矩阵、散点图矩阵与报告口径
输出结果往往以一张相关矩阵为起点,但很多人拿到后只看有没有星号,忽略了矩阵里“个案数”和“显著性”两个隐藏信息。这一章分三块:先看相关矩阵,再确认散点图是否存在异常值,最后把结果整理成可以写进报告的文字。
5.1 相关矩阵的行列结构怎么找关键数据
SPSS 输出表格的行和列都是变量名,对角线位置等于 1。由于相关性是对称的,矩阵的下三角和上三角实际上讲的是同一件事。行末的“个案数”表示参与该配对计算的样本量。单元格里的数值就是相关系数,旁边有星号表示它在相应显著性水平下通过检验。
| 年龄 | 收入 | |
|---|---|---|
| 年龄 | 皮尔逊相关性 | 1 |
| 显著性(双尾) | ||
| 个案数 | 120 | |
| 收入 | 皮尔逊相关性 | -0.32* |
上面的结果中,年龄与收入的皮尔逊相关系数是 -0.32,星号代表 p < 0.05,实际显著性数值是 0.043,说明在 0.05 显著性水平下存在显著负相关。解读时同步看“个案数”是不是 120,如果年龄的有效个案是 110,收入是 120,两侧的个案数不一致,就是缺失值按成对方式删除了。
5.2 先画散点图,再用相关系数叙事
在做相关分析之前最好先做散点图验证形态。SPSS 操作是“图形 → 图形构建器”,选择“散点图/点图”中的“矩阵图”,把需要分析的变量拖入矩阵框,产出多组变量两两之间的散点图。也可以直接用以下语法生成三个变量的散点图矩阵:
GRAPH /SCATTERPLOT(MATRIX)=age income score /MISSING=LISTWISE.其中/SCATTERPLOT(MATRIX)定义散点图矩阵,LISTWISE要求完全排除含任何一个变量缺失值的样本,保证矩阵里所有小图都是同一批样本,这样对比才一致。看这张图时要找三种情形:是否存在明显的线性趋势,是否存在异常值,是否存在两端收紧的锥形分布。锥形分布往往意味着方差不齐,皮尔逊系数的可信度会下降。
5.3 报告中如何写相关系数
论文或汇报中相关分析结果不用附上整个矩阵,把关键配对写清楚即可。标准格式是“变量 A 与变量 B 的皮尔逊相关系数 r = -0.32,p = 0.043”。p 值小于 0.001 时应写“p < 0.001”,而不是写一个带好几位零的数值。如果用了斯皮尔曼或肯德尔系数,在方法部分注明所用系数名,例如“采用斯皮尔曼等级相关分析满意度与缴费次数的关系”。
6. 进阶操作:偏相关和两个容易踩的坑
6.1 用偏相关控制第三个变量
基础的相关矩阵只反映两个变量之间的关系,现实数据里经常存在第三个变量同时影响两端,导致计算结果出现“看起来相关但其实不相关”的假象。这种场景下需要做偏相关,先把第三个变量的影响从两个变量中剔除,再计算剩余关系。
PARTIAL CORR /VARIABLES=age income /CONTROL=score /SIGNIFICANCE=TWOTAIL /STATISTICS=CORR.PARTIAL CORR是偏相关过程,/VARIABLES指定参与计算的变量,/CONTROL指定要控制的变量,/STATISTICS=CORR表示在输出中保留零阶相关系数。运行结果里既能看到控制前的相关系数,也能看到控制后的偏相关系数,两个值的差异直接说明“控制变量”到底起了多大作用。
6.2 两个容易踩的坑:名义变量编码与因果误读
第一个容易踩的坑,是把名义变量当作数值拿去跑皮尔逊。比如“所在区域”编码为 1、2、3,虽然看起来是数字,变量本身没有大小顺序,算出的相关系数没有任何实际含义,只能在特定场景下把它作为虚拟编码回归问题处理。
第二个坑,是把相关关系解释成因果关系。SPSS 标注的“双尾显著性”只说明两个变量之间的关联在统计上不太可能是偶然出现的,“显著相关”不等于一个人能够改变另一个人。业务报告中想表达“A 导致 B”,需要设计实验,或者结合回归分析中的路径关系来支撑。
验证分析结果时,把相关矩阵里的“个案数”和原始数据的有效样本数逐一比对,如果差得太多,说明缺失值处理和数据清洗环节还有漏洞。全部数字对不上之前,不要急着下结论,先回到数据视图检查测量尺度和缺失编码,再重新运行一遍相同语法。
本文还有配套的精品资源,点击获取