目录
- 前言
- 1. 引言
- 2. 示例与动机
- 3. 联合分布中的独立性
- 4. 结语
- 结语
- 参考
前言
学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第二十六讲:联合概率分布,记录下个人学习笔记,和大家一起分享交流😄
video:https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V
1. 引言
OK,我们已经介绍了随机变量及其概率分布的概念,现在我们来讨论联合概率分布,这是关于两个随机变量如何相互依存(或互不影响),并共同影响这两个事件同时发生的概率。
给定两个随机变量X XX和Y YY,这两个随机变量不必遵循相同的分布,可以定义联合概率分布为:
P ( x , y ) = P ( X = x , Y = y ) P(x,y) = P(X=x,Y=y)P(x,y)=P(X=x,Y=y)
这是随机变量X XX取值为x xx且随机变量Y YY取值为y yy的概率,这是个非常简单的概念。
我们之前已经讨论过条件概率,要知道,在给定Y YY发生的条件下X XX发生的概率,这两者密切相关。这里我以离散型随机变量的形式绘制并呈现了这一概念,不过这个概念同样适用于连续型随机变量,稍后我会详细说明。
2. 示例与动机
接下来,我将通过几个示例来说明引入这一新概念的意义。
以湍流为例,其速度分量 —x xx、y yy、z zz三个方向上的u uu、v vv、w ww速度分量,正是联合分布的随机变量,这种联合分布的特性会随具体流体流动状态而变化,若存在各向同性的随机湍流(即方向无关性),这些变量或许会呈现出独立性。
在边界层流动中,当流体沿x xx方向从左向右运动时,u uu、v vv、w ww速度分量之间的关联性将形成独特的联合概率分布结构。
OK,这就是一个很酷的例子,在公共卫生与医疗预后领域,联合概率分布同样具有很重要的应用价值。
当我们将患者的健康指标、人口统计学数据以及生物特征数据相结合时,这些变量之间的联合概率分布能够揭示潜在的健康模式与风险关联。
例如,通过分析联合概率分布可以得出:一位居住在美国华盛顿的 40 岁男性,其患心脏病的条件概率会与特定的人口统计学特征和生物指标产生显著关联。假设该男性身高六英尺(约 183 厘米),体重为特定公斤数,这些数据的综合信息能够构建不同健康结果的联合概率分布,为制定可操作的医疗决策提供依据。
实际上,当我们构建这类联合概率分布时,各个变量之间会呈现出极其紧密的关联性,主成分分析所依赖的基本假设之一,大家其实早已接触过主成分分析(PCA)这一方法,通过这种方式,我们可以处理从系统中收集到的高维数据,然后对这些数据进行主成分分析,从而提取出该联合分布的近似表征。
关于主成分分析,我有一整套系列讲座,这是统计学中一个较为进阶的主题,我们很快会深入探讨这个主题。
这本质上是一种假设,有时我们会忽略这个假设,或者不经意间忘记:PCA 在联合高斯分布下具有最优性—此时主成分之间不仅不相关,而且严格独立—但有时我们可能不经意地忽略这一前提条件的适用范围。
类似的例子还有很多,现在请大家思考离散变量与连续变量的联合分布,以及如何运用这些分布解决问题。
我最喜欢的一个示例 — 实际上我将通过它来介绍连续型联合分布的概念,我研究生时期的实验同门,后来曾在一家体育数据分析公司工作,我了解到他们收集了大量赛场摄像机数据,记录了篮球比赛过程中的全场动态,他们能够实时追踪每位球员的移动轨迹。
实际上这是一个高度简化的球场模型,通过追踪球员整个赛季的移动轨迹,可以构建出该球员在场上出现位置的频率分布图,比如某位球员可能经常在某个区域活动,有时会出现在某个位置,而极少会跑到另一个角落,这便构成了类似勒布朗·詹姆斯这类球员在整个赛季中活动区域的概率分布图。
通过实际采集数据构建概率分布的核心思路,这是对概率分布进行数据驱动的近似建模,我们通过概率密度函数来预测球员的移动位置。因此在连续时间维度中,我们通常用函数f ( x , y ) f(x,y)f(x,y)表示该概率密度函数,直观来说,它表示在极小的d x × d y dx \times dydx×dy微元区域内发现目标的概率。
因此可以计算随机变量(即球员位置)出现在特定区域内的概率,假设我设定一个区域 A,点( x , y ) (x,y)(x,y)落在此区域内的概率为:
P ( ( x , y ) ∈ A ) = ∫ A f ( x , y ) d x d y P\left((x,y) \in A \right) =\int_A f(x,y) \, dx \, dyP((x,y)∈A)=∫Af(x,y)dxdy
区域 A 的概率值即为该概率密度函数在此区域上的积分,该概率值等于函数f ( x , y ) f(x,y)f(x,y)在区域 A 上的二重积分,这与单随机变量的处理方式完全一致:单随机变量的概率密度函数通过积分计算概率,而现在我们可以对二维区域进行积分运算,对于三维随机变量,则需通过体积分进行计算。
其核心思路非常简单明了,根据该概率密度函数,计算落在这个二维平面特定有限区域内的概率。
3. 联合分布中的独立性
我想说明的是,如果这两个变量相互独立会产生什么结果 — 这一点非常重要,并且与变量分离密切相关,让我们暂时回到之前讨论的高斯分布示例上来。
假设存在两个随机变量X XX和Y YY,它们都是服从正态分布的随机变量,这样我们就可以构建一个新的联合分布f ( x , y ) f(x,y)f(x,y),那么这个联合分布会形成具有径向对称性的二维高斯分布:
可以注意到,这个联合概率密度函数本身就是一个二维高斯分布,数据确实服从联合高斯分布时,PCA 具有特别优雅的统计解释:主成分之间严格独立,且每个方向的方差恰好对应高斯分布在该方向的散布程度。
可以观察到,若对X XX变量的所有取值进行积分运算,最终将得到Y YY变量的高斯概率密度函数,若对Y YY变量的所有取值进行积分运算,最终将得到X XX变量的高斯分布,这就是所谓的边缘分布 — 通过对Y YY的所有取值进行积分得到X XX的边缘分布,或通过对X XX的所有取值进行积分得到Y YY的边缘分布。
后续我们将进一步探讨这一概念,我们可以这样理解:若存在两个本身服从高斯分布的变量,就能构建一个联合分布 — 即二维高斯分布,其中每个边缘概率本身也都是高斯分布。
接下来要介绍的重要概念是独立性,这是一个非常重要的性质,我们将在后续内容中反复运用。当我们计算联合分布的期望值时,当我们在主成分分析中计算方差时,诸如此类的情况都会用到。
我们在讨论条件概率时已经接触过独立性的概念,当两个随机变量X XX和Y YY相互独立时,已知Y YY的信息不会改变X XX的概率分布,这种独立性同样适用于联合概率分布的表述。
假设随机变量X XX与Y YY相互独立,那么X XX等于某个特定值且Y YY等于某个特定值的概率等于两个独立概率密度的乘积,即:
P ( X = x , Y = y ) = P ( X = x ) P ( Y = y ) P(X=x,Y=y) = P(X=x)P(Y=y)P(X=x,Y=y)=P(X=x)P(Y=y)
你会发现,这种处理方式与求解偏微分方程时采用的变量分离法几乎如出一辙,当我在二维矩形区域求解热传导方程并分析温度分布时,通常可以将解分离为x xx的函数与y yy的函数的乘积形式,这正是完全相同的思路。
这恰如变量分离法的思路,实际上在那个热传导案例中,温度分布的变量分离过程还涉及了与高斯函数的卷积运算,热传导方程的解包含高斯热核函数,不过这与当前主题并无直接关联。
因此,独立性的概率确实至关重要,当随机变量X XX和Y YY完全独立时,我们可以通过将各自的概率密度函数相乘来得到联合分布,我们知道这种方法时而适用,时而不适用,让我们通过一个具体示例来说明。
假设我正在投掷飞镖,假设有一个标靶,标靶通常呈圆形,通常标靶会划分为靶心、环形区域和扇形分区:
如果我的飞镖技术不错,你会发现投掷落点的分布会逐渐接近高斯分布,当然,这得是真正擅长飞镖的情况下,当你瞄准靶心时,落点会围绕靶心形成二维高斯分布。
若尝试用X , Y X,YX,Y变量描述该概率密度函数,其表达式将不可分离,因为在X XX轴方向上移动时,Y YY变量的概率分布确实会随X XX坐标的变化而改变,因此我无法将该概率密度函数分解为X XX和Y YY的独立表达式,该函数在X XX和Y YY方向上不可分离。
正如热传导方程所示,若在圆盘中心用喷枪加热,热力分布将无法在X XX和Y YY方向上实现分离,但在极坐标系的径向和角向维度上,该函数可分离为θ \thetaθ和r rr的独立表达式。
因此,通过寻找合适的坐标系,我们往往能够基于变量独立性将概率密度函数分解为独立分量的乘积形式,而某些坐标系则难以实现这种分解。正如微分方程中存在优选坐标系,概率论中也常存在能够简化问题表述的坐标系。
当然,引力的存在会打破这种对称性,使概率分布产生特定方向的偏移,假设我们在国际空间站的零重力环境下投掷飞镖。
理解变量独立性这一概念具有重要价值,我们将持续运用变量独立性这一核心特性,若两个随机过程相互独立,其联合概率分布可通过各自概率密度的乘积构建,反之亦可将联合密度分解为两个独立密度的乘积。
4. 结语
在后续课程中,我们将讲解一个称为边缘分布的概念,这一点我在前面已经有所提及,这个思路是指:当存在联合分布时,可以通过对Y YY取平均值得到X XX的边缘分布,反之亦可对X XX取平均值得到Y YY的边缘分布。
我将把这个概念与条件概率联系起来,这种条件概率的思想我们之前在贝叶斯定理中已经使用过,我认为在下一讲中会将其与独立性和联合分布联系起来。
结语
联合概率分布将概率论从 “一维望远镜” 升级为 “多维显微镜”—P ( X = x , Y = y ) P(X=x, Y=y)P(X=x,Y=y)或f ( x , y ) f(x,y)f(x,y)不仅描述单个变量的随机行为,更捕捉变量之间的关联结构。Brunton 的示例矩阵精彩地展示了这一概念的跨学科解释力:湍流的速度三分量( u , v , w ) (u,v,w)(u,v,w)的依赖关系揭示了流动物理、多元患者健康指标预测疾病风险、篮球运动员的场上热力图构成f ( x , y ) f(x,y)f(x,y)的数据驱动近似—从流体力学到公共卫生再到体育分析,联合分布是统一的建模语言。
独立性的判别是联合分布最核心的运算属性:若X XX与Y YY独立,联合分布可分解为各自边缘密度的乘积f ( x , y ) = f X ( x ) f Y ( y ) f(x,y) = f_X(x)f_Y(y)f(x,y)=fX(x)fY(y)—这与偏微分方程中分离变量法的数学结构完全同构。但 Brunton 以二维飞镖靶为例警示了不可分离的情形:围绕靶心的高斯分布无法在( x , y ) (x,y)(x,y)笛卡尔坐标下分解,却可在( r , θ ) (r,\theta)(r,θ)极坐标下分离—可分性依赖于坐标系的选择,这与热传导方程在圆盘上的求解策略异曲同工。这一洞见为主成分分析(PCA)提供了概率论注脚:PCA 假设数据服从联合高斯分布,通过旋转坐标轴寻找使变量 “最接近独立” 的方向,本质上是在做 “最优分离变量”。
边缘分布(对Y YY积分得X XX的分布,反之亦然)和条件分布(固定一个变量看另一个)是联合分布的两个派生概念,它们将与贝叶斯定理一起构成后续统计推断的核心运算工具箱 🤗。
参考
- https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V