PROB-02 随机变量及其分布

一、常见分布速查

分布 参数 P(X=k)或f(x) E(X) D(X) 典型应用
二项分布 B(n,p) n试验次数,p成功概率 C(n,k)p^k(1-p)^(n-k) np np(1-p) n次独立重复试验的成功次数
泊松分布 P(λ) λ 平均发生率 e^(-λ)λ^k/k! λ λ 单位时间内随机事件发生次数
均匀分布 U(a,b) a,b 区间端点 1/(b-a) (a+b)/2 (b-a)²/12 等可能地取区间内任意值
指数分布 Exp(λ) λ 失效率 λe^(-λx), x>0 1/λ 1/λ² 寿命、等待时间
正态分布 N(μ,σ²) μ均值,σ标准差 φ(x)=(1/σ√(2π))e^(-(x-μ)²/2σ²) μ σ² 自然和社会科学中最常用的分布

正态分布

-3 -2 -1 0 1 2 3 μ±σ ≈ 68.27% μ±2σ ≈ 95.45% μ±3σ ≈ 99.73%

正态分布是概率论中最重要的分布。它的概率密度函数呈钟形,以μ为对称轴,σ决定了曲线的"胖瘦"——σ越大,曲线越扁平;σ越小,曲线越瘦高。标准化公式Z=(X-μ)/σ使任何正态分布都能转化为标准正态分布N(0,1),通过查表计算概率。

二、分布函数与概率密度

分布函数F(x)=P{X≤x}描述了随机变量取值不超过x的概率。这是一个单调不减的右连续函数,取值范围为[0,1]。

概率密度函数f(x)是连续型随机变量分布函数的导数。f(x)本身不是概率,它在某区间的积分才是概率:P{a<X≤b}=∫ab f(x)dx。

求解分布函数的步骤

求连续型随机变量X的分布函数F(x),就是对f(x)从-∞到x分段积分。需要特别注意分段点的处理。

三、随机变量函数的分布

已知X的分布,求Y=g(X)的分布是考试中的常见题型。

离散型:列出所有可能的Y值,合并相同Y值的概率。

连续型:先求分布函数F_Y(y)=P{g(X)≤y},再对y求导得到概率密度f_Y(y)。这是"先积分后求导"的通用方法。

:设X~Exp(1),求Y=2X+1的概率密度。

f_X(x)=e^(-x), x>0
F_Y(y)=P{2X+1≤y}=P{X≤(y-1)/2}=1-e^(-(y-1)/2), y>1
f_Y(y)=d/dy F_Y(y)=(1/2)e^(-(y-1)/2), y>1

四、二维随机变量

4.1 联合分布与边缘分布

二维随机变量(X,Y)的联合密度函数f(x,y)描述了X和Y共同取值的概率分布。单个变量的分布称为边缘分布,通过对另一个变量积分得到:

f_X(x)=∫f(x,y)dy, f_Y(y)=∫f(x,y)dx

4.2 独立性判定

X与Y相互独立的充要条件是:f(x,y)=f_X(x)·f_Y(y),对所有x,y成立。

:设(X,Y)的联合概率密度f(x,y)=xy, 0<x<1, 0<y<2,判断X与Y是否独立。

f_X(x)=∫₀² xy dy = x·[y²/2]₀² = x·2 = 2x, 0<x<1
f_Y(y)=∫₀¹ xy dx = y·[x²/2]₀¹ = y/2, 0<y<2
f_X(x)·f_Y(y)=2x·(y/2)=xy=f(x,y)
所以X与Y相互独立

4.3 确定联合密度中的常数

联合密度函数的积分必须为1:∫∫f(x,y)dxdy=1。利用这一性质可以求出未知常数。

(接上题):验证常数c=1。∫₀¹∫₀² c·xy dy dx = c·(∫₀¹xdx)·(∫₀²ydy) = c·(1/2)·2 = c = 1 ✓

五、边缘分布与条件分布的本质区别

理解边缘分布和条件分布的区别是学习二维随机变量的关键:

  • 边缘分布:固定X(或Y),对另一个变量全部积分。它回答的是"不管Y如何,X单独看是什么分布"。
  • 条件分布:固定Y的取值,看X在该条件下的分布。它回答的是"已知Y=y的条件下,X是什么分布"。

独立性判定是考试中的常考问题。判定方法为:

  1. 离散型:验证对所有i,j,P(X=xi,Y=yj)=P(X=xi)P(Y=yj)
  2. 连续型:验证对所有x,y,f(x,y)=f_X(x)f_Y(y)