容斥原理#
P(i=1⋃nAi)=k=1∑n(−1)k−1i1<i2<…<ik∑P(Ai1Ai2…Aik)自由度为n-1,但在取值特殊的情况部分项会退化成平凡,在那时不需要已知n-1个项
常见分布#
离散型随机变量一般先写分布律:
P{X=xi}=pi,i∑pi=1二项分布#
X∼B(n,p),P{X=k}=Cnkpk(1−p)n−k含义是n次独立重复试验中事件A发生k次的概率。
E(X)=np,D(X)=np(1−p)当n很大,p较小,λ=np适中时,可以用泊松分布近似:
B(n,p)≈P(λ)泊松分布#
X∼P(λ),P{X=k}=k!λke−λ常用于单位时间、单位面积内随机事件发生次数。
E(X)=λ,D(X)=λ可加性:
X∼P(λ1),Y∼P(λ2),X,Y 独立⇒X+Y∼P(λ1+λ2)几何分布#
X∼Ge(p),P{X=k}=(1−p)k−1p,k=1,2,⋯含义是第一次成功发生在第k次试验。
E(X)=p1,D(X)=p21−p无记忆性:
P{X>m+n∣X>m}=P{X>n}超几何分布#
总体N个,其中有M个目标元素,不放回抽取n个,抽到k个目标元素:
P{X=k}=CNnCMkCN−Mn−kE(X)=nNM方差:
D(X)=nNM(1−NM)N−1N−n负二项分布#
P{X=k}=Ck−1r−1pr(1−p)k−r,k=r,r+1,⋯含义是第r次成功发生在第k次试验。
E(X)=pr,D(X)=p2r(1−p)连续型随机变量通常先写密度函数f(x):
P{a<X≤b}=∫abf(x)dx,∫−∞+∞f(x)dx=1分布函数:
F(x)=P{X≤x}=∫−∞xf(t)dt均匀分布#
X∼U(a,b),f(x)={b−a1,0,a<x<b其他E(X)=2a+b,D(X)=12(b−a)2指数分布#
X∼E(λ),f(x)={λe−λx,0,x>0x≤0分布函数:
F(x)={1−e−λx,0,x>0x≤0E(X)=λ1,D(X)=λ21无记忆性:
P{X>s+t∣X>s}=P{X>t}正态分布#
X∼N(μ,σ2),f(x)=2πσ1e−2σ2(x−μ)2标准化:
Z=σX−μ∼N(0,1)P{a<X<b}=Φ(σb−μ)−Φ(σa−μ)可加性:
X∼N(μ1,σ12),Y∼N(μ2,σ22),X,Y 独立⇒X+Y∼N(μ1+μ2,σ12+σ22)设Y=g(X)。
离散型直接合并概率:
P{Y=y}=x:g(x)=y∑P{X=x}连续型常用分布函数法:
FY(y)=P{Y≤y}=P{g(X)≤y}先把事件转化成X的范围,再对FY(y)求导得到fY(y)。
若g(x)在区间上单调可导,反函数为x=h(y),则:
fY(y)=fX(h(y))∣h′(y)∣多元函数常见线性变换:
Y=aX+b有
E(Y)=aE(X)+b,D(Y)=a2D(X)设X1,⋯,Xn相互独立同分布,分布函数为F(x),密度为f(x)。
最大值:
M=max{X1,⋯,Xn}FM(x)=P{M≤x}=Fn(x)fM(x)=nFn−1(x)f(x)最小值:
m=min{X1,⋯,Xn}Fm(x)=P{m≤x}=1−[1−F(x)]nfm(x)=n[1−F(x)]n−1f(x)
随机过程#
随机过程是一族按参数t变化的随机变量,记作:
{X(t),t∈T}其中t常表示时间,X(t)表示时刻t系统所处的随机状态。若T为离散集合,称为离散时间随机过程;若T为连续区间,称为连续时间随机过程。
泊松过程#
泊松过程常用来描述随机事件随时间发生的次数。设N(t)表示时间区间[0,t]内事件发生的次数,若{N(t),t≥0}为强度为λ的泊松过程,则:
N(t)∼P(λt)即:
P{N(t)=k}=k!(λt)ke−λt,k=0,1,2,⋯它满足:
- N(0)=0;
- 独立增量:互不相交时间区间内发生的事件数相互独立;
- 平稳增量:长度相同的时间区间内事件数分布相同,且只与区间长度有关。
若T1,T2,⋯表示相邻两次事件发生的时间间隔,则:
Ti∼E(λ),f(t)=λe−λt,t>0也就是说,泊松过程中两个相邻事件的时间间隔服从指数分布,且:
E(Ti)=λ1证明思路是把“等待第一次事件超过t”转化为“[0,t]内没有事件”:
P{T1>t}=P{N(t)=0}=e−λt所以:
FT1(t)=P{T1≤t}=1−e−λt这正是参数为λ的指数分布。
数字特征#
分布数字特征总结#
期望:
E(X)=i∑xipi或
E(X)=∫−∞+∞xf(x)dx函数期望:
E[g(X)]=i∑g(xi)pi或
E[g(X)]=∫−∞+∞g(x)f(x)dx方差:
D(X)=E[(X−E(X))2]=E(X2)−[E(X)]2常用性质:
E(aX+bY+c)=aE(X)+bE(Y)+cD(aX+b)=a2D(X)若X,Y独立,则:
E(XY)=E(X)E(Y)D(X+Y)=D(X)+D(Y)最值期望#
对非负随机变量,有尾和公式:
E(X)=∫0+∞P{X>x}dx离散非负整数型:
E(X)=k=0∑+∞P{X>k}所以最值期望通常先求最值的分布函数,再转成尾概率。
最大值:
E(M)=∫−∞+∞x⋅nFn−1(x)f(x)dx最小值:
E(m)=∫−∞+∞x⋅n[1−F(x)]n−1f(x)dx切比雪夫不等式#
若E(X)=μ,D(X)=σ2,则:
P{∣X−μ∣≥ε}≤ε2σ2等价形式:
P{∣X−μ∣<ε}≥1−ε2σ2这个不要求知道具体分布,只要期望和方差存在即可。
协方差#
Cov(X,Y)=E[(X−E(X))(Y−E(Y))]常用计算式:
Cov(X,Y)=E(XY)−E(X)E(Y)方差展开:
D(X+Y)=D(X)+D(Y)+2Cov(X,Y)若X,Y独立,则Cov(X,Y)=0。
相关系数#
ρXY=D(X)D(Y)Cov(X,Y)−1≤ρXY≤1独立一定不相关,不相关不一定独立
当∣ρXY∣=1时,X,Y之间存在几乎处处的线性关系。
依概率收敛#
随机变量序列Xn依概率收敛到X,记作:
Xn⟶PX定义为对任意ε>0:
n→∞limP{∣Xn−X∣≥ε}=0直观理解是n足够大时,Xn偏离X的概率趋于0。
大数定律#
大数定律说明样本均值在概率意义下趋近于总体期望。
切比雪夫大数定理#
若X1,⋯,Xn两两不相关,且方差有共同上界,即存在C使D(Xi)≤C,则:
n1i=1∑n(Xi−E(Xi))⟶P0特别地,若同分布且E(Xi)=μ,则:
n1i=1∑nXi⟶Pμ辛钦定理大数定理#
若X1,X2,⋯独立同分布,且E(Xi)=μ存在,则:
n1i=1∑nXi⟶Pμ辛钦定理不要求方差存在,只要求期望存在。
伯努利大数定理#
设n次独立重复试验中事件A发生次数为X,每次发生概率为p,频率为nX,则:
nX⟶Pp也就是频率稳定于概率。
中心极限定理#
中心极限#
设X1,X2,⋯独立同分布,E(Xi)=μ,D(Xi)=σ2,则:
σn∑i=1nXi−nμ⟶dN(0,1)所以当n较大时:
i=1∑nXi≈N(nμ,nσ2)样本均值:
Xˉ=n1i=1∑nXi≈N(μ,nσ2)棣莫弗-拉普拉斯定理#
若X∼B(n,p),则当n较大时:
np(1−p)X−np≈N(0,1)因此:
P{a≤X≤b}≈Φ(np(1−p)b−np)−Φ(np(1−p)a−np)做连续性修正时常写成:
P{a≤X≤b}≈Φ(np(1−p)b+0.5−np)−Φ(np(1−p)a−0.5−np)