16-概率论

2194 字
11 分钟
16-概率论

容斥原理#

P(⋃i=1nAi)=∑k=1n(−1)k−1∑i1<i2<…<ikP(Ai1Ai2…Aik)\mathrm{P} (\bigcup_{i=1}^{n}{A_i}) = \sum_{k=1}^{n}(-1)^{k-1} \sum_{i_{1} \lt i_{2} \lt \ldots \lt i_{k}}{\mathrm{P}(A_{i_1}A_{i_2}\ldots A_{i_k})}

自由度为n-1,但在取值特殊的情况部分项会退化成平凡,在那时不需要已知n-1个项

常见分布#

离散#

离散型随机变量一般先写分布律:

P{X=xi}=pi,∑ipi=1P\{X=x_i\}=p_i,\qquad \sum_i p_i=1

二项分布#

X∼B(n,p),P{X=k}=Cnkpk(1−p)n−kX\sim B(n,p),\qquad P\{X=k\}=C_n^k p^k(1-p)^{n-k}

含义是nn次独立重复试验中事件AA发生kk次的概率。

E(X)=np,D(X)=np(1−p)E(X)=np,\qquad D(X)=np(1-p)

可加性:

X∼B(n1,p),  Y∼B(n2,p),  X,Y 独立⇒X+Y∼B(n1+n2,p)X\sim B(n_1,p),\;Y\sim B(n_2,p),\;X,Y\text{ 独立} \Rightarrow X+Y\sim B(n_1+n_2,p)

条件是随机变量相互独立,且成功概率pp相同;相加的是试验次数nn,pp保持不变。

直观理解:把两组相互独立、每次成功概率均为pp的试验合并,就得到n1+n2n_1+n_2次独立重复试验,X+YX+Y是总成功次数。

证明:设0<p<10<p<1,由独立性,对k=0,1,⋯ ,n1+n2k=0,1,\cdots,n_1+n_2有

P{X+Y=k}=∑j=max⁡(0,k−n2)min⁡(n1,k)P{X=j}P{Y=k−j}=pk(1−p)n1+n2−k∑j=max⁡(0,k−n2)min⁡(n1,k)Cn1jCn2k−j=Cn1+n2kpk(1−p)n1+n2−k.\begin{aligned} P\{X+Y=k\} &=\sum_{j=\max(0,k-n_2)}^{\min(n_1,k)}P\{X=j\}P\{Y=k-j\}\\ &=p^k(1-p)^{n_1+n_2-k} \sum_{j=\max(0,k-n_2)}^{\min(n_1,k)}C_{n_1}^jC_{n_2}^{k-j}\\ &=C_{n_1+n_2}^k p^k(1-p)^{n_1+n_2-k}. \end{aligned}

最后一步使用范德蒙德恒等式:从两组共n1+n2n_1+n_2个元素中选kk个,可按第一组选了jj个分类计数。p=0p=0或p=1p=1时,随机变量为常数,结论也成立。

推广到多个随机变量:若X1,⋯ ,XmX_1,\cdots,X_m相互独立,且Xi∼B(ni,p)X_i\sim B(n_i,p),则

∑i=1mXi∼B(∑i=1mni,p).\sum_{i=1}^{m}X_i\sim B\left(\sum_{i=1}^{m}n_i,p\right).

例如,独立的X∼B(3,0.4)X\sim B(3,0.4)与Y∼B(5,0.4)Y\sim B(5,0.4)满足X+Y∼B(8,0.4)X+Y\sim B(8,0.4)。若成功概率不同,和一般不再服从二项分布;若不独立,也不能直接使用上述结论。

当nn很大,pp较小,λ=np\lambda=np适中时,可以用泊松分布近似:

B(n,p)≈P(λ)B(n,p)\approx P(\lambda)

泊松分布#

X∼P(λ),P{X=k}=λkk!e−λX\sim P(\lambda),\qquad P\{X=k\}=\frac{\lambda^k}{k!}e^{-\lambda}

常用于单位时间、单位面积内随机事件发生次数。

E(X)=λ,D(X)=λE(X)=\lambda,\qquad D(X)=\lambda

可加性:

X∼P(λ1),  Y∼P(λ2),  X,Y 独立⇒X+Y∼P(λ1+λ2)X\sim P(\lambda_1),\;Y\sim P(\lambda_2),\;X,Y\text{ 独立} \Rightarrow X+Y\sim P(\lambda_1+\lambda_2)

几何分布#

X∼Ge(p),P{X=k}=(1−p)k−1p,k=1,2,⋯X\sim Ge(p),\qquad P\{X=k\}=(1-p)^{k-1}p,\quad k=1,2,\cdots

含义是第一次成功发生在第kk次试验。

E(X)=1p,D(X)=1−pp2E(X)=\frac{1}{p},\qquad D(X)=\frac{1-p}{p^2}

无记忆性:

P{X>m+n∣X>m}=P{X>n}P\{X>m+n\mid X>m\}=P\{X>n\}

超几何分布#

总体NN个,其中有MM个目标元素,不放回抽取nn个,抽到kk个目标元素:

P{X=k}=CMkCN−Mn−kCNnP\{X=k\}=\frac{C_M^kC_{N-M}^{n-k}}{C_N^n}E(X)=nMNE(X)=n\frac{M}{N}

方差:

D(X)=nMN(1−MN)N−nN−1D(X)=n\frac{M}{N}\left(1-\frac{M}{N}\right)\frac{N-n}{N-1}

负二项分布#

P{X=k}=Ck−1r−1pr(1−p)k−r,k=r,r+1,⋯P\{X=k\}=C_{k-1}^{r-1}p^r(1-p)^{k-r},\quad k=r,r+1,\cdots

含义是第rr次成功发生在第kk次试验。

E(X)=rp,D(X)=r(1−p)p2E(X)=\frac{r}{p},\qquad D(X)=\frac{r(1-p)}{p^2}

连续#

连续型随机变量通常先写密度函数f(x)f(x):

P{a<X≤b}=∫abf(x)dx,∫−∞+∞f(x)dx=1P\{a<X\le b\}=\int_a^b f(x)dx,\qquad \int_{-\infty}^{+\infty}f(x)dx=1

分布函数:

F(x)=P{X≤x}=∫−∞xf(t)dtF(x)=P\{X\le x\}=\int_{-\infty}^{x}f(t)dt

均匀分布#

X∼U(a,b),f(x)={1b−a,a<x<b0,其他X\sim U(a,b),\qquad f(x)= \begin{cases} \frac{1}{b-a}, & a<x<b\\ 0, & \text{其他} \end{cases}E(X)=a+b2,D(X)=(b−a)212E(X)=\frac{a+b}{2},\qquad D(X)=\frac{(b-a)^2}{12}

指数分布#

X∼E(λ),f(x)={λe−λx,x>00,x≤0X\sim E(\lambda),\qquad f(x)= \begin{cases} \lambda e^{-\lambda x}, & x>0\\ 0, & x\le 0 \end{cases}

分布函数:

F(x)={1−e−λx,x>00,x≤0F(x)= \begin{cases} 1-e^{-\lambda x}, & x>0\\ 0, & x\le 0 \end{cases}E(X)=1λ,D(X)=1λ2E(X)=\frac{1}{\lambda},\qquad D(X)=\frac{1}{\lambda^2}

无记忆性:

P{X>s+t∣X>s}=P{X>t}P\{X>s+t\mid X>s\}=P\{X>t\}

正态分布#

X∼N(μ,σ2),f(x)=12πσe−(x−μ)22σ2X\sim N(\mu,\sigma^2),\qquad f(x)=\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}

标准化:

Z=X−μσ∼N(0,1)Z=\frac{X-\mu}{\sigma}\sim N(0,1)P{a<X<b}=Φ(b−μσ)−Φ(a−μσ)P\{a<X<b\}=\Phi\left(\frac{b-\mu}{\sigma}\right)-\Phi\left(\frac{a-\mu}{\sigma}\right)

可加性:

X∼N(μ1,σ12),  Y∼N(μ2,σ22),  X,Y 独立⇒X+Y∼N(μ1+μ2,σ12+σ22)X\sim N(\mu_1,\sigma_1^2),\;Y\sim N(\mu_2,\sigma_2^2),\;X,Y\text{ 独立} \Rightarrow X+Y\sim N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2)

随机变量的函数#

一般#

设Y=g(X)Y=g(X)。

离散型直接合并概率:

P{Y=y}=∑x:g(x)=yP{X=x}P\{Y=y\}=\sum_{x:g(x)=y}P\{X=x\}

连续型常用分布函数法:

FY(y)=P{Y≤y}=P{g(X)≤y}F_Y(y)=P\{Y\le y\}=P\{g(X)\le y\}

先把事件转化成XX的范围,再对FY(y)F_Y(y)求导得到fY(y)f_Y(y)。

若g(x)g(x)在区间上单调可导,反函数为x=h(y)x=h(y),则:

fY(y)=fX(h(y))∣h′(y)∣f_Y(y)=f_X(h(y))|h'(y)|

多元函数常见线性变换:

Y=aX+bY=aX+b

有

E(Y)=aE(X)+b,D(Y)=a2D(X)E(Y)=aE(X)+b,\qquad D(Y)=a^2D(X)

最值#

设X1,⋯ ,XnX_1,\cdots,X_n相互独立同分布,分布函数为F(x)F(x),密度为f(x)f(x)。

最大值:

M=max⁡{X1,⋯ ,Xn}M=\max\{X_1,\cdots,X_n\}FM(x)=P{M≤x}=Fn(x)F_M(x)=P\{M\le x\}=F^n(x)fM(x)=nFn−1(x)f(x)f_M(x)=nF^{n-1}(x)f(x)

最小值:

m=min⁡{X1,⋯ ,Xn}m=\min\{X_1,\cdots,X_n\}Fm(x)=P{m≤x}=1−[1−F(x)]nF_m(x)=P\{m\le x\}=1-[1-F(x)]^nfm(x)=n[1−F(x)]n−1f(x)f_m(x)=n[1-F(x)]^{n-1}f(x)

随机过程#

随机过程是一族按参数tt变化的随机变量,记作:

{X(t),  t∈T}\{X(t),\;t\in T\}

其中tt常表示时间,X(t)X(t)表示时刻tt系统所处的随机状态。若TT为离散集合,称为离散时间随机过程;若TT为连续区间,称为连续时间随机过程。

泊松过程#

泊松过程常用来描述随机事件随时间发生的次数。设N(t)N(t)表示时间区间[0,t][0,t]内事件发生的次数,若{N(t),t≥0}\{N(t),t\ge0\}为强度为λ\lambda的泊松过程,则:

N(t)∼P(λt)N(t)\sim P(\lambda t)

即:

P{N(t)=k}=(λt)kk!e−λt,k=0,1,2,⋯P\{N(t)=k\}=\frac{(\lambda t)^k}{k!}e^{-\lambda t},\quad k=0,1,2,\cdots

它满足:

  • N(0)=0N(0)=0;
  • 独立增量:互不相交时间区间内发生的事件数相互独立;
  • 平稳增量:长度相同的时间区间内事件数分布相同,且只与区间长度有关。

为什么事件次数服从泊松分布#

公式中的指数并不是凭空假设出来的,而是把时间切成很多小段后,由独立性和重要极限推出来的。这里 λ>0\lambda>0 表示单位时间的平均发生次数,λt\lambda t 表示长度为 tt 的时间内的平均次数。注意:前面泊松分布 P(λ)P(\lambda) 中的参数表示平均次数;这里过程的 λ\lambda 表示速率,固定时间段对应的分布参数是 λt\lambda t。

除独立、平稳增量外,普通泊松过程还要求事件在极短时间内稀疏地发生。记 ΔN=N(s+h)−N(s)\Delta N=N(s+h)-N(s),当 h→0+h\to0^+ 时:

P{ΔN=1}=λh+o(h),P{ΔN≥2}=o(h).P\{\Delta N=1\}=\lambda h+o(h),\qquad P\{\Delta N\ge2\}=o(h).

也就是:发生一次的概率近似与时长成正比,发生两次及以上的概率比时长更高阶地趋于零。仅有“事件随机发生”或独立、平稳增量,还不足以得到普通泊松过程。

把 [0,t][0,t] 等分成 nn 段,每段长 t/nt/n,则每段可以近似看作一次独立的伯努利试验,发生概率约为 λt/n\lambda t/n,所以

N(t)≈B(n,λtn).N(t)\approx B\left(n,\frac{\lambda t}{n}\right).

切分无限变细时,对固定的非负整数 kk,得到二项分布的泊松极限:

P{N(t)=k}=lim⁡n→∞(nk)(λtn)k(1−λtn)n−k=(λt)kk!e−λt.\begin{aligned} P\{N(t)=k\} &=\lim_{n\to\infty}\binom nk \left(\frac{\lambda t}{n}\right)^k \left(1-\frac{\lambda t}{n}\right)^{n-k}\\ &=\frac{(\lambda t)^k}{k!}e^{-\lambda t}. \end{aligned}

其中两部分分别来自:

(nk)(λtn)k=(λt)kk!∏j=0k−1(1−jn)⟶(λt)kk!,\binom nk\left(\frac{\lambda t}{n}\right)^k =\frac{(\lambda t)^k}{k!}\prod_{j=0}^{k-1}\left(1-\frac jn\right) \longrightarrow\frac{(\lambda t)^k}{k!},(1−λtn)n−k⟶e−λt.\left(1-\frac{\lambda t}{n}\right)^{n-k} \longrightarrow e^{-\lambda t}.

严格处理上述近似时,可先统计“至少发生一次的小段数”:它服从参数为 nn 和 λt/n+o(t/n)\lambda t/n+o(t/n) 的二项分布;任一小段发生多次的概率不超过 n o(t/n)→0n\,o(t/n)\to0,因此它与总事件数不同的概率趋于零,二者得到相同的极限分布。

指数项与时间的直接关系#

令 k=0k=0,便有

P{N(t)=0}=e−λt.\boxed{P\{N(t)=0\}=e^{-\lambda t}}.

它表示整段时间内一次事件也没发生的概率。“一直没发生”要求每个小时间段都没发生,由独立性将概率相乘,极限就是指数函数:

(1−λtn)n⟶e−λt.\left(1-\frac{\lambda t}{n}\right)^n\longrightarrow e^{-\lambda t}.

例如平均每小时来 22 个电话,取小时为时间单位,则 λ=2\lambda=2。半小时 t=0.5t=0.5 内:

N(0.5)∼P(1),P{N(0.5)=0}=e−1,E[N(0.5)]=1.N(0.5)\sim P(1),\qquad P\{N(0.5)=0\}=e^{-1},\qquad E[N(0.5)]=1.
对象描述的内容
泊松分布固定时间段内发生了几次
泊松过程随着时间增加,累计次数如何变化,以及不同时间段的次数之间的关系
指数分布等到下一次事件需要多久

时间通过“速率 ×\times 时长”进入分布。速率稳定、不同时间段独立、短时间内多次发生的概率可忽略,是这个模型适用的关键。

与指数等待时间的联系#

若T1T_1表示从时刻 00 到第一次事件的等待时间,T2,T3,⋯T_2,T_3,\cdots表示此后相邻两次事件发生的时间间隔,则它们相互独立且同分布,并且:

Ti∼E(λ),f(t)=λe−λt,t>0T_i\sim E(\lambda),\qquad f(t)=\lambda e^{-\lambda t},\quad t>0

也就是说,泊松过程中两个相邻事件的时间间隔服从指数分布,且:

E(Ti)=1λE(T_i)=\frac{1}{\lambda}

证明思路是把“等待第一次事件超过tt”转化为“[0,t][0,t]内没有事件”:

P{T1>t}=P{N(t)=0}=e−λtP\{T_1>t\}=P\{N(t)=0\}=e^{-\lambda t}

所以:

FT1(t)=P{T1≤t}=1−e−λtF_{T_1}(t)=P\{T_1\le t\}=1-e^{-\lambda t}

这正是参数为λ\lambda的指数分布。

数字特征#

分布数字特征总结#

期望:

E(X)=∑ixipiE(X)=\sum_i x_ip_i

或

E(X)=∫−∞+∞xf(x)dxE(X)=\int_{-\infty}^{+\infty}xf(x)dx

函数期望:

E[g(X)]=∑ig(xi)piE[g(X)]=\sum_i g(x_i)p_i

或

E[g(X)]=∫−∞+∞g(x)f(x)dxE[g(X)]=\int_{-\infty}^{+\infty}g(x)f(x)dx

方差:

D(X)=E[(X−E(X))2]=E(X2)−[E(X)]2D(X)=E[(X-E(X))^2]=E(X^2)-[E(X)]^2

常用性质:

E(aX+bY+c)=aE(X)+bE(Y)+cE(aX+bY+c)=aE(X)+bE(Y)+cD(aX+b)=a2D(X)D(aX+b)=a^2D(X)

若X,YX,Y独立,则:

E(XY)=E(X)E(Y)E(XY)=E(X)E(Y)D(X+Y)=D(X)+D(Y)D(X+Y)=D(X)+D(Y)

最值期望#

对非负随机变量,有尾和公式:

E(X)=∫0+∞P{X>x}dxE(X)=\int_0^{+\infty}P\{X>x\}dx

离散非负整数型:

E(X)=∑k=0+∞P{X>k}E(X)=\sum_{k=0}^{+\infty}P\{X>k\}

所以最值期望通常先求最值的分布函数,再转成尾概率。

最大值:

E(M)=∫−∞+∞x⋅nFn−1(x)f(x)dxE(M)=\int_{-\infty}^{+\infty}x\cdot nF^{n-1}(x)f(x)dx

最小值:

E(m)=∫−∞+∞x⋅n[1−F(x)]n−1f(x)dxE(m)=\int_{-\infty}^{+\infty}x\cdot n[1-F(x)]^{n-1}f(x)dx

切比雪夫不等式#

若E(X)=μ,  D(X)=σ2E(X)=\mu,\;D(X)=\sigma^2,则:

P{∣X−μ∣≥ε}≤σ2ε2P\{|X-\mu|\ge \varepsilon\}\le \frac{\sigma^2}{\varepsilon^2}

等价形式:

P{∣X−μ∣<ε}≥1−σ2ε2P\{|X-\mu|<\varepsilon\}\ge 1-\frac{\sigma^2}{\varepsilon^2}

这个不要求知道具体分布,只要期望和方差存在即可。

协方差#

Cov(X,Y)=E[(X−E(X))(Y−E(Y))]Cov(X,Y)=E[(X-E(X))(Y-E(Y))]

常用计算式:

Cov(X,Y)=E(XY)−E(X)E(Y)Cov(X,Y)=E(XY)-E(X)E(Y)

方差展开:

D(X+Y)=D(X)+D(Y)+2Cov(X,Y)D(X+Y)=D(X)+D(Y)+2Cov(X,Y)

若X,YX,Y独立,则Cov(X,Y)=0Cov(X,Y)=0。

相关系数#

ρXY=Cov(X,Y)D(X)D(Y)\rho_{XY}=\frac{Cov(X,Y)}{\sqrt{D(X)}\sqrt{D(Y)}}−1≤ρXY≤1-1\le \rho_{XY}\le 1

独立一定不相关,不相关不一定独立

当∣ρXY∣=1|\rho_{XY}|=1时,X,YX,Y之间存在几乎处处的线性关系。

依概率收敛#

随机变量序列XnX_n依概率收敛到XX,记作:

Xn⟶PXX_n\overset{P}{\longrightarrow}X

定义为对任意ε>0\varepsilon>0:

lim⁡n→∞P{∣Xn−X∣≥ε}=0\lim_{n\rightarrow\infty}P\{|X_n-X|\ge \varepsilon\}=0

直观理解是nn足够大时,XnX_n偏离XX的概率趋于0。

大数定律#

大数定律说明样本均值在概率意义下趋近于总体期望。

切比雪夫大数定理#

若X1,⋯ ,XnX_1,\cdots,X_n两两不相关,且方差有共同上界,即存在CC使D(Xi)≤CD(X_i)\le C,则:

1n∑i=1n(Xi−E(Xi))⟶P0\frac{1}{n}\sum_{i=1}^{n}(X_i-E(X_i))\overset{P}{\longrightarrow}0

特别地,若同分布且E(Xi)=μE(X_i)=\mu,则:

1n∑i=1nXi⟶Pμ\frac{1}{n}\sum_{i=1}^{n}X_i\overset{P}{\longrightarrow}\mu

辛钦定理大数定理#

若X1,X2,⋯X_1,X_2,\cdots独立同分布,且E(Xi)=μE(X_i)=\mu存在,则:

1n∑i=1nXi⟶Pμ\frac{1}{n}\sum_{i=1}^{n}X_i\overset{P}{\longrightarrow}\mu

辛钦定理不要求方差存在,只要求期望存在。

伯努利大数定理#

设nn次独立重复试验中事件AA发生次数为XX,每次发生概率为pp,频率为Xn\frac{X}{n},则:

Xn⟶Pp\frac{X}{n}\overset{P}{\longrightarrow}p

也就是频率稳定于概率。

中心极限定理#

中心极限#

设X1,X2,⋯X_1,X_2,\cdots独立同分布,E(Xi)=μ,  D(Xi)=σ2E(X_i)=\mu,\;D(X_i)=\sigma^2,则:

∑i=1nXi−nμσn⟶dN(0,1)\frac{\sum_{i=1}^{n}X_i-n\mu}{\sigma\sqrt{n}}\overset{d}{\longrightarrow}N(0,1)

所以当nn较大时:

∑i=1nXi≈N(nμ,nσ2)\sum_{i=1}^{n}X_i\approx N(n\mu,n\sigma^2)

样本均值:

Xˉ=1n∑i=1nXi≈N(μ,σ2n)\bar X=\frac{1}{n}\sum_{i=1}^{n}X_i\approx N\left(\mu,\frac{\sigma^2}{n}\right)

棣莫弗-拉普拉斯定理#

若X∼B(n,p)X\sim B(n,p),则当nn较大时:

X−npnp(1−p)≈N(0,1)\frac{X-np}{\sqrt{np(1-p)}}\approx N(0,1)

因此:

P{a≤X≤b}≈Φ(b−npnp(1−p))−Φ(a−npnp(1−p))P\{a\le X\le b\} \approx \Phi\left(\frac{b-np}{\sqrt{np(1-p)}}\right) - \Phi\left(\frac{a-np}{\sqrt{np(1-p)}}\right)

做连续性修正时常写成:

P{a≤X≤b}≈Φ(b+0.5−npnp(1−p))−Φ(a−0.5−npnp(1−p))P\{a\le X\le b\} \approx \Phi\left(\frac{b+0.5-np}{\sqrt{np(1-p)}}\right) - \Phi\left(\frac{a-0.5-np}{\sqrt{np(1-p)}}\right)

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

16-概率论
https://skaco2.com/posts/02-math/16-概率论/
作者
SKACO2
发布于
2026-04-09
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
SKACO2
笼中鸟,何时飞!
公告
欢迎来到我的博客!
音乐
封面

音乐

暂未播放

0:00 0:00
暂无歌词
分类
标签
站点统计
文章
63
分类
10
标签
59
总字数
84,017
运行时长
0 天
最后活动
0 天前

目录