Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 33 | Markov 不等式:一阶概率估计

目录

    • 前言
    • 1. 引言
    • 2. 示例与直观理解
    • 3. 马尔可夫不等式的证明
    • 4. 结语
    • 结语
    • 参考

前言

学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第三十三讲:Markov 不等式:一阶概率估计,记录下个人学习笔记,和大家一起分享交流😄

video:https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V

1. 引言

OK,现在我们要开始探讨概率论与统计学中最重要的系列结论之一 — 中心极限定理和大数定律。这本质上揭示了当样本量n → ∞ n \rightarrow \inftyn时,概率分布的极限行为。

例如,当我们将多个概率分布相加时,它们会逐渐收敛于正态分布,而大数定律则表明:若对某个分布进行采样并计算样本均值,该均值将收敛于分布的期望值。

要证明这些极限定理,我们需要借助两个非常重要的数学定理 — 马尔可夫不等式与切比雪夫不等式。

马尔可夫不等式非常直观且简单,接下来我将逐步解释其原理。

该定理指出:若存在一个非负随机变量X XX,则X XX大于等于某个数值a aa的概率,不超过X XX的期望值除以a aa,即:

P ( X ≥ a ) ≤ E ( X ) a P(X \ge a) \le \frac{\mathbb{E}(X)}{a}P(Xa)aE(X)

这听起来可能有点抽象,这有什么用呢?我举个简单例子帮你建立直观理解,然后我们再给出证明。

2. 示例与直观理解

假设随机变量X XX的期望值E ( X ) = 10 \mathbb{E}(X) =10E(X)=10,这意味着X ≥ 20 X \ge 20X20的概率(这里的 20 对应不等式中的a aa)不超过期望值 10 与 20 的比值,即不超过1 2 \frac{1}{2}21

用通俗的话来说,如果一个概率分布函数 — 我们画个正态概率分布示意图,请注意,X XX严格非负,因此其取值范围仅限于从零开始的正数:

这意味着,如果我的均值(期望值)为 10,那么分布中最多只有一半的值可能超过 20。

确实如此,如果超过半数的分布落在 20 的右侧,那么左侧剩余的分布就不足以平衡整体,无法维持期望值为 10 的结果,这非常直观。

若平均值为 10,则分布中远离右侧某值的概率密度不能过高,否则左侧区域将没有足够的概率质量来平衡整体均值至 10。

这一思路通过一个极其实用且简洁的公式得以形式化,实际上,若超过 20 的概率大于1 2 \frac{1}{2}21,则所有大于 20 的概率质量必须集中在 20 处,而对应的平衡概率质量则需全部堆积在X = 0 X=0X=0的位置。

这可以说是极限情况,若要使分布的一半位于 20 的右侧,唯一的方式是将这部分概率全部集中在 20 处,而另一半则完全置于零点。若分布中位于 20 右侧的部分不足一半,则这部分概率可适当分散,对应的平衡概率也可作适度分布。

3. 马尔可夫不等式的证明

接下来我们逐步推导这个证明过程,这个证明相对简单。

对于离散随机变量X XX的期望值,其表达式可写为:

E ( X ) = ∑ x x P ( X = x ) \mathbb{E}(X) = \sum_x xP(X=x)E(X)=xxP(X=x)

对所有可能的随机变量取值进行求和,即每个可能取值x xx乘以该取值对应的概率P ( X = x ) P(X=x)P(X=x)的总和。该总和恒满足大于等于零的条件,由于X XX始终取正值且概率均为非负数。

若将求和范围限定为X ≥ A X \ge AXA的区间内,由于所有项均为非负值,部分和必然小于等于完整求和,即:

E ( X ) = ∑ x x P ( X = x ) ≥ ∑ x ≥ a x P ( X = x ) \mathbb{E}(X) = \sum_x xP(X=x) \ge \sum_{x \ge a} x P(X=x)E(X)=xxP(X=x)xaxP(X=x)

又由于x ≥ a x \ge axa,因此有:

E ( X ) = ∑ x x P ( X = x ) ≥ ∑ x ≥ a x P ( X = x ) ≥ ∑ x ≥ a a P ( X = x ) \mathbb{E}(X) = \sum_x xP(X=x) \ge \sum_{x \ge a} x P(X=x) \ge \sum_{x \ge a}aP(X=x)E(X)=xxP(X=x)xaxP(X=x)xaaP(X=x)

此时,可将a aa提取至外部,得到:

E ( X ) = ∑ x x P ( X = x ) ≥ ∑ x ≥ a x P ( X = x ) ≥ ∑ x ≥ a a P ( X = x ) = a P ( X ≥ a ) \mathbb{E}(X) = \sum_x xP(X=x) \ge \sum_{x \ge a} x P(X=x) \ge \sum_{x \ge a}aP(X=x) = aP(X \ge a)E(X)=xxP(X=x)xaxP(X=x)xaaP(X=x)=aP(Xa)

该式等于a aa乘以事件X ≥ a X \ge aXa发生的概率。

最后这一步可能需要稍作停顿思考才能理解,其实并不复杂,将a aa提取出来后,对于所有满足x ≥ a x \ge axax xx值概率求和,结果就是随机变量X ≥ a X \ge aXa的概率,这正是该求和运算的定义所在。

那么根据上述推导,最终我们可以得到前面提到的马尔可夫不等式,这就是证明过程。

4. 结语

OK,这是一个非常实用的定理(或不等式),在接下来的课程中,我们将运用这个结论来证明切比雪夫不等式,再借助切比雪夫不等式最终完成大数定律的证明。

因此,这个定理非常实用且直观,堪称解决问题的得力工具,该定理指出:对于非负分布,若存在均值,则分布数据不会过度集中在均值右侧,因为剩余部分不足以形成平衡,这个思路完全符合逻辑。

不等式的证明过程正是将这种直观理解进行严谨数学表达的方式,类似这样的定理还有很多,所以请大家先熟悉当前的推导思路,因为在接下来的示例中,我们将接触到更精妙的论证方法。

结语

马尔可夫不等式P ( X ≥ a ) ≤ E ( X ) a P(X \ge a) \le \frac{\mathbb{E}(X)}{a}P(Xa)aE(X)是整个极限定理大厦的第一块基石。它的极简性令人印象深刻:仅需知道随机变量的期望值(一阶矩),无需任何分布形态或高阶矩信息,即可给出尾部概率的上界。代价是宽松—若E ( X ) = 10 \mathbb{E}(X)=10E(X)=10,则P ( X ≥ 20 ) ≤ 0.5 P(X \ge 20) \le 0.5P(X20)0.5,这个上界在实际应用中可能相当保守,但数学上它始终严格成立。

证明过程仅用三步截断求和就完成了全部论证:(1)E ( X ) = ∑ x P ( x ) ≥ ∑ x ≥ a x P ( x ) \mathbb{E}(X) = \sum xP(x) \ge \sum_{x \ge a} xP(x)E(X)=xP(x)xaxP(x)—非负项的部分和不大于完整和;(2)∑ x ≥ a x P ( x ) ≥ ∑ x ≥ a a P ( x ) \sum_{x \ge a} xP(x) \ge \sum_{x \ge a} aP(x)xaxP(x)xaaP(x)—在截断区域内以a aa替代x xx,由于x ≥ a x \ge axa,这是下界;(3)∑ x ≥ a a P ( x ) = a P ( X ≥ a ) \sum_{x \ge a} aP(x) = aP(X \ge a)xaaP(x)=aP(Xa)—常数a aa提出,余下即所求概率。这三步本质上是将期望值中 “离原点足够远” 的贡献剥离出来并用下界估计,整个论证不依赖分布的连续/离散性、对称性、独立性等任何额外假设,唯一前提是X ≥ 0 X \ge 0X0

尽管马尔可夫不等式本身在实践中因过于宽松而较少直接使用,其真正的威力在于传递性:它作为引理支撑了切比雪夫不等式(引入方差信息使上界收窄为1 / k 2 1/k^21/k2),切比雪夫又进而支撑大数定律的证明。因此本讲是后续 L34–L36 三个里程碑(切比雪夫 → 大数定律 → 中心极限定理)的逻辑起点—正如 Brunton 所言,先从这条最直观也最基础的不等式熟悉截断求和的论证思路,后续的精妙推导都将在此模式上层层叠加 🤗。

参考

  • https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V