1. 为什么“数字特征”才是概率论里最像人话的一章如果你问一个学概率论的人前三章最劝退的是什么十有八九会说是“分布函数”“密度函数”“边缘分布”那一堆公式。但到了第四章“随机变量的数字特征”画风突然就变了——期望、方差、协方差、相关系数这些词你在生活里、在工作里、在刷短视频的时候几乎天天都能撞见。这一章之所以重要是因为它把前面那些抽象的分布“压缩”成了几个能算、能比、能解释的数。说白了前三章是在给你一张地图第四章是教你看地图上的几个关键坐标。我教过不少刚入门数据分析的朋友他们最大的困惑不是“不会算积分”而是“算出来这个数到底代表什么”。比如老板问你“这个月用户消费波动大不大”你回一句“方差是12400”老板只会觉得你在念咒。但如果你说“平均每人花86块但大部分人只花二三十少数人花好几百所以波动挺大”老板立刻就懂了。数字特征这一章练的就是这种把数学翻译成人话的能力。这篇文章我会按我平时带新人的路子来写先把这一章的核心概念拆开讲清楚每个数字特征到底在描述什么、为什么这么定义、计算的时候坑在哪里然后拿几个真实场景把期望、方差、协方差从头算一遍最后把我这些年踩过的坑和常见错误整理成一张速查表。不管你是正在啃教材的学生还是工作中要用到概率统计的从业者这一章的内容都值得你花时间吃透因为它是后面数理统计、回归分析、机器学习里“损失函数”“方差膨胀”“特征相关性”这些概念的根。2. 核心概念拆解每个数字特征到底在描述什么2.1 数学期望把“平均”这件事说严谨了期望这个词英文叫expected value直译是“预期值”。很多人第一次学的时候会觉得奇怪掷一个骰子结果只能是1到6期望是3.5可你永远掷不出3.5啊。这就是期望最容易被误解的地方——它不是“你下一次会得到的结果”而是“如果你重复无数次所有结果的平均值会趋近的那个数”。从定义上看离散型随机变量的期望是每个取值乘以对应概率再求和写成公式就是 $E(X) \sum_i x_i p_i$。连续型则是 $E(X) \int_{-\infty}^{\infty} x f(x) dx$。这两个式子本质上是一回事把“加权平均”这件事从有限个点推广到了连续的情况。你可以把概率理解成“权重”取值理解成“数据点”期望就是加权平均。这里有个关键点很多人会忽略期望存在的条件。离散型要求级数绝对收敛连续型要求积分绝对收敛。如果 $\sum |x_i| p_i$ 发散那期望就不存在。最经典的例子是柯西分布它的密度函数是 $\frac{1}{\pi(1x^2)}$你算 $\int |x| f(x) dx$ 会发现它发散所以柯西分布的期望不存在。这个知识点考试爱考工作中也重要——如果你拿一组服从重尾分布的数据去算平均值那个平均值可能根本没有意义。期望有几个性质必须记牢$E(C) C$常数期望是它自己$E(CX) C \cdot E(X)$$E(XY) E(X) E(Y)$这个对任意随机变量都成立不要求独立。最后这条特别有用因为它意味着你可以把复杂随机变量拆成简单部分分别求期望再相加这在后面算二项分布、泊松分布的期望时能省大量力气。2.2 方差与标准差波动到底该怎么衡量知道了平均值下一个问题自然是“数据离平均值有多远”。你可能会想那直接算 $E(X - E(X))$ 不就行了问题是这个值恒等于0因为正负偏差会互相抵消。所以人们改成算 $E[(X - E(X))^2]$这就是方差记作 $D(X)$ 或 $Var(X)$。方差衡量的是“离散程度”但它有个实际使用上的麻烦量纲不对。如果 $X$ 是“米”方差就是“平方米”你没法直接跟原始数据比较。所以实际工作中更常用的是标准差 $\sigma \sqrt{D(X)}$它和原始数据同量纲。比如一组人身高的方差是25平方厘米标准差就是5厘米你立刻能感觉到“平均身高上下浮动5厘米”是什么概念。方差的计算有个常用变形公式$D(X) E(X^2) - [E(X)]^2$。这个公式在手工计算时比定义式好用得多因为 $E(X^2)$ 往往比 $E[(X-E(X))^2]$ 好算。但要注意这个公式在数值计算时可能有精度问题——如果 $E(X^2)$ 和 $[E(X)]^2$ 都很大且很接近相减会损失有效数字。我处理过一组数据均值在10的8次方量级方差只有几百用这个公式算出来居然是负数就是因为浮点精度不够。这种情况要么用定义式要么先把数据平移再算。方差的性质里最常用的是 $D(CX) C^2 D(X)$ 和 $D(XC) D(X)$。注意第一个是 $C^2$ 不是 $C$因为偏差被放大了 $C$ 倍平方之后就是 $C^2$ 倍。第二个说明平移不改变波动这也符合直觉——你把所有人的身高都加10厘米大家之间的差距没变。还有一条如果 $X$ 和 $Y$ 独立那么 $D(XY) D(X) D(Y)$。这条在独立同分布场景下极其有用比如算 $n$ 次独立重复实验的总方差。2.3 协方差与相关系数两个变量之间的“默契程度”期望和方差都是描述单个随机变量的但现实里我们更常关心两个变量之间的关系。比如广告投入和销售额是不是同涨同跌身高和体重有没有关联协方差就是干这个的定义是 $Cov(X,Y) E[(X-E(X))(Y-E(Y))]$。理解协方差的关键在于那个乘积如果 $X$ 高于均值时 $Y$ 也倾向于高于均值乘积为正协方差就为正如果 $X$ 高时 $Y$ 反而低乘积为负协方差就为负如果两者没有这种同向或反向的趋势正负抵消协方差接近0。所以协方差的符号告诉你“方向”大小告诉你“强度”。但协方差有个和方差一样的毛病量纲不对。$X$ 是“元”、$Y$ 是“件”协方差就是“元·件”这个单位没有任何实际意义而且数值大小会随着你换单位而变。所以人们把它标准化除以两个标准差的乘积得到相关系数 $\rho \frac{Cov(X,Y)}{\sqrt{D(X)}\sqrt{D(Y)}}$。相关系数的取值范围是 $[-1, 1]$无量纲可以跨数据集比较。$\rho 1$ 表示完全正线性相关$\rho -1$ 表示完全负线性相关$\rho 0$ 表示不线性相关。这里有个大坑不相关不等于独立。不相关只说明没有线性关系但可能有非线性关系。最经典的例子是 $X$ 服从 $[-1,1]$ 上的均匀分布$Y X^2$你可以算出 $Cov(X,Y) 0$但 $Y$ 完全由 $X$ 决定显然不独立。这个反例在考试里出现频率极高工作中也很重要——你做特征筛选时如果只看相关系数会漏掉那些非线性相关的特征。2.4 矩与协方差矩阵把数字特征统一起来如果前面几个概念让你觉得有点散那“矩”这个概念能把它们串起来。$k$ 阶原点矩是 $E(X^k)$$k$ 阶中心矩是 $E[(X-E(X))^k]$。期望是一阶原点矩方差是二阶中心矩偏度是三阶标准中心矩峰度是四阶标准中心矩。这套语言在金融风控里特别常见因为收益率的偏度和峰度直接关系到极端风险。协方差矩阵则是把多个变量的方差和两两协方差装进一个矩阵。如果有 $n$ 个变量协方差矩阵是 $n \times n$ 的对角线是各自的方差非对角线是两两协方差。这个矩阵在多元统计、主成分分析、投资组合优化里是核心工具。它有个重要性质对称且半正定。半正定意味着对任意向量 $a$都有 $a^T \Sigma a \geq 0$这保证了方差永远非负。3. 实操计算从定义到结果的完整推演3.1 离散型案例掷骰子与二项分布的期望方差先从最简单的掷公平骰子开始。$X$ 的取值是1到6每个概率都是 $\frac{1}{6}$。期望 $E(X) \frac{123456}{6} 3.5$。方差用变形公式先算 $E(X^2) \frac{149162536}{6} \frac{91}{6} \approx 15.167$然后 $D(X) 15.167 - 3.5^2 15.167 - 12.25 2.917$。标准差约1.708。再来看二项分布 $X \sim B(n,p)$。这个分布的期望是 $np$方差是 $np(1-p)$这两个结论必须背下来。但我想带你推一遍期望因为推导过程体现了“拆解”的思想。把 $X$ 写成 $n$ 个独立伯努利变量之和$X X_1 X_2 \cdots X_n$每个 $X_i$ 取1的概率是 $p$取0的概率是 $1-p$。那么 $E(X_i) 1 \cdot p 0 \cdot (1-p) p$由期望的线性性质$E(X) np$。方差那边因为独立$D(X) \sum D(X_i)$而 $D(X_i) E(X_i^2) - [E(X_i)]^2 p - p^2 p(1-p)$所以 $D(X) np(1-p)$。这种“拆成独立小变量”的技巧在概率论里反复出现值得你专门练熟。举个实际数字某产品次品率5%抽100件次品数的期望是5方差是 $100 \times 0.05 \times 0.95 4.75$标准差约2.18。这意味着你抽100件次品数在5上下浮动2个左右是正常的如果某次抽出来15件次品那就偏离均值超过4个标准差基本可以怀疑这批货的次品率不止5%。3.2 连续型案例均匀分布与指数分布的手工计算均匀分布 $X \sim U(a,b)$ 的密度是 $\frac{1}{b-a}$在 $[a,b]$ 上。期望 $E(X) \int_a^b x \cdot \frac{1}{b-a} dx \frac{ab}{2}$就是区间中点符合直觉。方差 $D(X) \frac{(b-a)^2}{12}$。这个 $\frac{1}{12}$ 是怎么来的算 $E(X^2) \int_a^b x^2 \cdot \frac{1}{b-a} dx \frac{b^3-a^3}{3(b-a)} \frac{a^2abb^2}{3}$然后减去 $\left(\frac{ab}{2}\right)^2$化简后就是 $\frac{(b-a)^2}{12}$。这个结果在生成随机数、模拟实验里经常用到。指数分布 $X \sim Exp(\lambda)$ 的密度是 $\lambda e^{-\lambda x}$$x \geq 0$。期望 $E(X) \frac{1}{\lambda}$方差 $D(X) \frac{1}{\lambda^2}$。指数分布有个特别的性质叫“无记忆性”$P(X st | X s) P(X t)$。意思是如果你已经等了 $s$ 时间还没发生那再等 $t$ 时间的概率和从头开始等 $t$ 时间一样。这个性质在可靠性分析里很关键——如果某个元件的寿命服从指数分布那它“用旧了”不会更容易坏也不会更不容易坏。手工算指数分布的期望要用分部积分$\int_0^\infty x \lambda e^{-\lambda x} dx$令 $u x$$dv \lambda e^{-\lambda x} dx$则 $du dx$$v -e^{-\lambda x}$代入得 $[-xe^{-\lambda x}]_0^\infty \int_0^\infty e^{-\lambda x} dx 0 \frac{1}{\lambda} \frac{1}{\lambda}$。这个积分技巧在概率论里出现频率很高建议你亲手推两遍。3.3 协方差实操广告投入与销售额的相关性分析假设我们有一组简化的数据广告投入 $X$万元和销售额 $Y$万元的联合分布如下表。X\Y10203010.10.10.020.10.20.130.00.10.3先算边缘分布。$P(X1)0.2$$P(X2)0.4$$P(X3)0.4$。$P(Y10)0.2$$P(Y20)0.4$$P(Y30)0.4$。然后 $E(X) 1 \times 0.2 2 \times 0.4 3 \times 0.4 2.2$$E(Y) 10 \times 0.2 20 \times 0.4 30 \times 0.4 22$。算 $E(XY)$把所有 $x \cdot y \cdot p$ 加起来。$1 \times 10 \times 0.1 1$$1 \times 20 \times 0.1 2$$2 \times 10 \times 0.1 2$$2 \times 20 \times 0.2 8$$2 \times 30 \times 0.1 6$$3 \times 20 \times 0.1 6$$3 \times 30 \times 0.3 27$。总和是 $12286627 52$。所以 $Cov(X,Y) 52 - 2.2 \times 22 52 - 48.4 3.6$。再算方差$E(X^2) 1 \times 0.2 4 \times 0.4 9 \times 0.4 5.4$$D(X) 5.4 - 2.2^2 0.56$。$E(Y^2) 100 \times 0.2 400 \times 0.4 900 \times 0.4 540$$D(Y) 540 - 484 56$。相关系数 $\rho \frac{3.6}{\sqrt{0.56} \times \sqrt{56}} \frac{3.6}{0.748 \times 7.483} \frac{3.6}{5.598} \approx 0.643$。这说明广告投入和销售额有中等偏强的正相关但远没到完全线性相关的程度。3.4 用代码验证Python 实操一遍手工算完我习惯用代码验证一遍避免计算错误。下面这段代码把上面的例子完整跑一遍。import numpy as np # 联合概率表 p np.array([[0.1, 0.1, 0.0], [0.1, 0.2, 0.1], [0.0, 0.1, 0.3]]) x np.array([1, 2, 3]) y np.array([10, 20, 30]) # 边缘分布 px p.sum(axis1) py p.sum(axis0) # 期望 EX np.sum(x * px) EY np.sum(y * py) # 二阶矩 EX2 np.sum(x**2 * px) EY2 np.sum(y**2 * py) # 协方差 EXY np.sum(np.outer(x, y) * p) cov EXY - EX * EY # 方差与相关系数 DX EX2 - EX**2 DY EY2 - EY**2 rho cov / np.sqrt(DX * DY) print(fE(X){EX:.2f}, E(Y){EY:.2f}) print(fD(X){DX:.2f}, D(Y){DY:.2f}) print(fCov{cov:.2f}, rho{rho:.4f})跑出来的结果和手工算的一致$E(X)2.2$$E(Y)22$$D(X)0.56$$D(Y)56$$Cov3.6$$\rho \approx 0.643$。用代码的好处是改数据方便你可以把概率表换成任意值立刻看到相关系数怎么变。我建议你至少手动改两组数据一组让协方差为负一组让协方差接近0感受一下相关系数的变化。4. 常见问题与排查技巧实录4.1 期望与方差计算中的高频错误我批改过大量作业也 review 过不少同事的计算下面这些错误出现频率最高。错误类型典型表现正确做法方差公式用错写成 $D(X) E(X^2) - E(X)$是 $E(X^2) - [E(X)]^2$别漏平方线性变换系数$D(2X) 2D(X)$是 $D(2X) 4D(X)$系数要平方独立条件滥用不验证独立就用 $D(XY)D(X)D(Y)$只有独立或不相关时才成立相关系数范围算出 $\rho 1.2$ 还继续用$\rho$ 必须在 $[-1,1]$超出说明算错了期望不存在对柯西分布算期望先验证绝对收敛不收敛则期望不存在还有一个隐蔽的坑连续型随机变量求期望时积分上下限搞错。比如指数分布的积分是从0到正无穷如果你从负无穷开始积虽然密度在负半轴是0但写出来会显得不严谨考试可能扣分。再比如均匀分布 $U(a,b)$积分限是 $a$ 到 $b$不是0到1。4.2 相关系数为0但不独立的经典反例这个反例我每次讲课都要强调一遍因为考试太爱考了。设 $X \sim U(-1,1)$$Y X^2$。先算 $E(X) 0$$E(Y) E(X^2) \int_{-1}^1 x^2 \cdot \frac{1}{2} dx \frac{1}{3}$。然后 $E(XY) E(X^3) \int_{-1}^1 x^3 \cdot \frac{1}{2} dx 0$奇函数在对称区间积分。所以 $Cov(X,Y) 0 - 0 \times \frac{1}{3} 0$相关系数也是0。但 $Y$ 完全由 $X$ 决定$P(Y X^2) 1$显然不独立。这个例子的实际意义是你做特征工程时如果只算皮尔逊相关系数会认为 $X$ 和 $Y$ 没关系但实际上它们有很强的二次关系。解决办法是画散点图或者算互信息、距离相关系数。我在实际项目里遇到过好几次这种情况一个特征和标签的线性相关系数只有0.02但把它平方后加进模型AUC 提升了3个点。4.3 数值计算中的精度陷阱前面提过 $D(X) E(X^2) - [E(X)]^2$ 在数值计算时可能出问题。我再展开说一下。假设你的数据均值是 $10^8$方差是 $100$那么 $E(X^2)$ 大约是 $10^{16} 100$。双精度浮点数有大约15到16位有效数字$10^{16}$ 这个量级下加100根本体现不出来$E(X^2)$ 和 $[E(X)]^2$ 都是 $10^{16}$相减得到0甚至负数。解决办法有两个一是先把数据减去一个近似均值再算也就是用 $D(X) E[(X-c)^2] - [E(X)-c]^2$其中 $c$ 取接近均值的常数二是直接用定义式 $E[(X-E(X))^2]$先算偏差再平方。第二种方法在编程时更稳妥虽然多一次遍历但精度有保障。我在处理金融数据时养成了习惯只要数值量级超过 $10^6$就不用变形公式。4.4 协方差矩阵的半正定性检查如果你在多元统计里自己算协方差矩阵一定要检查它是不是半正定的。我见过有人因为数据里有重复列或者线性相关的列算出来的协方差矩阵有负特征值后面做 Cholesky 分解直接报错。检查方法很简单算特征值如果有小于 $-\epsilon$ 的$\epsilon$ 是容差比如 $10^{-8}$说明有问题。常见原因有三个一是数据里有完全共线的列比如一列是另一列的两倍二是样本量小于变量数协方差矩阵秩不够三是数值误差累积。解决办法分别是删掉冗余列、增加样本、或者对矩阵做正则化对角线加一个小量。这个坑在做主成分分析时特别常见因为 PCA 要对协方差矩阵做特征分解矩阵不正定会直接导致结果不可信。5. 这一章在后续学习中的实际位置数字特征这一章之所以关键是因为它往后连接了数理统计和机器学习。大数定律和中心极限定理都是用期望和方差来表述的参数估计里矩估计法就是令样本矩等于总体矩来解参数假设检验里$t$ 统计量、$F$ 统计量的构造都依赖方差回归分析里最小二乘法的目标函数就是残差平方和本质是在最小化方差机器学习里的偏差-方差分解、正则化项、批归一化全都建立在期望和方差的概念上。我个人的体会是如果你这一章没吃透后面学统计推断会非常痛苦因为你会一直在“这个公式为什么长这样”和“这个符号到底代表什么”之间反复卡壳。反过来如果你把期望的线性性质、方差的计算公式、协方差和相关系数的区别这几件事彻底搞明白了后面很多内容会变得顺理成章。最后分享一个我常用的检验方法学完这一章后随便找一个实际数据集算一遍每个特征的均值、标准差、两两相关系数然后试着用一句话解释每个数字的含义。如果你能对着老板或同事说清楚“这个特征平均是多少、波动大不大、和那个特征有没有关系”那这一章就算过关了。
企业数字化 ERP 产品动态
相关推荐
AI赋能文学创作:技术实践与创新应用 1. 项目背景与核心价值单向空间作为国内知名的独立书店与文学社群,近期开展的"AI文学"实验在文化圈引发热议。这场跨界尝试并非简单套用AI工具,而是探索了技术介入文学创作、传播与社群运营的全新可能。从实际效果来看,他们的实践至… · 2026/9/23 22:28:57
瑞芯微RV1106边缘视觉系统实战指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 2:25:35
如何用git把本地的文件上传到码云中仓库 Git 本地仓库与 Gitee 远程仓库冲突解决完整流程一、配置用户信息(全局,只需执行一次)以下命令用于配置 Git 全局用户信息,新项目无需重复设置:git config --global user.name 你的用户名
git config --global user.em… · 2026/9/24 2:25:10
Agent集群失控怎么办?企业级Agent架构从Demo走向生产 文章目录前言一、Agent 一多就乱,问题到底出在哪1.1 单打独斗的 Agent,像个全能实习生1.2 ReAct 循环:走一步算一步,翻车了才知道二、Plan 的全生命周期:从立 flag 到拔 flag2.1 创建计划:先把活拆成待办清… · 2026/9/24 2:25:04
对话即代码:用编译器技术实现自然语言的确定性编程 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 2:24:33
单相全桥SPWM调制选型:单极性、双极性与倍频对比 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 2:24:27
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44