在数理统计的广阔领域中,因子分解定理(Factorization Theorem,又称Cochran定理或Fisher-Neyman因子分解定理)是连接样本数据与参数估计的桥梁。它是判断一个统计量是否为充分统计量(Sufficient Statistic)最常用且最实用的工具。对于学习统计推断的学生和研究者而言,掌握这一定理是理解后续UMVUE(一致最小方差无偏估计)和Rao-Blackwell定理的基础。
设 是来自总体 的一个随机样本,其中 是未知参数(可以是向量)。统计量 是 的充分统计量,当且仅当存在非负函数 和 ,使得样本的联合概率密度函数(或概率质量函数) 可以分解为:
f_X(x; theta) = g(T(x); theta) cdot h(x)
其中:
注意:函数 和 的定义域可能依赖于 ,但在应用分解定理时,我们通常关注的是函数形式的分解,只要分解成立,充分性即得证。
为了深入理解因子分解定理,我们通过几个经典的数理统计案例来演示如何应用该定理寻找充分统计量。
设 独立同分布于 ,其中 未知。求 的充分统计量。
步骤1:写出联合密度函数
f(x; mu) = prod_{i=1}^{n} frac{1}{sqrt{2pi}} e^{-frac{1}{2}(x_i - mu)^2}
= (2pi)^{-n/2} e^{-frac{1}{2} sum_{i=1}^{n} (x_i - mu)^2}
步骤2:展开指数部分
sum (x_i - mu)^2 = sum (x_i^2 - 2x_imu + mu^2)
= sum x_i^2 - 2mu sum x_i + nmu^2
代回原式:
f(x; mu) = (2pi)^{-n/2} e^{-frac{1}{2} sum x_i^2} cdot e^{mu sum x_i - frac{nmu^2}{2}}
步骤3:进行因子分解
我们要将其写成 的形式。
结论:根据因子分解定理, 是 的充分统计量。
设 独立同分布于 。求 的充分统计量。
步骤1:写出联合密度函数
单个变量的密度为 ,其中 是指示函数。
f(x; theta) = prod_{i=1}^{n} frac{1}{theta} I_{[0, theta]}(x_i)
= frac{1}{theta^n} prod_{i=1}^{n} I_{[0, theta]}(x_i)
步骤2:分析指示函数
乘积 为1,当且仅当所有 。这等价于 且 。通常假设数据非负,故条件简化为 。
因此,。
步骤3:进行因子分解
结论:根据因子分解定理, 是 的充分统计量。注意,这里充分统计量的维度(1维)小于样本维度(n维),体现了充分统计量的压缩数据特性。
设 ,求 的充分统计量。
步骤1:写出联合概率函数
P(X=x; lambda) = prod_{i=1}^{n} frac{e^{-lambda} lambda^{x_i}}{x_i!}
= e^{-nlambda} lambda^{sum x_i} frac{1}{prod x_i!}
步骤2:进行因子分解
结论: 是 的充分统计量。事实上,由于泊松分布的可加性,,其分布仅依赖于 ,进一步验证了充分性。
许多常见的数理统计分布都属于指数族(Exponential Family)。指数族分布的定义本身就体现了因子分解定理的结构。一个分布属于指数族,如果其密度函数可以写成:
f(x; theta) = h(x) expleft( sum_{i=1}^{k} eta_i(theta) T_i(x) - A(theta) right)
由此可以看出,对于指数族分布, 构成了 的联合充分统计量。这使得我们可以直接通过观察分布形式来识别充分统计量,而无需每次都进行繁琐的分解计算。
| 分布名称 | 参数 | 联合充分统计量 T(X) | 备注 |
|---|---|---|---|
| 正态分布 N(μ, σ²) | (μ, σ²) | (sum X_i, sum X_i²) | 若σ²已知,则仅为 sum X_i |
| 正态分布 N(μ, 1) | μ | sum X_i | 单参数指数族 |
| 二项分布 B(n, p) | p | sum X_i | n 已知 |
| 几何分布 Geom(p) | p | sum X_i | 成功概率 p |
| 指数分布 Exp(λ) | λ | sum X_i | 尺度参数 λ |
| 伽马分布 Gamma(α, β) | (α, β) | (sum ln X_i, sum X_i) | 双参数情况 |
在数理统计中,因子分解定理找到的充分统计量,往往是构建最优估计量的起点。特别是当结合 Rao-Blackwell 定理 和 Lehmann-Scheffe 定理 时,充分统计量对于寻找 UMVUE(一致最小方差无偏估计)至关重要。
使用因子分解定理找到参数 的充分统计量 。
找到一个关于 的初始无偏估计量 (可能不是最优的,甚至方差很大)。
构造新的估计量 。根据 Rao-Blackwell 定理, 的方差不大于 ,且仍然是无偏的。
如果 还是完备充分统计量(Complete Sufficient Statistic),那么 就是唯一的 UMVUE。此时,其方差达到 Cramer-Rao 下界(如果正则条件满足)。
因此,因子分解定理不仅是理论工具,更是实际计算最优估计量的关键步骤。在许多数理统计考题和实际应用中,直接验证一个估计量是否达到C-R下界,往往需要先确认其基于充分统计量,并检查其方差是否等于 。
因子分解定理(Factorization Theorem),又称Cochran定理或Fisher-Neyman因子分解定理,是判断统计量是否为充分统计量的重要工具。它指出,样本联合概率密度函数(或概率质量函数)可以分解为两个函数的乘积:一个仅依赖于样本和参数,另一个仅依赖于样本(通常通过统计量T),且与参数无关。
"充分"意味着该统计量T(X)包含了样本中关于未知参数θ的所有信息。一旦知道了T(X)的值,样本的条件分布就不再依赖于参数θ。换句话说,在已知充分统计量的情况下,原始样本中不再包含任何可用于进一步估计参数的额外信息。
虽然因子分解定理主要用于识别充分统计量,但在推导Cramer-Rao下界时,充分统计量的存在往往能简化费雪信息量的计算。如果存在充分统计量,且其分布属于指数族,通常更容易验证无偏估计量是否达到方差下界,从而判断其是否为UMVUE(一致最小方差无偏估计)。
不一定。样本本身 总是参数的充分统计量,但维度为n。我们通常希望找到维度小于n的充分统计量,称为"简约充分统计量"(Minimal Sufficient Statistic)。例如,在正态分布 中, 是二维的简约充分统计量,而整个样本是n维的。