贝叶斯估计——统计推断的参数估计方法
贝叶斯估计——统计推断的参数估计方法统计推断的基础统计推断是根据样本信息对总体分布或总体的数字特征进行推断。事实上这是经典学派对统计推断的规定这里的统计推断使用到两种信息总体信息和样本信息而贝叶斯学派认为除了上述两种信息以外统计推断还应该使用第三种信息先验信息。总体信息总体信息即总体分布或总体所属分布族提供的信息。比如若已知“总体是正态分布”或者总体的一切阶矩都存在总体密度函数关于均值对称总体的所有性质由其一、二阶矩决定有许多成熟的统计推断方法可供选用等。样本信息样本信息即抽取样本所得观测值提供的信息。例如在有了样本观测值后可以根据它大概知道总体的一些数字特征如总体均值、总体方差等在一个什么范围内。样本信息越多越好希望通过样本对总体分布或总体的某些特征作出较精确的统计推断。没有样本就没有统计学可言。先验信息如果把抽取样本看作做一次试验则样本信息是试验中得到的信息。先验信息即是抽样试验之前有关统计问题的一些信息。人们在试验之前对要做的问题在经验上和资料上总是有所了解的。一般说来先验信息来源于经验和历史资料。先验信息在日常生活和工作中是很重要的。先看一个例子。例 在某工厂的产品中每天要抽检nnn件以确定该厂产品的质量是否满足要求。产品质量可用不合格品率ppp来度量也可以用nnn件抽查产品中的不合格品件数θ\thetaθ表示。由于生产过程有连续性可以认为每天的产品质量是有关联的即是说在估计现在的ppp时以前所积累的资料应该是可供使用的这些积累的历史资料是先验信息。为了能使用这些先验信息需要对它进行加工。例如在经过一段时间后就可根据历史资料对过去nnn件产品中的不合格品件数θ\thetaθ构造一个分布P(θi)pi,i1,2,⋯ ,n. P\left(\theta i\right) p_i, \quad i 1, 2, \cdots, n.P(θi)pi,i1,2,⋯,n.这种对先验信息进行加工获得的分布称为先验分布。这种先验分布是对该厂过去产品的不合格品率的一个全面看法。基于上述三种信息进行统计推断的统计学称为贝叶斯统计学。贝叶斯统计学与经典统计学的差别在于是否利用先验信息。贝叶斯统计在重视使用总体信息和样本信息的同时还注意先验信息的收集、挖掘和加工使它数量化形成先验分布参加到统计推断中来以提高统计推断的质量。贝叶斯学派的基本观点是任一未知量θ\thetaθ都可看作随机变量可用一个概率分布去描述这个分布称为先验分布在获得样本之后总体分布、样本与先验分布通过贝叶斯公式结合起来得到一个关于未知量θ\thetaθ的新分布——后验分布任何关于θ\thetaθ的统计推断都应该基于θ\thetaθ的后验分布进行。关于未知量是否可看作随机变量在经典学派与贝叶斯学派间争论了很长时间。因为任一未知量都有不确定性而在表述不确定性的程度时概率与概率分布是最好的语言因此把它看成随机变量是合理的。如今经典学派已不反对这一观点。著名的美国经典统计学家莱曼Lehmann, E. L.在他的《点估计理论》一书中写道“把统计问题中的参数看作随机变量的实现要比看作未知参数更合理一些”。如今两派的争论焦点是如何利用各种先验信息合理地确定先验分布。这在有些场合是容易解决的但在很多场合是相当困难的关于这方面问题的讨论可参阅相关文献。贝叶斯公式的密度函数形式这里用随机变量的概率函数再一次叙述贝叶斯公式并从中介绍贝叶斯学派的一些具体想法。1总体依赖于参数θ\thetaθ的概率密度函数在经典统计推断中记为p(x;θ)p\left(x; \theta\right)p(x;θ)它表示参数空间Θ\varThetaΘ中不同的θ\thetaθ对应不同的分布。在贝叶斯统计推断中应记为p(x∣θ)p\left(x\mid \theta\right)p(x∣θ)它表示在随机变量θ\thetaθ取某个给定值时总体的条件概率函数。2根据参数θ\thetaθ的先验信息确定先验分布p(θ)p\left(\theta\right)p(θ)。3从贝叶斯观点看样本X(x1,⋯ ,xn)X \left(x_1, \cdots, x_n\right)X(x1,⋯,xn)的产生要分两步进行。首先设想从先验分布p(θ)p\left(\theta\right)p(θ)产生一个样本θ0\theta_0θ0。第二步从p(X∣θ0)p\left(X\mid \theta_0\right)p(X∣θ0)中产生一组样本。这时样本X(x1,⋯ ,xn)X \left(x_1, \cdots, x_n\right)X(x1,⋯,xn)的联合条件概率函数为p(X∣θ0)p(x1,⋯ ,xn∣θ0)∏i1np(xi∣θ0), p\left(X\mid \theta_0\right) p\left(x_1, \cdots, x_n\mid \theta_0\right) \prod_{i1}^n p\left(x_i\mid \theta_0\right),p(X∣θ0)p(x1,⋯,xn∣θ0)i1∏np(xi∣θ0),这个分布综合了总体信息和样本信息。4由于θ0\theta_0θ0是设想出来的仍然是未知的它是按先验分布p(θ)p\left(\theta\right)p(θ)产生的。为把先验信息综合进去不能只考虑θ0\theta_0θ0也要考虑θ\thetaθ的其他值发生的可能性故要用p(θ)p\left(\theta\right)p(θ)进行综合。这样一来样本XXX和参数θ\thetaθ的联合分布为p(X,θ)p(X∣θ)p(θ). p\left(X, \theta\right) p\left(X\mid \theta\right) p\left(\theta\right).p(X,θ)p(X∣θ)p(θ).这个联合分布把总体信息、样本信息和先验信息三种可用信息都综合进去了。5要对未知参数θ\thetaθ作统计推断。在没有样本信息时只能依据先验分布对θ\thetaθ作出推断。在有了样本观测值X(x1,⋯ ,xn)X \left(x_1, \cdots, x_n\right)X(x1,⋯,xn)之后应依据p(X,θ)p\left(X, \theta\right)p(X,θ)对θ\thetaθ作出推断。若把p(X,θ)p\left(X, \theta\right)p(X,θ)作如下分解p(X,θ)p(θ∣X)p(X), p\left(X, \theta\right) p\left(\theta \mid X\right) p\left(X\right),p(X,θ)p(θ∣X)p(X),其中p(X)p\left(X\right)p(X)是XXX的边缘概率函数p(X)∫Θp(X,θ) dθ∫Θp(X∣θ)p(θ) dθ, p\left(X\right) \int_\varTheta p\left(X, \theta\right) \, {\rm d}\theta \int_\varTheta p\left(X \mid \theta\right) p\left(\theta\right) \, {\rm d}\theta,p(X)∫Θp(X,θ)dθ∫Θp(X∣θ)p(θ)dθ,它与θ\thetaθ无关或者说p(X)p\left(X\right)p(X)中不含θ\thetaθ的任何信息。因此能用来对θ\thetaθ作出推断的是条件分布p(θ∣X)p\left(\theta \mid X\right)p(θ∣X)它的计算公式是p(θ∣X)p(X,θ)p(X)p(X∣θ)p(θ)∫Θp(X∣θ)p(θ) dθ. p\left(\theta \mid X\right) \frac{p\left(X, \theta\right)}{p\left(X\right)} \frac{p\left(X \mid \theta\right) p\left(\theta\right)}{\int_\varTheta p\left(X \mid \theta\right) p\left(\theta\right) \, {\rm d}\theta}.p(θ∣X)p(X)p(X,θ)∫Θp(X∣θ)p(θ)dθp(X∣θ)p(θ).这个条件分布称为θ\thetaθ的后验分布它集中了总体、样本和先验中有关θ\thetaθ的一切信息。这是用密度函数表示的贝叶斯公式它也是用总体和样本对先验分布p(θ)p\left(\theta\right)p(θ)作调整的结果它要比p(θ)p\left(\theta\right)p(θ)更接近θ\thetaθ的实际情况。贝叶斯估计由后验分布p(θ∣X)p\left(\theta\mid X\right)p(θ∣X)估计θ\thetaθ有三种常用的方法使用后验分布的密度函数最大值点作为θ\thetaθ的点估计的最大后验估计。使用后验分布的中位数作为θ\thetaθ的点估计的后验中位数估计。使用后验分布的均值作为θ\thetaθ的点估计的后验期望估计。最常用的是后验期望估计它一般也简称为贝叶斯估计记为θ^B\hat{\theta}_Bθ^B。