依我好读书不求甚解的浮躁性子,我和很多人一样老早知道这个原理,却从未深思过它的根据。只是模糊的以为,大概出于数学和物理以简约为美的传统,又经过无数次成功的实践,奥卡姆剃刀早被视作一种实用的方法。近来机缘巧合外加闲得蛋疼,竟日研读贝叶斯概率分析方法,才恍然大悟,原来贝叶斯定理就是奥卡姆剃刀原理的数学基础。贝叶斯概率当年在统计课上只是一带而过的内容,内容之简单以至于不值得深思,其实威力强大效用非凡,私以为可与达尔文自然选择学说并称宏伟。
在已观察到现象或数据D的前提下,假说H为真的概率P(H|D)(亦即后验概率) 就等于其先验概率P(H)和在该假说前提下观察到D的似然估计P(D|H)的乘积,再除以无论假说成立与否观察到D的总概率P(D)。当有两种备择假说时,这两种备择假说的相对可靠程度就取决于各自先验概率和各自给出的似然估计的乘积。贝叶斯定理用公式可表示如图1:
![]() |
| 图1. 贝叶斯定理 (上)及其在假说比较中的应用(下)。 |
假设备择假说H2比H1多包含一个变量, 即H2比H1更加复杂。奥卡姆剃刀原理告诉我们「 如无必要,勿增实体」,应该选择H1,放弃H2,相当于相信P(H1|D)>P(H2|D). 那么这种信念在数学上可靠吗?答案是肯定的。
![]() |
| 图2.复杂假说(H2)的似然分布P(D|H)较简单假说(H1)更为扁平低矮,可以解释更多数据,同时造成产生特定数据的可能性下降。图片引自 Figure 28.3, David MacKay: Information theory, inference and learning algorithms. |
无论是崇尚简单为美的美学考虑,还是经验告诉我们奥卡姆剃刀是管用的,都意味着先验概率P(H1)>P(H2)。假说H2比H1多了一个变量,在数学上意味着P(D|H2)这个函数在数据空间D上可以符合更多的数据,形象地理解就是其概率分布相较于P(D|H1)更加扁平。由于定义上P(D|H)对D的积分恒定为1,更为扁平的分布意味着更低矮的峰值,亦即P(D|H2) < P(D|H1),如图2所示。即便我们放弃以简单为美的美学「 偏见」,忽略奥卡姆剃刀的成功历史,使先验概率P(H1)=P(H2),那么由于 P(D|H1)>P(D|H2) ,由图1中的第二个公式,依然轻易可以得出P(H1|D)>P(H2|D). 也就说,贝叶斯定理证实了奥卡姆剃刀原理的数学可靠性。而奥卡姆剃刀的成功,也证实了贝叶斯方法在科学实践中的威力。


没有评论:
发表评论