本讲主张
贝叶斯推理之所以强,不在于纸上计算,而在于它能被嵌进自动系统,持续把文本特征转成分类判断。
中文释读
垃圾邮件过滤器是一个极好的现代例子:词语、发件模式、历史误判记录,这些都在不断更新后验概率。
知识路线
关键论点
- 自动分类本质上是在比较不同解释的后验概率。
- 特征越多,更新越细。
- 贝叶斯非常适合可迭代、可反馈的系统。
行动清单
- 把文本特征看成证据而不是标签。
- 关注系统如何随着反馈校正。
- 理解‘概率分类’比‘硬规则分类’更灵活。
源章节深读
11-1 垃圾邮件过滤器以贝叶斯推理为基础
这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。
怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。
常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。
原书线索:在进行统计推算与贝叶斯推理等概率推算时,通常需要两条以上的信息。并且,信息数量越多,推算出的结果可信度越高。后面的三讲,会讲解如何利用多条信息来进行推算的问题,而其中的要点则是上一讲中提到的
11-2 在过滤器上设置“先验概率”
这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。
怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。
常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。
原书线索:和前面的操作步骤相同,第一步是设定事前类别,并在获得一条信息之后,计算出后验概率。
11-3 扫描字句与条件概率的设定
这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。
怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。
常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。
原书线索:接下来要做的是,设定一些在垃圾邮件里常见的字句及特征。但需要注意的是,“贴有其他网页的URL链接”这一特征,是电脑判断一封邮件疑似为垃圾邮件的关键点。实际上,大多垃圾邮件的目的确实是引诱读者访问其他网址,因而附带有URL的链接。因此,如果符合以下稳固关系,即:
11-4 根据扫描结果,计算垃圾邮件的贝叶斯逆概率
这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。
怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。
常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。
原书线索:过滤器扫描完邮件后得到的结论是“附带链接”。此时,就不必再考虑“无链接”的两种可能性,只需要考虑剩余的两种可能性,如
11-5 获得第2条信息后,可能性随之变为8种
这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。
怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。
常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。
原书线索:通过上一节中我们了解到,即使在获得了“附带链接”的信息之后,也只能初步判断这封邮件极有可能是垃圾邮件,但不能确定它一定会被移动到垃圾箱中。因此,过滤器会通过添加其他的信息,再次进行判断。现在我们添加一个条件:把“幽会”一词作为关键词来进行检索。“幽会”一词出现的概率和不出现的概…
11-6 从2个信息可以消去不可能的情况
这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。
怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。
常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。
原书线索:在设定上述概率的前提下,过滤器对邮件进行扫描,通过检查是否附带“链接”、是否含有“幽会”一词这两个条件,来计算该邮件为垃圾邮件的概率。图表11-8中共有8种可能性,而只有最上面的2种有可能是垃圾邮件的。于是,留下最上面的2个,排除掉下面的6个,结果如
本讲图版学习路径
概念可视化
第11讲 垃圾邮件过滤器是贝叶斯的现实化身图版
11-3 4种互不相同的可能性
这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。
11-4 可能性被限定为两种
这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。
11-5 扫描前与扫描后
这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。
11-8 8种互不相同的可能性
这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。
11-9 扫描之后只剩下两种可能性
这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。
11-10 扫描之前与扫描两次之后
这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。
辨析题
为什么垃圾邮件过滤器常被拿来讲贝叶斯,而不是拿来讲别的统计方法?