统计学关我什么事Bayesian Learning Site
Chapter

第11讲 垃圾邮件过滤器是贝叶斯的现实化身

从两条信息到自动分类系统

11-1 理由不充分原理的先验概率
11-1 理由不充分原理的先验概率这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。
11-3 4种互不相同的可能性11-4 可能性被限定为两种11-5 扫描前与扫描后11-7 附带链接的条件概率

本讲主张

贝叶斯推理之所以强,不在于纸上计算,而在于它能被嵌进自动系统,持续把文本特征转成分类判断。

中文释读

垃圾邮件过滤器是一个极好的现代例子:词语、发件模式、历史误判记录,这些都在不断更新后验概率。

知识路线

关键论点

  1. 自动分类本质上是在比较不同解释的后验概率。
  2. 特征越多,更新越细。
  3. 贝叶斯非常适合可迭代、可反馈的系统。

行动清单

  1. 把文本特征看成证据而不是标签。
  2. 关注系统如何随着反馈校正。
  3. 理解‘概率分类’比‘硬规则分类’更灵活。

源章节深读

11-1 垃圾邮件过滤器以贝叶斯推理为基础

这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。

怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。

常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。

原书线索:在进行统计推算与贝叶斯推理等概率推算时,通常需要两条以上的信息。并且,信息数量越多,推算出的结果可信度越高。后面的三讲,会讲解如何利用多条信息来进行推算的问题,而其中的要点则是上一讲中提到的

11-2 在过滤器上设置“先验概率”

这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。

怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。

常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。

原书线索:和前面的操作步骤相同,第一步是设定事前类别,并在获得一条信息之后,计算出后验概率。

11-3 扫描字句与条件概率的设定

这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。

怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。

常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。

原书线索:接下来要做的是,设定一些在垃圾邮件里常见的字句及特征。但需要注意的是,“贴有其他网页的URL链接”这一特征,是电脑判断一封邮件疑似为垃圾邮件的关键点。实际上,大多垃圾邮件的目的确实是引诱读者访问其他网址,因而附带有URL的链接。因此,如果符合以下稳固关系,即:

11-4 根据扫描结果,计算垃圾邮件的贝叶斯逆概率

这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。

怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。

常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。

原书线索:过滤器扫描完邮件后得到的结论是“附带链接”。此时,就不必再考虑“无链接”的两种可能性,只需要考虑剩余的两种可能性,如

11-5 获得第2条信息后,可能性随之变为8种

这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。

怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。

常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。

原书线索:通过上一节中我们了解到,即使在获得了“附带链接”的信息之后,也只能初步判断这封邮件极有可能是垃圾邮件,但不能确定它一定会被移动到垃圾箱中。因此,过滤器会通过添加其他的信息,再次进行判断。现在我们添加一个条件:把“幽会”一词作为关键词来进行检索。“幽会”一词出现的概率和不出现的概…

11-6 从2个信息可以消去不可能的情况

这节解决什么:这一节在解决《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》里一个具体判断问题:当证据进入后,读者到底该改哪一步判断。

怎么迁移使用:把它当作一个生活化推理模板。下次遇到类似问题时,不要直接套结论,而是照着这节的判断顺序重走一遍。

常见误区:常见误区不是不会算,而是先验、条件、独立性或样本空间在中途被偷换了。

原书线索:在设定上述概率的前提下,过滤器对邮件进行扫描,通过检查是否附带“链接”、是否含有“幽会”一词这两个条件,来计算该邮件为垃圾邮件的概率。图表11-8中共有8种可能性,而只有最上面的2种有可能是垃圾邮件的。于是,留下最上面的2个,排除掉下面的6个,结果如

本讲图版学习路径

概念可视化

第11讲 垃圾邮件过滤器是贝叶斯的现实化身图版

11-3 4种互不相同的可能性
第11讲 垃圾邮件过滤器是贝叶斯的现实化身图版

11-3 4种互不相同的可能性

这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。

11-4 可能性被限定为两种
第11讲 垃圾邮件过滤器是贝叶斯的现实化身图版

11-4 可能性被限定为两种

这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。

11-5 扫描前与扫描后
第11讲 垃圾邮件过滤器是贝叶斯的现实化身图版

11-5 扫描前与扫描后

这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。

11-8 8种互不相同的可能性
第11讲 垃圾邮件过滤器是贝叶斯的现实化身图版

11-8 8种互不相同的可能性

这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。

11-9 扫描之后只剩下两种可能性
第11讲 垃圾邮件过滤器是贝叶斯的现实化身图版

11-9 扫描之后只剩下两种可能性

这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。

11-10 扫描之前与扫描两次之后
第11讲 垃圾邮件过滤器是贝叶斯的现实化身图版

11-10 扫描之前与扫描两次之后

这张图版来自《第11讲 垃圾邮件过滤器是贝叶斯的现实化身》相关页,适合用来把统计直觉、图形关系或案例结构重新具体化。

辨析题

为什么垃圾邮件过滤器常被拿来讲贝叶斯,而不是拿来讲别的统计方法?