
朴素贝叶斯1、贝叶斯定理要是假定针对某一个数据集而言, 随机变量称作为C的这个, 它所表示的是样本归属于C类的概率, 还有F1, 它所表示的是测试样本里某特征出现的概率, 然后去套用基本贝叶斯公式, 那么情况就如下所展示的那样:此式子用以表明, 针对于某一样本而言, 当特征F1出现之际, 该样本被划分至C类的这种条件概率。那么, 怎样运用此式子去对测试样本展开分类操作呢比如说, 存在一个测试样本, 这个样本的特征F1出现情况为F1等于1, 在发现此情况后, 进而也就是去算一算P(C等于0且F1等于1)以及P(C等于1且F1等于1)这两个的概率数值, 要是前面这个概率值更大的时候, 那么这个样本就会被判定为是第0类, 反之换到后面那个概率值更大的时候, 这个样本就会被划分成第1类。对该公示有几个概念需要熟知先期概率Prior, P(C)属于C的先期概率能够凭借已有的训练集合来计算, 计算方式是把划分为C类的样本, 在所有样本里所占的比例给得出。所谓证据, 就是上式当中的P(F1), 它所表达的是针对某一个测试样本而言, 特征F1出现的概率, 而且这个概率同样能够通过从训练集中F1特征对应样本在总样本里所占的比例来得出。似然, 也就是上式当中体现作为P(F1|C)的部分, 它所表达的意思是, 当知晓有一个样本被划分到了C类这种情况下, 那么该样本其特征呈现为F1时的概率究竟是多少。对于多个特征而言贝叶斯公式可以扩展如下于分子里面, 存在着一长串相像的概率数值。在特征数量众多的情形下, 针对这些相像概率数值的计算, 是极为让人难受痛苦的。那么此时此刻, 应该怎么样去解决应对呢?2、朴素的概念简化计算之目的下, 朴素贝叶斯算法立下一假设, 其内容为“朴素地认定各个特征相互独立”。如此这般, 上式的分子便被简化成为:P(C)P(F1|C)P(F2|C)...P(Fn|C)。这样简化过后计算起来就方便多了。此假设认定每个特征相互独立, 乍一看着实是极不科学的假设, 因为诸多情形之下, 各个特征关联甚密, 然而朴素贝叶斯在大量应用里实际显示其运作颇为良好。其次, 朴素贝叶斯的工作原理是, 计算P(C0|F1...Fn), 计算P(C 1|F1...Fn), 把当中取最大值的那个当作其分类, 而这二者的分母是完全相同的, 故而, 我们能够省略分母计算, 进而更进一步简化计算过程。除此之外贝叶斯公式推导得以成立存在一个关键前期条件, 那便是各个证据不能等于0也就是说, 对于任意特征Fx而言, P(Fx)不能等于0然而, 显示某些特征未在测试集中出现这种状况完全是有可能发生的所以, 在实现过程中通常需要进行一些细微的处理, 像把所有计数都加以1操作此为加法平滑, 也被称为拉普拉斯平滑要是借助增加一个大于0的可调参数alpha来实现平滑, 那就称作 平滑。基于朴素贝叶斯的情感分类原始数据集只抽了10条读数据读取excel文件用的库的的数据类型分词对每个评论分词分词的同时去除停用词得到如下词表每个列表是与评论一一对应的统计这里统计什么呢统计两种数据1. 评论级别的次数这里有三个级别分别对应c0 → 好 2c1 → 中 3c2 → 差 52. 每个词在句子中出现的次数得到一个字典数据半价划算不错·········不满重要清楚具体位于每个词特征之后的 list 坐标位, 其中 0 对应好, 1 对应中, 2 对应差。以上工作完成之后就是把模型训练好了只不过数据越多越准确测试比如输入一个句子关于世纪联华百联西郊购物中心店的点评时发现, 在一个被称作国际大都市的地方, 该店收银处人员的服务态度糟糕至极并且这里开展的银联活动是满30减10, 居然还不允许连单。得到结果c2-差