c4.5为什么使用信息增益比来选择特征?信息增益准则为什么对可取值数目较多的属性有所偏好
:暂无数据 2026-09-19 14:10:02 :0

各位老铁们好,相信很多人对信息增益比都不是特别的了解,因此呢,今天就来为大家分享下关于信息增益比以及c4.5为什么使用信息增益比来选择特征的问题知识,还望可以帮助大家,解决大家的一些困惑,下面一起来看看吧!
本文目录
c4.5为什么使用信息增益比来选择特征
对于取值多的属性,尤其一些连续型数值,比如两条地理数据的距离属性,这个单独的属性就可以划分所有的样本,使得所有分支下的样本集合都是“纯的”(最极端的情况是每个叶子节点只有一个样本)。 一个属性的信息增益越大,表明属性对样本的熵减少
信息增益准则为什么对可取值数目较多的属性有所偏好
从公式出发,信息增益是整个数据集的经验熵与特征A对整个数据集的经验条件熵的差值,信息增益越大即经验条件熵越小,那什么情况下的属性会有极小的的经验条件熵呢?举个极端的例子,如果将身份证号作为一个属性,那么,其实每个人的身份证号都是不相同的,也就是说,有多少个人,就有多少种取值,如果用身份证号这个属性去划分原数据集,那么,原数据集中有多少个样本,就会被划分为多少个子集,这样的话,会导致信息增益公式的第二项整体为0,虽然这种划分毫无意义,但是从信息增益准则来讲,这就是最好的划分属性。其实从概念来讲,就一句话,信息增益表示由于特征A而使得数据集的分类不确定性减少的程度,信息增益大的特征具有更强的分类能力。
关于本次信息增益比和c4.5为什么使用信息增益比来选择特征的问题分享到这里就结束了,如果解决了您的问题,我们非常高兴。

本文编辑:admin
:
信息增益比
更多文章:
another time(another time和other time的区别)
2026年10月11日 05:00








