本文实例为大家分享了python实现ID3决策树算法的具体代码,供大家参考,具体内容如下
''''' Created on Jan 30, 2015 @author: 史帅 ''' from math import log import operator import re def fileToDataSet(fileName): ''''' 此方法功能是:从文件中读取样本集数据,样本数据的格式为:数据以空白字符分割,最后一列为类标签 参数: fileName:存放样本集数据的文件路径 返回值: dataSet:样本集数据组成的二维数组 ''' file=open(fileName, mode='r') lines=file.readlines() dataSet=[] index=0 p=re.compile(r"\s+") for line in lines: line=p.split(line.strip()) dataSet.append(line) index+=1 return dataSet def calculateShannonEntropy(dataSet): ''''' 此方法功能是:计算样本集数据类别的信息熵,样本数据的格式为二维数组 参数: dataSet:样本集数据组成的二维数组 返回值: shannonEntropy:样本集数据类别的信息熵 ''' dataCount=len(dataSet) classCountDic={} for data in dataSet: label=data[-1] if label not in classCountDic.keys(): classCountDic[label]=0 classCountDic[label]+=1 shannonEntropy=0.0 for key in classCountDic: prob=float(classCountDic[key])/dataCount shannonEntropy-=prob*log(prob,2) return shannonEntropy def splitDataSet(dataSet,axis,value): ''''' 此方法功能是:对样本集数据按照某一特征进行分割,使得分割后的数据集中该特征的值全部等于同一个值,并且将分割后的数据中该特征列去除 参数: dataSet:待分割的样本集数据,二维数组 axis:特征所在样本集数据列中的位置 value:样本集数据分割后该特征的值 返回值: splitedDataSet:按照所在位置为axis的特征进行分割,并且该特征值为value的样本集数据的子集 ''' splitedDataSet=[] for data in dataSet: if data[axis]==value: splitedData=data[:axis] splitedData.extend(data[axis+1:]) splitedDataSet.append(splitedData) return splitedDataSet def chooseBestFeatureToSlipt(dataSet): ''''' 此方法功能是:分别计算整个样本集数据的信息熵与按照各个特征分割后的数据集的信息熵之差,得到使差值最大的分割方案,得到该分割方案的特征 参数: dataSet:待分割的样本集数据,二维数组 返回值: bestFeature:按照分割前后信息熵差值最大的分割方案得到的特征,返回此特征所在样本集数据列中的位置 ''' bestFeature=-1 dataSetShannonEntropy=calculateShannonEntropy(dataSet) infoGain=0 featureCount=len(dataSet[0])-1 for i in range(featureCount): featureList=[example[i] for example in dataSet] featureSet=set(featureList) splitedDataSetShannonEntropy=0 for feature in featureSet: splitedDataSet=splitDataSet(dataSet,i,feature) splitedDataSetShannonEntropy+=float(len(splitedDataSet))/len(dataSet)*calculateShannonEntropy(splitedDataSet) if dataSetShannonEntropy-splitedDataSetShannonEntropy>infoGain: infoGain=dataSetShannonEntropy-splitedDataSetShannonEntropy bestFeature=i return bestFeature def majorityClass(classList): ''''' 此方法功能是:从类别列表中得到个数最多的类别 参数: classList:类别列表,一维数组 返回值: 类别列表中个数最多的类别 ''' classCountDic={} for label in classList: if label not in classCountDic.keys(): classCountDic[label]=0 classCountDic[label]+=1 classCountDic=sorted(classCountDic.item(),key=operator.itemgetter(1),reverse=True) return classCountDic[0][0] def createTree(dataSet,features): ''''' 此方法功能是:根据训练样本集数据创建对分类最有效的决策树 参数: dataSet:训练样本集数据,二维数组 features:与训练样本集数据中各列的特征值相对应的特征名称集合,一维数组 返回值: tree:根据训练样本集数据所创建的,对分类最有效的决策树 ''' subFeatures=features[:] classList=[example[-1] for example in dataSet] if classList.count(classList[0])==len(classList): return classList[0] if len(dataSet[0])==1: return majorityClass(classList) bestFeature=chooseBestFeatureToSlipt(dataSet) label=subFeatures[bestFeature] tree={label:{}} del(subFeatures[bestFeature]) featureList=[example[bestFeature] for example in dataSet] featureSet=set(featureList) for feature in featureSet: splitedDataSet=splitDataSet(dataSet,bestFeature,feature) tree[label][feature]=createTree(splitedDataSet, subFeatures) return tree def classify(inX,tree,features): ''''' 此方法功能是:根据创建好的决策树,对特定的数据进行分类 参数: inX:待分类的数据,特征值向量,一维数组 tree:根据决策树算法创建好的最有效的决策树 features:与训练样本集数据中各列的特征值相对应的特征名称集合,一维数组 返回值: label:待分类的数据通过决策树分类之后的类别 ''' feature=list(tree.keys())[0] featureIndex=features.index(feature) secondTree=tree[feature][inX[featureIndex]] if type(secondTree).__name__=="dict": label=classify(inX,secondTree,features) else: label=secondTree return label
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持小牛知识库。
本文向大家介绍python实现ID3决策树算法,包括了python实现ID3决策树算法的使用技巧和注意事项,需要的朋友参考一下 决策树之ID3算法及其Python实现,具体内容如下 主要内容 决策树背景知识 决策树一般构建过程 ID3算法分裂属性的选择 ID3算法流程及其优缺点分析 ID3算法Python代码实现 1. 决策树背景知识 决策树是数据挖掘中最重要且最常用的方法之一,主要应用于数据
本文向大家介绍python实现C4.5决策树算法,包括了python实现C4.5决策树算法的使用技巧和注意事项,需要的朋友参考一下 C4.5算法使用信息增益率来代替ID3的信息增益进行特征的选择,克服了信息增益选择特征时偏向于特征值个数较多的不足。信息增益率的定义如下: 调用代码 以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持呐喊教程。
本文向大家介绍python实现决策树C4.5算法详解(在ID3基础上改进),包括了python实现决策树C4.5算法详解(在ID3基础上改进)的使用技巧和注意事项,需要的朋友参考一下 一、概论 C4.5主要是在ID3的基础上改进,ID3选择(属性)树节点是选择信息增益值最大的属性作为节点。而C4.5引入了新概念“信息增益率”,C4.5是选择信息增益率最大的属性作为树节点。 二、信息增益 以上公式是
本文向大家介绍基于Python实现的ID3决策树功能示例,包括了基于Python实现的ID3决策树功能示例的使用技巧和注意事项,需要的朋友参考一下 本文实例讲述了基于Python实现的ID3决策树功能。分享给大家供大家参考,具体如下: ID3算法是决策树的一种,它是基于奥卡姆剃刀原理的,即用尽量用较少的东西做更多的事。ID3算法,即Iterative Dichotomiser 3,迭代二叉树3代,
本文向大家介绍python基于ID3思想的决策树,包括了python基于ID3思想的决策树的使用技巧和注意事项,需要的朋友参考一下 这是一个判断海洋生物数据是否是鱼类而构建的基于ID3思想的决策树,供大家参考,具体内容如下 最后我们测试一下这个脚本即可,如果想把这个生成的决策树用图像画出来,也只是在需要在脚本里面定义一个plottree的函数即可。 以上就是本文的全部内容,希望对大家的学习有所帮助
一、引言 在最开始的时候,我本来准备学习的是C4.5算法,后来发现C4.5算法的核心还是ID3算法,所以又辗转回到学习ID3算法了,因为C4.5是他的一个改进。至于是什么改进,在后面的描述中我会提到。 二、ID3算法 ID3算法是一种分类决策树算法。他通过一系列的规则,将数据最后分类成决策树的形式。分类的根据是用到了熵这个概念。熵在物理这门学科中就已经出现过,表示是一个物质的稳定度,在这里就是分类