IBM SPSS Modeler算法系列------C&R Tree算法介绍 -

数控小J

浏览: 69656 次

最近访客更多访客>>

万里一梦遥

zhangyou1010

amc1989

rrstpit

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

IBM SPSS Modeler算法系列------C&R Tree算法介绍

大数据 spss 预测分析数据分析

C&R Tree全称是Classification and Regression Tree,即分类及回归树，它是由美国斯坦福大学和加州大学伯克利分校的Breiman等人于1984年提出的，从名称中不难理解，它包含了分类树和回归树，分类树用于目标变量是分类型的，回归树用于目标变量是连续型的。

该算法分割的核心技术取决于目标变量的类型，如果是分类变量，可以选择使用Gini或者是Twoing.如果是连续变量，会自动选择LSD(Least-squared deviation)。

C&R Tree的生长是二叉树，前面我们讲过的C5.0和CHAID分别是以信息增益率和卡方为标准来选择最佳分组变量和分割点，今天我们讲的C&R Tree，如果目标变量是分类型，则以Gini系数来确认分割点，如果目标变量是数值型，则以方差来确认分割点。

我们先来讲目标变量是分类型的情况，我们称之为分类树：

在C&R Tree算法中，Gini系数反映的是目标变量组间差异程度，系数越小，组间差异越大。Gini系数计算公式如下：

G(t)=1-(t1/T)^2-(t2/T)^2-(t3/T)^2-(tn/T)^2

其中T为总记录数，t1,t2,t3,tn…..分别为输出变量每个类别的记录数

为了比较好理解这个公式，我们以分析结果来理解公式内容，如下图：

该决策树分析结果，是分析客户的流失为目标，影响的因素有小朋友个数（children),婚姻状态（Status)，年龄（age)等，我们先从根节点开始看。

根节点的G(t)=1-(562/1469) ^2-(907/1469)^2=0.472421883

左边节点G(t1)=1-(439/833) ^2-(394/833) ^2=0.498540833

右边节点G(t2)=1-(123/636) ^2-(513/636) ^2=0.311988252

C&R Tree采用Gini系数的减少量来测量异质性下降，因此

ΔG(t)=G(t)-n1/N*G(t1)-n2/N*G(t2)=0.472421883-833/(833+636)* 0.498540833-636/(833+636)* 0.311988252=0.05464854

其中n1是左节点的记录数833，n2是右节点的记录数636，N是根节点的记录数833+636=1469。

计算最终得到的ΔG(t)=0.05464854就是上图中显示的改进=0.055（四舍五入），那么为什么选择这个children<-1.5和children>1/5作为分割点，是因为与其它影响因素相比较，这里计算得到的ΔG(t)最大。所以在整个决策树生长中，可以看到，越往下生长，ΔG(t)越小。

针对连续变量，先对变量按升序排列，然后，从小到大依次以相邻数值的中间值作为将样本分为两组，然后分别计算其ΔG(t)。针对分类变量，由于C&R Tree只能建立二叉树（即只能有两个分支），首先需将多类别合并成两个类别，形成“超类”，然后计算两“超类”下样本输出变量取值的异质性。

在IBM SPSS Modeler中，除了使用Gini系数的减少量作为标准，还可以选择另外两种标准，分别是Twoing（两分法）和Ordered（有序），如下图：

Twoing策略中，输出变量的差异性测度仍采用Gini系数，不同的是，不再以使用Gini系数减少最快为原则，而是要找到使合并形成的左右子节点（两个超类）中分布差异足够大的合并点s，计算公式为：

仍以下图决策树结果为例：

因此

该数值对应着上图第一个根节点的改进=0.109（四舍五入）

可以看到，越是靠近根节点，该值越大。

Order策略适用于有序型输入变量的情况，它只限定只有两个连续的类别才可以合并成超类，最终得到最理想的两个超类。

接下来我们来看目标变量是数值型的情况，我们称为回归树。回归树确定最佳分组变量的策略与分类树相同，主要不同是测试输出变量异质性的指标，

回归树使用的是方差，因此异质性下降的测度指标为方差的减少量，其数学定义为：

其中R(t)和N分别为分组前输出变量的方差和样本量，R(t1),Nt1和R(t2)，Nt2分别为分组后左右子树的方差和样本量。使ΔR(t)达到最大的变量应为当前最佳分组变量。我们通过实际例子的结果倒推来理解这个计算公式。

我们使用SPSS Modeler做一个男装销售额（men)预测的场景，因为销售额是数值型，我们选择C&R Tree来实现，那么影响男装销售的输入影响因素有女装销售(women)、电话营销成本（phone)等，得到的决策树分析结果如下：

那么为什么生成的决策树会以woman作为最佳分组变量，以51286.490作为分割点呢，因这它计算出来的ΔR(t)最大，大家可以尝试找个例子自己计算看看，这里不再赘述。

最佳分割点的确定方法与最佳分组亦是的确定方法相同。

在IBM SPSSModeler里面，针对 C&R Tree算法，以上介绍的内容是确定分割点的核心标准，对于该算法，还有其它的内容，比如剪枝，交互树建模等，感兴趣的话，可以点击以下链接到官网下载试用！

更多大数据与分析相关行业资讯、解决方案、案例、教程等请点击查看>>>

0
顶

1
踩

分享到：

大数据时代：看大数据如何帮助你预测消费者 ... | 大数据时代，IBM 带你玩转大数据处理

2016-09-01 10:23
浏览 3385
评论(0)
分类:行业应用
查看更多

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

IBM SPSS Modeler使用教程: 常用的算法包括决策树(C&R Tree、QUEST、CHAID、C5.0)、回归(线性、逻辑、广义线性、Cox回归)、神经网络、支持向量机(Support Vector Machine, SVM)、贝叶斯网络等。 2. **关联(Association)**：发现数据中的关联...

IBM SPSS Modeler 决策树之银行行销预测应用分析: 在 IBM SPSS Modeler 中，主要提供了四种常用的决策树演算法供使用者选择，分别为：C5.0、CHAID、QUEST 以及 C&R Tree 四种。 C5.0 是一种常用的决策树演算法，通过资讯衡量标准 (Information Measure) 来构建决策...

基于模糊故障树的工业控制系统可靠性分析与Python实现: 内容概要：本文探讨了模糊故障树（FFTA）在工业控制系统可靠性分析中的应用，解决了传统故障树方法无法处理不确定数据的问题。文中介绍了模糊数的基本概念和实现方式，如三角模糊数和梯形模糊数，并展示了如何用Python实现模糊与门、或门运算以及系统故障率的计算。此外，还详细讲解了最小割集的查找方法、单元重要度的计算，并通过实例说明了这些方法的实际应用场景。最后，讨论了模糊运算在处理语言变量方面的优势，强调了在可靠性分析中处理模糊性和优化计算效率的重要性。适合人群：从事工业控制系统设计、维护的技术人员，以及对模糊数学和可靠性分析感兴趣的科研人员。使用场景及目标：适用于需要评估复杂系统可靠性的场合，特别是在面对不确定数据时，能够提供更准确的风险评估。目标是帮助工程师更好地理解和预测系统故障，从而制定有效的预防措施。其他说明：文中提供的代码片段和方法可用于初步方案验证和技术探索，但在实际工程项目中还需进一步优化和完善。

风力发电领域双馈风力发电机（DFIG）Simulink模型的构建与电流电压波形分析: 内容概要：本文详细探讨了双馈风力发电机（DFIG）在Simulink环境下的建模方法及其在不同风速条件下的电流与电压波形特征。首先介绍了DFIG的基本原理，即定子直接接入电网，转子通过双向变流器连接电网的特点。接着阐述了Simulink模型的具体搭建步骤，包括风力机模型、传动系统模型、DFIG本体模型和变流器模型的建立。文中强调了变流器控制算法的重要性，特别是在应对风速变化时，通过实时调整转子侧的电压和电流，确保电流和电压波形的良好特性。此外，文章还讨论了模型中的关键技术和挑战，如转子电流环控制策略、低电压穿越性能、直流母线电压脉动等问题，并提供了具体的解决方案和技术细节。最终，通过对故障工况的仿真测试，验证了所建模型的有效性和优越性。适用人群：从事风力发电研究的技术人员、高校相关专业师生、对电力电子控制系统感兴趣的工程技术人员。使用场景及目标：适用于希望深入了解DFIG工作原理、掌握Simulink建模技能的研究人员；旨在帮助读者理解DFIG在不同风速条件下的动态响应机制，为优化风力发电系统的控制策略提供理论依据和技术支持。其他说明：文章不仅提供了详细的理论解释，还附有大量Matlab/Simulink代码片段，便于读者进行实践操作。同时，针对一些常见问题给出了实用的调试技巧，有助于提高仿真的准确性和可靠性。

基于西门子S7-200 PLC和组态王的八层电梯控制系统设计与实现: 内容概要：本文详细介绍了基于西门子S7-200 PLC和组态王软件构建的八层电梯控制系统。首先阐述了系统的硬件配置，包括PLC的IO分配策略，如输入输出信号的具体分配及其重要性。接着深入探讨了梯形图编程逻辑，涵盖外呼信号处理、轿厢运动控制以及楼层判断等关键环节。随后讲解了组态王的画面设计，包括动画效果的实现方法，如楼层按钮绑定、轿厢移动动画和门开合效果等。最后分享了一些调试经验和注意事项，如模拟困人场景、防抖逻辑、接线艺术等。适合人群：从事自动化控制领域的工程师和技术人员，尤其是对PLC编程和组态软件有一定基础的人群。使用场景及目标：适用于需要设计和实施小型电梯控制系统的工程项目。主要目标是帮助读者掌握PLC编程技巧、组态画面设计方法以及系统联调经验，从而提高项目的成功率。其他说明：文中提供了详细的代码片段和调试技巧，有助于读者更好地理解和应用相关知识点。此外，还强调了安全性和可靠性方面的考量，如急停按钮的正确接入和硬件互锁设计等。

CarSim与Simulink联合仿真：基于MPC模型预测控制实现智能超车换道: 内容概要：本文介绍了如何将CarSim的动力学模型与Simulink的智能算法相结合，利用模型预测控制(MPC)实现车辆的智能超车换道。主要内容包括MPC控制器的设计、路径规划算法、联合仿真的配置要点以及实际应用效果。文中提供了详细的代码片段和技术细节，如权重矩阵设置、路径跟踪目标函数、安全超车条件判断等。此外，还强调了仿真过程中需要注意的关键参数配置，如仿真步长、插值设置等，以确保系统的稳定性和准确性。适合人群：从事自动驾驶研究的技术人员、汽车工程领域的研究人员、对联合仿真感兴趣的开发者。使用场景及目标：适用于需要进行自动驾驶车辆行为模拟的研究机构和企业，旨在提高超车换道的安全性和效率，为自动驾驶技术研发提供理论支持和技术验证。其他说明：随包提供的案例文件已调好所有参数，可以直接导入并运行，帮助用户快速上手。文中提到的具体参数和配置方法对于初学者非常友好，能够显著降低入门门槛。

基于单片机的鱼缸监测设计(51+1602+AD0809+18B20+UART+JKx2)#0107: 包括：源程序工程文件、Proteus仿真工程文件、论文材料、配套技术手册等 1、采用51单片机作为主控； 2、采用AD0809(仿真0808)检测"PH、氨、亚硝酸盐、硝酸盐"模拟传感； 3、采用DS18B20检测温度； 4、采用1602液晶显示检测值； 5、检测值同时串口上传，调试助手监看； 6、亦可通过串口指令对加热器、制氧机进行控制；

风电领域双馈永磁风电机组并网仿真及短路故障分析与MPPT控制: 内容概要：本文详细介绍了双馈永磁风电机组并网仿真模型及其短路故障分析方法。首先构建了一个9MW风电场模型，由6台1.5MW双馈风机构成，通过升压变压器连接到120kV电网。文中探讨了风速模块的设计，包括渐变风、阵风和随疾风的组合形式，并提供了相应的Python和MATLAB代码示例。接着讨论了双闭环控制策略，即功率外环和电流内环的具体实现细节，以及MPPT控制用于最大化风能捕获的方法。此外，还涉及了短路故障模块的建模，包括三相电压电流特性和离散模型与phasor模型的应用。最后，强调了永磁同步机并网模型的特点和注意事项。适合人群：从事风电领域研究的技术人员、高校相关专业师生、对风电并网仿真感兴趣的工程技术人员。使用场景及目标：适用于风电场并网仿真研究，帮助研究人员理解和优化风电机组在不同风速条件下的性能表现，特别是在短路故障情况下的应对措施。目标是提高风电系统的稳定性和可靠性。其他说明：文中提供的代码片段和具体参数设置有助于读者快速上手并进行实验验证。同时提醒了一些常见的错误和需要注意的地方，如离散化步长的选择、初始位置对齐等。

空手道训练测试系统BLE106版本: 适用于空手道训练和测试场景

【音乐创作领域AI提示词】AI音乐提示词（deepseek,豆包,kimi,chatGPT,扣子空间,manus,AI训练师）: 内容概要：本文介绍了金牌音乐作词大师的角色设定、背景经历、偏好特点、创作目标、技能优势以及工作流程。金牌音乐作词大师凭借深厚的音乐文化底蕴和丰富的创作经验，能够为不同风格的音乐创作歌词，擅长将传统文化元素与现代流行文化相结合，创作出既富有情感又触动人心的歌词。在创作过程中，会严格遵守社会主义核心价值观，尊重用户需求，提供专业修改建议，确保歌词内容健康向上。; 适合人群：有歌词创作需求的音乐爱好者、歌手或音乐制作人。; 使用场景及目标：①为特定主题或情感创作歌词，如爱情、励志等；②融合传统与现代文化元素创作独特风格的歌词；③对已有歌词进行润色和优化。; 阅读建议：阅读时可以重点关注作词大师的创作偏好、技能优势以及工作流程，有助于更好地理解如何创作出高质量的歌词。同时，在提出创作需求时，尽量详细描述自己的情感背景和期望，以便获得更贴合心意的作品。

linux之用户管理教程.md: linux之用户管理教程.md

基于单片机的搬运机器人设计(51+1602+L298+BZ+KEY6)#0096: 包括：源程序工程文件、Proteus仿真工程文件、配套技术手册等 1、采用51/52单片机作为主控芯片； 2、采用1602液晶显示设置及状态； 3、采用L298驱动两个电机，模拟机械臂动力、移动底盘动力； 3、首先按键配置-待搬运物块的高度和宽度（为0不能开始搬运）； 4、按下启动键开始搬运，搬运流程如下：机械臂先把物块抓取到机器车上，机械臂减速机器车带着物块前往目的地机器车减速机械臂把物块放下来机械臂减速机器车回到物块堆积处（此时机器车是空车）机器车减速蜂鸣器提醒按下复位键，结束本次搬运

基于下垂控制的三相逆变器电压电流双闭环仿真及MATLAB/Simulink/PLECS实现: 内容概要：本文详细介绍了基于下垂控制的三相逆变器电压电流双闭环控制的仿真方法及其在MATLAB/Simulink和PLECS中的具体实现。首先解释了下垂控制的基本原理，即有功调频和无功调压，并给出了相应的数学表达式。随后讨论了电压环和电流环的设计与参数整定，强调了两者带宽的差异以及PI控制器的参数选择。文中还提到了一些常见的调试技巧，如锁相环的响应速度、LC滤波器的谐振点处理、死区时间设置等。此外，作者分享了一些实用的经验，如避免过度滤波、合理设置采样周期和下垂系数等。最后，通过突加负载测试展示了系统的动态响应性能。适合人群：从事电力电子、微电网研究的技术人员，尤其是有一定MATLAB/Simulink和PLECS使用经验的研发人员。使用场景及目标：适用于希望深入了解三相逆变器下垂控制机制的研究人员和技术人员，旨在帮助他们掌握电压电流双闭环控制的具体实现方法，提高仿真的准确性和效率。其他说明：本文不仅提供了详细的理论讲解，还结合了大量的实战经验和调试技巧，有助于读者更好地理解和应用相关技术。

光伏并网逆变器全栈开发资料：硬件设计、控制算法及实战经验: 内容概要：本文详细介绍了光伏并网逆变器的全栈开发资料，涵盖了从硬件设计到控制算法的各个方面。首先，文章深入探讨了功率接口板的设计，包括IGBT缓冲电路、PCB布局以及EMI滤波器的具体参数和设计思路。接着，重点讲解了主控DSP板的核心控制算法，如MPPT算法的实现及其注意事项。此外，还详细描述了驱动扩展板的门极驱动电路设计，特别是光耦隔离和驱动电阻的选择。同时，文章提供了并联仿真的具体实现方法，展示了环流抑制策略的效果。最后，分享了许多宝贵的实战经验和调试技巧，如主变压器绕制、PWM输出滤波、电流探头使用等。适合人群：从事电力电子、光伏系统设计的研发工程师和技术爱好者。使用场景及目标：①帮助工程师理解和掌握光伏并网逆变器的硬件设计和控制算法；②提供详细的实战经验和调试技巧，提升产品的可靠性和性能；③适用于希望深入了解光伏并网逆变器全栈开发的技术人员。其他说明：文中不仅提供了具体的电路设计和代码实现，还分享了许多宝贵的实际操作经验和常见问题的解决方案，有助于提高开发效率和产品质量。

机器人轨迹规划中粒子群优化与3-5-3多项式结合的时间最优路径规划: 内容概要：本文详细介绍了粒子群优化（PSO）算法与3-5-3多项式相结合的方法，在机器人轨迹规划中的应用。首先解释了粒子群算法的基本原理及其在优化轨迹参数方面的作用，随后阐述了3-5-3多项式的数学模型，特别是如何利用不同阶次的多项式确保轨迹的平滑过渡并满足边界条件。文中还提供了具体的Python代码实现，展示了如何通过粒子群算法优化时间分配，使3-5-3多项式生成的轨迹达到时间最优。此外，作者分享了一些实践经验，如加入惩罚项以避免超速，以及使用随机扰动帮助粒子跳出局部最优。适合人群：对机器人运动规划感兴趣的科研人员、工程师和技术爱好者，尤其是有一定编程基础并对优化算法有初步了解的人士。使用场景及目标：适用于需要精确控制机器人运动的应用场合，如工业自动化生产线、无人机导航等。主要目标是在保证轨迹平滑的前提下，尽可能缩短运动时间，提高工作效率。其他说明：文中不仅给出了理论讲解，还有详细的代码示例和调试技巧，便于读者理解和实践。同时强调了实际应用中需要注意的问题，如系统的建模精度和安全性考量。

【KUKA 机器人资料】：kuka机器人压铸欧洲标准.pdf: KUKA机器人相关资料

光子晶体中BIC与OAM激发的模拟及三维Q值计算: 内容概要：本文详细探讨了光子晶体中的束缚态在连续谱中（BIC）及其与轨道角动量（OAM）激发的关系。首先介绍了光子晶体的基本概念和BIC的独特性质，随后展示了如何通过Python代码模拟二维光子晶体中的BIC，并解释了BIC在光学器件中的潜在应用。接着讨论了OAM激发与BIC之间的联系，特别是BIC如何增强OAM激发效率。文中还提供了使用有限差分时域（FDTD）方法计算OAM的具体步骤，并介绍了计算本征态和三维Q值的方法。此外，作者分享了一些实验中的有趣发现，如特定条件下BIC表现出OAM特征，以及不同参数设置对Q值的影响。适合人群：对光子晶体、BIC和OAM感兴趣的科研人员和技术爱好者，尤其是从事微纳光子学研究的专业人士。使用场景及目标：适用于希望通过代码模拟深入了解光子晶体中BIC和OAM激发机制的研究人员。目标是掌握BIC和OAM的基础理论，学会使用Python和其他工具进行模拟，并理解这些现象在实际应用中的潜力。其他说明：文章不仅提供了详细的代码示例，还分享了许多实验心得和技巧，帮助读者避免常见错误，提高模拟精度。同时，强调了物理离散化方式对数值计算结果的重要影响。

C#联合Halcon 17.12构建工业视觉项目的配置与应用: 内容概要：本文详细介绍了如何使用C#和Halcon 17.12构建一个功能全面的工业视觉项目。主要内容涵盖项目配置、Halcon脚本的选择与修改、相机调试、模板匹配、生产履历管理、历史图像保存以及与三菱FX5U PLC的以太网通讯。文中不仅提供了具体的代码示例，还讨论了实际项目中常见的挑战及其解决方案，如环境配置、相机控制、模板匹配参数调整、PLC通讯细节、生产数据管理和图像存储策略等。适合人群：从事工业视觉领域的开发者和技术人员，尤其是那些希望深入了解C#与Halcon结合使用的专业人士。使用场景及目标：适用于需要开发复杂视觉检测系统的工业应用场景，旨在提高检测精度、自动化程度和数据管理效率。具体目标包括但不限于：实现高效的视觉处理流程、确保相机与PLC的无缝协作、优化模板匹配算法、有效管理生产和检测数据。其他说明：文中强调了框架整合的重要性，并提供了一些实用的技术提示，如避免不同版本之间的兼容性问题、处理实时图像流的最佳实践、确保线程安全的操作等。此外，还提到了一些常见错误及其规避方法，帮助开发者少走弯路。

基于Matlab的9节点配电网中分布式电源接入对节点电压影响的研究: 内容概要：本文探讨了分布式电源（DG）接入对9节点配电网节点电压的影响。首先介绍了9节点配电网模型的搭建方法，包括定义节点和线路参数。然后，通过在特定节点接入分布式电源，利用Matlab进行潮流计算，模拟DG对接入点及其周围节点电压的影响。最后，通过绘制电压波形图，直观展示了不同DG容量和接入位置对配电网电压分布的具体影响。此外，还讨论了电压越限问题以及不同线路参数对电压波动的影响。适合人群：电力系统研究人员、电气工程学生、从事智能电网和分布式能源研究的专业人士。使用场景及目标：适用于研究分布式电源接入对配电网电压稳定性的影响，帮助优化分布式电源的规划和配置，确保电网安全稳定运行。其他说明：文中提供的Matlab代码和图表有助于理解和验证理论分析，同时也为后续深入研究提供了有价值的参考资料。

电力市场领域中基于CVaR风险评估的省间交易商最优购电模型研究与实现: 内容概要：本文探讨了在两级电力市场环境中，针对省间交易商的最优购电模型的研究。文中提出了一个双层非线性优化模型，用于处理省内电力市场和省间电力交易的出清问题。该模型采用CVaR（条件风险价值）方法来评估和管理由新能源和负荷不确定性带来的风险。通过KKT条件和对偶理论，将复杂的双层非线性问题转化为更易求解的线性单层问题。此外，还通过实际案例验证了模型的有效性，展示了不同风险偏好设置对购电策略的影响。适合人群：从事电力系统规划、运营以及风险管理的专业人士，尤其是对电力市场机制感兴趣的学者和技术专家。使用场景及目标：适用于希望深入了解电力市场运作机制及其风险控制手段的研究人员和技术开发者。主要目标是为省间交易商提供一种科学有效的购电策略，以降低风险并提高经济效益。其他说明：文章不仅介绍了理论模型的构建过程，还包括具体的数学公式推导和Python代码示例，便于读者理解和实践。同时强调了模型在实际应用中存在的挑战，如数据精度等问题，并指出了未来改进的方向。

最近访客 更多访客>>