略做分析,忘批评指正。
mahout源码版本:0.7
mahout官方算法说明是根据原google的几位大牛的论文进行实现,详情请参见:
https://cwiki.apache.org/confluence/display/MAHOUT/Parallel+Frequent+Pattern+Mining
在实际应用中,貌似有些问题:
I1: 不能通过指定谓词进行挖掘。
I2: 不能通过约束规则进行挖掘。
在实际的使用中还需要进行一些改动来实现这些功能。
1 起始类:FPGrowthDriver。
输入参数:minSupport 最小支持计数,默认是3.
maxHeapSize 最大的堆大小,表示top K的item数,默认是50。
numGroups 分组数,即将数据分成多少组来进行频繁树的建立。
splitterPattern 特征的分割方式。
numTreeCacheEntries 树的entry的缓存数,用来防止树的重复建立。
method 指定是顺序方式,还是mapreduce计算方式。
encoding 文件的编码集。
userFPG2 用替换的FPG实现方式。
2 并行频繁树。
如果使用的mapreduce计算方式,则调用PFPGrowth的runPFPGrowth方法。
第一个job统计所有feature的支持度计数,用于之后的排序等工作。
2.1 startingParallelCounting
ParallelCountingMapper 将一行transaction的每个特征按其名字分布出去。
ParallelCountingReducer 对特征值进行计数。
结果存到PARALLEL_COUNTING中。
3 第二个步骤将第一步得到的feature存入DistributeCache。
然后会把支持度大于指定最小支持度(默认为3)以上的feature列表载入到内存中。这里如果feature列表大于内存能承受的大小,则需要将feature分到不同的文件中,因为hdfs不支持随机
saveFList 将feature列表存入到hdfs中。
4 第三步,对feature进行分布,各自建TransactionTree,然后导出频繁模式。
startParallelFPGrowth
4.1 从原始feature文件中,读入feature,根据支持度计数排列后的feature进行分组,分组的feature即为规则的右值。
ParallelFPGrowthMapper的setup方法中会载入所有的满足最小支持度的feature及其支持度,并对feature进行increment的index的建立。根据item对应的index对item进行分组。
对每个transaction,从后取feature作为分组分布的key,把列表中feature前的feature做为TransactionTree分布出去。
ParallelFPGrowthCombiner 构造TransactionTree,将所有相同index的feature相关的TransactionTree合并到一个中。
TransactionTree
childCount 是一个数组,保存节点的子节点的个数。
nodeCount 是一个数组,保存节点的频繁度计数。
attribute 是一个数组,保存feature的编号,不同分支下的相同名字的节点,所在位置不同。
nodeChildren 是一个二维数组,保持某节点的第n个子节点在attribute数组中的位置编号。
addPattern() 在现有的树中添加一个模式。遍历新加入的模式的各属性,首先默认是增量状态,从根节点找与模式想匹配的频繁树的分支,在没有找到现有模式节点的地方,切换成新建模式的状态,开始创建模式的节点。
context.write(key, cTree.getCompressedTree()), combiner导出的是一个压缩树,这里又涉及到了TransactionTreeIterator对象对TransactionTree的遍历,对树的路径的遍历。computeNext中:
while(top[1] + 1 == transactionTree.childCount(top[0])),这行用于判断child node是否都被访问过了(因为top[1]从-1开始增量计数)。
getCompressedTree()中node表示树中独立节点的个数,size代表事物集中项的个数加上2乘以transaction的个数,如果node×4 + 树的所有节点的子节点个数小于等于 size,则直接返回重新构成的树,否则用compressedTransactionSet构造一个TransactionTree。
最后将压缩的TransactionTree分布出去。
4.2 ParallelFPGrowthReducer
setup中,从Configuration中取到PFPGrowth.PFP_PARAMETERS参数;从DistributedCache中读入feature freq list(需要ensure PFPGrowth.readFList方法读入的文件是否已经按freq从大到小排列好!!!),feature存入到featureReverseMap中,频繁计数值存入到freqList中。
reduce中,对接收到的Transaction列表进行合并,构造一棵新的TransactionTree—cTree;从cTree中导出feature->freq的列表localFList(这个是选用FPGrowth的处理方法时使用的,可以放在条件判断分支中???),记录了所有feature及其freq计数的列表,将localFList的元素按freq计数倒序排列。
判断是用FPGrowthIds还是用FPGrowth进行频繁模式的导出。
FPGrowthIds.generateTopKFreqentPatterns(cTree.iterator(),
freqList,
minSupport,
maxHeapSize,
PFPGrowth.getGroupMembers(key.get(),
maxPerGroup,
numFeatures),
IntegerStringOutputConverter,
ContextStatusUpdater)
首先,将freqList进行截断,只保留频繁度大于minSupport的feature,这个feature列表returnFeatures用于之后的频繁模式的导出;然后构造FPTree,遍历cTree中的所有事务,即树的所有分支,并将这些事务用来构造频繁树。
FPTree.java中添加事物项集到频繁树中的方法:
/**
* Adds an itemset with the given occurrance count.
*/
publicvoid accumulate(IntArrayList argItems, long count) {
// boxed primitive used so we can use custom comparitor in sort
List<Integer> items = Lists.newArrayList();
for (int i = 0; i < argItems.size(); i++) {
items.add(argItems.get(i));
}
/* 对这个transaction中的itemcode根据支持度计数进行排序。 */
Collections.sort(items, attrComparator);
FPNode currNode = root;
for (int i = 0; i < items.size(); i++) {
int item = items.get(i);
long attrCount = 0;
if (item < attrCountList.size())
attrCount = attrCountList.get(item);
/* 只收支持度高于minSupport的 */
if (attrCount < minSupport)
continue;
/* 查看当前节点是否有子节点是item */
FPNode next = currNode.child(item);
/* 如果没有子节点是item,则创建此子节点 */
if (next == null) {
next = new FPNode(currNode, item, count);
currNode.addChild(next);
/* 读item的节点索引 */
List<FPNode> nodeList = (List<FPNode>) attrNodeLists.get(item);
if (nodeList == null) {
nodeList = Lists.newArrayList();
attrNodeLists.put(item, nodeList);
}
nodeList.add(next);
} else {
next.accumulate(count);
}
currNode = next;
}
}
4.3 用频繁模树导出频繁模式。
调用fpGrowth()方法来对每个满足最小支持度的feature进行频繁模式FrequentPatternMaxHeap的导出;对某个feature,从FPTree中导出其频繁模式的growth()方法。
growth()方法,如果当前feature的频繁度计数不够大,则直接返回一个空的FrequentPatternMaxHeap;否则调用FPTree的createMoreFreqConditionalTree方法,找到这个节点出现的所有位置,往根节点扫描,导出路径上的频繁节点,构造一个condTree;然后调用splitSinglePrefix方法,将共享的feature放入到pTree中,底层的feature放到qTree中。
ptree和qtree分别保存往上挖和往下挖频繁模式得到的结果。如下图,从x节点开始挖,ptree包含n,qtree包含x的子节点中的频繁项。
导出的FrequentPatternMaxHeap用TopKPatternsOutputConverter发送出去。结果的存储路径为“fpgrowth”。
5 AggregateMapper
读入fpgrowth中的数据,根据模式中的每个feature将模式及其支持度发送出去。
6 AggregateReducer
对某一个feature,将所有相关的模式进行合并,即可得到最终的频繁模式的结果。
相关推荐
在日常的开发和使用中,我们经常需要借助各种小工具来提高工作效率,例如快速启动常用的应用程序、管理文件等。一个简单但功能强大的集成工具箱可以帮助用户快速访问、启动并管理程序。今天,我们将以Python为基础,结合Tkinter和Win32API,开发一个类似Windows快捷方式的工具箱应用,能够让你轻松集成各种常用程序并一键启动
django自建博客app
《基于YOLOv8的智慧校园实验室高压灭菌锅安全联锁系统》(包含源码、可视化界面、完整数据集、部署教程)简单部署即可运行。功能完善、操作简单,适合毕设或课程设计
测试啊啊啊啊啊啊啊!!!!!
用于hifi测序数据的基因组组装程序
Microsoft Access 2010 数据库引擎可再发行程序包AccessDatabaseEngine-X64解压后的文件AceRedist
从大模型、智能体到复杂AI应用系统的构建——以产业大脑为例
自然语言处理之TF-IDF算法与TextRank算法的缠绵_textrank,tf-idf和两者的组合-CSDN博客.html
内容概要:2023版《科学智能 (AI4S)全球发展观察与展望》阐述了AI for Science(AI4S)在全球范围内的最新进展及其对科学和工业的深远影响。文章首先回顾了AI4S在过去一年中的快速发展,特别是在药物研发、材料科学、地质学、污染治理等多个领域的应用实例。AI4S通过结合深度学习、机器学习和其他AI技术,加速了从基础研究到实际应用的转化过程。例如,在药物研发中,AI4S帮助科学家克服了“反摩尔定律”的挑战,提高了新药研发的成功率;在材料科学中,AI4S实现了复杂材料的高效模拟,如人造钻石、石墨烯、碳纳米管等;在地质学中,AI4S通过模拟地球内部结构和物理过程,为地震学研究提供了新视角。此外,文章还探讨了大语言模型(LLMs)与科学方法的结合,指出LLMs不仅能辅助科学研究,还能生成新的科学假设并进行逻辑推理。 适合人群:具备一定科研背景或对AI技术感兴趣的科研人员、工程师、政策制定者及高校师生。
这个数据集包含了日常步数统计、睡眠时长、活跃分钟数以及消耗的卡路里,是个人健康与健身追踪的一部分。 该数据集非常适合用于以下实践: 数据清洗:现实世界中的数据往往包含缺失值、异常值或不一致之处。例如,某些天的步数可能缺失,或者存在不切实际的数值(如10,000小时的睡眠或负数的卡路里消耗)。通过处理这些问题,可以学习如何清理和准备数据进行分析。 探索性分析(发现日常习惯中的模式):可以通过分析找出日常生活中的模式和趋势,比如一周中哪一天人们通常走得最多,或是睡眠时间与活跃程度之间的关系等。 构建可视化图表(步数趋势、睡眠与活动对比图):将数据转换成易于理解的图形形式,有助于更直观地看出数据的趋势和关联。例如,绘制步数随时间变化的趋势图,或是比较睡眠时间和活动量之间的关系图。 数据叙事(将个人风格的追踪转化为可操作的见解):通过讲述故事的方式,把从数据中得到的洞察变成具体的行动建议。例如,根据某人特定时间段内的活动水平和睡眠质量,提供改善健康状况的具体建议。
框架结构天城商业办公楼5200平米(建筑图 结构图 计算书 开题报告 任务书 文献翻.zip
柴油机连杆加工工艺及夹具设计.zip
读书网首页的HTML信息
文字渐变颜色代码生成器:让文字绽放多彩魅力,演示:在信息交流日益丰富的今天,个性化的文字展示成为吸引目光的关键。这款文字渐变颜色代码生成器,便是为满足这一需求而生的绿色软件,无需安装,便捷实用。 它的操作极为简便。用户只需在软件界面中输入想要转换的文字内容,接着从丰富的色彩选项里挑选心仪的起始颜色与结束颜色,随后轻轻按下 “转换按钮”,神奇的事情就此发生 —— 适用于论坛、网页、QQ 空间等多种平台,以及自定义格式的渐变颜色代码便会即刻生成。不仅如此,生成的代码还能自动复制到剪切板,极大地节省了用户手动复制的时间。当你在论坛回帖、更新网页内容或是装扮 QQ 空间时,只需轻松粘贴代码,原本单调的文字瞬间就能拥有绚丽的渐变色彩,瞬间脱颖而出,为你的表达增添独特魅力,让文字不再平凡,轻松成为视觉焦点。 一款可以轻松把一段文字生成渐变颜色代码的绿色软件,当你在软件中输入完要转换的文字后,只需要挑选自己喜欢的起始颜色、结束颜色后,按一下―转换按钮即可生成相应的论坛/网页/QQ空间以及自定义格式代码,并且代码可以自动复制到剪切板中,回帖时直接粘贴代码即可不错得文字代码生成器,让你得文字更加漂亮.
1.【锂电池剩余寿命预测】Transformer锂电池剩余寿命预测(Matlab完整源码和数据) 2.数据集:NASA数据集,已经处理好,B0005电池训练、B0006测试; 3.环境准备:Matlab2023b,可读性强; 4.模型描述:Transformer在各种各样的问题上表现非常出色,现在被广泛使用。 5.领域描述:近年来,随着锂离子电池的能量密度、功率密度逐渐提升,其安全性能与剩余使用寿命预测变得愈发重要。本代码实现了Transformer在该领域的应用。 6.作者介绍:机器学习之心,博客专家认证,机器学习领域创作者,2023博客之星TOP50,主做机器学习和深度学习时序、回归、分类、聚类和降维等程序设计和案例分析,文章底部有博主联系方式。从事Matlab、Python算法仿真工作8年,更多仿真源码、数据集定制私信。
资源内项目源码是来自个人的毕业设计,代码都测试ok,包含源码、数据集、可视化页面和部署说明,可产生核心指标曲线图、混淆矩阵、F1分数曲线、精确率-召回率曲线、验证集预测结果、标签分布图。都是运行成功后才上传资源,毕设答辩评审绝对信服的保底85分以上,放心下载使用,拿来就能用。包含源码、数据集、可视化页面和部署说明一站式服务,拿来就能用的绝对好资源!!! 项目备注 1、该资源内项目代码都经过测试运行成功,功能ok的情况下才上传的,请放心下载使用! 2、本项目适合计算机相关专业(如计科、人工智能、通信工程、自动化、电子信息等)的在校学生、老师或者企业员工下载学习,也适合小白学习进阶,当然也可作为毕设项目、课程设计、大作业、项目初期立项演示等。 3、如果基础还行,也可在此代码基础上进行修改,以实现其他功能,也可用于毕设、课设、作业等。 下载后请首先打开README.txt文件,仅供学习参考, 切勿用于商业用途。
资源内项目源码是来自个人的毕业设计,代码都测试ok,包含源码、数据集、可视化页面和部署说明,可产生核心指标曲线图、混淆矩阵、F1分数曲线、精确率-召回率曲线、验证集预测结果、标签分布图。都是运行成功后才上传资源,毕设答辩评审绝对信服的保底85分以上,放心下载使用,拿来就能用。包含源码、数据集、可视化页面和部署说明一站式服务,拿来就能用的绝对好资源!!! 项目备注 1、该资源内项目代码都经过测试运行成功,功能ok的情况下才上传的,请放心下载使用! 2、本项目适合计算机相关专业(如计科、人工智能、通信工程、自动化、电子信息等)的在校学生、老师或者企业员工下载学习,也适合小白学习进阶,当然也可作为毕设项目、课程设计、大作业、项目初期立项演示等。 3、如果基础还行,也可在此代码基础上进行修改,以实现其他功能,也可用于毕设、课设、作业等。 下载后请首先打开README.txt文件,仅供学习参考, 切勿用于商业用途。
Android项目原生java语言课程设计,包含LW+ppt
配套文章:https://blog.csdn.net/gust2013/article/details/146909670?spm=1001.2014.3001.5502
《基于YOLOv8的智慧社区儿童游乐设施安全监测系统》(包含源码、可视化界面、完整数据集、部署教程)简单部署即可运行。功能完善、操作简单,适合毕设或课程设计