首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到20条相似文献,搜索用时 15 毫秒
1.
Apriori算法是关联规则挖掘中的经典算法。在Apriori算法中,使用频繁项集的先验知识,逐层搜索的迭代方法,通过扫描数据库,累积每个项的计数,并收集满足最小支持度的项,找每个Lk都需要扫描一次数据库。算法的效率随着数据量的增大,频繁项集的增多,算法的效率就非常的低,本文通过对Apriori算法分析,应用散列、事务压缩、划分、抽样等方法,最大可能的减少数据库扫描的次数,快速发现频繁项集,提高Apriori算法的效率。  相似文献   

2.
经过分析关联规则中Apriori算法存在的不足,为减少对事务数据库的扫描次数,缩减产生频繁项集的时间,列出两种基于哈希表的计算项集支持计数的方法以及利用哈希表来进行项集的地址定位的方法,使得生成频繁项集的效率有所提高。  相似文献   

3.
翟悦 《科教文汇》2011,(4):89-90
针对传统的Apriori算法需要产生大量的候选项目集和多次扫描数据库的不足,提出了一种新的基于内积运算的频繁项集生成算法。该算法对事务数据库布尔化表示,通过内积运算搜寻矩阵行向量直接生成频繁项集,打破了频繁项集必须从低次到高次的局限,当频繁项集可能是大项集时,大大提高了搜索效率。  相似文献   

4.
谢胡林 《科技通报》2019,35(8):172-176
在大数据背景下进行数据挖掘越来越受到重视,针对Apriori挖掘算法中存在消耗时间长,算法效率低的特点,采用添加数据库、改进频繁1-项集,改进频繁2-项集和引入动态存储空间等措施,提高Apriori算法的性能,仿真实验中,本文算法在时间消耗、CPU耗能和挖掘效果上都取得了良好的效果。  相似文献   

5.
为了更好的对户外运动资源进行整合,以提高资源利用率,本文采用数据挖掘技术构建了一种并行拓展及关联分析的户外运动资源整合模型。首先将整个数据集随机分割成若干个非重叠子数据集,并且每个子数据集还可继续划分成更小的子集,进而并行分层地挖掘出局部频繁项集,然后根据频繁项集先验性质,连接局部频繁项集得到全局候选项集;最后扫描数据集统计出每个候选项集的实际支持度,以确定全局频繁项集。算法实例仿真结果表明,本文提出的改进算法与普通Apriori算法相比更高效,并且在户外运动资源整合的应用中,本文提出的算法表现出更好的挖掘效率。  相似文献   

6.
Apriori算法是关联规则挖掘中的经典算法。通过对Apriori算法的基本思想和性能的研究分析,提出了一种基于垂直事务列表的树形结构的挖掘算法,减少了候选频繁项集的数量,提高了挖掘算法的效率。实验结果表明新算法具有良好的性能。  相似文献   

7.
挖掘最大频繁项目集是数据挖掘领域的一个重要的研究内容。Apriori算法作为一种挖掘频繁项目集的基本算法,其缺点是产生大量的候选项目集,算法的代价很大。本文在基于FP-Tree的基础上提出了挖掘最大频繁项目集的新算法FP-GDMA。该算法采用自顶向下和自底向上相结合的搜索策略有效减少了生产候选项目集的数目,有效提高了挖掘最大频繁项目集的效率。并通过实验比较FP-GDMA与DMFIA算法。  相似文献   

8.
本文提出了一种改进的Apriori算法。解决经典的Apriori算法的瓶颈,通过对数据库中小于最小支持度的项集进行剪枝,减少数据库中的事物数量来提高下次扫描的效率,同时改变产生候选集的函数,生成连续的访问页面。改进算法提高了网上学习模型的智能性。  相似文献   

9.
关联规则在数据挖掘中扮演着十分重要的角色,而Apriori算法和FP-growth算法是当前关联规则中两大主要算法。其中Apriori算法的主要开支是产生大量候选项集和重复遍历数据库,FP-growth算法的主要开支是重复创建和遍历条件FP树。在介绍两种算法基础上,提出了一种新的算法,使Apriori算法产生的候选项集不是查找数据库而是查找FP-tree来确定是否为频繁项集。实际测试表明,在一定的条件下,新算法的效率高于原先的两种算法。  相似文献   

10.
在研究和剖析关联Apriori算法的基础上,针对Apriori算法中的瓶颈,提出了一种优化算法,从算法的计数、连接和减枝等方面进行优化,快速搜索频繁项集,从而提升算法效率.  相似文献   

11.
随着互联网的广泛应用与云计算技术得到飞速发展,如何从大数据中寻求数据规律,并以此做出科学的预测与决策,成为目前数据挖掘技术的主要研究方向之一。Apriori算法就是一种基于海量数据并挖掘关联规则频繁项集的典型算法,其在大数据挖掘分析中具有较大研究与应用价值。  相似文献   

12.
王昱  陈仪香 《中国科技信息》2007,24(20):78-78,80
从Apriori算法可以看出,每次对数据库的扫描时,有些事务已经对频繁项目集的生成不产生作用。减少数据库内与进一步挖掘任务不相关的事务对于算法来说很有必要。本文不同于传统的事务压缩方法,设计了新的基于数据集削减法的Apriori算法。  相似文献   

13.
Web页面包含复杂的、无结构的、动态的数据信息,包含大量的、不完全的、有噪声的、模糊的、随机的数据,干扰了正常的提取过程.为此提出一种改进Apriori算法的海量Web数据高效挖掘方法.在自然连接产生候选集以前先进行一个修剪过程,减少参加连接的项集数量,因而减小生成的候选项集规模,减少了循环迭代次数和运行时间,同时在连接判断步骤中减少多余的判断次数.实验表明,该方法能够迅速排除冗余数据干扰,提高了挖掘的准确性.  相似文献   

14.
关联规则挖掘是数据挖掘研究领域中的一个重要任务,旨在挖掘事务数据库中有趣的关联。Apriori算法是关联规则挖掘中的经典算法。然而Apriori算法存在着产生候选项目集效率低和频繁扫描数据等缺点。提出了一种新的Apriori的改进算法,该算法在生成k(k>1)项频繁集时,不需要重新扫描数据库,只是在生成1项频集时,才需要扫描事务数据库,有效地减少了对事务数据库的读操作,在时间复杂度上较经典的Apriori算法有更加优越的性能。  相似文献   

15.
经典的Apriori算法可以搜索出所有的频繁项集,因而被广泛地应用于关联规则数据挖掘系统。研究表明:采用一种辅助分析策略,通过对项集规模的计算简化搜索过程,提高算法效率。  相似文献   

16.
频繁项集挖掘算法研究   总被引:2,自引:0,他引:2  
在数据库中挖掘频繁项集是数据挖掘领域的最基本、最重要的问题。自从Agrawal的开创性工作以来,有关研究从未停止过。然而由于其内在的计算复杂性,这一问题并未完全解决。通过描述频繁项集挖掘的特点,并根据解空间的分类对已有各种频繁项集、闭频繁项集、最大闭频项集和不生成频繁项集的挖掘算法进行了分析和比较。  相似文献   

17.
在挖掘关联规则的过程中,关键步骤是产生频繁项集。文中利用逻辑与运算并建立频繁项集支持矩阵,提出一种有效的频繁项集挖掘算法—LA。算法利用逻辑与运算挖掘频繁项集,不产生候选项集,且只需扫描数据库一次,所以此算法是非常有效的。  相似文献   

18.
关联规则是数据挖掘的重要研究方向之一,Apriori算法是利用关联规则进行数据挖掘中的一个最经典的算法。通过对Apriori算法进行研究分析,发现该算法具有产生大量候选项集和多次扫描数据库的缺点。提出了一种基于矩阵按位存储的改进型Apriori算法,该算法将数据库中的数据读入内存,用矩阵按位存储数据,使用按位运算计算项集的支持数,提高了支持数计数的效率,从而提高了关联规则挖掘的速度和效率。  相似文献   

19.
针对Apriori算法的存在产生大量的候选频繁集合的缺点,本文提出了基于加权代价敏感的非频过滤矩阵Apriori算法,通过在FP-tree算法的基础上构造的决策树对应的数据进行代价敏感学习;设定不同的数据的权值,设定加权置信度;非频集过滤矩阵寻找频集,生成强关联规则;构成非频集过滤Apriori算法对应的初始矩阵;构建代价敏感的非频集过滤矩阵等措施提高了算法的挖掘效果。  相似文献   

20.
研究频繁项集模式挖掘优化问题。传统的挖掘算法常产生大规模的候选项集,并且反复扫描数据库,导致频繁项集挖掘时间过长,空间效率太低。为了改进频繁项集挖掘时时间与空间效率低的问题,提出一种高效频繁项集挖掘算法CPT-Mine。此算法利用编码模式树存储事务数据库中的频繁项集信息,构建FP数组,加快产生频繁项集,引入CPT-Mine算法,快速地挖掘数据库中所包含的频繁项集,无需递归构造条件模式树,只需两次扫描数据库即可生成所有频繁项集。最后的实验证明了该算法能缩短挖掘时间3~10 s,空间效率提高43%。  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号