从数据流中挖掘高效用项集是一项具有挑战性的任务,因为传入的数据必须在时间和存储内存约束下进行实时处理.数据流挖掘通常会产生大量冗余的项集,为了减少这些无用的项集数量且保证无损压缩,需要挖掘闭合项集,它可以比全集高效用项集...从数据流中挖掘高效用项集是一项具有挑战性的任务,因为传入的数据必须在时间和存储内存约束下进行实时处理.数据流挖掘通常会产生大量冗余的项集,为了减少这些无用的项集数量且保证无损压缩,需要挖掘闭合项集,它可以比全集高效用项集的集合小几个数量级.为了解决以上问题,提出一种基于滑动窗口模型的数据流闭合高效用项集挖掘(closed high utility itemsets mining over data stream based on sliding window model,CHUI_DS)算法.在CHUI_DS中设计了一种新的效用列表结构,该结构在提升批次插入和删除的速度方面非常有效.此外,应用修剪策略来改进闭合项集挖掘过程,消除潜在的低效用候选对象.对真实数据集和合成数据集进行的广泛实验评估显示了该算法的效率以及可行性.就速度而言,它优于先前提出的主要以批处理模式运行的算法.且它适用于不同大小的滑动窗口,在事务数量等方面具有较强的扩展性.展开更多
现有的面向数据流的高效用模式挖掘方法局限性之一在于假定数据都带有正的效用值,且在挖掘过程中使用效用列表会消耗大量的时间和内存。为了解决以上问题,首次提出在数据流中挖掘含负项的高效用模式挖掘算法,在算法中设计了一种新颖的...现有的面向数据流的高效用模式挖掘方法局限性之一在于假定数据都带有正的效用值,且在挖掘过程中使用效用列表会消耗大量的时间和内存。为了解决以上问题,首次提出在数据流中挖掘含负项的高效用模式挖掘算法,在算法中设计了一种新颖的列表索引结构(list index structure,LIS),LIS包括数据段和索引段,依据索引段中的索引值以及项集中的正负效用值,在滑动窗口中可快速访问或更新数据段并及时剪枝,有效挖掘含负项的高效用模式,以此来提升算法的时空性能。进行了广泛的实验评估来验证算法的效率,实验结果表明,提出算法在内存消耗及运行时间方面均表现出良好的性能。展开更多
文摘从数据流中挖掘高效用项集是一项具有挑战性的任务,因为传入的数据必须在时间和存储内存约束下进行实时处理.数据流挖掘通常会产生大量冗余的项集,为了减少这些无用的项集数量且保证无损压缩,需要挖掘闭合项集,它可以比全集高效用项集的集合小几个数量级.为了解决以上问题,提出一种基于滑动窗口模型的数据流闭合高效用项集挖掘(closed high utility itemsets mining over data stream based on sliding window model,CHUI_DS)算法.在CHUI_DS中设计了一种新的效用列表结构,该结构在提升批次插入和删除的速度方面非常有效.此外,应用修剪策略来改进闭合项集挖掘过程,消除潜在的低效用候选对象.对真实数据集和合成数据集进行的广泛实验评估显示了该算法的效率以及可行性.就速度而言,它优于先前提出的主要以批处理模式运行的算法.且它适用于不同大小的滑动窗口,在事务数量等方面具有较强的扩展性.
文摘现有的面向数据流的高效用模式挖掘方法局限性之一在于假定数据都带有正的效用值,且在挖掘过程中使用效用列表会消耗大量的时间和内存。为了解决以上问题,首次提出在数据流中挖掘含负项的高效用模式挖掘算法,在算法中设计了一种新颖的列表索引结构(list index structure,LIS),LIS包括数据段和索引段,依据索引段中的索引值以及项集中的正负效用值,在滑动窗口中可快速访问或更新数据段并及时剪枝,有效挖掘含负项的高效用模式,以此来提升算法的时空性能。进行了广泛的实验评估来验证算法的效率,实验结果表明,提出算法在内存消耗及运行时间方面均表现出良好的性能。