原型选择与文档聚类算法的研究与实践
在机器学习和数据挖掘领域,原型选择和文档聚类是两个重要的研究方向。原型选择有助于提高分类器的效率和性能,而文档聚类则能帮助我们从大量文本中发现主题。下面将详细介绍相关的方法和实验结果。
原型选择方法
在训练集中,不同的原型可能具有不同的相关性。为了选择最相关的原型,人们提出了多种方法。
相关工作中的原型选择方法
- Condensed Nearest Neighbor (CNN) :初始时,集合 $S$ 为空,随机将每个类的一个原型加入 $S$。然后用 $S$ 中的原型对训练集 $T$ 中的每个原型进行分类,如果某个原型分类错误,则将其加入 $S$,重复此过程直到 $T$ 中所有原型都能被正确分类。该方法能保证 $S$ 对 $T$ 中所有原型正确分类,但不一定能找到最小的一致子集。
- Generalized Condensed Nearest Neighbor Rule (GCNN) :与 CNN 类似,但根据 Absorption(p) 准则将原型加入 $S$,该准则基于 $p$ 在 $S$ 中的最近邻和最近敌(不同类的最近原型)计算。当 $T$ 中所有原型都被强吸收(即 Absorption 满足用户给定的阈值)时,选择过程结束。
- Edited Nearest Neighbor (ENN) :从 $T$ 中丢弃不属于其 $k$ 个最近邻类别的原型,可作为噪声过滤器。其变体 Repeated ENN (RENN) 会反复应用 ENN 直到 $S$ 中所
超级会员免费看
订阅专栏 解锁全文

5308

被折叠的 条评论
为什么被折叠?



