基于本地与通用知识的文档聚类方法
在文档聚类任务中,单一知识来源往往难以全面准确地刻画文档特征,导致聚类效果不佳。为解决知识不足的问题,我们考虑结合通用知识和本地知识进行文档聚类。通用知识是具有文档一般含义的外部知识源,本地知识则针对特定问题具有文档的领域特定含义。下面将详细介绍两种结合这两种知识的方法,并通过实验验证其有效性。
1. 结合知识的方法
为了将通用知识(U)和本地知识(L)的优势结合起来用于文档聚类,我们提出了两种不同的方法:
- 方法一:结合相似度
- 相似度计算 :给定问题P和知识体L,用$S_L(D_i, D_j)$表示基于本地知识L的两个文档$D_i$和$D_j$之间的相似度,例如可以使用余弦度量:
$S_L(D_i, D_j) = \frac{NR(D_i) \cdot NR(D_j)}{|NR(D_i)| 2 |NR(D_j)|_2}$
其中$NR(D_i)$和$NR(D_j)$是从知识库L导出的$D_i$和$D_j$的数值特征向量,$| \cdot |_2$是欧几里得范数。同时,用$S_U(D_i, D_j)$表示基于通用知识U的两个文档之间的相似度,U假设由预训练的Doc2Vec模型建模,$S_U(D_i, D_j)$是$D_i$和$D_j$的Doc2Vec向量之间的余弦度量。
- 图表示 :目标是导出一个完全连通的图$G {LU}(V, E)$,其中节点V是知识库L中的文档,每条边$(D_i, D_j)$的权重为$S_{LU}(D_i, D_j)$,这些相似度值可用于文档聚类。输入是两
超级会员免费看
订阅专栏 解锁全文

5308

被折叠的 条评论
为什么被折叠?



