19、基于本地与通用知识的文档聚类方法

基于本地与通用知识的文档聚类方法

在文档聚类任务中,单一知识来源往往难以全面准确地刻画文档特征,导致聚类效果不佳。为解决知识不足的问题,我们考虑结合通用知识和本地知识进行文档聚类。通用知识是具有文档一般含义的外部知识源,本地知识则针对特定问题具有文档的领域特定含义。下面将详细介绍两种结合这两种知识的方法,并通过实验验证其有效性。

1. 结合知识的方法

为了将通用知识(U)和本地知识(L)的优势结合起来用于文档聚类,我们提出了两种不同的方法:
- 方法一:结合相似度
- 相似度计算 :给定问题P和知识体L,用$S_L(D_i, D_j)$表示基于本地知识L的两个文档$D_i$和$D_j$之间的相似度,例如可以使用余弦度量:
$S_L(D_i, D_j) = \frac{NR(D_i) \cdot NR(D_j)}{|NR(D_i)| 2 |NR(D_j)|_2}$
其中$NR(D_i)$和$NR(D_j)$是从知识库L导出的$D_i$和$D_j$的数值特征向量,$| \cdot |_2$是欧几里得范数。同时,用$S_U(D_i, D_j)$表示基于通用知识U的两个文档之间的相似度,U假设由预训练的Doc2Vec模型建模,$S_U(D_i, D_j)$是$D_i$和$D_j$的Doc2Vec向量之间的余弦度量。
- 图表示 :目标是导出一个完全连通的图$G
{LU}(V, E)$,其中节点V是知识库L中的文档,每条边$(D_i, D_j)$的权重为$S_{LU}(D_i, D_j)$,这些相似度值可用于文档聚类。输入是两

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值