基于gensim的Doc2Vec简析

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

摘要:本文主要描述了一种文章向量(doc2vec)表示及其训练的相关内容,并列出相关例子。两位大牛Quoc Le 和 Tomas Mikolov(搞出Word2vec的家伙)在2014年的《Distributed Representations of Sentences and Documents》所提出文章向量(Documents vector),或者称句向量(Sentences vector),当然在文章中,统一称这种向量为Paragraph Vector,本文也将已doc2vec称呼之。文章中讲述了如何将文章转换成向量表示的算法。

1、Word2vec的基本原理

先简述一下Word2vec相关原理,因为本文要讲述的doc2vec是基于Word2vec思想的算法。w2v的数学知识还比较丰富,网络上相关资料也很多。如果要系统的讲述,我可能会涉及包括词向量的理解、sigmoid函数、逻辑回归、Bayes公式、Huffman编码、n-gram模型、浅层神经网络、激活函数、最大似然及其梯度推导、随机梯度下降法、词向量与模型参数的更新公式、CBOW模型和 Skip-gram模型、Hierarchical Softmax算法和Negative Sampling算法。当然还会结合google发布的C源码(好像才700+行),讲述相关部分的实现细节,比如Negative Sampling算法如何随机采样、参数更新的细节、sigmod的快速近似计算、词典的hash存储、低频与高频词的处理、窗口内的采样方式、自适应学习、参数初始化、w2v实际上含有两中方法等,用C代码仅仅700+行实现,并加入了诸多技巧,推荐初识w2v的爱好者得看一看。

Google出品的大多都是精品 ,w2v也不例外。Word2Vec实际上使用了两种方法,Continuous Bag of Words (CBOW) 和Skip-gram,如下图所示。在CBOW方法中,目的是将文章中某个词的上下文经过模型预测该词。而Skip-gram方法则是用给定的词来预测其周边的词。而词向量是在训练模型中所得到的一个副产品,此模型在源码中是为一个浅层的神经网络(3层)。在训练前,每一个词都会首先初始化为一个N维的向量,训练过程中,会对输入的向量进行反馈更新,在进行大量语料训练之后,便可得到每一个词相应的训练向量。而每一种模型方法都可以使用两种对应的训练方法Hierarchical Softmax算法和Negative Sampling算法,有兴趣的盆友可以自行查阅相关内容。
Word2Vec的两种不同方法

训练出的向量有一定的特性,即相近意义的词在向量空间上其距离也是相近。
有一个经典例子就是 V(‘king’) – V(‘man’) + V(‘woman’) ≈ V(‘queen’)

2、Doc2Vec的基本原理

基于上述的Word2Vec的方法,Quoc Le 和Tomas Mikolov又给出了Doc2Vec的训练方法。如下图所示,其原理与Word2Vec非常的相似。分为Distributed Memory (DM) 和Distributed Bag of Words (DBOW),可以看出 Distributed Memory version of Paragraph Vector
(PV-DM)方法与Word2Vec的CBOW方法类似,Bag of Words version of Paragraph Vector (PV-DBOW)与Word2Vec的Skip-gram方法类似。不同的是,给文章也配置了向量,并在训练过程中更新。熟悉了w2v之后,Doc2Vec便非常好理解。具体细节可以看原文Distributed Representations of Sentences and Documents

Doc2Vec的两种不同方法

3、gensim的实现

使用Doc2Vec进行分类任务,我们使用 IMDB电影评论数据集作为分类例子,测试gensim的Doc2Vec的有效性。数据集中包含25000条正向评价,25000条负面评价以及50000条未标注评价。

#!/usr/bin/python
import sys
import numpy as np
import gensim

from gensim.models.doc2vec import Doc2Vec,LabeledSentence
from sklearn.cross_validation import train_test_split

LabeledSentence = gensim.models.doc2vec.LabeledSentence
##读取并预处理数据
def get_dataset():
    #读取数据
    with open(pos_file,'r') as infile:
        pos_reviews = infile.readlines()
    with open(neg_file,'r') as infile:
        neg_reviews = infile.readlines()
    with open(unsup_file,'r') as infile:
        unsup_reviews = infile.readlines()

    #使用1表示正面情感,0为负面
    y = np.concatenate((np.ones(len(pos_reviews)), np.zeros(len(neg_reviews))))
    #将数据分割为训练与测试集
    x_train, x_test, y_train, y_test = train_test_split(np.concatenate((pos_reviews, neg_reviews)), y, test_size=0.2)

    #对英文做简单的数据清洗预处理,中文根据需要进行修改
    def cleanText(corpus):
        punctuation = """.,?!:;(){}[]"""
        corpus = [z.lower().replace('\n','') for z in corpus]
        corpus = [z.replace('<br />', ' ') for z in corpus]

        #treat punctuation as individual words
        for c in punctuation:
            corpus = [z.replace(c, ' %s '%c) for z in corpus]
        corpus = [z.split() for z in corpus]
        return corpus

    x_train = cleanText(x_train)
    x_test = cleanText(x_test)
    unsup_reviews = cleanText(unsup_reviews)

    #Gensim的Doc2Vec应用于训练要求每一篇文章/句子有一个唯一标识的label.
    #我们使用Gensim自带的LabeledSentence方法. 标识的格式为"TRAIN_i"和"TEST_i",其中i为序号
    def labelizeReviews(reviews, label_type):
        labelized = []
        for i,v in enumerate(reviews):
            label = '%s_%s'%(label_type,i)
            labelized.append(LabeledSentence(v, [label]))
        return labelized

    x_train = labelizeReviews(x_train, 'TRAIN')
    x_test = labelizeReviews(x_test, 'TEST')
    unsup_reviews = labelizeReviews(unsup_reviews, 'UNSUP')

    return x_train,x_test,unsup_reviews,y_train, y_test
##读取向量
def getVecs(model, corpus, size):
    vecs = [np.array(model.docvecs[z.tags[0]]).reshape((1, size)) for z in corpus]
    return np.concatenate(vecs)
##对数据进行训练
def train(x_train,x_test,unsup_reviews,size = 400,epoch_num=10):
    #实例DM和DBOW模型
    model_dm = gensim.models.Doc2Vec(min_count=1, window=10, size=size, sample=1e-3, negative=5, workers=3)
    model_dbow = gensim.models.Doc2Vec(min_count=1, window=10, size=size, sample=1e-3, negative=5, dm=0, workers=3)

    #使用所有的数据建立词典
    model_dm.build_vocab(np.concatenate((x_train, x_test, unsup_reviews)))
    model_dbow.build_vocab(np.concatenate((x_train, x_test, unsup_reviews)))

    #进行多次重复训练,每一次都需要对训练数据重新打乱,以提高精度
    all_train_reviews = np.concatenate((x_train, unsup_reviews))
    for epoch in range(epoch_num):
        perm = np.random.permutation(all_train_reviews.shape[0])
        model_dm.train(all_train_reviews[perm])
        model_dbow.train(all_train_reviews[perm])

    #训练测试数据集
    x_test = np.array(x_test)
    for epoch in range(epoch_num):
        perm = np.random.permutation(x_test.shape[0])
        model_dm.train(x_test[perm])
        model_dbow.train(x_test[perm])

    return model_dm,model_dbow
##将训练完成的数据转换为vectors
def get_vectors(model_dm,model_dbow):

    #获取训练数据集的文档向量
    train_vecs_dm = getVecs(model_dm, x_train, size)
    train_vecs_dbow = getVecs(model_dbow, x_train, size)
    train_vecs = np.hstack((train_vecs_dm, train_vecs_dbow))
    #获取测试数据集的文档向量
    test_vecs_dm = getVecs(model_dm, x_test, size)
    test_vecs_dbow = getVecs(model_dbow, x_test, size)
    test_vecs = np.hstack((test_vecs_dm, test_vecs_dbow))

    return train_vecs,test_vecs
##使用分类器对文本向量进行分类训练
def Classifier(train_vecs,y_train,test_vecs, y_test):
    #使用sklearn的SGD分类器
    from sklearn.linear_model import SGDClassifier

    lr = SGDClassifier(loss='log', penalty='l1')
    lr.fit(train_vecs, y_train)

    print 'Test Accuracy: %.2f'%lr.score(test_vecs, y_test)

    return lr
##绘出ROC曲线,并计算AUC
def ROC_curve(lr,y_test):
    from sklearn.metrics import roc_curve, auc
    import matplotlib.pyplot as plt

    pred_probas = lr.predict_proba(test_vecs)[:,1]

    fpr,tpr,_ = roc_curve(y_test, pred_probas)
    roc_auc = auc(fpr,tpr)
    plt.plot(fpr,tpr,label='area = %.2f' %roc_auc)
    plt.plot([0, 1], [0, 1], 'k--')
    plt.xlim([0.0, 1.0])
    plt.ylim([0.0, 1.05])

    plt.show()
##运行模块
if __name__ == "__main__":
    #设置向量维度和训练次数
    size,epoch_num = 40010
    #获取训练与测试数据及其类别标注
    x_train,x_test,unsup_reviews,y_train, y_test = get_dataset()
    #对数据进行训练,获得模型
    model_dm,model_dbow = train(x_train,x_test,unsup_reviews,size,epoch_num)
    #从模型中抽取文档相应的向量
    train_vecs,test_vecs = get_vectors(model_dm,model_dbow)
    #使用文章所转换的向量进行情感正负分类训练
    lr=Classifier(train_vecs,y_train,test_vecs, y_test)
    #画出ROC曲线
    ROC_curve(lr,y_test)

IMDB影评数据使用Doc2vec分类的ROC曲线

训练结果的,test分类精度为86%,AUC面积为0.94

————————————————————————————————————————
————————————————————————————————————————
相关链接:

[1] 安装Tensorflow(Linux ubuntu) http://blog.csdn.net/lenbow/article/details/51203526
[2] ubuntu下CUDA编译的GCC降级安装 http://blog.csdn.net/lenbow/article/details/51596706
[3] ubuntu手动安装最新Nvidia显卡驱动 http://blog.csdn.net/lenbow/article/details/51683783
[4] Tensorflow的CUDA升级,以及相关配置 http://blog.csdn.net/lenbow/article/details/52118116

gensimdoc2vec计算文本相似度 最近在做判断两个文本是否是描述的同一件事情,之前是采用gensim中的TF-IDF进行计算的,TF-IDF这种方法没有考虑到文字背后的语义关联,可能在两个文档共同出现的单词很少甚至没有相同的单词,但两个文档是相似的情况下,就需要考虑到文档的语义。我们都知道word2vec是可以分析语义的,那么doc2vec是不是也可以分析出语义呢?于是试了一下gensim中的doc2vecDoc2Vec也... 阅读详情

相关推荐

深度学习:详解word2vec + 实践操作(包括text2word)

Text2vec 的输入是整个文本序列,输出是文本序列对应的向量表示。Word2vec 的训练目标是最小化相似单词在空间中的距离或最大化不相似单词在空间中的距离。Text2vec 的训练目标是最小化文本之间的距离或最大化相似文本的相似度。Text2vec 和 Word2vec 都是用于将文本(文本中的单词或字符)转换为向量的方法。Word2vec 的输入是单个单词,输出是单词对应的向量表示。Text2vec 通常用于处理整个文本序列的任务,如文本分类、文本相似度计算、文本聚类等。

qq_41298763的博客 8011

word2vecdoc2vec模型详解及应用

词袋模型(Bag of Word Model) 将所有词语装进一个袋子里,不考虑其词法和语序的问题,即每个词语都是独立的。例如如下2个例句: Jane wants to go to Shenzhen. Bob wants to go to Shanghai. 就可以构成一个词袋,袋子里包括{ Jane,wants,to,go,Shenzhen,Bob,Shangh...

L 1685

机器学习算法(十三):word2vec

1 单词表达 1.1Word embedding Embedding是数学领域的有名词,是指某个对象 X 被嵌入到另外一个对象 Y 中,映射 f : X → Y ,例如有理数嵌入实数。 Word embedding 是NLP中一组语言模型(language modeling)和特征学习技术(feature learning techniques)的总称,这些...

weixin_39910711的博客 9008

Doc2Vec模型的介绍与gensimDoc2Vec的使用

文章目录一、Doc2Vec模型1 、PV-DM2 、PV-DBOW二、gensim实现1、gensim实现Doc2Vec(IMDB数据集)2、gensim实现Doc2Vec(中文数据集)三、总结四、程序编写时遇到的错误:gensim包中相关函数说明: 一、Doc2Vec模型   许多机器学习算法需要的输入是一个固定长度的向量,当涉及到短文时,最常用的固定长度的向量方法是词袋模型(bag-of-wo...

潘多拉星系的专栏 1万+

Doc2Vec - 计算文档之间的相似性

如果我们将上下文数据转换为低维向量,并且当我们谈论将文本文档转换为其数字表示时,这就是doc2vec模型发挥作用的地方,自然语言处理领域有许多具有挑战性的任务可以完成。但是,我们可以使用doc2vec完成许多任务,但今天我们只专注于计算文档之间的相似性,以便您能够识别抄袭文档,获得相似文章的推荐等等。Doc2vec是一种无监督机器学习算法,用于将文档转换为向量。这个概念是由Mikilov和Le在本文中提出的。我们已经看到使用doc2vec模型可以获得很多帮助。httpshttps。............

qq_43483899的博客 7947

基于gensimDoc2Vec简析,以及用python 实现简要代码

Doc2Vec 原理:Doc2Vec 或者叫做 paragraph2vec, sentence embeddings,是一种非监督式算法,可以获得sentences/paragraphs/documents 的向量表达,是 word2vec 的拓展。学出来的向量可以通过计算距离来找 sentences/paragraphs/documents 之间的相似性, 或者进一步可以给文档打标签。例如首先是...

立身以力学为先,力学以读书为本。 —郑耕老《劝学》 3367

基于gensimDoc2Vec\word2vec简析,以及用python 实现简要代码,

Doc2Vec 原理: Doc2Vec 或者叫做 paragraph2vec, sentence embeddings,是一种非监督式算法,可以获得sentences/paragraphs/documents 的向量表达,是 word2vec 的拓展。学出来的向量可以通过计算距离来找 sentences/paragraphs/documents 之间的相似性, 或者进一步可以给文档打标签。 ...

IT届的小学生 9710

Gensim库之Doc2Vec模型详解

Gensim库之Doc2Vec模型详解 models.doc2vecDoc2vec paragraph embeddings: TaggedDocument: 对于输入的文档 text,转换为:TaggedDocument(text, [i])的形式,i为文档编号 class gensim.models.doc2vec.Doc2Vec( documents=None, 输入语料库,是Tagg...

turboMan的博客 3804

Doc2Vec的简介及应用(gensim)

作者:Gidi Shperber 在本文中,你将学习什么是doc2vec,它是如何构建的,它与word2vec有什么关系,你能用它做什么,并且没有复杂的数学公式。 介绍 文本文档的量化表示在机器学习中是一项具有挑战性的任务。很多应用都需要将文档量化处理,例如:文档检索,web搜索,垃圾邮件过滤,主题建模等。 但是,要做到这一点好的方法不多。很多方法使用众所周知但简单化的词袋方法(BOW)...

weixin_42608414的博客 4万+

Gensim进阶教程:训练word2vecdoc2vec模型

本篇是Gensim的进阶教程,主要介绍用于词向量见面的word2vec模型和用于长文本向量建模的doc2vec模型在Gensim中的实现。 Word2Vec Word2Vec并不是一个模型—它是2013年Mikolov开源的一款用于计算词向量的工具,关于word2vec更多的原理性的介绍,可以参考其他博客。 在Gensim中实现word2vec模型非常简单。首先我们需要将原始的训练语料转化成一个sentence的迭代器,每一次迭代返回的sentence是一个word(utf-8)的列表: class MyS

m0_37531129的博客 1350

Doc2Vec模型介绍及使用

Doc2Vec模型Doc2Vec模型 摘要 背景 段落向量 PV-DM模型 PV-DBOW模型 gensim实现Doc2Vec 说明 参考文献摘要通过本文,你将了解到: Doc2Vec模型是如何产生的 Doc2Vec模型细节 Doc2Vec模型的特点 Doc2Vec的使用及代码(gensim) 背景  Doc2Vec模型的产生要从词向量表示(论文word2vec模型)开始说起,该文章介绍了两种词的向

walkeao的博客 1万+

Gensim库的使用——Doc2Vec模型(一)介绍与使用

Doc2Vec模型 使用Lee corpus来介绍GensimDoc2vec模型的使用 Doc2vec模型是用来将每一篇文档转换成向量的模型,注意,是将整篇文档转换为向量! 段落向量模型 Le and Mikolov 在2014年介绍了Doc2Vec 算法,这个算法虽然仅仅是使用了Word2Vec的向量进行了平均化操作,但是效果却很好。 这个算法的基本思想是,如果说一个文档有另一个类似于词的浮动向量, ...

一个小菜鸟的博客 8973

doc2vec论文方法解析及基于Gensim库的Python代码实现

文章目录一、全文概述二、word2vec三、doc2vec1. PV-DM2. PV-DBOW三、Python代码实现 本文主要讲解Mikolov在2014年发表的论文《Distributed Representations of Sentences and Documents》,论文主要是基于word2vec方法的一种改进,建议在理解word2vec的基础再来看这篇文章。 一、全文概述 基于wo...

weixin_44735126的博客 1188

gensimdoc2vec调参

在文本分类中,需要把文本转换成向量。官方文档https://radimrehurek.com/gensim/models/doc2vec.htmldoc2vec算法是基于word2vec算法。model = Doc2Vec(documents, size=100, window=8, min_count=5, workers=4)documents是训练文档,训练文档必须是一行一个文本,并且进行过分

baidu_15113429的博客 6157

关于gensimdoc2vec的使用参考

工具:anaconda2 1.TaggedDocumnet 和TaggedLineDocument 前者的输入有两个参数:一行分词后的文本,标签; 后者的输入:分词之后的文本文件,每个文本占一行 2.库版本的差异 python的gensim有2.3.0和3.4.0两个版本,加载模型推测文本向量时所用的gensim版本一定要和训模型时使用的版本一样。 3.推测文本向量时的注意事项 一开......

wo的博客 1万+

Gensim库的使用——Doc2vec段落嵌入

使用方法: 地址:models.doc2vecDoc2vec paragraph embeddings — gensim 1、初始化与训练模型 from gensim.test.utils import common_texts from gensim.models.doc2vec import Doc2Vec, TaggedDocument #将common_tests中的文本读入,并给其进行标号 documents = [TaggedDocument(doc, [i]) for i, d

一个小菜鸟的博客 1192

python gensim[word2vec & doc2vec]基本操作

gemsim[word2vec & doc2vec] 官方文档:https://radimrehurek.com/gensim/models/word2vec.html https://rare-technologies.com/word2vec-tutorial/. gensim介绍:python NLP的包 gensim包依赖于numpy包和scipy包,即需要先安装numpy和sc...

weixin_38523904的博客 1247

GensimDoc2Vec方法简介

Doc2Vec主要作用是将文章转化为词向量,支持大批量的数据训练,如果遇到多个较大的数据文件,不能全部加装到内存中,可以使用下面的方法,自己封装TaggedDocument。 如果数据量较小,且只有1个数据文件,可以使用doc2vec.TaggedLineDocument,注意,数据文件一行对应一篇文章,并且词必须以空格隔开。 1 TaggedLineDocument训练小数据 # 设置迭代器 tagged_line = TaggedLineDocument("F:\\my_data\\t...

make_progress的博客 3265
上一篇: Tensorflow的CUDA升级,以及相关配置
下一篇: TensorFlow的分布式学习框架简介
林海山波
博客等级 码龄16年 496粉丝 9原创
评论 42
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值