• 欢迎访问搞代码网站,推荐使用最新版火狐浏览器和Chrome浏览器访问本网站!
  • 如果您觉得本站非常有看点,那么赶紧使用Ctrl+D 收藏搞代码吧

Python使用gensim计算文档相似性

python 搞代码 4年前 (2022-01-09) 17次浏览 已收录 0个评论

pre_file.py

#-*-coding:utf-8-*-import MySQLdbimport MySQLdb as mdbimport os,sys,stringimport jiebaimport codecsreload(sys)sys.setdefaultencoding('utf-8')#连接数据库try:  conn=mdb.connect(host='127.0.0.1',user='root',passwd='kongjunli',db='test1',charset='utf8')except Exception,e:  print e  sys.exit()#获取cursor对象操作数据库cursor=conn.cursor(mdb.cursors.DictCursor) #cursor游标#获取内容sql='SELECT link,content FROM test1.spider;'cursor.execute(sql)   #execute()方法,将字符串当命令执行data=cursor.fetchall()#fetchall()接收全部返回结果行f=codecs.open('C:\Users\kk\Desktop\hello-result1.txt','w','utf-8') for row in data:    #row接收结果行的每行数据  seg='/'.join(list(jieba.cut(row['content'],cut_all='False')))  f.write(row['link']+' '+seg+'\r\n')f.close() cursor.close()      #提交事务,在插入数据时必须

jiansuo.py

#-*-coding:utf-8-*-import sysimport stringimport MySQLdbimport MySQLdb as mdbimport gensimfrom gensim import corpora,models,similaritiesfrom gensim.similarities import MatrixSimilarityimport loggingimport codecsreload(sys)sys.setdefaultencoding('utf-8') con=mdb.connect(host='127.0.0.1',user='root',passwd='kongjunli',db='test1',charset='utf8')with con:  cur=con.cursor()  cur.execute('SELECT * FROM cutresult_copy')  rows=cur.fetchall()  class MyCorpus(object):    def __iter__(self):      for row in rows:        yield str(row[1]).split('/')#开启日志logging.basicConfig(format='%(asctime)s:%(levelname)s:%(message)s',level=logging.INFO)Corp=MyCorpus()#将网页文档转化为tf-idfdictionary=corpora.Dictionary(Corp)corpus=[dictionary.doc2bow(text) for text in Corp] #将文档转化为词袋模型#print corpustfidf=models.TfidfModel(corpus)#使用tf-idf模型得出文档的tf-idf模型corpus_tfidf=tfidf[<b>本文来源gao@dai!ma.com搞$代^码!网7</b>corpus]#计算得出tf-idf值#for doc in corpus_tfidf:  #print doc###'''q_file=open('C:\Users\kk\Desktop\q.txt','r')query=q_file.readline()q_file.close()vec_bow=dictionary.doc2bow(query.split(' '))#将请求转化为词带模型vec_tfidf=tfidf[vec_bow]#计算出请求的tf-idf值#for t in vec_tfidf: # print t'''###query=raw_input('Enter your query:')vec_bow=dictionary.doc2bow(query.split())vec_tfidf=tfidf[vec_bow]index=similarities.MatrixSimilarity(corpus_tfidf)sims=index[vec_tfidf]similarity=list(sims)print sorted(similarity,reverse=True)

encodings.xml

    

misc.xml

                   

modules.xml

         

搞代码网(gaodaima.com)提供的所有资源部分来自互联网,如果有侵犯您的版权或其他权益,请说明详细缘由并提供版权或权益证明然后发送到邮箱[email protected],我们会在看到邮件的第一时间内为您处理,或直接联系QQ:872152909。本网站采用BY-NC-SA协议进行授权
转载请注明原文链接:Python使用gensim计算文档相似性
喜欢 (0)
[搞代码]
分享 (0)
发表我的评论
取消评论

表情 贴图 加粗 删除线 居中 斜体 签到

Hi,您需要填写昵称和邮箱!

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址