• 欢迎访问搞代码网站,推荐使用最新版火狐浏览器和Chrome浏览器访问本网站!
  • 如果您觉得本站非常有看点,那么赶紧使用Ctrl+D 收藏搞代码吧

PHP中文分词 自动获取关键词介绍_php实例

php 搞代码 3年前 (2022-01-25) 53次浏览 已收录 0个评论
 <BR><?php <BR>header("Content-Type:text/html; charset=utf-8"); <BR>define('APP_ROOT', str_replace('\\', '/', dirname(__FILE__))); <BR>$test = '这里是一段中文测试代码!'; <BR>function get_tags_arr($title) <BR>{ <BR>require(APP_ROOT.'/pscws4.class.php'); <BR>$pscws = new PSCWS4(); <BR>$pscws->set_dict(APP_ROOT.'/scws/dict.utf8.xdb'); <BR>$pscws->set_rule(APP_ROOT.'/scws/rules.utf8.ini'); <BR>$pscws->set_ignore(true); <BR>$pscws->send_text($title); <BR>$words = $pscws->get_tops(5); <BR>$tags = array(); <BR>foreach ($words as $val) { <BR>$tags[] = $val['word']; <BR>} <BR>$pscws->close(); <BR>return $tags; <BR>} <BR>print_r(get_tags_arr($test)); <BR>//============================================================ <BR>function get_keywords_str($content){ <BR>require(APP_ROOT.'/phpanalysis.class.php'); <BR>PhpAnalysis::$loadInit = false; <BR>$pa = new PhpAnalysis('utf-8', 'utf-8', false); <BR>$pa->LoadDict(); <BR>$pa->SetSource($content); <BR>$pa->StartAnalysis( false ); <BR>$tags = $pa->GetFinallyResult(); <BR>return $tags; <BR>} <BR>print(get_keywords_str($test)); <BR>


相关下载地址

SCWS – 简易中文分词系统

SCWS 在概念上并无创新成分,采用的是自行采集的词频词典,并辅以一定程度上的专有名称、人名、地名、数字年代等规则集,经小范围测试大概准确率在 90% ~ 95% 之间,已能基本满足一些中小型搜索引擎、关键字提取等场合运用。 SCWS 采用纯 C 代码开发,以 Unix-Like OS 为主要平台环境,提/本文来源gao@!dai!ma.com搞$$代^@码5网@搞代gaodaima码供共享函数库,方便植入各种现有软件系统。此外它支持 GBK,UTF-8,BIG5 等汉字编码,切词效率高。

系统平台:Windows/Unix
开发语言:C
使用方式:PHP扩展

演示网址:http://www.ftphp.com/scws/demo.php
开源官网:http://www.ftphp.com/scws/

晴枫附注:作为PHP扩展,容易与现有的基于PHP架构的Web系统继续集成,是其一大优势。

PhpanAlysis – PHP无组件分词系统

PhpanAlysis分词系统是基于字符串匹配的分词方法 ,这种方法又叫做机械分词方法,它是按照一定的策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。按照扫描方向的不同,串匹配分词方法可以分为正向匹配 和逆向匹配;按照不同长度优先匹配的情况,可以分为最大(最长)匹配和最小(最短)匹配;按照是否与词性标注过程相结合,又可以分为单纯分词方法和分词与标注相结合的一体化方法。

系统平台:PHP环境

开发语言:PHP

使用方式:HTTP服务

演示网址:http://www.itgrass.com/phpanalysis/
开源官网:http://www.itgrass.com/phpanalysis/

晴枫附注:实现简单,容易使用,能做一些简单应用,但大数据量的计算效率不如前几种。

试用了几个系统,基本分词功能都没什么问题,只是在个别一些词的划分上存在一些差异;对于词性的确定,系统间有所不同。

http://www.php.net/codes/40139.html


搞代码网(gaodaima.com)提供的所有资源部分来自互联网,如果有侵犯您的版权或其他权益,请说明详细缘由并提供版权或权益证明然后发送到邮箱[email protected],我们会在看到邮件的第一时间内为您处理,或直接联系QQ:872152909。本网站采用BY-NC-SA协议进行授权
转载请注明原文链接:PHP中文分词 自动获取关键词介绍_php实例
喜欢 (0)
[搞代码]
分享 (0)
发表我的评论
取消评论

表情 贴图 加粗 删除线 居中 斜体 签到

Hi,您需要填写昵称和邮箱!

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址