加入收藏 | 设为首页 | 会员中心 | 我要投稿 源码网 (https://www.900php.com/)- 科技、建站、经验、云计算、5G、大数据,站长网!
当前位置: 首页 > 站长学院 > PHP教程 > 正文

SCWS 中文分词 php安装使用例子

发布时间:2022-02-24 13:29:53 所属栏目:PHP教程 来源:互联网
导读:今天发现一个很好用的中文分词工具,分享一下 CWS 是 Simple Chinese Word Segmentation 的首字母缩写(即:简易中文分词系统)。 分词算法上并无太多创新成分,采用的是自己采集的词频词典,并辅以一定的专有名称,人名,地名, 数字年代等规则识别来达到
  今天发现一个很好用的中文分词工具,分享一下
 
  CWS 是 Simple Chinese Word Segmentation 的首字母缩写(即:简易中文分词系统)。

  分词算法上并无太多创新成分,采用的是自己采集的词频词典,并辅以一定的专有名称,人名,地名, 数字年代等规则识别来达到基本分词,经小范围测试准确率在 90% ~ 95% 之间, 基本上能满足一些小型搜索引擎、关键字提取等场合运用。首次雏形版本发布于 2005 年底。
 
  二、scws安装
 
  # wget -c http://www.xunsearch.com/scws/down/scws-1.2.1.tar.bz2
  # tar jxvf scws-1.2.1.tar.bz2
  # cd scws-1.2.1
  # ./configure --prefix=/usr/local/scws
  # make && make install
  三、scws的PHP扩展安装
 
  # cd ./phpext
  # phpize  
  # ./configure --with-php-config=/usr/local/php5410/bin/php-config
  # make && make install
  # echo "[scws]" >> /usr/local/php5410/etc/php.ini  
  # echo "extension = scws.so" >> /usr/local/php5410/etc/php.ini
  # echo "scws.default.charset = utf-8" >> /usr/local/php5410/etc/php.ini
  # echo "scws.default.fpath = /usr/local/scws/etc/" >> /usr/local/php5410/etc/php.ini
  四、词库安装
 
  # wget http://www.xunsearch.com/scws/down/scws-dict-chs-utf8.tar.bz2
  # tar jxvf scws-dict-chs-utf8.tar.bz2 -C /usr/local/scws/etc/
  # chown www:www /usr/local/scws/etc/dict.utf8.xdb
  例子:
 
  header("Content-Type:text/html; charset=utf-8");
  define('APP_ROOT', str_replace('//', '/', dirname(__FILE__)));
  $test = '真怕有一天我们再次成为交叉线,我想那时就再也不可能回归了,快乐永远是拿痛苦做代价,你现在多幸福,多快乐,你以后就会越伤心越难过,不想发生!';
           return $tags;
   }
  print_r(get_tags_arr($test));
   function get_keywords_str($content){
      require(APP_ROOT.'/phpanalysis.class.php');
      PhpAnalysis::$loadInit = false;
      $pa = new PhpAnalysis('utf-8', 'utf-8', false);
      $pa->LoadDict();
      $pa->SetSource($content);
      $pa->StartAnalysis( false );
      $tags = $pa->GetFinallyResult();
      return $tags;
   }
   print(get_keywords_str($test));
 

(编辑:源码网)

【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容!

    热点阅读