亚洲免费在线-亚洲免费在线播放-亚洲免费在线观看-亚洲免费在线观看视频-亚洲免费在线看-亚洲免费在线视频

PHPAnalysis中文分詞類實用教程

系統(tǒng) 2648 0

PHPAnalysis是目前廣泛使用的中文分詞類,使用反向匹配模式分詞,因此兼容編碼更廣泛,現(xiàn)將其變量與常用函數(shù)詳解如下:

一、比較重要的成員變量
$resultType = 1 生成的分詞結(jié)果數(shù)據(jù)類型(1 為全部, 2為 詞典詞匯及單個中日韓簡繁字符及英文, 3 為詞典詞匯及英文)
這個變量一般用 SetResultType( $rstype ) 這方法進行設(shè)置。
$notSplitLen = 5 切分句子最短長度
$toLower = false 把英文單詞全部轉(zhuǎn)小寫
$differMax = false 使用最大切分模式對二元詞進行消岐
$unitWord = true 嘗試合并單字(即是新詞識別)
$differFreq = false 使用熱門詞優(yōu)先模式進行消岐
二、主要成員函數(shù)列表
1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函數(shù)說明:構(gòu)造函數(shù)
參數(shù)列表:(www.jbxue.com)
$source_charset 源字符串編碼
$target_charset 目錄字符串編碼
$load_all 是否完全加載詞典(此參數(shù)已經(jīng)作廢)
$source 源字符串
如果輸入輸出都是utf-8,實際上可以不必使用任何參數(shù)進行初始化,而是通過 SetSource 方法設(shè)置要操作的文本
2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函數(shù)說明:設(shè)置源字符串
參數(shù)列表:
$source 源字符串
$source_charset 源字符串編碼
$target_charset 目錄字符串編碼
返回值:bool
3、public function StartAnalysis($optimize=true)
函數(shù)說明:開始執(zhí)行分詞操作
參數(shù)列表:
$optimize 分詞后是否嘗試優(yōu)化結(jié)果
返回值:void
一個基本的分詞過程:
//////////////////////////////////////
$pa = new PhpAnalysis();
$pa->SetSource('需要進行分詞的字符串');
//設(shè)置分詞屬性
$pa->resultType = 2;
$pa->differMax = true;
$pa->StartAnalysis();
//獲取你想要的結(jié)果
$pa->GetFinallyIndex();
////////////////////////////////////////
4、public function SetResultType( $rstype )
函數(shù)說明:設(shè)置返回結(jié)果的類型
實際是對成員變量$resultType的操作
參數(shù) $rstype 值為:
1 為全部, 2為 詞典詞匯及單個中日韓簡繁字符及英文, 3 為詞典詞匯及英文
返回值:void
5、public function GetFinallyKeywords( $num = 10 )
函數(shù)說明:獲取出現(xiàn)頻率最高的指定詞條數(shù)(通常用于提取文檔關(guān)鍵字)
參數(shù)列表:
$num = 10 返回詞條個數(shù)
返回值:用","分隔的關(guān)鍵字列表
6、public function GetFinallyResult($spword=' ')
函數(shù)說明:獲得最終分詞結(jié)果
參數(shù)列表:
$spword 詞條之間的分隔符
返回值:string
7、public function GetSimpleResult()
函數(shù)說明:獲得粗分結(jié)果
返回值:array

(腳本學堂 ?www.jbxue.com)
8、public function GetSimpleResultAll()
函數(shù)說明:獲得包含屬性信息的粗分結(jié)果
屬性(1中文詞句、2 ANSI詞匯(包括全角),3 ANSI標點符號(包括全角),4數(shù)字(包括全角),5 中文標點或無法識別字符)
返回值:array
9、public function GetFinallyIndex()
函數(shù)說明:獲取hash索引數(shù)組
返回值:array('word'=>count,...) 按出現(xiàn)頻率排序
10、public function MakeDict( $source_file, $target_file='' )
函數(shù)說明:把文本文件詞庫編譯成詞典
參數(shù)列表:
$source_file 源文本文件
$target_file 目標文件(如果不指定,則為當前詞典)
返回值:void
11、public function ExportDict( $targetfile )
函數(shù)說明:導出當前詞典全部詞條為文本文件
參數(shù)列表:
$targetfile 目標文件
返回值:void

PHPAnalysis中文分詞類實用教程


更多文章、技術(shù)交流、商務(wù)合作、聯(lián)系博主

微信掃碼或搜索:z360901061

微信掃一掃加我為好友

QQ號聯(lián)系: 360901061

您的支持是博主寫作最大的動力,如果您喜歡我的文章,感覺我的文章對您有幫助,請用微信掃描下面二維碼支持博主2元、5元、10元、20元等您想捐的金額吧,狠狠點擊下面給點支持吧,站長非常感激您!手機微信長按不能支付解決辦法:請將微信支付二維碼保存到相冊,切換到微信,然后點擊微信右上角掃一掃功能,選擇支付二維碼完成支付。

【本文對您有幫助就好】

您的支持是博主寫作最大的動力,如果您喜歡我的文章,感覺我的文章對您有幫助,請用微信掃描上面二維碼支持博主2元、5元、10元、自定義金額等您想捐的金額吧,站長會非常 感謝您的哦!!!

發(fā)表我的評論
最新評論 總共0條評論
主站蜘蛛池模板: 国产精品欧美亚洲区 | 国产成人综合91香蕉 | 奇米777第四 | 久久久久欧美精品观看 | 人成午夜欧美大片免费视频 | 日日碰狠狠添天天爽对白 | 国产日| 欧美最猛性xxxxx短视频 | 欧美高清无砖专区欧美精品 | 中国欧美一级毛片免费 | 看全色黄大色黄大片爽一下 | 国产精品深爱在线 | 久青草中文字幕精品视频 | 色婷婷精品视频 | 天天做天天爱夜夜大爽完整 | 久久国产精品999 | 四虎影视永久在线精品免费播放 | 四虎色| 99热久久国产精品这里 | 亚洲高清网站 | 99久久中文字幕 | 久久艹在线观看 | 伊人久久青草青青综合 | 久久九九久精品国产 | 九一国产| 色姑娘色综合 | 国产一级视频播放 | 亚洲精品成人a在线观看 | 四虎影院永久在线观看 | 久久国内精品视频 | 深插视频| 99国产福利 | 偷偷狠狠的日日2020 | 免费观看四虎精品国产永久 | 天天爱天天做久久天天狠狼 | 精品国产精品国产偷麻豆 | 一区二区三区免费视频网站 | 久久91精品久久久久久水蜜桃 | 一线视频日本 | 亚洲欧美中文字幕在线网站 | 美女国产精品 |