首頁 後端開發 php教程 基於RMM的簡易中文分詞

基於RMM的簡易中文分詞

Jul 25, 2016 am 08:49 AM

本程式為基於​​RMM中文分詞思想,編寫的簡易中文分詞,程式中還存在不少漏洞,望大神指點....優化了下亂碼問題
  1. /**
  2. * 基於RMM中文分詞(逆向配對法)
  3. * @author tangpan
  4. * @date 2013-10-12
  5. * @version 1.0.0
  6. **/
  7. class SplitWord {
  8. //public $Tag_dic = array(); //儲存字典分詞
  9. public $Rec_dic = array(); //儲存重組的分詞
  10. public $Split_char = ' '; //分隔符號
  11. public $Source_str = ''; //儲存來源字串
  12. public $Result_str = ''; //儲存分詞結果字串
  13. public $limit_lenght = 2;
  14. public $Dic_maxLen = 28; //字典中詞的最大長度
  15. public $Dic_minLen = 2; //字典中詞的最大長度
  16. public $Dic_minLen = 2; // / /字典中詞的最小長度
  17. public function SplitWord() { //初始化對象,並自動執行成員方法
  18. $this->__construct();
  19. }
  20. public function __construct () {
  21. $dic_path = dirname(__FILE__).'/words.csv'; //預先載入字典以提高分詞速度
  22. $fp = fopen( $dic_path, 'r' ); //讀取詞庫中的字
  23. while( $line = fgets( $fp, 256 ) ) {
  24. $ws = explode(' ', $line); //將字庫中的字分割
  25. $ws[0] = trim(iconv('utf-8','GBK',$ws[0])); //編碼轉換
  26. //$this->Tag_dic[$ws[0]] = true; //以字為索引,序號為值
  27. $this->Rec_dic[strlen($ws[0])][$ws[0]] = true; //以字長度和字分別為二維數組的索引,以n為值,來重組詞庫
  28. }
  29. fclose($fp); //關閉詞庫
  30. }
  31. /**
  32. * 設定來源字串
  33. * @param 要分詞的字串
  34. * /
  35. public function SetSourceStr( $str ) {
  36. $str = iconv( 'utf-8', 'GBK', $str ); // 將utf-8編碼字元轉換為GBK編碼
  37. $ this->Source_str = $this->DealStr( $str ); //初步處理字串
  38. }
  39. /**
  40. * 檢查字串
  41. * @param $str 來源字串
  42. * @return bool
  43. */
  44. public function checkStr( $str ) {
  45. if ( trim($str) == '' ) return; //若字串為空,直接回傳
  46. if ( ord( $str[0] ) > 0x80 ) return true; //是中文字元則回傳true
  47. else return false; //不是中文字元則回傳false
  48. }
  49. /**
  50. * RMM分詞演算法
  51. * @param $str 待處理字串
  52. */
  53. public function SplitRMM( $str = '' ) {
  54. if ( trim( $str ) == '' ) return; //若字串為空,則直接回傳
  55. else $this->SetSourceStr( $str ); //字串不為空時,設定來源字串
  56. if ( $this->Source_str == ' ' ) return; //當來源字串為空時,直接回傳
  57. $split_words = explode( ' ', $ this->Source_str ); //以空格來切分字串
  58. $lenght = count( $split_words ); //計算陣列長度
  59. for ( $i = $lenght - 1; $i >= 0 ; $i-- ) {
  60. if ( trim( $split_words[$i] ) == ' ' ) continue; //如果字元為空時,跳過後面的程式碼,直接進入下一次循環
  61. if ( $this->checkStr( $split_words[$i] ) ) { //檢查字串,如果是中文字元
  62. if ( strlen( $split_words[$i] ) >= $this->limit_lenght ) { //字串長度大於限制大小時
  63. //對字串進行逆向比對
  64. $this->Result_str = $this->pregRmmSplit( $split_words[$i] ).$this->Split_char.$ this->Result_str;
  65. }
  66. } else {
  67. $this->Result_str = $split_words[$i].$this->Split_char.$this->Result_str;
  68. }
  69. }
  70. $this->clear( $split_words ); //釋放記憶體
  71. return iconv('GBK', 'utf-8', $this->Result_str);
  72. }
  73. /**
  74. * 對中文字串進行逆向匹配方式分解
  75. * @param $str 字串
  76. * @return $retStr 分詞完成的字串
  77. */
  78. public function pregRmmSplit( $str ) {
  79. if ( $str == ' ' ) return;
  80. $splen = strlen( $str );
  81. $
  82. $splen = strlen( $str );
  83. $
  84. $splen = strlen( $str );
  85. $ $splen = strlen( $str ); $ $splen = strlen( $str ); $ Split_Result = array(); for ( $j = $splen - 1; $j >= 0; $j--) { //逆向匹配字元 if ( $splen Dic_minLen ) { //當字元長度大於字典中最小字元長度時 if ( $j == 1 ) { //當長度為1 時 $Split_Result[] = substr( $str, 0, 2 ) ; }else {
  86. $w = trim( substr( $str, 0, $this->Dic_minLen 1 ) ); //截取前四個字元
  87. if ( $this->IsWord( $w ) ) { / /判斷字典中是否存在該字元
  88. $Split_Result[] = $w; //存在,則寫入陣列儲存
  89. } else {
  90. $Split_Result[] = substr( $str, 2, 2 ); //逆向儲存
  91. $Split_Result[] = substr( $str, 0, 2 );
  92. }
  93. }
  94. $j = -1; //關閉迴圈;
  95. break ;
  96. }
  97. if ( $j >= $this->Dic_maxLen ) $max_len = $this->Dic_maxLen; //當字元長度大於字典最大詞的長度時,賦值最大限制長度
  98. else $max_len = $j;
  99. for ( $k = $max_len; $k >= 0; $k = $k - 2 ) { //一次跳動為一個中文字元
  100. $w = trim( substr( $str, $j - $k, $k 1 ) );
  101. if ( $this->IsWord( $w ) ) {
  102. $Split_Result[] = $w; //存該字
  103. $j = $j - $k - 1; //位置移動到已匹配的字符的位置
  104. break; //分詞成功即跳出當前循環,進入下一循環
  105. }
  106. }
  107. }
  108. $retStr = $this->resetWord( $Split_Result ); //重組字串,並回傳處理好的字串
  109. $this->clear( $Split_Result ); //釋放記憶體
  110. return $retStr;
  111. }
  112. /**
  113. * 重新辨識並組合分詞
  114. * @param $Split_Result 重組目標字串
  115. * @return $ret_Str 重組字串
  116. */
  117. public function resetWord( $Split_Result ) {
  118. if ( trim( $Split_Result==[0] ) == ' ' ) return;
  119. $Len = count( $Split_Result ) - 1;
  120. $ret_Str = '';
  121. $spc = $this->Split_char;
  122. for ( $i = $Len; $i >= 0; $i-- ) {
  123. if ( trim( $Split_Result[$i] ) != '' ) {
  124. $Split_Result[$i] = iconv( 'GBK', 'utf -8', $Split_Result[$i] );
  125. $ret_Str .= $spc.$Split_Result[$i].' ';
  126. }
  127. }
  128. //$ret_Str = preg_replace( '/^'.$spc.'/','、',$ret_Str);
  129. $ret_Str = iconv('utf-8','GBK',$ret_Str);
  130. return $ret_Str;
  131. }
  132. /**
  133. * 檢查字典中是否存在某個字
  134. * @param $okWord 檢查的字
  135. * @return bool;
  136. */
  137. public function IsWord( $okWord ) {
  138. $len = strlen( $okWord );
  139. if ( $len > $this ->Dic_maxLen 1 ) return false;
  140. else { //根據二維數組索引匹配,是否存在該詞
  141. return isset($this->Rec_dic[$len][$okWord]);
  142. }
  143. }
  144. /**
  145. * 初步處理字串(以空格來替換特殊字元)
  146. * @param $str 要處理的來源字串
  147. * @return $okStr 傳回預處理好的字串
  148. */
  149. public function DealStr( $str ) {
  150. $spc = $this->Split_char; //拷貝分隔符
  151. $slen = strlen( $str ); //計算字元的長度
  152. if ( $slen == 0 ) return; //如果字元長度為0,直接回傳
  153. $okstr = ''; //初始化變數
  154. $prechar = 0; //字元判斷變數(0-空白,1-英文,2-中文,3-符號)
  155. for ( $i = 0; $i $str_ord = ord( $str[$i] );
  156. if ( $str_ord if ( $str_ord if ( $str[$i] != 'r' && $str[$i] != 'n' )
  157. $okstr .= $spc;
  158. $prechar = 0 ;
  159. continue;
  160. } else if ( ereg('[@.%#:^&_-]',$str[$i]) ) { //如果關鍵字的字元是數字或英文或特殊字元
  161. if ( $prechar == 0 ) { //當字元為空白符時
  162. $okstr .= $str[$i];
  163. $prechar = 3;
  164. } else {
  165. $okstr .= $spc.$str[$i]; //字元不為空格符時,在字元前串上空白符
  166. $prechar = 3;
  167. }
  168. } else if ( ereg('[0-9a-zA-Z]', $str[$i]) ) { //分割英文數字組合
  169. if ( (ereg('[0-9]',$str[$ i-1]) && ereg('[a-zA-Z]',$str[$i]))
  170. || (ereg('[a-zA-Z]',$str[$i- 1]) && ereg('[0-9]',$str[$i])) ) {
  171. $okstr .= $spc.$str[$i];
  172. } else {
  173. $okstr .= $str[$i];
  174. }
  175. }
  176. }else { //如果關鍵字的第二個字元是漢字
  177. if ( $prechar != 0 && $prechar != 2 ) //如果上一個字元為非中文和非空格,則加一個空格
  178. $okstr .= $spc;
  179. if ( isset( $str[$i 1] ) ) { //如果是中文字元
  180. $c = $str[$i].$str[$i 1 ]; //將兩個字串在一起,構成一個中文字
  181. $n = hexdec( bin2hex( $c ) ); //將ascii碼轉換成16進制,再轉換為10進位
  182. if ( $n > 0xA13F && $n if ( $prechar != 0 ) $okstr .= $spc; //將中文標點替換為空
  183. //else $okstr .= $spc; //若前一個字元為空,則直接串上
  184. $prechar = 3;
  185. } else { //若不是中文標點
  186. $okstr .= $c;
  187. $prechar = 2;
  188. }
  189. $i ; // $i 再加1 ,即使一次移動為一個中文字元
  190. }
  191. }
  192. }
  193. return $okstr;
  194. }
  195. /**
  196. * 釋放記憶體
  197. * @param $data 暫存資料
  198. */
  199. public function clear( $data ) {
  200. unset( $data ); //刪除暫存資料
  201. }
  202. }
  203. ?>
複製程式碼
基於RMM的簡易中文分詞


本網站聲明
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn

熱AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

Undress AI Tool

免費脫衣圖片

Clothoff.io

Clothoff.io

AI脫衣器

Video Face Swap

Video Face Swap

使用我們完全免費的人工智慧換臉工具,輕鬆在任何影片中換臉!

熱工具

記事本++7.3.1

記事本++7.3.1

好用且免費的程式碼編輯器

SublimeText3漢化版

SublimeText3漢化版

中文版,非常好用

禪工作室 13.0.1

禪工作室 13.0.1

強大的PHP整合開發環境

Dreamweaver CS6

Dreamweaver CS6

視覺化網頁開發工具

SublimeText3 Mac版

SublimeText3 Mac版

神級程式碼編輯軟體(SublimeText3)

在PHP API中說明JSON Web令牌(JWT)及其用例。 在PHP API中說明JSON Web令牌(JWT)及其用例。 Apr 05, 2025 am 12:04 AM

JWT是一種基於JSON的開放標準,用於在各方之間安全地傳輸信息,主要用於身份驗證和信息交換。 1.JWT由Header、Payload和Signature三部分組成。 2.JWT的工作原理包括生成JWT、驗證JWT和解析Payload三個步驟。 3.在PHP中使用JWT進行身份驗證時,可以生成和驗證JWT,並在高級用法中包含用戶角色和權限信息。 4.常見錯誤包括簽名驗證失敗、令牌過期和Payload過大,調試技巧包括使用調試工具和日誌記錄。 5.性能優化和最佳實踐包括使用合適的簽名算法、合理設置有效期、

會話如何劫持工作,如何在PHP中減輕它? 會話如何劫持工作,如何在PHP中減輕它? Apr 06, 2025 am 12:02 AM

會話劫持可以通過以下步驟實現:1.獲取會話ID,2.使用會話ID,3.保持會話活躍。在PHP中防範會話劫持的方法包括:1.使用session_regenerate_id()函數重新生成會話ID,2.通過數據庫存儲會話數據,3.確保所有會話數據通過HTTPS傳輸。

PHP 8.1中的枚舉(枚舉)是什麼? PHP 8.1中的枚舉(枚舉)是什麼? Apr 03, 2025 am 12:05 AM

PHP8.1中的枚舉功能通過定義命名常量增強了代碼的清晰度和類型安全性。 1)枚舉可以是整數、字符串或對象,提高了代碼可讀性和類型安全性。 2)枚舉基於類,支持面向對象特性,如遍歷和反射。 3)枚舉可用於比較和賦值,確保類型安全。 4)枚舉支持添加方法,實現複雜邏輯。 5)嚴格類型檢查和錯誤處理可避免常見錯誤。 6)枚舉減少魔法值,提升可維護性,但需注意性能優化。

描述紮實的原則及其如何應用於PHP的開發。 描述紮實的原則及其如何應用於PHP的開發。 Apr 03, 2025 am 12:04 AM

SOLID原則在PHP開發中的應用包括:1.單一職責原則(SRP):每個類只負責一個功能。 2.開閉原則(OCP):通過擴展而非修改實現變化。 3.里氏替換原則(LSP):子類可替換基類而不影響程序正確性。 4.接口隔離原則(ISP):使用細粒度接口避免依賴不使用的方法。 5.依賴倒置原則(DIP):高低層次模塊都依賴於抽象,通過依賴注入實現。

在PHPStorm中如何進行CLI模式的調試? 在PHPStorm中如何進行CLI模式的調試? Apr 01, 2025 pm 02:57 PM

在PHPStorm中如何進行CLI模式的調試?在使用PHPStorm進行開發時,有時我們需要在命令行界面(CLI)模式下調試PHP�...

如何用PHP的cURL庫發送包含JSON數據的POST請求? 如何用PHP的cURL庫發送包含JSON數據的POST請求? Apr 01, 2025 pm 03:12 PM

使用PHP的cURL庫發送JSON數據在PHP開發中,經常需要與外部API進行交互,其中一種常見的方式是使用cURL庫發送POST�...

解釋PHP中的晚期靜態綁定(靜態::)。 解釋PHP中的晚期靜態綁定(靜態::)。 Apr 03, 2025 am 12:04 AM

靜態綁定(static::)在PHP中實現晚期靜態綁定(LSB),允許在靜態上下文中引用調用類而非定義類。 1)解析過程在運行時進行,2)在繼承關係中向上查找調用類,3)可能帶來性能開銷。

See all articles