백엔드 개발 PHP 튜토리얼 RMM을 기반으로 한 간단한 중국어 단어 분할

RMM을 기반으로 한 간단한 중국어 단어 분할

Jul 25, 2016 am 08:49 AM

이 프로그램은 RMM 중국어 단어 분할 아이디어를 기반으로 한 간단한 중국어 단어 분할입니다. 프로그램에는 아직 허점이 많이 있습니다.
  1. /**
  2. * RMM 중국어 단어 분할 기준(역매칭 방식)
  3. * @author tangpan
  4. * @date 2013-10-12
  5. * @version 1.0.0
  6. **/
  7. class SplitWord {
  8. //public $Tag_dic = array() //스토리지 사전 단어 분할
  9. public $Rec_dic = array(); //저장소 단어 분할
  10. public $Split_char = ' '; //Separator
  11. public $Source_str = ''; public $Result_str = ''; //저장 단어 분할 결과 문자열
  12. public $limit_lenght = 2;
  13. public $Dic_maxLen = 28; //사전의 최대 단어 길이
  14. public $Dic_minLen = 2 ; //사전의 최소 단어 길이
  15. public function SplitWord() { //객체를 초기화하고 멤버 메서드를 자동으로 실행
  16. $this->__construct();
  17. }
  18. public function __construct() {
  19. $dic_path = dirname(__FILE__).'/words.csv'; //단어 분할 속도를 향상시키기 위해 사전을 미리 로드합니다
  20. $fp = fopen( $dic_path, 'r' ) ; / /어휘의 단어 읽기
  21. while( $line = fgets( $fp, 256 ) ) {
  22. $ws =explore(' ', $line) // 어휘의 단어 분할
  23. $ws[0] = Trim(iconv('utf-8','GBK',$ws[0])) //인코딩 변환
  24. //$this->Tag_dic[$ws[ 0 ]] = true; //워드를 인덱스로, 일련번호를 값으로 사용
  25. $this->Rec_dic[strlen($ws[0])][$ws[0]] = true; 단어는 각각 2차원 배열의 인덱스이며 n을 값으로 사용하여 어휘를 재구성합니다.
  26. }
  27. fclose($fp) // 어휘 닫기
  28. }
  29. /**
  30. * 소스 문자열 설정
  31. * @param 분할할 문자열
  32. */
  33. public function SetSourceStr( $str ) {
  34. $str = iconv( 'utf-8', 'GBK', $str ) // utf-8로 인코딩된 문자를 다음으로 변환합니다. GBK 인코딩
  35. $this->Source_str = $this->DealStr( $str ) //문자열 사전 처리
  36. }
  37. /**
  38. * 문자열 검사
  39. * @param $str 소스 문자열
  40. * @return bool
  41. */
  42. public function checkStr( $str ) {
  43. if ( Trim($str) == '' ) return; //문자열이 비어 있으면 직접 반환
  44. if ( ord( $str[0] ) > 0x80 ) return true; //한자이면 true를 반환
  45. else return false; //한자가 아니면 false를 반환
  46. }
  47. /* *
  48. * RMM 단어 분할 알고리즘
  49. * 처리할 @param $str 문자열
  50. */
  51. public function SplitRMM( $str = '' ) {
  52. if ( Trim( $str ) == '' ) return; //문자열이 비어 있으면 직접 반환
  53. else $this->SetSourceStr( $str ); //문자열이 비어 있지 않으면 소스 문자열을 설정합니다.
  54. if ( $this->Source_str == ' ' ) return; 비어 있으면 직접 반환
  55. $split_words =explore( ' ', $this->Source_str ); //문자열을 공백으로 분할합니다
  56. $lenght = count( $split_words ) //배열의 길이를 계산합니다.
  57. for ( $i = $lenght - 1; $i >= 0; $i-- ) {
  58. if ( Trim( $split_words[$i] ) == ' ' ) continue; 문자가 비어 있으면 다음 코드를 건너뛰고 다음 루프로 직접 입력
  59. if ( $this->checkStr( $split_words[$i] ) ) { //한자인지 문자열을 확인하세요
  60. if ( strlen( $split_words[$ i] ) >= $this->limit_lenght ) { //문자열 길이가 제한 크기보다 큰 경우
  61. //문자열 역일치
  62. $this- >Result_str = $this->pregRmmSplit ( $split_words[$i] ).$this->Split_char.$this->Result_str;
  63. }
  64. } else {
  65. $this-> ;Result_str = $split_words[$i].$this->Split_char.$this->Result_str;
  66. }
  67. }
  68. $this->clear( $split_words );
  69. return iconv('GBK', 'utf-8', $this->Result_str);
  70. }
  71. /**
  72. * 역방향 매칭 방식으로 중국어 문자열 분해
  73. * @param $str string
  74. * @return $retStr 단어 분할로 분할된 문자열
  75. */
  76. 공용 함수 pregRmmSplit( $ str ) {
  77. if ( $str == ' ' ) return;
  78. $splen = strlen( $str );
  79. $Split_Result = array();
  80. for ( $j = $splen - 1; $j >= 0; $ j--) { //역방향 일치 문자
  81. if ( $splen <= $this->Dic_minLen ) { //문자 길이가 최소 문자보다 큰 경우 사전의 길이
  82. if ( $j == 1 ) { //길이가 1인 경우
  83. $Split_Result[] = substr( $str, 0, 2 );
  84. }else {
  85. $w = Trim( substr( $str, 0, $this->Dic_minLen 1 ) ) //처음 4자를 자릅니다.
  86. if ( $this->IsWord( $w ) ) { //해당 문자가 사전에 존재하는지 확인
  87. $Split_Result[] = $w; //존재하는 경우 배열 저장소에 씁니다.
  88. } else {
  89. $Split_Result[] = substr( $ str, 2 , 2 ); //역저장
  90. $Split_Result[] = substr( $str, 0, 2 );
  91. }
  92. }
  93. $j = -1; loop;
  94. break;
  95. }
  96. if ( $j >= $this->Dic_maxLen ) $max_len = $this->Dic_maxLen; 사전의 최대 단어, 최대 제한 길이 할당
  97. else $max_len = $j;
  98. for ( $k = $max_len; $k >= 0; $k = $k - 2 ) { / /한 점프는 한자 한자
  99. $ w = Trim( substr( $str, $j - $k, $k 1 ) );
  100. if ( $this->IsWord( $w ) ) {
  101. $Split_Result[] = $w; / /단어 저장
  102. $j = $j - $k - 1 //일치하는 문자의 위치로 이동
  103. break; 단어 분할이 성공하면 현재 루프에서 빠져나와 다음 루프로 들어갑니다
  104. }
  105. }
  106. }
  107. $retStr = $this->resetWord( $Split_Result ) //문자열 재구성 처리된 문자열을 반환합니다
  108. $this->clear( $ Split_Result ); //메모리 해제
  109. return $retStr;
  110. }
  111. /**
  112. * 단어 세그먼트 재식별 및 결합
  113. * @param $Split_Result 대상 문자열 재구성
  114. * @return $ret_Str 문자열 재구성
  115. */
  116. 공개 함수 ResetWord( $Split_Result ) {
  117. if ( Trim( $Split_Result[0] ) == '' ) return;
  118. $Len = count( $Split_Result ) - 1;
  119. $ret_Str = ' ';
  120. $spc = $this->Split_char;
  121. for ( $i = $Len; $i >= 0; $i-- ) {
  122. if ( 트림( $Split_Result[$ i] ) != '' ) {
  123. $Split_Result[$ i] = iconv( 'GBK', 'utf-8', $Split_Result[$i] );
  124. $ret_Str .= $spc.$ Split_Result[$i].';
  125. }
  126. }
  127. //$ret_Str = preg_replace('/^'.$spc.'/',',',$ret_Str);
  128. $ret_Str = iconv('utf-8','GBK',$ ret_Str);
  129. return $ret_Str;
  130. }
  131. /**
  132. * 특정 단어가 사전에 존재하는지 확인
  133. * @param $okWord 확인된 단어
  134. * @return bool;
  135. */
  136. 공개 함수 IsWord ( $okWord ) {
  137. $len = strlen( $okWord ) ;
  138. if ( $len > $this->Dic_maxLen 1 ) return false;
  139. else { //2차원에 따르면 배열 인덱스 일치, 단어 존재 여부
  140. return isset($this-> Rec_dic[$len][$okWord]);
  141. }
  142. }
  143. /**
  144. * 예비 문자열 처리(특수문자를 공백으로 대체)
  145. * @param $str 처리할 소스 문자열
  146. * @return $okStr 전처리된 문자열을 반환
  147. */
  148. public function DealStr( $str ) {
  149. $spc = $this->Split_char; //구분자 복사
  150. $slen = strlen( $str ); of 문자
  151. if ( $slen == 0 ) return; //문자 길이가 0이면 바로 return
  152. $okstr = '' //초기화 변수
  153. $prechar = 0; 판단변수 (0-공백, 1-영어, 2-중국어, 3-기호)
  154. for ( $i = 0; $i < $slen; $i ) {
  155. $str_ord = ord( $str [$i] );
  156. if ( $str_ord < 0x81 ) { // 영문자인 경우
  157. if ( $str_ord < 33 ) { //영문 공백기호
  158. if ( $str [$i] != 'r' && $str[$i] != 'n' )
  159. $okstr .= $spc;
  160. $prechar = 0;
  161. 계속;
  162. } else if ( ereg('[@.%#:^&_-]',$str[$ i]) ) { //키워드 문자가 숫자, 영어, 특수문자인 경우
  163. if ( $prechar = = 0 ) { // 문자가 공백인 경우
  164. $okstr .= $str[$ i];
  165. $prechar = 3;
  166. } else {
  167. $okstr .= $spc .$str[$i]; //문자가 공백 문자가 아닌 경우 문자 앞에 공백 문자를 추가합니다.
  168. $prechar = 3;
  169. }
  170. } else if ( ereg(' [0-9a-zA-Z]', $str[$i]) ) { //영문 숫자 조합 분할
  171. if ( (ereg('[0-9]',$str[$i-1] ) && ereg('[a-zA-Z]',$str[$i]))
  172. || ( ereg('[a-zA-Z]',$str[$i-1]) && ereg('[0-9]',$str[$i])) ) {
  173. $okstr .= $ spc.$str[$i];
  174. } else {
  175. $okstr .= $str[$i];
  176. }
  177. }
  178. }else { //키워드의 두 번째 문자가 한자인 경우
  179. if ( $prechar != 0 && $prechar != 2 ) // 이전 문자가 한자가 아니고 공백이 아닌 경우 공백을 추가합니다.
  180. $okstr .= $spc;
  181. if ( isset( $str[$i 1] ) ) { //한자인 경우
  182. $c = $str[$i].$str [$i 1 ]; //두 문자열을 합쳐 한자를 만듭니다.
  183. $n = hexdec( bin2hex( $c ) ) //ASCII 코드를 16진수로 변환한 후 10진수로 변환합니다.
  184. if ( $n > 0xA13F && $n < 0xAA40 ) { //중국어 구두점인 경우
  185. if ( $prechar != 0 ) $okstr .= $spc //중국어 구두점을 공백으로 대체
  186. //else $okstr .= $spc; //이전 문자가 비어 있으면 직접 문자열로 지정
  187. $prechar = 3;
  188. } else { //중국어 구두점이 아닌 경우
  189. $ okstr .= $c;
  190. $prechar = 2;
  191. }
  192. $i; // $i는 한자씩 옮겨도 1씩 증가합니다
  193. }
  194. }
  195. }
  196. return $okstr;
  197. }
  198. /**
  199. * 메모리 해제
  200. * @param $data 임시 데이터
  201. */
  202. 공용 함수clear( $data ) {
  203. unset( $data ); //임시저장 데이터 삭제
  204. }
  205. }
  206. ?>
코드 복사
RMM을 기반으로 한 간단한 중국어 단어 분할


본 웹사이트의 성명
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

핫 AI 도구

Undresser.AI Undress

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

인기 기사

R.E.P.O. 에너지 결정과 그들이하는 일 (노란색 크리스탈)
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. 최고의 그래픽 설정
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. 아무도들을 수없는 경우 오디오를 수정하는 방법
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
WWE 2K25 : Myrise에서 모든 것을 잠금 해제하는 방법
4 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌

뜨거운 도구

메모장++7.3.1

메모장++7.3.1

사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전

SublimeText3 중국어 버전

중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기

스튜디오 13.0.1 보내기

강력한 PHP 통합 개발 환경

드림위버 CS6

드림위버 CS6

시각적 웹 개발 도구

SublimeText3 Mac 버전

SublimeText3 Mac 버전

신 수준의 코드 편집 소프트웨어(SublimeText3)

Laravel의 플래시 세션 데이터로 작업합니다 Laravel의 플래시 세션 데이터로 작업합니다 Mar 12, 2025 pm 05:08 PM

Laravel은 직관적 인 플래시 방법을 사용하여 임시 세션 데이터 처리를 단순화합니다. 응용 프로그램에 간단한 메시지, 경고 또는 알림을 표시하는 데 적합합니다. 데이터는 기본적으로 후속 요청에만 지속됩니다. $ 요청-

PHP의 컬 : REST API에서 PHP Curl Extension 사용 방법 PHP의 컬 : REST API에서 PHP Curl Extension 사용 방법 Mar 14, 2025 am 11:42 AM

PHP 클라이언트 URL (CURL) 확장자는 개발자를위한 강력한 도구이며 원격 서버 및 REST API와의 원활한 상호 작용을 가능하게합니다. PHP CURL은 존경받는 다중 프로모토콜 파일 전송 라이브러리 인 Libcurl을 활용하여 효율적인 execu를 용이하게합니다.

Laravel 테스트에서 단순화 된 HTTP 응답 조롱 Laravel 테스트에서 단순화 된 HTTP 응답 조롱 Mar 12, 2025 pm 05:09 PM

Laravel은 간결한 HTTP 응답 시뮬레이션 구문을 제공하여 HTTP 상호 작용 테스트를 단순화합니다. 이 접근법은 테스트 시뮬레이션을보다 직관적으로 만들면서 코드 중복성을 크게 줄입니다. 기본 구현은 다양한 응답 유형 단축키를 제공합니다. Illuminate \ support \ Facades \ http를 사용하십시오. http :: 가짜 ([ 'google.com'=> ​​'Hello World', 'github.com'=> ​​[ 'foo'=> 'bar'], 'forge.laravel.com'=>

Codecanyon에서 12 개의 최고의 PHP 채팅 스크립트 Codecanyon에서 12 개의 최고의 PHP 채팅 스크립트 Mar 13, 2025 pm 12:08 PM

고객의 가장 긴급한 문제에 실시간 인스턴트 솔루션을 제공하고 싶습니까? 라이브 채팅을 통해 고객과 실시간 대화를 나누고 문제를 즉시 해결할 수 있습니다. 그것은 당신이 당신의 관습에 더 빠른 서비스를 제공 할 수 있도록합니다.

PHP에서 늦은 정적 결합의 개념을 설명하십시오. PHP에서 늦은 정적 결합의 개념을 설명하십시오. Mar 21, 2025 pm 01:33 PM

기사는 PHP 5.3에 도입 된 PHP의 LSB (Late STATIC BING)에 대해 논의하여 정적 방법의 런타임 해상도가보다 유연한 상속을 요구할 수있게한다. LSB의 실제 응용 프로그램 및 잠재적 성능

프레임 워크 보안 기능 : 취약점 보호. 프레임 워크 보안 기능 : 취약점 보호. Mar 28, 2025 pm 05:11 PM

기사는 입력 유효성 검사, 인증 및 정기 업데이트를 포함한 취약점을 방지하기 위해 프레임 워크의 필수 보안 기능을 논의합니다.

JWT (JSON Web Tokens) 및 PHP API의 사용 사례를 설명하십시오. JWT (JSON Web Tokens) 및 PHP API의 사용 사례를 설명하십시오. Apr 05, 2025 am 12:04 AM

JWT는 주로 신분증 인증 및 정보 교환을 위해 당사자간에 정보를 안전하게 전송하는 데 사용되는 JSON을 기반으로 한 개방형 표준입니다. 1. JWT는 헤더, 페이로드 및 서명의 세 부분으로 구성됩니다. 2. JWT의 작업 원칙에는 세 가지 단계가 포함됩니다. JWT 생성, JWT 확인 및 Parsing Payload. 3. PHP에서 인증에 JWT를 사용하면 JWT를 생성하고 확인할 수 있으며 사용자 역할 및 권한 정보가 고급 사용에 포함될 수 있습니다. 4. 일반적인 오류에는 서명 검증 실패, 토큰 만료 및 대형 페이로드가 포함됩니다. 디버깅 기술에는 디버깅 도구 및 로깅 사용이 포함됩니다. 5. 성능 최적화 및 모범 사례에는 적절한 시그니처 알고리즘 사용, 타당성 기간 설정 합리적,

See all articles