문자 세트 메소드를 자동으로 식별하려면 java.nio.charset.CharsetDecoder를 사용하십시오.-java지도 시간-php.cn

집

Java

java지도 시간

문자 세트 메소드를 자동으로 식별하려면 java.nio.charset.CharsetDecoder를 사용하십시오.

高洛峰

Mar 12, 2017 am 09:43 AM

java

이 글소개java.nio.charset.CharsetDecoder를 사용하여 문자 집합메서드

를 자동으로 식별하는 방법을 연구합니다. 인터넷에서 사용할 수 있습니다. 문자 집합을 자동으로 식별하는 가장 효과적인 방법은 타사 클래스 라이브러리 jchardet를 사용하는 것입니다. 실제로 jchardet을 사용하는 cpDetector도 있습니다. 우연히 jdk의 java.nio.charset.CharsetDecoder를 사용하여 문자 집합을 식별할 수 있다는 사실을 발견했습니다.

1. 원리

InputStreamReader를 구성하는 데는 일반적으로 두 가지 방법이 사용됩니다.

InputStreamReader reader = new InputStreamReader(in, charsetName);

로그인 후 복사

InputStreamReader reader = new InputStreamReader(in, charset);

로그인 후 복사

문자셋이 일치하지 않으면 깨져서 출력됩니다.

CharsetDecoder를 사용하는 구성 방법도 있습니다.

CharsetDecoder cd = charset.newDecoder();
InputStreamReader reader = new InputStreamReader(in, cd);

로그인 후 복사

이때 일치하는 항목이 없으면 예외가 발생합니다:

java.nio.charset.MalformedInputException: Input length = 1
    at java.nio.charset.CoderResult.throwException(CoderResult.java:277)
    at sun.nio.cs.StreamDecoder.implRead(StreamDecoder.java:338)
    at sun.nio.cs.StreamDecoder.read(StreamDecoder.java:177)
        ....

로그인 후 복사

이런 방식으로 문자 집합 감지로 사용할 수 있습니다.

2. AutoCharsetReader 사용

AutoCharsetReader는 위의 원칙을 바탕으로 작성된 클래스이며 은 을 상속합니다. 🎜>Reader 는 Charset 적응형 InputStreamReader로 볼 수 있습니다.

AutoCharsetReader ar= new AutoCharsetReader(in);char c = ar.read();
...char[] cbuf = new char[2000];
ar.read(cbuf);
...
BufferedReader br = new BufferedReader(ar);
br.readLine();
...

로그인 후 복사

또 다른 예는 Reader 매개변수가 필요한 전체 텍스트 index를 생성하는 Lucene의 TextField입니다. 이 클래스를 직접 사용할 수 있습니다.

Field field = new TextField("content", new AutoCharsetReader(file));

로그인 후 복사

파일을 읽은 후 파일의 문자셋을 얻을 수 있습니다. 참고로 읽어본 후의 내용입니다.

Charset charset = ar.charset();

로그인 후 복사

3. 대체 문자 집합

다중 시도 방식 때문에 문자 세트를 마무리하고 대안을 제공하십시오. 현재 코드에서 제공하는 기본 대체 문자 집합은 다음과 같습니다.

    private final static String[] _defaultCharsets = {        
            "US-ASCII",            "UTF-8",            "GB2312", 
            "BIG5",            "GBK",            "GB18030",                
            "UTF-16BE", 
            "UTF-16LE", 
            "UTF-16",            "UNICODE"};

로그인 후 복사

대체 문자 집합을 변경하는 방법도 제공됩니다. 예:

AutoCharsetReader ar = new AutoCharsetReader(in).setCharset("ascii", "utf-8", "gbk");

로그인 후 복사

순서는 감지 결과에 영향을 미칩니다. 예를 들어 GBK가 GB2312 이전인 경우 GBK에는 GB2312가 포함되어 있으므로 탐지 결과는 GBK만 가능하고 GB2312는 될 수 없습니다.

4. 문자 집합 감지 전용

은 문자 집합 감지에만 사용할 수 있습니다:

charset = AutoCharsetReader.quickDetect(file.toURI().toURL(), charsets);
or:
charset = AutoCharsetReader.deepDetect(file.toURI().toURL(), charsets, stops);

로그인 후 복사

quickDetect는 한 문자만 읽으며 단일 문자 집합 파일에 적합합니다. html의 경우 문자셋을 알기 위해 모두 읽어야 할 수도 있으므로 deepDetect를 사용하세요. 문자 집합 매개변수는 null일 수 있습니다.

파일 집합의 경우 알려진 가능한 문자 집합은 "ascii", "utf-8", "gb2312" 및 "gbk"입니다. 파일의 문자 집합이 다음과 같은 것으로 감지되면 "utf-8" 또는 "gbk"인 경우 파일을 계속 읽지 않고도 결과가 즉시 반환될 수 있습니다. 이때 stops 매개변수를 {"utf-8", "gbk"}에 할당할 수 있습니다. null인 경우 모두 읽어야 합니다.

5. 기타

이 클래스에는 효율성을 높이기 위해 버퍼가 있습니다. io 를 다시 읽어야 합니다. 기본 버퍼 크기는 8192입니다. 객체를 구성할 때 버퍼 크기를 직접 정의할 수 있습니다. 매개변수가 16보다 작으면 16으로 설정하세요.

위 내용은 문자 세트 메소드를 자동으로 식별하려면 java.nio.charset.CharsetDecoder를 사용하십시오.의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

본 웹사이트의 성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

Video Face Swap

완전히 무료인 AI 얼굴 교환 도구를 사용하여 모든 비디오의 얼굴을 쉽게 바꾸세요!

뜨거운 도구

메모장++7.3.1

사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전

중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기

강력한 PHP 통합 개발 환경

드림위버 CS6

시각적 웹 개발 도구

SublimeText3 Mac 버전

신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제

Gmail 이메일의 로그인 입구는 어디에 있나요?

7722

자바 튜토리얼

1642

Cakephp 튜토리얼

1396

라라벨 튜토리얼

1289

PHP 튜토리얼

1233

Related knowledge

Java Spring 인터뷰 질문 Aug 30, 2024 pm 04:29 PM

이 기사에서는 가장 많이 묻는 Java Spring 면접 질문과 자세한 답변을 보관했습니다. 그래야 면접에 합격할 수 있습니다.

Java 8 Stream foreach에서 나누거나 돌아 오시겠습니까? Feb 07, 2025 pm 12:09 PM

Java 8은 스트림 API를 소개하여 데이터 컬렉션을 처리하는 강력하고 표현적인 방법을 제공합니다. 그러나 스트림을 사용할 때 일반적인 질문은 다음과 같은 것입니다. 기존 루프는 조기 중단 또는 반환을 허용하지만 스트림의 Foreach 메소드는이 방법을 직접 지원하지 않습니다. 이 기사는 이유를 설명하고 스트림 처리 시스템에서 조기 종료를 구현하기위한 대체 방법을 탐색합니다. 추가 읽기 : Java Stream API 개선 스트림 foreach를 이해하십시오 Foreach 메소드는 스트림의 각 요소에서 하나의 작업을 수행하는 터미널 작동입니다. 디자인 의도입니다

Java의 날짜까지의 타임스탬프 Aug 30, 2024 pm 04:28 PM

Java의 TimeStamp to Date 안내. 여기서는 소개와 예제와 함께 Java에서 타임스탬프를 날짜로 변환하는 방법에 대해서도 설명합니다.

캡슐의 양을 찾기위한 Java 프로그램 Feb 07, 2025 am 11:37 AM

캡슐은 3 차원 기하학적 그림이며, 양쪽 끝에 실린더와 반구로 구성됩니다. 캡슐의 부피는 실린더의 부피와 양쪽 끝에 반구의 부피를 첨가하여 계산할 수 있습니다. 이 튜토리얼은 다른 방법을 사용하여 Java에서 주어진 캡슐의 부피를 계산하는 방법에 대해 논의합니다. 캡슐 볼륨 공식 캡슐 볼륨에 대한 공식은 다음과 같습니다. 캡슐 부피 = 원통형 볼륨 2 반구 볼륨 안에, R : 반구의 반경. H : 실린더의 높이 (반구 제외). 예 1 입력하다 반경 = 5 단위 높이 = 10 단위 산출 볼륨 = 1570.8 입방 단위 설명하다 공식을 사용하여 볼륨 계산 : 부피 = π × r2 × h (4

PHP : 웹 개발의 핵심 언어 Apr 13, 2025 am 12:08 AM

PHP는 서버 측에서 널리 사용되는 스크립팅 언어이며 특히 웹 개발에 적합합니다. 1.PHP는 HTML을 포함하고 HTTP 요청 및 응답을 처리 할 수 있으며 다양한 데이터베이스를 지원할 수 있습니다. 2.PHP는 강력한 커뮤니티 지원 및 오픈 소스 리소스를 통해 동적 웹 컨텐츠, 프로세스 양식 데이터, 액세스 데이터베이스 등을 생성하는 데 사용됩니다. 3. PHP는 해석 된 언어이며, 실행 프로세스에는 어휘 분석, 문법 분석, 편집 및 실행이 포함됩니다. 4. PHP는 사용자 등록 시스템과 같은 고급 응용 프로그램을 위해 MySQL과 결합 할 수 있습니다. 5. PHP를 디버깅 할 때 error_reporting () 및 var_dump ()와 같은 함수를 사용할 수 있습니다. 6. 캐싱 메커니즘을 사용하여 PHP 코드를 최적화하고 데이터베이스 쿼리를 최적화하며 내장 기능을 사용하십시오. 7

PHP vs. Python : 차이점 이해 Apr 11, 2025 am 12:15 AM

PHP와 Python은 각각 고유 한 장점이 있으며 선택은 프로젝트 요구 사항을 기반으로해야합니다. 1.PHP는 간단한 구문과 높은 실행 효율로 웹 개발에 적합합니다. 2. Python은 간결한 구문 및 풍부한 라이브러리를 갖춘 데이터 과학 및 기계 학습에 적합합니다.

미래를 창조하세요: 완전 초보자를 위한 Java 프로그래밍 Oct 13, 2024 pm 01:32 PM

Java는 초보자와 숙련된 개발자 모두가 배울 수 있는 인기 있는 프로그래밍 언어입니다. 이 튜토리얼은 기본 개념부터 시작하여 고급 주제를 통해 진행됩니다. Java Development Kit를 설치한 후 간단한 "Hello, World!" 프로그램을 작성하여 프로그래밍을 연습할 수 있습니다. 코드를 이해한 후 명령 프롬프트를 사용하여 프로그램을 컴파일하고 실행하면 "Hello, World!"가 콘솔에 출력됩니다. Java를 배우면 프로그래밍 여정이 시작되고, 숙달이 깊어짐에 따라 더 복잡한 애플리케이션을 만들 수 있습니다.