Java java지도 시간 JAVA 문자셋 기본 소개~자세한 설명

JAVA 문자셋 기본 소개~자세한 설명

Dec 17, 2016 am 11:01 AM

  1. 개요

    이 기사에는 주로 코딩, Java, 시스템 소프트웨어, URL, 도구 소프트웨어 등에 대한 기본 지식이 포함되어 있습니다.

    다음 설명에서는 "중국어"라는 단어를 예로 들어 보겠습니다. 테이블을 찾아보면 GB2312 인코딩이 "d6d0 cec4"이고 유니코드 인코딩이 "4e2d 6587"임을 알 수 있습니다. 이며 UTF 인코딩은 "e4b8ad" e69687"입니다. 이 두 문자에는 iso8859-1 인코딩이 없지만 iso8859-1 인코딩으로 "표현"될 수 있습니다.

    2. 코딩의 기본지식

    최초의 인코딩은 iso8859-1로 ASCII 인코딩과 유사합니다. 그러나 다양한 언어의 표현을 용이하게 하기 위해 점차 많은 표준 인코딩이 등장해 왔으며, 그 중 중요한 것은 다음과 같습니다.

    2.1.iso8859-1

    표현할 수 있는 최대 문자 범위는 영어 계열에 적용됩니다. 예를 들어 문자 'a'의 인코딩은 0x61=97입니다.

    iso8859-1 인코딩으로 표현되는 문자 범위가 매우 좁아서 한자를 표현할 수 없다는 것은 당연합니다. 그러나 싱글바이트 인코딩이고 컴퓨터의 가장 기본적인 표현 단위와 일치하기 때문에 여전히 iso8859-1 인코딩을 사용하는 경우가 많다. 그리고 많은 프로토콜에서 이 인코딩이 기본적으로 사용됩니다. 예를 들어 iso8859-1 인코딩에는 "중국어"라는 단어가 존재하지 않지만 gb2312 인코딩을 예로 들면 "d6d0 cec4"의 두 문자여야 합니다. iso8859-1 인코딩을 사용하면 4바이트로 분할됩니다. . "d6 d0 ce c4"를 나타냅니다(실제로 저장할 때도 바이트 단위로 처리됩니다). 그리고 UTF 인코딩인 경우 6바이트 "e4 b8 ad e6 96 87"입니다. 분명히 이 표현은 다른 인코딩을 기반으로 해야 합니다.

    2.2.GB2312/GBK

    한자를 표현하는데 특별히 사용되는 국가표준코드로, 영문자는 2바이트 인코딩으로 되어있습니다. iso8859-1 (iso8859-1 인코딩과 호환 가능). 그 중 gbk 인코딩은 전통 문자와 단순화된 문자를 모두 표시하는 데 사용할 수 있지만 gb2312는 단순화된 문자만 표현할 수 있습니다.

    2.3. 유니코드

    모든 언어에서 문자를 표현하는 데 사용할 수 있는 가장 통일된 인코딩으로, 고정 길이 더블바이트(역시 4바이트) 인코딩입니다. 영문자를 포함한 내부. 따라서 iso8859-1 인코딩과 호환되지 않으며 어떤 인코딩과도 호환되지 않는다고 말할 수 있습니다. 그러나 iso8859-1 인코딩과 비교할 때 유니오코드 인코딩은 앞에 0바이트만 추가합니다. 예를 들어 문자 'a'는 "00 61"입니다.

    고정 길이 인코딩은 컴퓨터에서 처리하기 쉽고(GB2312/GBK는 고정 길이 인코딩이 아님) 유니코드를 사용하여 모든 문자를 나타낼 수 있으므로 많은 소프트웨어에서 사용된다는 점에 유의해야 합니다. java와 같은 처리를 위한 유니코드 인코딩.

    2.4.UTF

    유니코드 인코딩은 iso8859-1 인코딩과 호환되지 않고 쉽게 더 많은 공간을 차지한다는 점을 고려하면, 영어 문자의 경우 유니코드도 표현하는 데 2바이트가 필요하기 때문입니다. 따라서 유니코드는 전송 및 저장에 편리하지 않습니다. 따라서 UTF 인코딩은 ISO8859-1 인코딩과 호환되며 모든 언어의 문자를 나타내는 데 사용할 수 있습니다. 그러나 UTF 인코딩은 가변 길이 인코딩이며 각 문자의 길이는 1-6입니다. 바이트. 또한 UTF 인코딩에는 간단한 확인 기능이 함께 제공됩니다. 일반적으로 영어는 1바이트로 표현되고, 한자는 3바이트로 표현됩니다.
    3. Java의 문자 처리

    Java 응용 프로그램에는 문자 세트 인코딩과 관련된 곳이 많으며 일부 위치는 올바르게 설정되어야 합니다. 어느 정도 처리합니다.

    3.1.getBytes(charset)

    문자열이 나타내는 문자를 charset에 따라 인코딩하여 바이트 단위로 표현하는 기능을 하는 Java 문자열 처리용 표준 함수입니다. 문자열은 항상 유니코드 인코딩으로 Java 메모리에 저장됩니다. 예를 들어, "중국어"는 일반적인 상황(즉, 오류가 없는 경우)에서는 "4e2d 6587"로 저장됩니다. 문자 세트가 "gbk"인 경우 "d6d0 cec4"로 인코딩된 다음 바이트 "d6"으로 인코딩됩니다. d0 ce c4"가 반환됩니다. 문자 세트가 "utf8"이면 끝은 "e4 b8 ad e6 96 87"입니다. "iso8859-1"이면 인코딩할 수 없기 때문에 최종적으로 "3f 3f"(물음표 2개)가 반환된다.

    3.2.새 문자열(문자 집합)

    이는 Java 문자열 처리를 위한 또 다른 표준 함수로, 이전 함수와 반대되는 문자 집합 인코딩에 따라 바이트 배열을 결합하고 식별하여 최종적으로 이를 유니코드로 변환하여 저장합니다. 위의 getBytes 예를 참조하면 "gbk"와 "utf8" 모두 "4e2d 6587"이라는 올바른 결과를 얻을 수 있지만 iso8859-1은 최종적으로 "003f 003f"(물음표 2개)가 됩니다.

    utf8을 사용하면 모든 문자를 표현/인코딩할 수 있으므로 new String(str.getBytes("utf8"), "utf8") === str은 완전히 되돌릴 수 있습니다.

    3.3.setCharacterEncoding()

    이 함수는 http 요청 또는 해당 인코딩을 설정하는 데 사용됩니다.

    요청의 경우 제출된 콘텐츠의 인코딩을 의미합니다. 지정 후 getParameter()를 통해 올바른 문자열을 직접 얻을 수 있습니다. 지정하지 않으면 기본적으로 iso8859-1 인코딩이 사용됩니다. 추가 처리가 필요합니다. 아래의 "양식 입력"을 참조하세요. setCharacterEncoding()이 실행되기 전에는 getParameter()를 실행할 수 없다는 점은 주목할 가치가 있습니다. Java 문서에는 다음과 같이 명시되어 있습니다. 요청 매개변수를 읽거나 getReader()를 사용하여 입력을 읽기 전에 이 메소드를 호출해야 합니다. 또한 이 사양은 GET 메서드가 아닌 POST 메서드에만 유효합니다. 이유를 분석해 보면 첫 번째 getParameter()를 실행할 때 java는 인코딩에 따라 제출된 모든 콘텐츠를 분석하고 이후의 getParameter()는 더 이상 분석되지 않으므로 setCharacterEncoding()이 유효하지 않습니다. 양식을 제출하는 GET 메소드의 경우 제출된 컨텐츠가 URL에 있으며 제출된 모든 컨텐츠는 처음부터 인코딩에 따라 분석되었으므로 setCharacterEncoding()은 당연히 유효하지 않습니다.

    응답의 경우 출력 콘텐츠의 인코딩을 지정하는 동시에 이 설정이 브라우저에 전달되어 콘텐츠 출력에 사용되는 인코딩을 브라우저에 알려줍니다.

    3.4. 처리 과정

    다음은 Java가 코딩 관련 문제를 처리하는 방법을 설명하기 위한 두 가지 대표적인 예를 분석한 것입니다.

    3.4.1. 폼 입력

    사용자 입력 *(gbk:d6d0 cec4) 브라우저 *(gbk:d6d0 cec4) 웹 서버 iso8859-1(00d6 00d ​​​​000ce 00c4) 클래스, 클래스에서 처리됨에 있어야 합니다. getbytes("iso8859-1")는 d6 d0 ce c4이고, new String("gbk")은 d6d0 cec4이며, 메모리의 유니코드 인코딩은 4e2d 6587입니다.

    l 사용자가 입력한 인코딩 방법은 페이지에 지정된 인코딩과 관련이 있고 사용자의 운영 체제에도 관련되어 있으므로 위의 예에서는 gbk를 예로 사용합니다.

    브라우저에서 웹 서버로 양식에 콘텐츠를 제출할 때 사용되는 문자 집합을 지정할 수 있습니다. 그렇지 않으면 페이지에서 지정한 인코딩이 사용됩니다. 그리고 ?를 사용하여 URL에 매개변수를 직접 입력하는 경우, 인코딩은 현재 페이지와 아무 관련이 없기 때문에 운영체제 자체의 인코딩인 경우가 많습니다. 위의 내용은 여전히 ​​gbk 인코딩을 예로 사용합니다.

    웹 서버는 기본적으로(getParameter) iso8859-1 인코딩으로 처리되므로 결과가 올바르지 않으므로 처리가 필요합니다. 하지만 미리 인코딩을 설정해 놓으면(request.setCharacterEncoding()을 통해) 바로 올바른 결과를 얻을 수 있습니다.

    페이지에서 인코딩을 지정하는 것은 좋은 습관입니다. 그렇지 않으면 통제력을 잃고 올바른 인코딩을 지정하지 못할 수 있습니다.


위는 기본 소개입니다. JAVA 문자셋에 대한 자세한 설명은 PHP 중국어 홈페이지(www.kr)를 참고해주세요. .php.cn)!

본 웹사이트의 성명
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

핫 AI 도구

Undresser.AI Undress

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

인기 기사

R.E.P.O. 에너지 결정과 그들이하는 일 (노란색 크리스탈)
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. 최고의 그래픽 설정
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. 아무도들을 수없는 경우 오디오를 수정하는 방법
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
WWE 2K25 : Myrise에서 모든 것을 잠금 해제하는 방법
4 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌

뜨거운 도구

메모장++7.3.1

메모장++7.3.1

사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전

SublimeText3 중국어 버전

중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기

스튜디오 13.0.1 보내기

강력한 PHP 통합 개발 환경

드림위버 CS6

드림위버 CS6

시각적 웹 개발 도구

SublimeText3 Mac 버전

SublimeText3 Mac 버전

신 수준의 코드 편집 소프트웨어(SublimeText3)

자바의 제곱근 자바의 제곱근 Aug 30, 2024 pm 04:26 PM

자바의 제곱근 안내 여기서는 예제와 코드 구현을 통해 Java에서 Square Root가 어떻게 작동하는지 설명합니다.

자바의 완전수 자바의 완전수 Aug 30, 2024 pm 04:28 PM

Java의 완전수 가이드. 여기서는 정의, Java에서 완전 숫자를 확인하는 방법, 코드 구현 예제에 대해 논의합니다.

Java의 난수 생성기 Java의 난수 생성기 Aug 30, 2024 pm 04:27 PM

Java의 난수 생성기 안내. 여기서는 예제를 통해 Java의 함수와 예제를 통해 두 가지 다른 생성기에 대해 설명합니다.

자바의 웨카 자바의 웨카 Aug 30, 2024 pm 04:28 PM

Java의 Weka 가이드. 여기에서는 소개, weka java 사용 방법, 플랫폼 유형 및 장점을 예제와 함께 설명합니다.

Java의 스미스 번호 Java의 스미스 번호 Aug 30, 2024 pm 04:28 PM

Java의 Smith Number 가이드. 여기서는 정의, Java에서 스미스 번호를 확인하는 방법에 대해 논의합니다. 코드 구현의 예.

Java Spring 인터뷰 질문 Java Spring 인터뷰 질문 Aug 30, 2024 pm 04:29 PM

이 기사에서는 가장 많이 묻는 Java Spring 면접 질문과 자세한 답변을 보관했습니다. 그래야 면접에 합격할 수 있습니다.

Java 8 Stream foreach에서 나누거나 돌아 오시겠습니까? Java 8 Stream foreach에서 나누거나 돌아 오시겠습니까? Feb 07, 2025 pm 12:09 PM

Java 8은 스트림 API를 소개하여 데이터 컬렉션을 처리하는 강력하고 표현적인 방법을 제공합니다. 그러나 스트림을 사용할 때 일반적인 질문은 다음과 같은 것입니다. 기존 루프는 조기 중단 또는 반환을 허용하지만 스트림의 Foreach 메소드는이 방법을 직접 지원하지 않습니다. 이 기사는 이유를 설명하고 스트림 처리 시스템에서 조기 종료를 구현하기위한 대체 방법을 탐색합니다. 추가 읽기 : Java Stream API 개선 스트림 foreach를 이해하십시오 Foreach 메소드는 스트림의 각 요소에서 하나의 작업을 수행하는 터미널 작동입니다. 디자인 의도입니다

Java의 날짜까지의 타임스탬프 Java의 날짜까지의 타임스탬프 Aug 30, 2024 pm 04:28 PM

Java의 TimeStamp to Date 안내. 여기서는 소개와 예제와 함께 Java에서 타임스탬프를 날짜로 변환하는 방법에 대해서도 설명합니다.

See all articles