青青草原综合久久大伊人导航_色综合久久天天综合_日日噜噜夜夜狠狠久久丁香五月_热久久这里只有精品

<s id="uq2qe"><em id="uq2qe"></em></s>

<strike id="uq2qe"><dd id="uq2qe"></dd></strike>

<kbd id="uq2qe"><code id="uq2qe"></code></kbd>

<abbr id="uq2qe"><code id="uq2qe"></code></abbr>

<strike id="uq2qe"></strike><del id="uq2qe"></del>

<center id="uq2qe"><code id="uq2qe"></code></center>

<bdo id="uq2qe"><th id="uq2qe"></th></bdo>

<strike id="uq2qe"><tbody id="uq2qe"></tbody></strike>

Welcome to 陳俊峰's ---BeetleHeaded Man Blog !

C++博客 :: 首頁 :: 新隨筆 :: 聯(lián)系 :: 聚合

:: 管理 ::

58 隨筆 :: 32 文章 :: 18 評(píng)論 :: 0 Trackbacks

字符，字節(jié)和編碼的區(qū)別(亂碼解決方案之一)

轉(zhuǎn)載：http://www.regexlab.com/zh/encoding.htm

引言

“字符與編碼”是一個(gè)被經(jīng)常討論的話題。即使這樣，時(shí)常出現(xiàn)的亂碼仍然困擾著大家。雖然我們有很多的辦法可以用來消除亂碼，但我們并不一定理解這些辦法的內(nèi)在原理。而有的亂碼產(chǎn)生的原因，實(shí)際上由于底層代碼本身有問題所導(dǎo)致的。因此，不僅是初學(xué)者會(huì)對(duì)字符編碼感到模糊，有的底層開發(fā)人員同樣對(duì)字符編碼缺乏準(zhǔn)確的理解。

1. 編碼問題的由來，相關(guān)概念的理解

1.1 字符與編碼的發(fā)展

從計(jì)算機(jī)對(duì)多國語言的支持角度看，大致可以分為三個(gè)階段：

	系統(tǒng)內(nèi)碼	說明	系統(tǒng)
階段一	ASCII	計(jì)算機(jī)剛開始只支持英語，其它語言不能夠在計(jì)算機(jī)上存儲(chǔ)和顯示。	英文 DOS
階段二	ANSI編碼（本地化）	為使計(jì)算機(jī)支持更多語言，通常使用 0x80~0xFF 范圍的 2 個(gè)字節(jié)來表示 1 個(gè)字符。比如：漢字 '中' 在中文操作系統(tǒng)中，使用 [0xD6,0xD0] 這兩個(gè)字節(jié)存儲(chǔ)。不同的國家和地區(qū)制定了不同的標(biāo)準(zhǔn)，由此產(chǎn)生了 GB2312, BIG5, JIS 等各自的編碼標(biāo)準(zhǔn)。這些使用 2 個(gè)字節(jié)來代表一個(gè)字符的各種漢字延伸編碼方式，稱為 ANSI 編碼。在簡體中文系統(tǒng)下，ANSI 編碼代表 GB2312 編碼，在日文操作系統(tǒng)下，ANSI 編碼代表 JIS 編碼。不同 ANSI 編碼之間互不兼容，當(dāng)信息在國際間交流時(shí)，無法將屬于兩種語言的文字，存儲(chǔ)在同一段 ANSI 編碼的文本中。	中文 DOS，中文 Windows 95/98，日文 Windows 95/98
階段三	UNICODE （國際化）	為了使國際間信息交流更加方便，國際組織制定了 UNICODE 字符集，為各種語言中的每一個(gè)字符設(shè)定了統(tǒng)一并且唯一的數(shù)字編號(hào)，以滿足跨語言、跨平臺(tái)進(jìn)行文本轉(zhuǎn)換、處理的要求。	Windows NT/2000/XP，Linux，Java

字符串在內(nèi)存中的存放方法：

在 ASCII 階段，單字節(jié)字符串使用一個(gè)字節(jié)存放一個(gè)字符（SBCS）。比如，"Bob123" 在內(nèi)存中為：

42	6F	62	31	32	33	00

B	o	b	1	2	3	\0

在使用 ANSI 編碼支持多種語言階段，每個(gè)字符使用一個(gè)字節(jié)或多個(gè)字節(jié)來表示（MBCS），因此，這種方式存放的字符也被稱作多字節(jié)字符。比如，"中文123" 在中文 Windows 95 內(nèi)存中為7個(gè)字節(jié)，每個(gè)漢字占2個(gè)字節(jié)，每個(gè)英文和數(shù)字字符占1個(gè)字節(jié)：

D6	D0	CE	C4	31	32	33	00

中		文		1	2	3	\0

在 UNICODE 被采用之后，計(jì)算機(jī)存放字符串時(shí)，改為存放每個(gè)字符在 UNICODE 字符集中的序號(hào)。目前計(jì)算機(jī)一般使用 2 個(gè)字節(jié)（16 位）來存放一個(gè)序號(hào)（DBCS），因此，這種方式存放的字符也被稱作寬字節(jié)字符。比如，字符串 "中文123" 在 Windows 2000 下，內(nèi)存中實(shí)際存放的是 5 個(gè)序號(hào)：

2D	4E	87	65	31	00	32	00	33	00	00	00	???? ← 在 x86 CPU 中，低字節(jié)在前

中		文		1		2		3		\0

一共占 10 個(gè)字節(jié)。

1.2 字符，字節(jié)，字符串

理解編碼的關(guān)鍵，是要把字符的概念和字節(jié)的概念理解準(zhǔn)確。這兩個(gè)概念容易混淆，我們在此做一下區(qū)分：

	概念描述	舉例
字符	人們使用的記號(hào)，抽象意義上的一個(gè)符號(hào)。	'1', '中', 'a', '$', '￥', ……
字節(jié)	計(jì)算機(jī)中存儲(chǔ)數(shù)據(jù)的單元，一個(gè)8位的二進(jìn)制數(shù)，是一個(gè)很具體的存儲(chǔ)空間。	0x01, 0x45, 0xFA, ……
ANSI 字符串	在內(nèi)存中，如果“字符”是以 ANSI 編碼形式存在的，一個(gè)字符可能使用一個(gè)字節(jié)或多個(gè)字節(jié)來表示，那么我們稱這種字符串為 ANSI 字符串或者多字節(jié)字符串。	"中文123" （占7字節(jié)）
UNICODE 字符串	在內(nèi)存中，如果“字符”是以在 UNICODE 中的序號(hào)存在的，那么我們稱這種字符串為 UNICODE 字符串或者寬字節(jié)字符串。	L"中文123" （占10字節(jié)）

由于不同 ANSI 編碼所規(guī)定的標(biāo)準(zhǔn)是不相同的，因此，對(duì)于一個(gè)給定的多字節(jié)字符串，我們必須知道它采用的是哪一種編碼規(guī)則，才能夠知道它包含了哪些“字符”。而對(duì)于 UNICODE 字符串來說，不管在什么環(huán)境下，它所代表的“字符”內(nèi)容總是不變的。

1.3 字符集與編碼

各個(gè)國家和地區(qū)所制定的不同 ANSI 編碼標(biāo)準(zhǔn)中，都只規(guī)定了各自語言所需的“字符”。比如：漢字標(biāo)準(zhǔn)（GB2312）中沒有規(guī)定韓國語字符怎樣存儲(chǔ)。這些 ANSI 編碼標(biāo)準(zhǔn)所規(guī)定的內(nèi)容包含兩層含義：

使用哪些字符。也就是說哪些漢字，字母和符號(hào)會(huì)被收入標(biāo)準(zhǔn)中。所包含“字符”的集合就叫做“字符集”。
規(guī)定每個(gè)“字符”分別用一個(gè)字節(jié)還是多個(gè)字節(jié)存儲(chǔ)，用哪些字節(jié)來存儲(chǔ)，這個(gè)規(guī)定就叫做“編碼”。

各個(gè)國家和地區(qū)在制定編碼標(biāo)準(zhǔn)的時(shí)候，“字符的集合”和“編碼”一般都是同時(shí)制定的。因此，平常我們所說的“字符集”，比如：GB2312, GBK, JIS 等，除了有“字符的集合”這層含義外，同時(shí)也包含了“編碼”的含義。

“UNICODE 字符集”包含了各種語言中使用到的所有“字符”。用來給 UNICODE 字符集編碼的標(biāo)準(zhǔn)有很多種，比如：UTF-8, UTF-7, UTF-16, UnicodeLittle, UnicodeBig 等。

2. 字符與編碼在程序中的實(shí)現(xiàn)

2.1 程序中的字符與字節(jié)

在 C++ 和 Java 中，用來代表“字符”和“字節(jié)”的數(shù)據(jù)類型，以及進(jìn)行編碼的方法：

類型或操作	C++	Java
字符	wchar_t	char^*
字節(jié)	char	byte
ANSI 字符串	char[]	byte[]
UNICODE 字符串	wchar_t[]	String
字節(jié)串→字符串	mbstowcs(), MultiByteToWideChar() ^*	string = new String(bytes, "encoding")
字符串→字節(jié)串	wcstombs(), WideCharToMultiByte()	bytes = string.getBytes("encoding")

以上需要注意幾點(diǎn)：

Java 中的 char 代表一個(gè)“UNICODE 字符（寬字節(jié)字符）”，而 C++ 中的 char 代表一個(gè)字節(jié)。
MultiByteToWideChar() 和 WideCharToMultiByte() 是 Windows API 函數(shù)。

2.2 C++ 中相關(guān)實(shí)現(xiàn)方法

聲明一段字符串常量：

// ANSI 字符串，內(nèi)容長度 7 字節(jié)
char ???? sz[20] = "中文123";

// UNICODE 字符串，內(nèi)容長度 5 個(gè) wchar_t（10 字節(jié)）
wchar_t wsz[20] = L"\x4E2D\x6587\x0031\x0032\x0033";

UNICODE 字符串的 I/O 操作，字符與字節(jié)的轉(zhuǎn)換操作：

// 運(yùn)行時(shí)設(shè)定當(dāng)前 ANSI 編碼，VC 格式
setlocale(LC_ALL, ".936");

// GCC 中格式
setlocale(LC_ALL, "zh_CN.GBK");

// Visual C++ 中使用小寫 %s，按照 setlocale 指定編碼輸出到文件
// GCC 中使用大寫 %S
fwprintf(fp, L"%s\n", wsz);

// 把 UNICODE 字符串按照 setlocale 指定的編碼轉(zhuǎn)換成字節(jié)
wcstombs(sz, wsz, 20);
// 把字節(jié)串按照 setlocale 指定的編碼轉(zhuǎn)換成 UNICODE 字符串
mbstowcs(wsz, sz, 20);

在 Visual C++ 中，UNICODE 字符串常量有更簡單的表示方法。如果源程序的編碼與當(dāng)前默認(rèn) ANSI 編碼不符，則需要使用 #pragma setlocale，告訴編譯器源程序使用的編碼：

// 如果源程序的編碼與當(dāng)前默認(rèn) ANSI 編碼不一致，
// 則需要此行，編譯時(shí)用來指明當(dāng)前源程序使用的編碼
#pragma setlocale (".936")

// UNICODE 字符串常量，內(nèi)容長度 10 字節(jié)
wchar_t wsz[20] = L"中文123";

以上需要注意 #pragma setlocale 與 setlocale(LC_ALL, "") 的作用是不同的，#pragma setlocale 在編譯時(shí)起作用，setlocale() 在運(yùn)行時(shí)起作用。

2.3 Java 中相關(guān)實(shí)現(xiàn)方法

字符串類 String 中的內(nèi)容是 UNICODE 字符串：

// Java 代碼，直接寫中文
String string = "中文123";

// 得到長度為 5，因?yàn)槭?5 個(gè)字符
System.out.println(string.length());

字符串 I/O 操作，字符與字節(jié)轉(zhuǎn)換操作。在 Java 包 java.io.* 中，以“Stream”結(jié)尾的類一般是用來操作“字節(jié)串”的類，以“Reader”，“Writer”結(jié)尾的類一般是用來操作“字符串”的類。

// 字符串與字節(jié)串間相互轉(zhuǎn)化

// 按照 GB2312 得到字節(jié)（得到多字節(jié)字符串）
byte [] bytes = string.getBytes("GB2312");

// 從字節(jié)按照 GB2312 得到 UNICODE 字符串
string = newString(bytes, "GB2312");

// 要將 String 按照某種編碼寫入文本文件，有兩種方法：

// 第一種辦法：用 Stream 類寫入已經(jīng)按照指定編碼轉(zhuǎn)化好的字節(jié)串
OutputStream os = new FileOutputStream("1.txt");
os.write(bytes);
os.close();

// 第二種辦法：構(gòu)造指定編碼的 Writer 來寫入字符串
Writer ow = new OutputStreamWriter(new FileOutputStream("2.txt"), "GB2312");
ow.write(string);
ow.close();

/* 最后得到的 1.txt 和 2.txt 都是 7 個(gè)字節(jié) */

如果 java 的源程序編碼與當(dāng)前默認(rèn) ANSI 編碼不符，則在編譯的時(shí)候，需要指明一下源程序的編碼。比如：

E:\>javac -encoding BIG5 Hello.java

以上需要注意區(qū)分源程序的編碼與 I/O 操作的編碼，前者是在編譯時(shí)起作用，后者是在運(yùn)行時(shí)起作用。

3. 幾種誤解，以及亂碼產(chǎn)生的原因和解決辦法

3.1 容易產(chǎn)生的誤解

	對(duì)編碼的誤解
誤解一	在將“字節(jié)串”轉(zhuǎn)化成“UNICODE 字符串”時(shí)，比如在讀取文本文件時(shí)，或者通過網(wǎng)絡(luò)傳輸文本時(shí)，容易將“字節(jié)串”簡單地作為單字節(jié)字符串，采用每“一個(gè)字節(jié)”就是“一個(gè)字符”的方法進(jìn)行轉(zhuǎn)化。而實(shí)際上，在非英文的環(huán)境中，應(yīng)該將“字節(jié)串”作為 ANSI 字符串，采用適當(dāng)?shù)木幋a來得到 UNICODE 字符串，有可能“多個(gè)字節(jié)”才能得到“一個(gè)字符”。通常，一直在英文環(huán)境下做開發(fā)的程序員們，容易有這種誤解。
誤解二	在 DOS，Windows 98 等非 UNICODE 環(huán)境下，字符串都是以 ANSI 編碼的字節(jié)形式存在的。這種以字節(jié)形式存在的字符串，必須知道是哪種編碼才能被正確地使用。這使我們形成了一個(gè)慣性思維：“字符串的編碼”。當(dāng) UNICODE 被支持后，Java 中的 String 是以字符的“序號(hào)”來存儲(chǔ)的，不是以“某種編碼的字節(jié)”來存儲(chǔ)的，因此已經(jīng)不存在“字符串的編碼”這個(gè)概念了。只有在“字符串”與“字節(jié)串”轉(zhuǎn)化時(shí)，或者，將一個(gè)“字節(jié)串”當(dāng)成一個(gè) ANSI 字符串時(shí)，才有編碼的概念。不少的人都有這個(gè)誤解。

第一種誤解，往往是導(dǎo)致亂碼產(chǎn)生的原因。第二種誤解，往往導(dǎo)致本來容易糾正的亂碼問題變得更復(fù)雜。

3.2 常用的編碼簡介

簡單介紹一下常用的編碼規(guī)則，為后邊的章節(jié)做一個(gè)準(zhǔn)備。在這里，我們根據(jù)編碼規(guī)則的特點(diǎn)，把所有的編碼分成三類：

分類	編碼標(biāo)準(zhǔn)	說明
單字節(jié)字符編碼	ISO-8859-1	最簡單的編碼規(guī)則，每一個(gè)字節(jié)直接作為一個(gè) UNICODE 字符。比如，[0xD6, 0xD0] 這兩個(gè)字節(jié)，通過 iso-8859-1 轉(zhuǎn)化為字符串時(shí)，將直接得到 [0x00D6, 0x00D0] 兩個(gè) UNICODE 字符，即 "?D"。反之，將 UNICODE 字符串通過 iso-8859-1 轉(zhuǎn)化為字節(jié)串時(shí)，只能正常轉(zhuǎn)化 0~255 范圍的字符。
ANSI 編碼	GB2312, BIG5, Shift_JIS, ISO-8859-2 ……	把 UNICODE 字符串通過 ANSI 編碼轉(zhuǎn)化為“字節(jié)串”時(shí)，根據(jù)各自編碼的規(guī)定，一個(gè) UNICODE 字符可能轉(zhuǎn)化成一個(gè)字節(jié)或多個(gè)字節(jié)。反之，將字節(jié)串轉(zhuǎn)化成字符串時(shí)，也可能多個(gè)字節(jié)轉(zhuǎn)化成一個(gè)字符。比如，[0xD6, 0xD0] 這兩個(gè)字節(jié)，通過 GB2312 轉(zhuǎn)化為字符串時(shí)，將得到 [0x4E2D] 一個(gè)字符，即 '中' 字。 “ANSI 編碼”的特點(diǎn)： 1. 這些“ANSI 編碼標(biāo)準(zhǔn)”都只能處理各自語言范圍之內(nèi)的 UNICODE 字符。 2. “UNICODE 字符”與“轉(zhuǎn)換出來的字節(jié)”之間的關(guān)系是人為規(guī)定的。
UNICODE 編碼	UTF-8, UTF-16, UnicodeBig ……	與“ANSI 編碼”類似的，把字符串通過 UNICODE 編碼轉(zhuǎn)化成“字節(jié)串”時(shí)，一個(gè) UNICODE 字符可能轉(zhuǎn)化成一個(gè)字節(jié)或多個(gè)字節(jié)。與“ANSI 編碼”不同的是： 1. 這些“UNICODE 編碼”能夠處理所有的 UNICODE 字符。 2. “UNICODE 字符”與“轉(zhuǎn)換出來的字節(jié)”之間是可以通過計(jì)算得到的。

在這里，我們可以看到，前面所講的“誤解一”，即采用每“一個(gè)字節(jié)”就是“一個(gè)字符”的轉(zhuǎn)化方法，實(shí)際上也就等同于采用 iso-8859-1 進(jìn)行轉(zhuǎn)化。因此，我們常常使用 bytes = string.getBytes("iso-8859-1") 來進(jìn)行逆向操作，得到原始的“字節(jié)串”。然后再使用正確的 ANSI 編碼，比如 string = new String(bytes, "GB2312")，來得到正確的“UNICODE 字符串”。

3.3 非 UNICODE 程序在不同語言環(huán)境間移植時(shí)的亂碼

非 UNICODE 程序中的字符串，都是以某種 ANSI 編碼形式存在的。如果程序運(yùn)行時(shí)的語言環(huán)境與開發(fā)時(shí)的語言環(huán)境不同，將會(huì)導(dǎo)致 ANSI 字符串的顯示失敗。

比如，在日文環(huán)境下開發(fā)的非 UNICODE 的日文程序界面，拿到中文環(huán)境下運(yùn)行時(shí)，界面上將顯示亂碼。如果這個(gè)日文程序界面改為采用 UNICODE 來記錄字符串，那么當(dāng)在中文環(huán)境下運(yùn)行時(shí)，界面上將可以顯示正常的日文。

由于客觀原因，有時(shí)候我們必須在中文操作系統(tǒng)下運(yùn)行非 UNICODE 的日文軟件，這時(shí)我們可以采用一些工具，比如，南極星，AppLocale 等，暫時(shí)的模擬不同的語言環(huán)境。

3.4 網(wǎng)頁提交字符串

當(dāng)頁面中的表單提交字符串時(shí)，首先把字符串按照當(dāng)前頁面的編碼，轉(zhuǎn)化成字節(jié)串。然后再將每個(gè)字節(jié)轉(zhuǎn)化成 "%XX" 的格式提交到 Web 服務(wù)器。比如，一個(gè)編碼為 GB2312 的頁面，提交 "中" 這個(gè)字符串時(shí)，提交給服務(wù)器的內(nèi)容為 "%D6%D0"。

在服務(wù)器端，Web 服務(wù)器把收到的 "%D6%D0" 轉(zhuǎn)化成 [0xD6, 0xD0] 兩個(gè)字節(jié)，然后再根據(jù) GB2312 編碼規(guī)則得到 "中" 字。

在 Tomcat 服務(wù)器中，request.getParameter() 得到亂碼時(shí)，常常是因?yàn)榍懊嫣岬降摹罢`解一”造成的。默認(rèn)情況下，當(dāng)提交 "%D6%D0" 給 Tomcat 服務(wù)器時(shí)，request.getParameter() 將返回 [0x00D6, 0x00D0] 兩個(gè) UNICODE 字符，而不是返回一個(gè) "中" 字符。因此，我們需要使用 bytes = string.getBytes("iso-8859-1") 得到原始的字節(jié)串，再用 string = new String(bytes, "GB2312") 重新得到正確的字符串 "中"。

3.5 從數(shù)據(jù)庫讀取字符串

通過數(shù)據(jù)庫客戶端（比如 ODBC 或 JDBC）從數(shù)據(jù)庫服務(wù)器中讀取字符串時(shí)，客戶端需要從服務(wù)器獲知所使用的 ANSI 編碼。當(dāng)數(shù)據(jù)庫服務(wù)器發(fā)送字節(jié)流給客戶端時(shí)，客戶端負(fù)責(zé)將字節(jié)流按照正確的編碼轉(zhuǎn)化成 UNICODE 字符串。

如果從數(shù)據(jù)庫讀取字符串時(shí)得到亂碼，而數(shù)據(jù)庫中存放的數(shù)據(jù)又是正確的，那么往往還是因?yàn)榍懊嫣岬降摹罢`解一”造成的。解決的辦法還是通過 string = new String( string.getBytes("iso-8859-1"), "GB2312") 的方法，重新得到原始的字節(jié)串，再重新使用正確的編碼轉(zhuǎn)化成字符串。

3.6 電子郵件中的字符串

當(dāng)一段 Text 或者 HTML 通過電子郵件傳送時(shí)，發(fā)送的內(nèi)容首先通過一種指定的字符編碼轉(zhuǎn)化成“字節(jié)串”，然后再把“字節(jié)串”通過一種指定的傳輸編碼（Content-Transfer-Encoding）進(jìn)行轉(zhuǎn)化得到另一串“字節(jié)串”。比如，打開一封電子郵件源代碼，可以看到類似的內(nèi)容：

Content-Type: text/plain;
??????? charset="gb2312"
Content-Transfer-Encoding: base64

sbG+qcrQuqO17cf4yee74bGjz9W7+b3wudzA7dbQ0MQNCg0KvPKzxqO6uqO17cnnsaPW0NDEDQoNCg==

最常用的 Content-Transfer-Encoding 有 Base64 和 Quoted-Printable 兩種。在對(duì)二進(jìn)制文件或者中文文本進(jìn)行轉(zhuǎn)化時(shí)，Base64 得到的“字節(jié)串”比 Quoted-Printable 更短。在對(duì)英文文本進(jìn)行轉(zhuǎn)化時(shí)，Quoted-Printable 得到的“字節(jié)串”比 Base64 更短。

郵件的標(biāo)題，用了一種更簡短的格式來標(biāo)注“字符編碼”和“傳輸編碼”。比如，標(biāo)題內(nèi)容為 "中"，則在郵件源代碼中表示為：

// 正確的標(biāo)題格式
Subject: =?GB2312?B?1tA=?=

其中，

第一個(gè)“=?”與“?”中間的部分指定了字符編碼，在這個(gè)例子中指定的是 GB2312。
“?”與“?”中間的“B”代表 Base64。如果是“Q”則代表 Quoted-Printable。
最后“?”與“?=”之間的部分，就是經(jīng)過 GB2312 轉(zhuǎn)化成字節(jié)串，再經(jīng)過 Base64 轉(zhuǎn)化后的標(biāo)題內(nèi)容。

如果“傳輸編碼”改為 Quoted-Printable，同樣，如果標(biāo)題內(nèi)容為 "中"：

// 正確的標(biāo)題格式
Subject: =?GB2312?Q?=D6=D0?=

如果閱讀郵件時(shí)出現(xiàn)亂碼，一般是因?yàn)椤白址幋a”或“傳輸編碼”指定有誤，或者是沒有指定。比如，有的發(fā)郵件組件在發(fā)送郵件時(shí)，標(biāo)題 "中"：

// 錯(cuò)誤的標(biāo)題格式
Subject: =?ISO-8859-1?Q?=D6=D0?=

這樣的表示，實(shí)際上是明確指明了標(biāo)題為 [0x00D6, 0x00D0]，即 "?D"，而不是 "中"。

4. 幾種錯(cuò)誤理解的糾正

誤解：“ISO-8859-1 是國際編碼？”

非也。iso-8859-1 只是單字節(jié)字符集中最簡單的一種，也就是“字節(jié)編號(hào)”與“UNICODE 字符編號(hào)”一致的那種編碼規(guī)則。當(dāng)我們要把一個(gè)“字節(jié)串”轉(zhuǎn)化成“字符串”，而又不知道它是哪一種 ANSI 編碼時(shí)，先暫時(shí)地把“每一個(gè)字節(jié)”作為“一個(gè)字符”進(jìn)行轉(zhuǎn)化，不會(huì)造成信息丟失。然后再使用 bytes = string.getBytes("iso-8859-1") 的方法可恢復(fù)到原始的字節(jié)串。

誤解：“Java 中，怎樣知道某個(gè)字符串的內(nèi)碼？”

Java 中，字符串類 java.lang.String 處理的是 UNICODE 字符串，不是 ANSI 字符串。我們只需要把字符串作為“抽象的符號(hào)的串”來看待。因此不存在字符串的內(nèi)碼的問題。

posted on 2006-04-12 19:33 Jeff-Chen 閱讀(1542) 評(píng)論(2) 編輯收藏引用

評(píng)論

# re: 字符，字節(jié)和編碼的區(qū)別(亂碼解決方案之一) 2006-04-12 21:46 Stone Jiang

好文章回復(fù) 更多評(píng)論

# re: 字符，字節(jié)和編碼的區(qū)別(亂碼解決方案之一) 2007-09-04 16:15 mapping

如下代碼生成了test文件，打開之后文件是亂碼，這算不算正常？如果生成兩個(gè)文件，現(xiàn)在要比較兩個(gè)
文件是否相同，該怎么辦？
) #H ? 刧酛 l= ? 畆 Ri 恄 I 駇馴籄 ? ? ? ? ? < 噡 9 > $ ^0
D I M 稭 G 轙 ? - M 萂 Cd 籪婤 ? p ] Zz }v E 8 %; ]n ? 薱黭 ? ? EN ;2 "
& 塳
0 ? 甐 2 歶 P# ? @K xX 6k 齖 > I 2_ ? ? }

sprintf(srcFile, "E:\\test", srcFile);

FILE *src = fopen(srcFile, "wb");
if (src)
{
msg.Format("Create %s\r\n", srcFile);
TestLog(strLog,msg.GetBuffer());
rewind(src);
for (int i=0; i < 1024 * 1024 * 10; i++)
{
int x = rand();
fwrite(&x, sizeof(int), 1, src);
}

fclose(src);
} 回復(fù) 更多評(píng)論

刷新評(píng)論列表

只有注冊用戶登錄后才能發(fā)表評(píng)論。




網(wǎng)站導(dǎo)航: 博客園 IT新聞 BlogJava 博問 Chat2DB 管理

青青草原综合久久大伊人导航_色综合久久天天综合_日日噜噜夜夜狠狠久久丁香五月_热久久这里只有精品

<ins id="pjuwb"></ins>

<blockquote id="pjuwb"><pre id="pjuwb"></pre></blockquote>

<noscript id="pjuwb"></noscript>

<sup id="pjuwb"><pre id="pjuwb"></pre></sup>

<dd id="pjuwb"></dd>

<abbr id="pjuwb"></abbr>

欧美一区=区| 影音先锋亚洲视频| 久久九九有精品国产23| 久久免费精品日本久久中文字幕| 蜜桃av一区二区三区| 国产精品久久久久一区二区三区共| 国产视频一区免费看| 日韩视频精品| 免费人成网站在线观看欧美高清| 99re热这里只有精品视频| 欧美资源在线| 国产伦精品一区二区三区免费迷| 在线成人激情黄色| 亚洲欧美三级伦理| 99精品视频免费观看视频| 久久一二三四| 国产一区亚洲| 久久精品成人一区二区三区| 亚洲国产天堂久久综合网| 亚洲影院在线| 欧美日韩国产一区二区| 亚洲激情一区| 久久一综合视频| 亚洲在线第一页| 欧美精品1区2区3区| 欧美视频一区二区| 日韩一区二区精品| 久久狠狠婷婷| 亚洲午夜羞羞片| 欧美日韩亚洲网| 一本色道久久综合一区| 蜜桃av综合| 另类欧美日韩国产在线| 激情伊人五月天久久综合| 欧美专区在线观看| 久久福利视频导航| 精品成人在线视频| 免费看黄裸体一级大秀欧美| 亚洲欧美影音先锋| 国内久久精品| 免费h精品视频在线播放| 午夜一区二区三区在线观看| 狠狠久久亚洲欧美| 久久综合国产精品台湾中文娱乐网| 午夜免费电影一区在线观看| 激情综合中文娱乐网| 麻豆精品在线视频| 欧美国产视频在线| 久久国产精品一区二区三区| 久久久999精品免费| 亚洲激情六月丁香| 午夜精品久久久久| 伊人久久av导航| 亚洲国产精品综合| 亚洲视频在线一区观看| 在线亚洲精品| 亚洲午夜高清视频| 亚洲欧美在线磁力| 亚洲国产日韩欧美在线99| 欧美www在线| 欧美成人一区二区三区片免费| av成人动漫| 亚洲一区二区三区免费在线观看 | 亚洲国产精品一区制服丝袜| 免费在线亚洲欧美| 国内外成人在线视频| 欧美激情一区二区三区在线| 欧美日韩国产综合网| 亚洲精品一区二区三区不| 亚洲午夜精品久久久久久app| 国产亚洲网站| 欧美激情一区二区三区四区| 国产精品国产成人国产三级| 久久黄色影院| 欧美一区激情| 精品999成人| 一区二区三区高清在线观看| 韩国三级电影久久久久久| 久久久久免费| 国产精品久久久久久久午夜片| 久久综合图片| 一区二区欧美国产| 亚洲福利小视频| 亚洲一区二区在| 一区二区三区免费网站| 久久久国产精品一区二区中文 | 美女久久一区| 久久午夜精品| 国产精品久久777777毛茸茸| 麻豆freexxxx性91精品| 国产精品日韩久久久| 亚洲黄色在线| 黄色精品一区二区| 亚洲欧美自拍偷拍| 在线一区免费观看| 老司机一区二区三区| 久久久久国产成人精品亚洲午夜| 欧美日韩亚洲激情| 亚洲二区在线视频| 亚洲丁香婷深爱综合| 欧美在线一区二区三区| 亚洲欧美激情视频| 国产精品vvv| 亚洲精品美女在线观看| 国产精品久久久久久久电影| 亚洲人成网站在线播| 在线观看视频一区二区欧美日韩 | 亚洲国产乱码最新视频| 欧美激情精品久久久| 国内精品一区二区三区| 亚洲一区免费视频| 日韩午夜激情av| 老司机一区二区| 欧美成人日本| 亚洲精品一品区二品区三品区| 久久香蕉精品| 亚洲欧美综合国产精品一区| 国产精品美女在线观看| 在线一区二区三区做爰视频网站| 一本一本久久a久久精品综合麻豆一本一本久久a久久精品牛牛影视 | 欧美精品自拍偷拍动漫精品| 亚洲人体大胆视频| 99精品国产热久久91蜜凸| 欧美亚洲免费电影| 免费在线观看日韩欧美| 在线观看日韩欧美| 欧美区一区二| 夜夜嗨av一区二区三区免费区| 在线天堂一区av电影| 国产精品国产三级国产专播品爱网 | 欧美在线在线| 美女图片一区二区| 伊人久久噜噜噜躁狠狠躁| 欧美不卡三区| 久久精品国产一区二区三区| 国产亚洲亚洲| 亚洲欧美日韩国产| 亚洲成色www久久网站| 亚洲精选在线| 国产精品一区二区黑丝| 久久国产成人| 亚洲网站在线观看| 国产精品天美传媒入口| 欧美一区二区三区免费视| 欧美激情一区二区在线| 亚洲毛片网站| 欧美风情在线| 亚洲一区二三| 免播放器亚洲| 亚洲欧美在线免费观看| 激情文学综合丁香| 国产精品xvideos88| 欧美夜福利tv在线| 欧美一区午夜视频在线观看| 亚洲国产精品高清久久久| 欧美日韩成人激情| 久久色中文字幕| 在线视频日韩精品| 久久资源av| 亚洲一区二区三区久久| 国产尤物精品| 国产精品久久国产愉拍| 蜜臀a∨国产成人精品| 亚洲一区中文| 亚洲精品在线免费| 久久久久国色av免费观看性色| a4yy欧美一区二区三区| 国产主播一区二区三区| 欧美一区二区成人| 国产精品一区二区三区观看| 久久九九热免费视频| 亚洲视频你懂的| 日韩亚洲欧美高清| 亚洲成人在线视频网站| 久久久久成人精品免费播放动漫| 亚洲一区精彩视频| 亚洲视频导航| 一本久久a久久免费精品不卡| 91久久国产综合久久| 一区一区视频| 国产综合视频| 国产日韩综合| 国产日韩亚洲| 国产一区二区精品在线观看| 国产精品欧美经典| 国产欧美日韩在线观看| 国产精品亚洲аv天堂网| 欧美三级免费| 国产精品久久久久久久久久久久| 欧美视频精品在线| 国产精品超碰97尤物18| 国产精品久久久久久久久久妞妞| 国产精品国产自产拍高清av王其 | 久久综合99re88久久爱| 美女精品在线| 欧美精品在线极品| 国产精品草莓在线免费观看| 国产精品久久久久天堂| 欧美三区在线| 国产亚洲一区在线播放|

<kbd id="q4keu"><noscript id="q4keu"></noscript></kbd>

<li id="q4keu"><menu id="q4keu"></menu></li>

<s id="q4keu"></s>

<table id="q4keu"><source id="q4keu"></source></table>

<abbr id="q4keu"><code id="q4keu"></code></abbr>

<li id="q4keu"><menu id="q4keu"></menu></li>

<strike id="q4keu"><kbd id="q4keu"></kbd></strike><input id="q4keu"><tbody id="q4keu"></tbody></input><abbr id="q4keu"></abbr>