<sup id="m9t4s"></sup>

<small id="m9t4s"></small>

<sup id="m9t4s"></sup>

<td id="m9t4s"><nav id="m9t4s"></nav></td>

溫馨提示×

溫馨提示×

您好，登錄后才能下訂單哦！

密碼登錄×

忘記密碼？

登錄注冊×

獲取短信驗證碼

其他方式登錄

點擊登錄注冊即表示同意《億速云用戶服務(wù)條款》

用戶登錄×

賬戶密碼登錄

請使用微信掃描上方二維碼

使用幫助

請求超時！

請點擊重新獲取二維碼

如何解決python utf-8 問題

發(fā)布時間：2021-10-14 14:48:54 來源：億速云閱讀：146 作者：柒染欄目：編程語言

本篇文章為大家展示了如何解決python utf-8 問題，內(nèi)容簡明扼要并且容易理解，絕對能使你眼前一亮，通過這篇文章的詳細介紹希望你能有所收獲。

中文編碼問題是用中文的程序員經(jīng)常頭大的問題，在python下也是如此，那么應(yīng)該怎么理解和解決python的編碼問題呢？

我們要知道python內(nèi)部使用的是unicode編碼，而外部卻要面對千奇百怪的各種編碼，比如作為中國程序經(jīng)常要面對的gbk，gb2312，utf8等，那這些編碼是怎么轉(zhuǎn)換成內(nèi)部的unicode呢？

首先我們先看一下源代碼文件中使用字符串的情況。源代碼文件作為文本文件就必然是以某種編碼形式存儲代碼的，python默認會認為源代碼文件是asci編碼，比如說代碼中有一個變量賦值：

s1=’a’
print s1

python認為這個’a'就是一個asci編碼的字符。在僅僅使用英文字符的情況下一切正常，但是如果用了中文，比如：

s1=’哈’
print s1

這個代碼文件被執(zhí)行時就會出錯，就是編碼出了問題。python默認將代碼文件內(nèi)容當作asci編碼處理，但asci編碼中不存在中文，因此拋出異常。

解決問題之道就是要讓python知道文件中使用的是什么編碼形式，對于中文，可以用的常見編碼有utf-8，gbk和gb2312等。只需在代碼文件的最前端添加如下：

# -*- coding: utf-8
-*-

這就是告知python我這個文件里的文本是用utf-8編碼的，這樣，python就會依照utf-8的編碼形式解讀其中的字符，然后轉(zhuǎn)換成unicode編碼內(nèi)部處理使用。

不過，如果你在Windows控制臺下運行此代碼的話，雖然程序是執(zhí)行了，但屏幕上打印出的卻不是哈字。這是由于python編碼與控制臺編碼的不一致造成的。Windows下控制臺中的編碼使用的

是gbk，而在代碼中使用的utf-8，python按照utf-8編碼打印到gbk編碼的控制臺下自然就會不一致而不能打印出正確的漢字。

解決辦法一個是將源代碼的編碼也改成gbk，也就是代碼第一行改成：

# -*- coding: gbk
-*-

另一種方法是保持源碼文件的utf-8不變，而是在’哈’前面加個u字，也就是:

s1=u’哈’
print s1

這樣就可以正確打印出’哈’字了。

這里的這個u表示將后面跟的字符串以unicode格式存儲。python會根據(jù)代碼第一行標稱的utf-8編碼識別代碼中的漢字’哈’，然后轉(zhuǎn)換成unicode對象。如果我們用type查看一下’哈’的數(shù)據(jù)類

型type(‘哈’)，會得到，而type(u’哈’)，則會得到，也就是在字符前面加u就表明這是一個unicode對象，這個字會以unicode格式存在于內(nèi)存中，而如果不加u

，表明這僅僅是一個使用某種編碼的字符串，編碼格式取決于python對源碼文件編碼的識別，這里就是utf-8。

Python在向控制臺輸出unicode對象的時候會自動根據(jù)輸出環(huán)境的編碼進行轉(zhuǎn)換，但如果輸出的不是unicode對象而是普通字符串，則會直接按照字符串的編碼輸出字符串，從而出現(xiàn)上面的現(xiàn)

象。

使用unicode對象的話，除了這樣使用u標記，還可以使用unicode類以及字符串的encode和decode方法。

unicode類的構(gòu)造函數(shù)接受一個字符串參數(shù)和一個編碼參數(shù)，將字符串封裝為一個unicode，比如在這里，由于我們用的是utf-8編碼，所以unicode中的編碼參數(shù)使用’utf-8′將字符封裝為

unicode對象，然后正確輸出到控制臺：

s1=unicode(‘哈’,
‘utf-8′)
print s1

另外，用decode函數(shù)也可以將一個普通字符串轉(zhuǎn)換為unicode對象。很多人都搞不明白python字符串的decode和encode函數(shù)都是什么意思。這里簡要說明一下。

decode是將普通字符串按照參數(shù)中的編碼格式進行解析，然后生成對應(yīng)的unicode對象，比如在這里我們代碼用的是utf-8，那么把一個字符串轉(zhuǎn)換為unicode就是如下形式：

s2=’哈’.decode(‘utf-8′)

這時，s2就是一個存儲了’哈’字的unicode對象，其實就和unicode(‘哈’,
‘utf-8′)以及u’哈’是相同的。

那么encode正好就是相反的功能，是將一個unicode對象轉(zhuǎn)換為參數(shù)中編碼格式的普通字符，比如下面代碼：

s3=unicode(‘哈’,
‘utf-8′).encode(‘utf-8′)

s3現(xiàn)在又變回了utf-8的’哈’。

上述內(nèi)容就是如何解決python utf-8 問題，你們學到知識或技能了嗎？如果還想學到更多技能或者豐富自己的知識儲備，歡迎關(guān)注億速云行業(yè)資訊頻道。

向AI問一下細節(jié)

推薦閱讀：

免責聲明：本站發(fā)布的內(nèi)容（圖片、視頻和文字）以原創(chuàng)、轉(zhuǎn)載和分享為主，文章觀點不代表本網(wǎng)站立場，如果涉及侵權(quán)請聯(lián)系站長郵箱：is@yisu.com進行舉報，并提供相關(guān)證據(jù)，一經(jīng)查實，將立刻刪除涉嫌侵權(quán)內(nèi)容。

上一篇新聞：
如何用android代碼設(shè)置、打開wifi熱點及熱點的連接
下一篇新聞：
如何將Fizz Gateway網(wǎng)關(guān)接入到gRPC中

猜你喜歡

AI
助
手

產(chǎn)品服務(wù)

地區(qū)劃分

專題活動

幫助支持

關(guān)于我們

售后咨詢

7*24小時在線電話：400-100-2938

7*24小時在線 QQ：800811969

關(guān)注億速云

億速云公眾號

手機網(wǎng)站二維碼