您好,登錄后才能下訂單哦!
本文章向大家介紹使用Python怎么將文本中的中英文進(jìn)行分離,主要包括使用Python怎么將文本中的中英文進(jìn)行分離的使用實(shí)例、應(yīng)用技巧、基本知識點(diǎn)總結(jié)和需要注意事項(xiàng),具有一定的參考價值,需要的朋友可以參考一下。
Python是一種編程語言,內(nèi)置了許多有效的工具,Python幾乎無所不能,該語言通俗易懂、容易入門、功能強(qiáng)大,在許多領(lǐng)域中都有廣泛的應(yīng)用,例如最熱門的大數(shù)據(jù)分析,人工智能,Web開發(fā)等。
1、超短文本,ASCII識別。
s = "China's Legend Holdings will split its several business arms to go public on stock markets, the group's president Zhu Linan said on Tuesday.該集團(tuán)總裁朱利安周二表示,中國聯(lián)想控股將分拆其多個業(yè)務(wù)部門在股市上市。" result = "".join(i for i in s if ord(i) < 256) print(result)
out: China's Legend Holdings will split its several business arms to go public on stock markets, the group's president Zhu Linan said on Tuesday.
2、unicode編碼識別
import re s = "China's Legend Holdings will split its several business arms to go public on stock markets, the group's president Zhu Linan said on Tuesday.該集團(tuán)總裁朱利安周二表示,中國聯(lián)想控股將分拆其多個業(yè)務(wù)部門在股市上市。" uncn = re.compile(r'[\u0061-\u007a,\u0020]') en = "".join(uncn.findall(s.lower())) print(en)
out: chinas legend holdings will split its several business arms to go public on stock markets, the groups president zhu linan said on tuesday
中文的編碼范圍是:\u4e00-\u9fa5,相應(yīng)的[^\u4e00-\u9fa5]可匹配非中文。
匹配英文時,需要將空格[\u0020]加入,不然單詞之間沒空格了。
到此這篇關(guān)于使用Python怎么將文本中的中英文進(jìn)行分離的文章就介紹到這了,更多相關(guān)的內(nèi)容請搜索億速云以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持億速云!
免責(zé)聲明:本站發(fā)布的內(nèi)容(圖片、視頻和文字)以原創(chuàng)、轉(zhuǎn)載和分享為主,文章觀點(diǎn)不代表本網(wǎng)站立場,如果涉及侵權(quán)請聯(lián)系站長郵箱:is@yisu.com進(jìn)行舉報,并提供相關(guān)證據(jù),一經(jīng)查實(shí),將立刻刪除涉嫌侵權(quán)內(nèi)容。