Python实现全角半角字符互转的方法--688IT编程网

Python实现全⾓半⾓字符互转的⽅法

前⾔

相信对于每⼀个编程⼈员来说，在⽂本处理的时候，经常会遇到全⾓半⾓不⼀致的问题。于是需要程序能够快速的在两者之间互转。由于全⾓半⾓本⾝存在着映射关系，所以处理起来并不复杂。

具体规则为：

全⾓字符unicode编码从65281~65374 （⼗六进制 0xFF01 ~ 0xFF5E）

半⾓字符unicode编码从33~126 （⼗六进制 0x21~ 0x7E）

空格⽐较特殊，全⾓为 12288（0x3000），半⾓为 32（0x20）

⽽且除空格外，全⾓/半⾓按unicode编码排序在顺序上是对应的（半⾓ + 65248 = 全⾓）

所以可以直接通过⽤+-法来处理⾮空格数据，对空格单独处理。

⽤到的⼀些函数

chr()函数⽤⼀个范围在range（256）内的（就是0～255）整数作参数，返回⼀个对应的字符。

unichr()跟它⼀样，只不过返回的是Unicode字符。

ord()函数是chr()函数或unichr()函数的配对函数，它以⼀个字符（长度为1的字符串）作为参数，返回对应的ASCII数值，或者Unicode数值。

先来打印下映射关系：

1 2for i in xrange(33,127):

print i,chr(i),i+65248,unichr(i+65248)

返回结果

1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 3433! 65281！34" 65282＂35# 65283 ＃36$ 65284＄37%65285％38& 65286＆39' 65287＇40( 65288（41) 65289）42*65290＊43+65291＋44, 65292，45-65293－46. 65294．47/65295／48065296０49165297１50265298２51365299３52465300４53565301５54665302６55765303７56865304８57965305９58: 65306：59; 65307；60< 65308＜61=65309＝62> 65310＞63? 65311？64@ 65312＠65A 65313Ａ66B 65314Ｂ

34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 9466B 65314Ｂ67C 65315Ｃ68D 65316Ｄ69E 65317Ｅ70F 65318Ｆ71G 65319Ｇ72H 65320Ｈ73I 65321Ｉ74J 65322Ｊ75K 65323Ｋ76L 65324Ｌ77M 65325Ｍ78N 65326Ｎ79O 65327Ｏ80P 65328Ｐ81Q 65329Ｑ82R 65330Ｒ83S 65331Ｓ84T 65332Ｔ85U 65333Ｕ86V 65334Ｖ87W 65335Ｗ88X 65336Ｘ89Y 65337Ｙ90Z 65338Ｚ91[ 65339［92\ 65340＼93] 65341］94^ 65342＾95_ 65343＿96` 65344｀97a 65345ａ98b 65346ｂ99c 65347ｃ100d 65348ｄ101e 65349ｅ102f 65350ｆ103g 65351ｇ104h 65352ｈ105i 65353ｉ106j 65354ｊ107k 65355ｋ108l 65356ｌ109m 65357ｍ110n 65358ｎ111o 65359ｏ112p 65360ｐ113q 65361ｑ114r 65362ｒ115s 65363ｓ116t 65364ｔ117u 65365ｕ118v 65366ｖ119w 65367ｗ120x 65368ｘ121y 65369ｙ122z 65370ｚ

123{ 65371｛124| 65372｜125} 65373｝126~ 65374～

把全⾓转成半⾓：

1 2 3 4 5 6def full2half(s):

n =[]

s =s.decode('utf-8') for char in s:

num =ord(char)

if num ==0x3000:

6 7 8 9 10 11 12 if num ==0x3000:

num =32

elif0xFF01<=num <=0xFF5E: num -=0xfee0

num =unichr(num)

n.append(num)

return''.join(n)

把半⾓转成全⾓：

1 2 3 4 5 6 7 8 9 10 11 12def half2full(s):

n =[]

s =s.decode('utf-8')

for char in s:

num =char(char)

if num ==320:

num =0x3000

elif0x21<=num <=0x7E: num +=0xfee0

num =unichr(num)

n.append(num)

return''.join(n)

上⾯的实现⽅式⾮常的简单，但是现实情况下可能并不会把所以的字符统⼀进⾏转换，⽐如中⽂⽂章中我们期望将所有出现的字母和数字全部转化成半⾓，⽽常见标点符号统⼀使⽤全⾓，上⾯的转化就不适合了。

解决⽅案，是⾃定义词典。

4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41#!/usr/bin/env python

# -*- coding: utf-8 -*-

FH_SPACE =FHS =((u"　", u" "),)

FH_NUM =FHN =(

(u"０", u"0"), (u"１", u"1"), (u"２", u"2"), (u"３", u"3"), (u"４", u"4"),

(u"５", u"5"), (u"６", u"6"), (u"７", u"7"), (u"８", u"8"), (u"９", u"9"),

)

FH_ALPHA =FHA =(

(u"ａ", u"a"), (u"ｂ", u"b"), (u"ｃ", u"c"), (u"ｄ", u"d"), (u"ｅ", u"e"),

(u"ｆ", u"f"), (u"ｇ", u"g"), (u"ｈ", u"h"), (u"ｉ", u"i"), (u"ｊ", u"j"),

(u"ｋ", u"k"), (u"ｌ", u"l"), (u"ｍ", u"m"), (u"ｎ", u"n"), (u"ｏ", u"o"),

(u"ｐ", u"p"), (u"ｑ", u"q"), (u"ｒ", u"r"), (u"ｓ", u"s"), (u"ｔ", u"t"),

(u"ｕ", u"u"), (u"ｖ", u"v"), (u"ｗ", u"w"), (u"ｘ", u"x"), (u"ｙ", u"y"), (u"ｚ", u"z"),

(u"Ａ", u"A"), (u"Ｂ", u"B"), (u"Ｃ", u"C"), (u"Ｄ", u"D"), (u"Ｅ", u"E"),

(u"Ｆ", u"F"), (u"Ｇ", u"G"), (u"Ｈ", u"H"), (u"Ｉ", u"I"), (u"Ｊ", u"J"),

(u"Ｋ", u"K"), (u"Ｌ", u"L"), (u"Ｍ", u"M"), (u"Ｎ", u"N"), (u"Ｏ", u"O"),

(u"Ｐ", u"P"), (u"Ｑ", u"Q"), (u"Ｒ", u"R"), (u"Ｓ", u"S"), (u"Ｔ", u"T"),

(u"Ｕ", u"U"), (u"Ｖ", u"V"), (u"Ｗ", u"W"), (u"Ｘ", u"X"), (u"Ｙ", u"Y"), (u"Ｚ", u"Z"),

)

FH_PUNCTUATION =FHP =(

(u"．", u"."), (u"，", u","), (u"！", u"!"), (u"？", u"?"), (u"”", u'"'),

(u"'", u"'"), (u"‘", u"`"), (u"＠", u"@"), (u"＿", u"_"), (u"：", u":"),

(u"；", u";"), (u"＃", u"#"), (u"＄", u"$"), (u"％", u"%"), (u"＆", u"&"),

(u"（", u"("), (u"）", u")"), (u"‐", u"-"), (u"＝", u"="), (u"＊", u"*"),

(u"＋", u"+"), (u"－", u"-"), (u"／", u"/"), (u"＜", u"<"), (u"＞", u">"),

(u"［", u"["), (u"￥", u"\\"), (u"］", u"]"), (u"＾", u"^"), (u"｛", u"{"),

(u"｜", u"|"), (u"｝", u"}"), (u"～", u"~"),

)

FH_ASCII =HAC =lambda: ((fr, to) for m in(FH_ALPHA, FH_NUM, FH_PUNCTUATION) for fr, to in m)

HF_SPACE =HFS =((u" ", u"　"),)

HF_NUM =HFN =lambda: ((h, z) for z, h in FH_NUM)

HF_ALPHA =HFA =lambda: ((h, z) for z, h in FH_ALPHA)

HF_PUNCTUATION =HFP =lambda: ((h, z) for z, h in FH_PUNCTUATION)

HF_ASCII =ZAC =lambda: ((h, z) for z, h in FH_ASCII())

def convert(text, *maps, **ops):

""" 全⾓/半⾓转换

args:

text: unicode string need to convert

maps: conversion maps

skip: skip out of character. In a tuple or string

41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 skip: skip out of character. In a tuple or string

return: converted unicode string

"""

if"skip"in ops:

skip =ops["skip"]

if isinstance(skip, basestring):

skip =tuple(skip)

def replace(text, fr, to):

unicode字符转中文return text if fr in skip place(fr, to)

else:

def replace(text, fr, to):

place(fr, to)

for m in maps:

if callable(m):

m =m()

elif isinstance(m, dict):

m =m.items()

for fr, to in m:

text =replace(text, fr, to)

return text

if__name__ =='__main__':

text =u"成⽥空港—【ＪＲ特急成⽥エクスプレス号·横浜⾏，2站】—東京—【ＪＲ新幹線はやぶさ号·新青森⾏,6站】—新青森—【ＪＲ特急スーパー⽩⿃号·函館⾏，4站】—函館"

print convert(text, FH_ASCII, {u"【": u"[", u"】": u"]", u",": u"，", u".": u"。", u"?": u"？", u"!": u"！"}, spit="，。？！“”")

特别注意：引号在英语体系中引号是不区分前引号和后引号。

688IT编程网

Python实现全角半角字符互转的方法

发表评论

推荐文章

java正则表达式选择题

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

工龄小数点提取

非零金额正则表达式

提取文本中数字的函数

热门文章

excel文字递增函数公式

数字递增公式

notepad 正则变量运算

C++regex库常用函数及实例

js正则表达式之前瞻后顾与非捕获分组

indesign正则数字和英文之间的空格

C#匹配中文字符串的4种正则表达式分享

PHP正则表达式匹配中文字符

匹配中文汉字的正则表达式介绍

Python正则表达式如何进行字符串替换

orcl中用正则表达式

sql正则表达式excel

dataframe正则表达式

postgress sql正则

el-upload accept 正则表达式

半小时正则表达式

判断科学计数法的正则

根据url判断静态资源的方法

Java正则表达式-匹配正负浮点数

替换模糊匹配正则-hive

最新文章

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

能被5整除的十进制整数的正规表达式

大于0小于等于1的正则表达式

linux grep 26个字母

java pattern 正则表达式

掌握文本编辑器中的搜索和替换技巧

标签列表

688IT编程网

Python实现全角半角字符互转的方法

发表评论

推荐文章

java正则表达式 选择题

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

工龄小数点提取

非零金额 正则表达式

提取文本中数字的函数

热门文章

excel文字递增函数公式

数字递增公式

notepad 正则变量运算

C++regex库常用函数及实例

js正则表达式之前瞻后顾与非捕获分组

indesign正则数字和英文之间的空格

C#匹配中文字符串的4种正则表达式分享

PHP正则表达式匹配中文字符

匹配中文汉字的正则表达式介绍

Python正则表达式如何进行字符串替换

orcl中用正则表达式

sql正则表达式excel

dataframe正则表达式

postgress sql正则

el-upload accept 正则表达式

半小时 正则表达式

判断科学计数法的正则

根据url判断静态资源的方法

Java正则表达式-匹配正负浮点数

替换模糊匹配正则-hive

最新文章

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

能被5整除的十进制整数的正规表达式

大于0小于等于1的正则表达式

linux grep 26个字母

java pattern 正则表达式

掌握文本编辑器中的搜索和替换技巧

标签列表

java正则表达式选择题

非零金额正则表达式

半小时正则表达式