这样算吗?121238asdf<img class="BDE_Image" src="https://imgsa.baidu.com/forum/w%3D580/sign=da0493cd90ef76c6d0d2fb23ad14fdf6/e483aa4bd11373f0bddb2e73a40f4bfbf9ed04b1.jpg" width="560" height="420">
字符串如上,类型是'str',要正则获得汉字。我之前使用[u4e00-u9fa5]结果获得的还是英文,符号跟数字的list。求教导正确姿势。另外说说我哪里写错了..
pattern = re.compile(r'[\u4E00-\u9FA5]')
print pattern.findall(x[1])
这是我写的...但是返回结果就没有汉字,反而是除汉字外的其他字符。
我这里假设你需要匹配的文本为
s
:这里的
decode('utf8')
是怕s的值为类似x66x77x88
这样的Unicode散列。另外,需要注意compile()
中ur
修饰符,u
为Unicode修饰符。PS:我是从这篇文章得到的启发。
Update
刚才看了下楼下说的,确实用Python 3就不存在输出为Unicode散列的情况了,以下摘自此处
你用的是python2,
uxxxx
是unicode字符,匹配后得到的是字节
串,print出来是各个字节值。换python
3
就没这个问题了