我有一个字符串,我想用一个星号替换任何非标准字符或数字的字符,如(az或0-9).例如,"h ^&ell`.,| ow] {+ orld"被替换为"h*ell*o*w*orld".请注意,多个字符(如"^&")将替换为一个星号.我该怎么做呢?
我正在编写一个python MapReduce字数统计程序.问题是数据中散布着许多非字母字符,我发现这篇文章从Python中的字符串中删除除字母数字字符之外的所有字符,这显示了使用正则表达式的一个很好的解决方案,但我不知道如何实现它
def mapfn(k, v):
print v
import re, string
pattern = re.compile('[\W_]+')
v = pattern.match(v)
print v
for w in v.split():
yield w, 1
Run Code Online (Sandbox Code Playgroud)
我担心我不确定如何使用库re甚至正则表达式.我不确定如何正确地将正则表达式模式应用于传入的字符串(书的行)v以检索没有任何非字母数字字符的新行.
建议?
我想要一个正则表达式或其他字符串,它可以替换字符串中除字母数字字符(a-z和0-9)之外的所有字符串.所有的事情,@#$(@*810都应该被剥夺.有任何想法吗?
编辑:我现在需要这个去除一切,但允许点,所以除了a-z, 1-9, ..想法?
是否有一种简单的方法来匹配类中除了某些特定组之外的所有字符?例如,如果在我可以使用\ w来匹配所有unicode单词字符集的语言中,有没有办法从该匹配中排除像下划线"_"这样的字符?
只有想到的想法是在每个角色周围使用负向前瞻/后面,但是当我有效地想要将角色与正匹配和负匹配匹配时,这似乎比必要更复杂.例如,如果&是一个AND运算符,我可以这样做......
^(\w&[^_])+$
Run Code Online (Sandbox Code Playgroud) 从字符串中删除不在字母表中的所有字符的最佳方法是什么?我的意思是,删除所有空格,interpunction,括号,数字,数学运算符..
例如:
input: 'as32{ vd"s k!+'
output: 'asvdsk'
Run Code Online (Sandbox Code Playgroud) 嘿,我已经看到了这个链接,但在那里他们已经使用了re模块,这就是我在这里发布的原因.希望您理解并删除副本.
这是链接.我想用re模块.
表:
A B C D
1 Q! W@ 2
2 1$ E% 3
3 S2# D! 4
Run Code Online (Sandbox Code Playgroud)
在这里,我想从column B和删除特殊字符C.我已经使用.transform()但我想re尽可能使用它,但我收到了错误.
输出:
A B C D E F
1 Q! W@ 2 Q W
2 1$ E% 3 1 E
3 S2# D! 4 S2 D
Run Code Online (Sandbox Code Playgroud)
我的代码:
df['E'] = df['B'].str.translate(None, ",!.; -@!%^&*)(")
Run Code Online (Sandbox Code Playgroud)
它只有在我知道什么是特殊字符时才有用.
但我想使用re哪种方式最好.
import re
#re.sub(r'\W+', '', your_string)
df['E'] = re.sub(r'\W+', '', df['B'].str) …Run Code Online (Sandbox Code Playgroud) 我有以下字符串:
string = """
Hello World
123
HelloWorld
"""
Run Code Online (Sandbox Code Playgroud)
我想清除python中字符串的所有换行符.
我试过了
string.strip()
Run Code Online (Sandbox Code Playgroud)
但它没有按预期工作.
我该做什么?
我正在使用python 3.3
谢谢.
我有一个字符串,我正在尝试删除所有不是字母数字的字符,也不在此集合中
'''!$%*()_-=+\/.,><:;'"?|'''.
Run Code Online (Sandbox Code Playgroud)
我知道这会删除所有非字母数字字符,但我怎样才能做得更好?
re.sub(r'\W+','',line)
Run Code Online (Sandbox Code Playgroud) 我读到了这一点: 从Python中的字符串中删除除字母数字字符之外的所有内容
不太明白,但我尝试了一下我自己的代码,现在看起来像这样:
import re
decrypt = str(open("crypt.txt"))
crypt = re.sub(r'([^\s\w]|_)+', '', decrypt)
print(crypt)
Run Code Online (Sandbox Code Playgroud)
当我运行脚本时它回来了这个答案: C:\ Users\Adrian\Desktop\python> python tick.py ioTextIOWrapper namecrypttxt moder encodingcp1252
我试图从文档中删除所有额外的代码,只需保留数字和字母,在文档中可以找到以下文本:http://pastebin.com/Hj3SjhxC
我正在尝试解决这里的任务:http: //www.pythonchallenge.com/pc/def/ocr.html
任何人都知道"ioTextIOWrapper namecrypttxt moder encodingcp1252"是什么意思?我应该如何格式化代码以正确删除除字母和数字之外的所有内容?
诚挚
我想知道如何实现字符串检查,我想确保字符串的第一个(和最后一个)字符是字母数字.我知道isalnum,但我如何使用它来实现这个检查/替换?
所以,我有一个像这样的字符串:
st="-jkkujkl-ghjkjhkj*"
Run Code Online (Sandbox Code Playgroud)
我想要回来:
st="jkkujkl-ghjkjhkj"
Run Code Online (Sandbox Code Playgroud)
谢谢..
我想删除所有特殊字符,例如“|”、“.” 或字符串中的“$”。
这是我的代码:
string= '#$#&^&#$@||||123515'
re.sub(r'[^a-zA-Z0-9]', '', string)
print(string)
Run Code Online (Sandbox Code Playgroud)
输出:
#$#&^&#$@||||123515
Run Code Online (Sandbox Code Playgroud)
我知道这个正则表达式意味着删除除 number、az 和 AZ 之外的所有内容。
但它无法删除所有特殊字符。
有人能告诉我为什么吗?谢谢你!:)
python ×9
regex ×6
string ×4
formatting ×1
pandas ×1
php ×1
python-2.7 ×1
python-3.x ×1
strip ×1