我想将一个字符串列表连接成一个按列表中的值分组的新字符串.这是我的意思的一个例子:
输入
key = ['1','2','2','3']
data = ['a','b','c','d']
Run Code Online (Sandbox Code Playgroud)
结果
newkey = ['1','2','3']
newdata = ['a','b c','d']
Run Code Online (Sandbox Code Playgroud)
我理解如何加入文字.但我不知道如何正确迭代列表的值以聚合相同键值共有的字符串.
任何帮助或建议表示赞赏.谢谢.
我有一个包含8000个字符串(stop_words)的列表,以及一个包含各种长度的100,000个字符串的列表,其中包含数百万个单词.我正在使用该函数来标记100,000个字符串,并从列表stop_words中排除非字母数字标记和标记.
def tokenizer(text):
return [stemmer.stem(tok.lower()) for tok in nltk.word_tokenize(text)/
if tok.isalpha() and tok.lower() not in stop_words]
Run Code Online (Sandbox Code Playgroud)
我已经使用600个字符串测试了这段代码,需要60秒.如果我删除条件以排除停用词,则在相同的600个字符串上需要1秒钟
def tokenizer(text):
return [stemmer.stem(tok.lower()) for tok in nltk.word_tokenize(text)/
if tok.isalpha()]
Run Code Online (Sandbox Code Playgroud)
我希望有一种更有效的方法可以从另一个列表中排除一个列表中的项目.
我很感激任何帮助或建议
谢谢