有效地在字符串中查找重复的字符

Chi*_*rk 5 python string performance

我知道这段代码的效率不是最优的(尤其是巨大的输入),我知道有一种方法可以改变这种算法来处理其他数据类型,而不仅仅是字符串中的重复(显然只有这样)要搜索的很多字符).

有什么方法可以提高效率吗?

我尝试使用字典,并且函数保持返回'none',所以我尝试了一个列表,事情很好.

提前感谢任何可以帮助我的人!

def find_repeater(string):
    my_list = []
    my_list.append(string[0])

    for i in range (1, len(string)):

        if string[i] in my_list:
            print 'repetition found'
            return (string[i])

        else:
            my_list.append(string[i])

print find_repeater('abca')  
Run Code Online (Sandbox Code Playgroud)

现在用字典....(它一直打印'无'到控制台)

def find_repeater(string):
    my_dict = {}
    my_dict[0] = string[0]

    for i in range (1, len(string)):

        if string[i] in my_dict:
            print 'repetition found'
            return string[i]

        else:
            my_dict[i] = string[i]

print find_repeater('abca')  
Run Code Online (Sandbox Code Playgroud)

geo*_*org 10

由于这是一个性能问题,让我们做一些时间:

def test_set(xs):
    seen = set()  # O(1) lookups
    for x in xs:
        if x not in seen:
            seen.add(x)
        else:
            return x

import collections

def test_counter(xs):
    freq = collections.Counter(xs)
    for k in freq:
        if freq[k] > 1:
            return k

def test_dict(xs):
    d = {}
    for x in xs:
        if x in d:
            return x
        d[x] = 1

def test_sort(xs):
    ys = sorted(xs)

    for n in range(1, len(xs)):
        if ys[n] == ys[n-1]:
            return ys[n]

##

import sys, timeit
print (sys.version + "\n")
xs = list(range(10000)) + [999]
fns = [p for name, p in globals().items() if name.startswith('test')]
for fn in fns:
    assert fn(xs) == 999
    print ('%50s %.5f' % (fn, timeit.timeit(lambda: fn(xs), number=100)))
Run Code Online (Sandbox Code Playgroud)

我正在测试一个整数列表而不是一个字符串(因为有一个字符串,你不能超过256个循环).我的机器上的结果如下所示:

3.2.3 (v3.2.3:3d0686d90f55, Apr 10 2012, 11:25:50) 
[GCC 4.2.1 (Apple Inc. build 5666) (dot 3)]

                <function test_set at 0x1020f7380> 0.19265
               <function test_dict at 0x1020f7490> 0.12725
               <function test_sort at 0x1020f7518> 0.04683
            <function test_counter at 0x1020f7408> 0.92485
Run Code Online (Sandbox Code Playgroud)

所以排序方法似乎是胜利者.我想这是因为它不浪费时间创建哈希并分配字典/集结构.此外,如果您不关心要更改的源列表,您可以xs.sort()代替ys = sorted(xs),这样可以减少内存占用.

另一方面,如果重复的项目更可能发生在输入的开头(如xs = 'abcdef' * 10000),则该set方法将执行最佳,因为它不同于sortCounter一旦发现重复就立即返回并且不需要预处理整个列表.set如果您需要第一个重复元素,也应该使用它,而不仅仅是其中之一.

Counter 是一个很好的工具,但它并不是为性能而设计的,所以如果你真的需要处理"巨大的输入",那么请使用集合(如果它们适合内存)或者如果它们不适合则进行合并.

  • 在此示例中,排序是否具有优势,因为您已经拥有一个对除一个值之外的所有值进行排序的列表?在设置 xs 之后放置 random.shuffle(xs) 会使 sort 表现最差,或者与计数器并列。 (2认同)