小编cod*_*yfe的帖子

如何从网站上使用Beautiful Soup(python)递归获取所有链接

我希望能够以递归方式从网站获取所有链接,然后按照这些链接获取这些网站的所有链接.深度应为5-10,以便返回它找到的所有链接的数组.最好使用美丽的汤/蟒蛇.谢谢!

到目前为止,我已经尝试了这个并且它不起作用....任何帮助将不胜感激.

from BeautifulSoup import BeautifulSoup
import urllib2

def getLinks(url):
    if (len(url)==0):
        return [url]
    else:
        files = [ ]
        page=urllib2.urlopen(url)
        soup=BeautifulSoup(page.read())
        universities=soup.findAll('a',{'class':'institution'})
        for eachuniversity in universities:
           files+=getLinks(eachuniversity['href'])
        return files

print getLinks("http://www.utexas.edu/world/univ/alpha/")
Run Code Online (Sandbox Code Playgroud)

python beautifulsoup

7
推荐指数
1
解决办法
1万
查看次数

标签 统计

beautifulsoup ×1

python ×1