我希望能够以递归方式从网站获取所有链接,然后按照这些链接获取这些网站的所有链接.深度应为5-10,以便返回它找到的所有链接的数组.最好使用美丽的汤/蟒蛇.谢谢!
到目前为止,我已经尝试了这个并且它不起作用....任何帮助将不胜感激.
from BeautifulSoup import BeautifulSoup
import urllib2
def getLinks(url):
if (len(url)==0):
return [url]
else:
files = [ ]
page=urllib2.urlopen(url)
soup=BeautifulSoup(page.read())
universities=soup.findAll('a',{'class':'institution'})
for eachuniversity in universities:
files+=getLinks(eachuniversity['href'])
return files
print getLinks("http://www.utexas.edu/world/univ/alpha/")
Run Code Online (Sandbox Code Playgroud)