跳过带有扩展名pdf的网页,在Anemone中抓取来自zip

Bhu*_*dha 3 ruby web-crawler ruby-on-rails-3 ruby-on-rails-3.1 anemone

我正在使用海葵宝石(Ruby-1.8.7和Rails 3.1.1)开发爬虫.如何从抓取/下载中跳过带有扩展名pdf,doc,zip等的网页.

sun*_*eja 8

ext = %w(flv swf png jpg gif asx zip rar tar 7z gz jar js css dtd xsd ico raw mp3 mp4 wav wmv ape aac ac3 wma aiff mpg mpeg avi mov ogg mkv mka asx asf mp2 m1v m3u f4v pdf doc xls ppt pps bin exe rss xml)

Anemone.crawl(url) do |anemone|

    anemone.skip_links_like /\.#{ext.join('|')}$/

    ...

end
Run Code Online (Sandbox Code Playgroud)

  • 你应该将你的正则表达式锚定到最后,否则会跳过像`http:// example.org/how-to-generate-pdf.html`这样的网址.点也应该被转义.怎么样`ext =%w(pdf doc etc ...)`和`anemone.skip_links_like /\ .# {ext.join('|')} $ /` (2认同)