小编Ant*_*esy的帖子

网页抓取:页面存在,但使用 requests/urllib 获取 404

我正在尝试抓取以下页面: http://usbcdirectory.com/listing/1-us-black-chambers

我正在使用Python 3.5.0

这是我的代码:

urllib.request.urlopen('http://usbcdirectory.com/listing/1-us-black-chambers')
Run Code Online (Sandbox Code Playgroud)

使用上面的内容我收到 404 未找到错误。但是,当我从浏览器打开该页面时,该页面存在。

我尝试寻找这个问题的解决方案,这是我发现的:

  1. 将 urllib 更改为 requests:我已经这样做了,并且状态代码中出现 404 错误
>>>requests.get('http://usbcdirectory.com/listing/1-us-black-chambers')
    
Request <404>
Run Code Online (Sandbox Code Playgroud)
  1. 我检查了我的链接是正确的

  2. 我试图查明该页面是否是使用 JavaScript 生成的。我相信事实并非如此。

这里的网页有什么问题吗?他们是否以某种方式阻止抓取,或者是 URL 的问题?

web-scraping python-3.x

3
推荐指数
1
解决办法
5233
查看次数

标签 统计

python-3.x ×1

web-scraping ×1