Python请求模块无法从Web服务器获取最新数据

Question

Python请求模块无法从Web服务器获取最新数据

Joe*_*ydt 7 python screen-scraping beautifulsoup web-scraping python-requests

在下面的代码片段中,您可以看到我正在尝试从NCAA Men's Basketball网站上搜集一些数据.

import requests

url = "https://www.ncaa.com/scoreboard/basketball-men/d1/"

response = requests.get(url)
html = response.text

print(html)
print(response.headers)
print("\n\n")
print(response.request.headers)

Run Code Online (Sandbox Code Playgroud)

该网站列出了游戏及其分数.我想出了如何使用Python请求获取HTTP请求所需的所有数据,然后使用BeautifulSoup从HTML中提取数据.如果您想看看,那么完整的刮刀就在这里.

问题:当请求从NCAA网站获得响应时,数据比实际网站上的数据更老(有时最多30或40分钟).

我一直在谷歌搜索这几个小时.阅读Python Requests文档后,我相信我发现NCAA Web服务器正在发送过时的数据.但我不明白为什么它会在向谷歌浏览器(或任何网络浏览器)发送正确的数据时发送我的程序过时的数据.

我认为服务器发送过期数据的原因是,当我打印响应标题时,其中一个项目是"Last-Modified":'Sat,26 Jan 2019 17:49:13 GMT',而另一个是'Date': '星期六,2019年1月26日18:20:29 GMT',所以看起来服务器在正确的时间获取请求,但提供了一段时间未被修改的数据.

我的问题:你知道为什么会这样吗？我的HTTP请求中是否需要添加一些内容,以使服务器向我发送与发送Web浏览器的内容一致的数据？

PS我很抱歉这个长期的问题.我试图保持简洁,但仍然清楚地解释事情.

Answer 1

chi*_*n88 6

在你之前requests.get(),尝试添加标题:

import requests

url = "https://www.ncaa.com/scoreboard/basketball-men/d1/"

headers = {'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36'}   


response = requests.get(url, headers = headers)
html = response.text

Run Code Online (Sandbox Code Playgroud)

我的另一个建议是使用:

url = 'https://data.ncaa.com/casablanca/scoreboard/basketball-men/d1/2019/01/26/scoreboard.json'

Run Code Online (Sandbox Code Playgroud)

并使用json包来读取它.一切都是现场的,并以一种漂亮的JSON格式为您服务

码

import json
import requests

url = 'https://data.ncaa.com/casablanca/scoreboard/basketball-men/d1/2019/01/26/scoreboard.json'
headers = {'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36'}    

response = requests.get(url, headers = headers)

jsonStr = response.text

jsonObj = json.loads(jsonStr)

Run Code Online (Sandbox Code Playgroud)

我检查了,JSON对象确实返回了实时分数/数据.您需要做的就是更改URL中的日期2019/01/26以获取游戏的先前日期结束数据.

编辑 - 附加

这可以帮助您提取数据.请注意我如何将其更改为今天的日期以获取当前数据.它为您提供了一个很好的数据框:

from pandas.io.json import json_normalize
import json
import requests

url = 'https://data.ncaa.com/casablanca/scoreboard/basketball-men/d1/2019/01/27/scoreboard.json'
headers = {'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36'}    

# Thanks to InfectedDrake wisdom, the following 3 lines that I previously had can be replaced by a single line. See below
#response = requests.get(url, headers = headers)
#jsonStr = response.text
#jsonObj = json.loads(jsonStr)

jsonObj = requests.get(url, headers = headers).json()

result = json_normalize(jsonObj['games'])

Run Code Online (Sandbox Code Playgroud)

归档时间：	6 年，11 月前
查看次数：	509 次
最近记录：	6 年，10 月前