Har*_*eel 2 python web-scraping python-requests
我一直在尝试从这个ajax 网站提取数字上每个单元格的数据,每个单元格的详细信息仅当鼠标指向单元格时才会弹出。
我已经使用Python seleniumwebdriver和 phantomjs 来加载和提取 page_source 但没有找到数据。我使用 firebug 查找可能从中加载内容的任何 .json 文件,但没有找到。
请查看该网站,并建议我如何从指向地图上每个单元格时移位的悬停框中抓取内容。
PS:我在堆栈溢出和几个网站上做了很多研究,但都无济于事。
数据可供获取,您所需要做的就是仔细了解幕后发生的事情。如何?使用Developer Tool并检查请求。您肯定会注意到有两个满足您的需求:
第一个使用当前时间(以秒为单位),另一个以毫秒为单位。每次提出请求时都必须交换它。
博彩公司请求是来自该站点的所有博彩公司的映射。这就是我获得1xBet代码的方式,即417. 您可以轻松地将其与赔率数据进行映射,例如,获取给定博彩公司的所有历史投注。这里有很多可能性。
赔率请求是您在这些表格中看到的所有数据。
然后,您需要执行一些正则表达式来获取JSON这两个请求返回的数据。
最后,您可以开始研究有效负载并获得您需要的内容。例如,假设您正在查看1xBet该X专栏。所以你会期待这样的事情:
1xBet - 2.61 3.5 2.88
该列的历史记录X(此处为3.5上面的值)可能如下所示:
2020-10-18 05:03:45 - 3.58
2020-10-18 04:29:41 - 3.54
2020-10-18 02:53:17 - 3.56
2020-10-17 22:25:56 - 3.58
2020-10-17 17:13:53 - 3.60
2020-10-17 13:03:37 - 3.64
2020-10-17 10:12:06 - 3.66
and so on...
Run Code Online (Sandbox Code Playgroud)
因此,将所有这些放在一起,这就是我得出的结论:
import json
import re
import time
from datetime import datetime
import requests
headers = {
"accept": "*/*",
"accept-encoding": "gzip, deflate, br",
"accept-language": "en-US,en;q=0.9,pl;q=0.8",
"referer": "https://www.oddsportal.com/",
"user-agent": "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/86.0.4240.99 Safari/537.36"
}
def get_response(url: str) -> str:
return requests.get(url, headers=headers).text
time_now_s = int(time.time())
time_now_ms = int(round(time.time() * 1000))
bookies_js = f"https://www.oddsportal.com/res/x/bookies-201014103652-{time_now_s}.js"
odds_data_js = f"https://fb.oddsportal.com/feed/match/1-1-ld9FDhEI-1-2-yje1c.dat?_={time_now_ms}"
bookies = json.loads(re.findall(r'bookmakersData=({.*});var', get_response(bookies_js))[0])
odds_data = json.loads(re.findall(r"\.dat',\s({.*})", get_response(odds_data_js))[0])
bookie = bookies['417']['WebName'] # 417 is 1xBet's code
bookies_odds = odds_data['d']['oddsdata']['back']['E-1-2-0-0-0']['odds']['417'] # current odds for a bookie
odds_sorted = dict(sorted(bookies_odds.items())).values() # sorted as on the website 1 - X - 2
print(f"{bookie} - {' '.join(str(i) for i in odds_sorted)}")
history_columns = {
"1": "4ccecxv464x0xbcsm1", # 1 column
"2": "4ccecxv464x0xbcsm2", # 2 column
"X": "4ccecxv498x0x0", # X column
}
# odds history for the X column for a given bookie
history_data = odds_data['d']['history']['back'][history_columns['X']]['417']
for item in history_data:
value, _, timestamp = item
print(f"{datetime.fromtimestamp(timestamp)} - {value}")
Run Code Online (Sandbox Code Playgroud)
输出:
1xBet - 2.61 3.5 2.88
2020-10-18 05:03:45 - 3.58
2020-10-18 04:29:41 - 3.54
2020-10-18 02:53:17 - 3.56
2020-10-17 22:25:56 - 3.58
2020-10-17 17:13:53 - 3.60
2020-10-17 13:03:37 - 3.64
2020-10-17 10:12:06 - 3.66
2020-10-17 09:58:04 - 3.64
2020-10-17 08:38:52 - 3.62
2020-10-17 08:08:54 - 3.64
2020-10-17 07:44:47 - 3.62
2020-10-17 06:17:33 - 3.64
2020-10-17 06:07:36 - 3.62
2020-10-17 00:04:35 - 3.64
2020-10-16 23:54:39 - 3.62
2020-10-16 23:38:40 - 3.64
2020-10-16 18:54:48 - 3.62
2020-10-16 15:14:17 - 3.64
2020-10-16 13:27:06 - 3.66
2020-10-01 21:43:39 - 3.40
Run Code Online (Sandbox Code Playgroud)
1xBet将鼠标悬停在该值上后,您会在网页上看到该列的内容X。
提示:如果您遇到missing oddsdata key问题,请查看开发人员工具并查看端点是否已更改。看看这个:
只需获取新的端点https://fb.oddsportal.com/feed/postmatchscore/1-ld9FDhEI-yje1c.dat?_=,或者更好的是只选择这一部分yje1c并将其与代码中的端点交换。
| 归档时间: |
|
| 查看次数: |
6826 次 |
| 最近记录: |