方法一：美汤

tdy_url = "https://www.todayonline.com/"
page = requests.get(tdy_url).text
soup = BeautifulSoup(page)
soup  # Returns me a HTML with javascript text
soup.find_all('h3')

### Returns me empty list []

Run Code Online (Sandbox Code Playgroud)

方法二：Selenium + BeautifulSoup

tdy_url = "https://www.todayonline.com/"

options = Options()
options.headless = True

driver = webdriver.Chrome("chromedriver",options=options)

driver.get(tdy_url)
time.sleep(10)
html = driver.page_source

soup = BeautifulSoup(html)
soup.find_all('h3')

### Returns me only less than 1/4 of the 'h3' tags found in the original page source

Run Code Online (Sandbox Code Playgroud)

请帮忙。我尝试过抓取其他新闻网站，这要容易得多。谢谢。

python selenium beautifulsoup

Coo*_*ata

lucky-day

6
推荐指数

1
解决办法

2万
查看次数