chrome网络调试器为我提供了为页面加载的所有HTTP资源的绝佳视图.但是只要加载新的顶级HTML页面,它就会清除列表.这使得调试由于某种原因而自动重新加载的页面非常困难(运行脚本或300个响应).
在加载新的顶级页面时,是否可以告诉chrome不要清除网络调试器?或者我可以回去查看上一页的网络资源吗?
或者我可以以某种方式强制chrome在加载新页面之前暂停,当我不控制页面时我正在尝试调试正在进行重定向?这是一个错误的开放式舞蹈的一部分,因此SSL和凭证的组合使得使用命令行工具进行调试变得极其困难.
或者萤火虫可以做我想要的吗?
我试图找出某个链接缩短器和out.php linkscripts重定向使用301重定向或不.我正在查看Chrome开发人员工具中的资源标签,但它只显示目标网页的标题,而不显示链接脚本本身.
此外,我正在调查的一些网站实际上不止一次重定向,所以最好能跟踪整个重定向路径.
如何查看我是如何完全重定向的,以及他们是否使用301?
我selenium用来点击我想要的网页,然后使用解析网页Beautiful Soup.
有人已经展示了如何获取元素的内部HTMLSelenium WebDriver.有没有办法获取整个页面的HTML?谢谢
示例代码Python
(基于上面的帖子,语言似乎并不重要):
from selenium import webdriver
from selenium.webdriver.support.ui import Select
from bs4 import BeautifulSoup
url = 'http://www.google.com'
driver = webdriver.Firefox()
driver.get(url)
the_html = driver---somehow----.get_attribute('innerHTML')
bs = BeautifulSoup(the_html, 'html.parser')
Run Code Online (Sandbox Code Playgroud) 我使用 selenium + vba 启动 chrome 以打开单元格范围(“A1:A10”)中列出的 10 个网址。我对 selenium 不熟悉,在尝试了很多次之后,我终于在笨拙的代码下面出来了。
Private selenium As New ChromeDriver
Sub test()
Dim cell As Range
Dim keys As New selenium.keys
Dim pageNo As Integer
pageNo = 0
selenium.Start "chrome", "http://www.google.com/"
For Each cell In Range("A1:A10")
If pageNo >= 1 Then
selenium.SendKeys keys.Control & "t" + keys.Control & "t"
selenium.SwitchToNextWindow
End If
selenium.Get cell.Value
pageNo = pageNo + 1
Next
End Sub
Run Code Online (Sandbox Code Playgroud)
提出的几个麻烦和问题:
我很困惑为什么我必须发送 2 次“Ctrl+t”键才能成功打开新选项卡。
为什么我必须在打开新标签后添加 selenium.SwitchToNextWindow ,或者下一个 url 将在原始标签上打开,而不是新标签?
经常在打开3~5个url后,vba弹出“内存不足”错误,停止加载下一个url。但是如果我在调试环境中逐行运行代码,则可以成功打开所有10个url。为什么?
我在谷歌上搜索到,如果我希望 chrome …