在我的旧电脑上,我能够从 Jupyter Notebook 运行 .py 文件,编辑并运行它们。.py 文件实际上是一个用于所有意图和目的的笔记本文件。我更新到了最新版本的 notebook,我再也无法这样做了。如何在笔记本上使用 .py 文件?
我知道有一些迂回的方法可以做到这一点。我正在寻找一种方法,当您在笔记本中时,不是打开 .ipynb 文件,而是选择一个打开的 .py 文件,其行为类似于 .ipnyb。当您保存它时,它会写入 .py。
我知道这在不知道完整代码是什么的情况下本质上是一个很难回答的问题。
下面是代码的摘要:
但一般来说,是什么导致请求的曲线如此不平滑?我没有太多的处理,所以我认为他们基本上会在并发请求下发出尽可能多的请求。此外,我已将并发请求数设置为 256,并且每个 IP 的请求数 = 1,因此不应该是因为任何特定网站。另一个有趣的事情是它开始很快,然后变慢。我可以理解,因为缓慢的请求在系统中停留的时间更长,并拉低了平均值。
任何想法都会受到欢迎。

[scrapy.crawler] Overridden settings: {'AUTOTHROTTLE_ENABLED': True, 'BOT_NAME': 'stack', 'CONCURRENT_REQUESTS': 256, 'CONCURRENT_REQUESTS_PER_DOMAIN': 1, 'CONCURRENT_REQUESTS_PER_IP': 1, 'DEPTH_LIMIT': 3, 'DEPTH_PRIORITY': 1, 'DOWNLOAD_DELAY': 1, 'LOG_ENABLED': False, 'LOG_LEVEL': 'INFO', 'MEMUSAGE_LIMIT_MB': 950, 'NEWSPIDER_MODULE': 'stack.spiders', 'REACTOR_THREADPOOL_MAXSIZE': 30, 'SCHEDULER_DISK_QUEUE': 'scrapy.squeues.PickleFifoDiskQueue', 'SCHEDULER_MEMORY_QUEUE': 'scrapy.squeues.FifoMemoryQueue', 'SPIDER_MODULES': ['stack.spiders'], 'STATS_CLASS': 'sh_scrapy.stats.HubStorageStatsCollector', 'TELNETCONSOLE_HOST': '0.0.0.0',}
Run Code Online (Sandbox Code Playgroud)
更新
我尝试将并发请求设置为 inf,这解决了线性问题,但产生了次要问题。

基于此更新,更明显的是什么限制了蜘蛛?
但是,现在计划的请求比实际请求高出约 20%,导致内存使用量随着程序的继续而增长。有没有办法删除老化的请求对象,以便内存使用量不会随着时间的推移而增长?
https://streeteasy.com/和https://www.geeksforgeeks.org/等网站采用相同的 UI,允许您一键使用 Google Auth 登录。下图显示了一个示例。
由于许多网站都有相同的 UI,我假设有一些 Google/Firebase 模式,但我没有看到与此相关的文档。
也许 html 中的这个链接可以帮助解决这个问题?ux_mode=popup 我很熟悉,但 ui_mode=card 我不熟悉。 https://accounts.google.com/gsi/iframe/select?client_id=388036620207-3uolk1hv6ta7p3r9l6s3bobifh086qe1.apps.googleusercontent.com&ux_mode=popup&ui_mode=card&as=al2HYo2TiehJpHITNY8fJQ&channel_id=9384f02a26b236ce29c0acab5000e8c656b9bbfb3202c094cd65f92e2468d6a3&origin=https%3A%2F%2Fwww.geeksforgeeks.org