如何一次性抓取 100 多个谷歌页面

Question

如何一次性抓取 100 多个谷歌页面

Muh*_*han 1 python html-parsing web-scraping google-custom-search python-requests

我正在使用 python 中的请求库来GET获取来自谷歌结果的数据。https://www.google.com.pk/#q=pizza&num=10将返回我提到的 google 的前 10 个结果num=10。最终https://www.google.com.pk/#q=pizza&num=100将返回 100 个 google 结果。

但

如果我写的任何数字超过 100，让https://www.google.com.pk/#q=pizza&num=200，谷歌仍然返回前 100 个结果

如何一次获得100多个？

代码：

import requests
url = 'http://www.google.com/search'
my_headers = { 'User-agent' : 'Mozilla/11.0' }
payload = { 'q' : pizza, 'start' : '0', 'num' : 200 }
r = requests.get( url, params = payload, headers = my_headers )

Run Code Online (Sandbox Code Playgroud)

在“r”中，我只得到 google 前 100 个结果的 URL，而不是 200

Answer 1

ACh*_*ion 5

您可以使用来自 google 的更具编程性的 api 来获取结果，而不是尝试对人工搜索界面进行屏幕抓取，没有错误检查或断言这符合所有 google 条款和条件，建议您查看使用此 url 的详细信息：

import requests

def search(query, pages=4, rsz=8):
    url = 'https://ajax.googleapis.com/ajax/services/search/web'
    params = {
        'v': 1.0,     # Version
        'q': query,   # Query string
        'rsz': rsz,   # Result set size - max 8
    }

    for s in range(0, pages*rsz+1, rsz):
        params['start'] = s
        r = requests.get(url, params=params)
        for result in r.json()['responseData']['results']:
            yield result

Run Code Online (Sandbox Code Playgroud)

例如，为“google”获得 200 个结果：

>>> list(search('google', pages=24, rsz=8))
[{'GsearchResultClass': 'GwebSearch',
  'cacheUrl': 'http://www.google.com/search?q=cache:y14FcUQOGl4J:www.google.com',
  'content': 'Search the world&#39;s information, including webpages, images, videos and more. \n<b>Google</b> has many special features to help you find exactly what you&#39;re looking\xa0...',
  'title': '<b>Google</b>',
  'titleNoFormatting': 'Google',
  'unescapedUrl': 'https://www.google.com/',
  'url': 'https://www.google.com/',
  'visibleUrl': 'www.google.com'},
  ...
]

Run Code Online (Sandbox Code Playgroud)

要使用 Google 的自定义搜索 API，您需要注册为开发人员。您每天可以获得 100 个免费查询（我不确定这是 API 调用还是它允许对同一查询的分页计为 1 个查询）：

注册@ https://console.developers.google.com
创建项目
创建一个 key
启用自定义搜索 API
创建自定义搜索引擎 @ https://cse.google.com
- 使用虚拟站点初始化 CSE
- 编辑 CSE 以搜索整个网络
- 删除虚拟站点
获取 CSE 参考（查看的公共 URL cx=<cse reference>）

您可以requests用来进行查询：

import requests
url = 'https://www.googleapis.com/customsearch/v1'
params = {
    'key': '<key>',
    'cx': '<cse reference>',
    'q': '<search>',
    'num': 10,
    'start': 1
}

resp = requests.get(url, params=params)
results = resp.json()['items']

Run Code Online (Sandbox Code Playgroud)

有了start你可以做一个类似的分页以上。

还有很多其他参数可用，您可以查看 CSE 的 REST 文档：https : //developers.google.com/custom-search/json-api/v1/reference/cse/list#request

谷歌也有一个客户端 API 库：pip install google-api-python-client你也可以使用：

from googleapiclient import discovery
service = discovery.build('customsearch', 'v1', developerKey='<key>')
params = {
    'q': '<query>',
    'cx': '<cse reference>',
    'num': 10,
    'start': 1
}
query = service.cse().list(**params)
results = query.execute()['items']

Run Code Online (Sandbox Code Playgroud)

归档时间：	10 年前
查看次数：	5139 次
最近记录：	10 年前