Mit*_*ril 1 python download python-2.7 python-requests
我正在使用requestslib 从网站下载一些图像。
我的代码会在下载后检查文件大小。
示例代码:
def download(url, store_dir):
r = requests.get(url, headers=headers, proxies=proxies)
filename = r.headers.get('content-disposition').split('=')[1]
real_length = int(r.headers.get('content-length'))
wholepath = os.path.join(store_dir, filename)
with open(wholepath, 'wb') as f:
f.write(r.content)
f.close()
if os.path.getsize(wholepath) != real_length:
print('size error')
print('status_code: %s' %r.status_code)
print('headers: %s' %r.headers)
print('url"%s' % url)
print('orgin:', r.headers['content-length'], 'now',os.path.getsize(wholepath))
self.download(url, store_dir)
Run Code Online (Sandbox Code Playgroud)
但我通常会发现即使os.path.getsize(wholepath) == real_length.
我怎么解决这个问题?
将近4年了。我忘记了这个问题,直到今天收到反对票。
让我结束这个问题:
但是如果你是从网站上爬取文件,你可以尝试查找页面/url上是否有一个看起来像md5/sha1的字符串,然后尝试一下。幸运的是,它是文件哈希,您可以通过它来验证文件。没有运气,没有办法。