Kat*_*one 3 python urllib python-3.x python-3.3 python-3.4
我有以下代码:
import urllib.request
try:
url = "https://www.google.com/search?q=test"
headers = {}
usag = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:25.0) Gecko/20100101 Firefox/25.0'
headers['User-Agent'] = usag.encode('utf-8-sig')
req = urllib.request.Request(url, headers=headers)
resp = urllib.request.urlopen(req)
respData = resp.read()
saveFile = open('withHeaders.txt','w')
saveFile.write(str(respData))
saveFile.close()
except Exception as e:
print(str(e))
Run Code Online (Sandbox Code Playgroud)
它给了我以下错误:
D:\virtualenv\samples\urllibb>python 1.py
File "1.py", line 35
usag = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:25.0) Gecko/20100101 Firefox/25.0'\ufeff
^
SyntaxError: invalid character in identifier
Run Code Online (Sandbox Code Playgroud)
\ufeff虽然我在我的代码中看不到。
\ufeff是零宽度无间断空间代码点;打印时不渲染。它在 UTF-16 和 UTF-32 中用作字节顺序标记,用于记录编码字节的解码顺序(big-endian 或 little-endian)。
UTF-8 不需要 BOM(它只有一个固定的字节顺序,无需跟踪替代方案),但微软认为这是他们检测 UTF-8 文件与 8- 的工具的一个方便的签名字符位编码(例如大多数 Windows 代码页使用)。
我怀疑您正在使用 Microsoft 文本编辑器(例如记事本)来保存您的代码。不要这样做,它会包含 BOM 但 Python 不支持它或从 UTF-8 源文件中剥离它。您可能使用记事本保存了文件,然后继续使用不同的工具向开头添加更多代码,而 BOM 卡在中间。
删除整行和下一行并重新键入它们,或者从您定义的字符串的结束引号中选择直到下一行的hof之前headers,删除该部分并重新插入换行符和足够的缩进。
如果您的编辑器在搜索和替换时支持使用转义序列(例如,SublimeText 在正则表达式模式下支持),您可以使用它来搜索字符并将其替换为空字符串。在 SublimeText 中,打开正则表达式支持并搜索\x{feff},用空字符串替换这些出现。
utf-8-sig您在此处使用的 Python编码还包括该 BOM:
headers['User-Agent'] = usag.encode('utf-8-sig')
Run Code Online (Sandbox Code Playgroud)
HTTP头应该不包括任何代码点。HTTP 标头通常坚持使用 Latin-1;甚至 ASCII 在这里就足够了,但否则使用'utf-8'(no -sig)。
你真的不需要在str.encode()那里使用,你也可以定义一个字节串:
headers = {}
usag = b'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:25.0) Gecko/20100101 Firefox/25.0'
headers['User-Agent'] = usag
Run Code Online (Sandbox Code Playgroud)
注意b字符串文字的前缀。