Adi*_*ngh 5 python unicode utf-8 protocol-buffers
我需要在我的 python - Tornado 服务器上接收协议缓冲区消息,并从二进制消息中获取内容。
postContent = self.request.body
message = prototemp.ReqMessage()
message.ParseFromString(postContent)
Run Code Online (Sandbox Code Playgroud)
它使用测试工具完美运行。当我在沙盒环境中运行它并模拟来自我的客户端的 1000 个请求时,它在某些情况下可以工作,但在大多数请求中,它会引发异常 -
File "server1.py", line 21, in post
message.ParseFromString(postContent)
File "/usr/lib/python2.6/site-packages/protobuf-2.4.1-py2.6.egg/google/protobuf/message.py", line 179, in ParseFromString
self.MergeFromString(serialized)
File "/usr/lib/python2.6/site-packages/protobuf-2.4.1-py2.6.egg/google/protobuf/internal/python_message.py", line 755, in MergeFromString
if self._InternalParse(serialized, 0, length) != length:
File "/usr/lib/python2.6/site-packages/protobuf-2.4.1-py2.6.egg/google/protobuf/internal/python_message.py", line 782, in InternalParse
pos = field_decoder(buffer, new_pos, end, self, field_dict)
File "/usr/lib/python2.6/site-packages/protobuf-2.4.1-py2.6.egg/google/protobuf/internal/decoder.py", line 544, in DecodeField
if value._InternalParse(buffer, pos, new_pos) != new_pos:
File "/usr/lib/python2.6/site-packages/protobuf-2.4.1-py2.6.egg/google/protobuf/internal/python_message.py", line 782, in InternalParse
pos = field_decoder(buffer, new_pos, end, self, field_dict)
File "/usr/lib/python2.6/site-packages/protobuf-2.4.1-py2.6.egg/google/protobuf/internal/decoder.py", line 410, in DecodeField
field_dict[key] = local_unicode(buffer[pos:new_pos], 'utf-8')
UnicodeDecodeError: 'utf8' codec can't decode byte 0xce in position 1: invalid continuation byte
Run Code Online (Sandbox Code Playgroud)
在其他一些情况下,它会给出这些错误 -
UnicodeDecodeError: 'utf8' codec can't decode byte 0xbf in position 3: invalid start byte
UnicodeDecodeError: 'utf8' codec can't decode byte 0xe7 in position 3: unexpected end of data
Run Code Online (Sandbox Code Playgroud)
可能是什么原因 ?
小智 6
我在使用 RabbitMQ 和 Protocol Buffers 时遇到了完全相同的问题。问题在于,protocol buffer 假定输入为 str 类型,而在某些情况下,RabbitMQ 似乎将消息解码为 unicode(如果字节数组包含大于 127 的字节)。龙卷风也可能发生同样的情况。到目前为止,似乎可以通过以下代码来解决该问题:
body = self.request.body
if type(body) == unicode:
data = bytearray(body, "utf-8")
body = bytes(data)
message = whatever.FromString(body)
Run Code Online (Sandbox Code Playgroud)
这段代码将 unicode 字符串转换为 python bytes 对象,它可以被协议缓冲区消息愉快地解析。不知道是否有更好的方法可以做到这一点,但至少这似乎有效。
| 归档时间: |
|
| 查看次数: |
12757 次 |
| 最近记录: |