chf*_*foo 5 character-encoding mojibake
在《辛普森一家》第12季第07集“大赚钱雀跃”上,我注意到几年前俄罗斯飞船上出现了“乱码”标志。今天,我决定随机搜索,看看是否有人解码了它们,但找不到任何结果。

我怀疑这是显示为Latin-1或Windows-1252的KOI8-R。我能抓到的图像不是很清楚。
如下面的Python 3代码解释器交互所示,我对mojibake有两种解释:
>>> 'Ï‹ÏËÏÁ ¿Ä ÄÏÍ.†.'.encode('windows-1252').decode('koi8_r')
'?????? ©? ???.?.'
>>> 'Ï<ÏËÏÁ ¿Ä ÄÏÍ.×.'.encode('latin1').decode('koi8_r')
'?<???? ©? ???.?.'
Run Code Online (Sandbox Code Playgroud)
查看Wikpedia上的代码表,我无法弄清楚“ <”和“ +”等符号是什么。我考虑过强行使用,并将其与某种拼写检查字典进行匹配,但我希望先获得一些帮助。
原始文字或含义仍可以恢复吗?还是真的很乱?
(我很高兴有人知道它在说什么,但是我想看看是否有可能通过一些代码解决这个问题。)
编辑:天真的脚本:
codec_list = ['ascii', 'big5', 'big5hkscs', 'cp037', 'cp424', 'cp437',
'cp500', 'cp720', 'cp737', 'cp775', 'cp850', 'cp852', 'cp855', 'cp856',
'cp857', 'cp858', 'cp860', 'cp861', 'cp862', 'cp863', 'cp864', 'cp865',
'cp866', 'cp869', 'cp874', 'cp875', 'cp932', 'cp949', 'cp950', 'cp1006',
'cp1026', 'cp1140', 'cp1250', 'cp1251', 'cp1252', 'cp1253', 'cp1254',
'cp1255', 'cp1256', 'cp1257', 'cp1258', 'euc_jp', 'euc_jis_2004',
'euc_jisx0213', 'euc_kr', 'gb2312', 'gbk', 'gb18030', 'hz', 'iso2022_jp',
'iso2022_jp_1', 'iso2022_jp_2', 'iso2022_jp_2004', 'iso2022_jp_3',
'iso2022_jp_ext', 'iso2022_kr', 'latin_1', 'iso8859_2', 'iso8859_3',
'iso8859_4', 'iso8859_5', 'iso8859_6', 'iso8859_7', 'iso8859_8',
'iso8859_9', 'iso8859_10', 'iso8859_13', 'iso8859_14', 'iso8859_15',
'iso8859_16', 'johab', 'koi8_r', 'koi8_u', 'mac_cyrillic', 'mac_greek',
'mac_iceland', 'mac_latin2', 'mac_roman', 'mac_turkish', 'ptcp154',
'shift_jis', 'shift_jis_2004', 'shift_jisx0213', 'utf_32', 'utf_32_be',
'utf_32_le', 'utf_16', 'utf_16_be', 'utf_16_le', 'utf_7', 'utf_8',
'utf_8_sig',]
source_str_list = ['Ï‹ÏËÏÁ ¿Ä ÄÏÍ.†.', 'Ï<ÏËÏÁ ¿Ä ÄÏÍ.×.']
for mangled_codec in codec_list:
for correct_codec in codec_list:
decoded_str_list = []
for s in source_str_list:
try:
decoded_str_list.append(s.encode(mangled_codec
).decode(correct_codec))
except (UnicodeEncodeError, UnicodeDecodeError):
continue
if decoded_str_list:
print(mangled_codec, correct_codec, decoded_str_list)
Run Code Online (Sandbox Code Playgroud)
\xc3\x8f\xe2\x80\xb9\xc3\x8f\xc3\x8b\xc3\x8f\xc3\x81\xc2\xbf\xc3\x84\xc3\x84\xc3\x8f\xc3\x8d.\xe2\x80\xa0.\n\n gbk 15 5 '\xe8\xa0\x87\xe7\xba\xa4\xe7\x8b\xad\xe7\xa3\x95\xe5\x8d\x97'\n cp932, sjis 31 11 '\xef\xbe\x8f\xe5\x9d\x87\xef\xbe\x8b\xef\xbe\x8f\xef\xbe\x81\xef\xbd\xbf\xef\xbe\x84\xef\xbe\x84\xef\xbe\x8f\xef\xbe\x8d.'\n cp1250 28 14 '\xc4\x8e\xe2\x80\xb9\xc4\x8e\xc3\x8b\xc4\x8e\xc3\x81\xc5\xbc\xc3\x84\xc3\x84\xc4\x8e\xc3\x8d.\xe2\x80\xa0.'\n cp1251 28 14 '\xd0\x9f\xe2\x80\xb9\xd0\x9f\xd0\x9b\xd0\x9f\xd0\x91\xd1\x97\xd0\x94\xd0\x94\xd0\x9f\xd0\x9d.\xe2\x80\xa0.'\n cp1256 28 14 '\xd8\xaf\xe2\x80\xb9\xd8\xaf\xd8\xab\xd8\xaf\xd8\xa1\xd8\x9f\xd8\xa4\xd8\xa4\xd8\xaf\xd8\xad.\xe2\x80\xa0.'\n cp1257 28 14 '\xc4\xbb\xe2\x80\xb9\xc4\xbb\xc4\x96\xc4\xbb\xc4\xae\xc3\xa6\xc3\x84\xc3\x84\xc4\xbb\xc4\xb6.\xe2\x80\xa0.'\n geostd8 37 14 '\xe1\x83\x9d\xe2\x80\xb9\xe1\x83\x9d\xe1\x83\x9a\xe1\x83\x9d\xe1\x83\x91\xc2\xbf\xe1\x83\x94\xe1\x83\x94\xe1\x83\x9d\xe1\x83\x9c.\xe2\x80\xa0.'\n\n\xc3\x8f<\xc3\x8f\xc3\x8b\xc3\x8f\xc3\x81 \xc2\xbf\xc3\x84 \xc3\x84\xc3\x8f\xc3\x8d\n\n euckr 31 11 '\xed\x9a\x95<\xed\x9a\x95\xed\x9a\x8f\xed\x9a\x95\xed\x9a\x81\xec\xa9\x94\xed\x9a\x86\xed\x9a\x86\xed\x9a\x95\xed\x9a\x92'\n gbk 31 11 '\xe8\x84\xa7<\xe8\x84\xa7\xe8\x84\xa3\xe8\x84\xa7\xe8\x84\x95\xe9\xa9\xb4\xe8\x84\x9b\xe8\x84\x9b\xe8\x84\xa7\xe8\x84\xa5'\nRun Code Online (Sandbox Code Playgroud)\n\n西里尔字母的 Mojibake 通常涉及“eth”:
\n\n\xd0\x90\xd0\x91\xd0\x92\xd0\x93\xd2\x90\xd0\x94\xd0\x82->\xc3\x90\xc3\x90\xe2\x80\x98\xc3\x90\xe2\x80\x99\xc3\x90\xe2\x80\x9c\xc3\x92\xc3\x90\xe2\x80\x9d\xc3\x90\xe2\x80\x9a
Mojibaking 希腊语得到\xc3\x8e和\xc3\x8f。
| 归档时间: |
|
| 查看次数: |
716 次 |
| 最近记录: |