goe*_*goe 5 perl utf-8 character-encoding utf8-decode
我在一个页面上有一个表单:
<form method="POST" accept-charset="UTF-8" action="index.cgi" name="TestForm">
Run Code Online (Sandbox Code Playgroud)
其中一个输入字段"search_string"可用于发送西里尔字符,如果发生这种情况,则URL字符串如下所示:
search_string=%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D
Run Code Online (Sandbox Code Playgroud)
如何将此解码回到我发布到的页面上的原始字符串?
正确的解决方案,包括空格:
use open ':std', ':encoding(UTF-8)';
use Encode;
my $escaped = '%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D';
(my $unescaped = $escaped) =~ s/\+/ /g;
$unescaped =~ s/%([[:xdigit:]]+)/chr hex $1/eg;
print $unescaped;
# ?/? ???????? ?? ????
Run Code Online (Sandbox Code Playgroud)
幸得雷诺Bompuis识别为第一,这些前缀Unicode代码点%.
我想补充一点,问题的编码方案非常不寻常,我以前没见过.通常人们会期望字符串?/? ???????? ?? ????被编码为%D0%9F%2F%D0%A4+%D0%9F%D0%9E%D0%94%D0%96%D0%90%D0%A0%D0%9A%D0%90+%D0%98%D0%97+%D0%A1%D0%92%D0%98%D0%9D,也就是说,首先将字符编码为UTF-8,然后八位字节被转义为百分比.该方案适用于Dr.Kameleon的答案.
在您的脚本 () 中尝试一下index.cgi:
use Encode;
Run Code Online (Sandbox Code Playgroud)
然后...
$search_string = decode_utf8( $search_string );
Run Code Online (Sandbox Code Playgroud)
另一个想法(如果你想为你的 CGI 输入创建一个 UTF8 友好的哈希值):
require Encode;
require CGI;
my $query = CGI ->new;
my $form_input = {};
foreach my $name ( $query ->param ) {
my @val = $query ->param( $name );
foreach ( @val ) {
$_ = Encode::decode_utf8( $_ );
}
$name = Encode::decode_utf8( $name );
if ( scalar @val == 1 ) {
$form_input ->{$name} = $val[0];
} else {
$form_input ->{$name} = \@val; # save value as an array ref
}
}
Run Code Online (Sandbox Code Playgroud)
摘自: http: //ahinea.com/en/tech/perl-unicode-struggle.html
| 归档时间: |
|
| 查看次数: |
2762 次 |
| 最近记录: |