小编aoc*_*nas的帖子

使用node.js从windows-1250编码的网页获取正确的字符串

我试图从nodejs 的网页抓取一些数据,但我遇到字符编码问题.该网页声明它的编码是: <meta http-equiv="Content-Type" content="text/html; charset=windows-1250"> 当我用chrome浏览它时,它将编码设置为windows-1250,一切看起来都很好.

由于节点中的流没有windows-1250编码/解码(并且utf8不起作用),我发现了一个iconv-lite包,它应该能够轻松地在不同的编码之间进行转换.但是在将响应保存到文件(或输出到控制台)后,我仍然会收到错误的字符.我也尝试了不同的编码,本机节点缓冲区编码,设置标题与我在chrome(Accept-Charset': 'ISO-8859-1,utf-8;q=0.7,*;q=0.3)中看到的相同,但似乎没有任何工作正常.

你可以在这里看到整个代码https://gist.github.com/4110999.

我想我错过了关于编码如何工作的基本信息,所以任何有关如何使用正确字符获取数据的帮助都将受到赞赏.

编辑:
还尝试了node-iconv包,以防它是一个包问题.将第51行更改为:

var decoder = new Iconv_native('WINDOWS-1250', 'UTF-8');  
var decoded = decoder.convert(body).toString();
Run Code Online (Sandbox Code Playgroud)

但仍然得到相同的结果.

javascript character-encoding node.js

5
推荐指数
1
解决办法
5120
查看次数

标签 统计

character-encoding ×1

javascript ×1

node.js ×1