小编Dig*_*ger的帖子

使用wget和Perl从HTML提取信息

我正在尝试编写一个类似于电视指南的Perl脚本,该脚本显示某些频道(例如Fox(7.1 WSVNH)和ABC(10.1 WPLGH))正在播放的当前节目。

我正在尝试实现的输出如下所示:

7.1 - Hell's Kitchen

10.1 - 20/20

... and so on
Run Code Online (Sandbox Code Playgroud)

(频道号和当前节目标题)

这是我要从中提取HTML的网站:https : //nocable.org/tv-listings/2f46-miami-fl

这是我用来执行脚本的命令:

wget -O - website | ./script.pl
Run Code Online (Sandbox Code Playgroud)

这是我正在处理的一些代码(注意:由于我仍在学习Perl,因此我试图在Perl中坚持使用正则表达式进行模式匹配):

#!/usr/bin/perl
while ( <> ) {
    @htmlstring = m/wplgh(.*?)br/i
}
print @htmlstring;
Run Code Online (Sandbox Code Playgroud)

我能够提取html块,但不能提取我想要的块。我正在尝试提取节目标题。另外我一直在想,最好是从html中提取出来后,将显示标题存储在哈希中。

%channel; 
$channel{'7.1'} = $showtitle;
$channel{'10.1'} = $showtitle;
Run Code Online (Sandbox Code Playgroud)

linux perl debian

0
推荐指数
1
解决办法
207
查看次数

标签 统计

debian ×1

linux ×1

perl ×1