如何从Hadoop的Pig处理的文件中修剪标题行?

Chr*_*ips 5 hadoop apache-pig

我试图通过Pig程序使用Amazon的Elastic Map Reduce来解析由我们的服务生成的制表符分隔数据文件.事情进展顺利,但我们所有的数据文件都包含一个标题行,用于定义每列的用途.显然,(字符串)标题不能转换为数字数据值,因此我从Pig得到警告,如下所示:

2011-03-17 22:49:55,378 [main] WARN  org.apache.pig.backend.hadoop.executionengine.mapReduceLayer.PigHadoopLogger - org.apache.pig.builtin.PigStorage: Unable to interpret value [<snip>] in field being converted to double, caught NumberFormatException <For input string: "headerName"> field discarded
Run Code Online (Sandbox Code Playgroud)

我在load语句之后有一个过滤器,它试图确保我以后不会对任何标题行进行操作(通过过滤掉标题术语),但是我想摆脱警告噪音以避免掩盖任何潜在的问题(例如未正确投射的实际数据字段).

这可能吗?

wlk*_*wlk 0

您可以在提交 Pig 作业之前执行此操作(如果可能),或者尝试编写 UDF,如果满足某些条件,该 UDF 将发出空值,以便稍后您可以将其过滤掉。