我有这种格式的大型数据集
HF TLLL A T 0.999 NA 0.666 NA 0.566 NA NA 0.87
HF TLLM A T 0.500 0.500 0.666 0.566 NA NA 0.87
Run Code Online (Sandbox Code Playgroud)
我想计算每一行的平均值,从第5列开始直到行结束,并忽略字符串NA.然后将平均值附加到每行的末尾.
输出看起来像这样:
HF TLLL A T 0.999 NA 0.666 NA 0.566 NA NA 0.87 0.775
HF TLLM A T 0.500 0.500 0.666 0.566 NA NA 0.87 0.620
Run Code Online (Sandbox Code Playgroud)
我一直得到这样的总和,但无法弄清楚如何跟踪求和的整数数,以便计算平均值.
awk '{x=0;for(i=5;i<=NF;i++)x=x+$i;print $0, x}'
Run Code Online (Sandbox Code Playgroud)
$ cat file
HF TLLL A T 0.999 NA 0.666 NA 0.566 NA NA 0.87
HF TLLM A T 0.500 0.500 0.666 0.566 NA NA 0.87
HF TLLM A T NA NA NA NA NA NA NA
$ awk '{sum=cnt=0; for (i=5;i<=NF;i++) if ($i != "NA") { sum+=$i; cnt++ } print $0, (cnt ? sum/cnt : "NA") }' file
HF TLLL A T 0.999 NA 0.666 NA 0.566 NA NA 0.87 0.77525
HF TLLM A T 0.500 0.500 0.666 0.566 NA NA 0.87 0.6204
HF TLLM A T NA NA NA NA NA NA NA NA
Run Code Online (Sandbox Code Playgroud)
三元表达式避免了输入行3上的除零误差,其中每个数据字段都是"NA".
| 归档时间: |
|
| 查看次数: |
1152 次 |
| 最近记录: |