来自shell的GROUP BY/SUM

Leg*_*end 31 unix linux shell awk command-line

我有一个包含这样的数据的大文件:

a 23
b 8
a 22
b 1
Run Code Online (Sandbox Code Playgroud)

我希望能够得到这个:

a 45
b 9
Run Code Online (Sandbox Code Playgroud)

我可以先对这个文件进行排序,然后通过扫描文件一次在Python中进行.这样做有什么好的直接命令行方式?

she*_*ter 33

编辑:现代(GNU/Linux)解决方案,如几年前的评论中所述;-).

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s\t%s\n", key, arr[key])
   }' file \
   | sort -k1,1
Run Code Online (Sandbox Code Playgroud)

最初发布的解决方案,基于旧的Unix sort选项:

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s\t%s\n", key, arr[key])
   }' file \
   | sort +0n -1
Run Code Online (Sandbox Code Playgroud)

我希望这有帮助.


Cha*_*ffy 8

这里不需要awk,甚至不需要排序 - 如果你有Bash 4.0,你可以使用关联数组:

#!/bin/bash
declare -A values
while read key value; do
  values["$key"]=$(( $value + ${values[$key]:-0} ))
done
for key in "${!values[@]}"; do
  printf "%s %s\n" "$key" "${values[$key]}"
done
Run Code Online (Sandbox Code Playgroud)

...或者,如果你首先对文件进行排序(这将更节省内存; GNU排序能够做一些技巧来排序大于内存的文件,这是一个天真的脚本 - 无论是在awk,python还是shell中 - 通常不会),你可以用一种适用于旧版本的方式(我期望以下工作通过bash 2.0):

#!/bin/bash
read cur_key cur_value
while read key value; do
  if [[ $key = "$cur_key" ]] ; then
    cur_value=$(( cur_value + value ))
  else
    printf "%s %s\n" "$cur_key" "$cur_value"
    cur_key="$key"
    cur_value="$value"
  fi
done
printf "%s %s\n" "$cur_key" "$cur_value"
Run Code Online (Sandbox Code Playgroud)

  • 哎呀,有一些最小的改编,上面的东西可以在香草Bourne工作,不需要bash.而读取键值; 如果["$ key"="$ cur_key"]; 然后cur_value = \`expr $ cur_value + $ value \`; 否则回显"$ cur_key $ cur_value"; cur_key = "$键"; cur_value = "$值"; 网络连接; 完成; echo"$ cur_key $ cur_value"` (3认同)
  • @MarkReed,当然如此,虽然运行`expr`的子shell的性能影响足以使POSIX sh` $(())`扩展更好; 而`(())`是一个bash扩展,`$(())`是标准兼容的; 它只是1991年之前-POSIX标准的Bourne sh,需要`expr`. (2认同)

Pau*_*ce. 8

这个Perl单线程似乎可以完成这项工作:

perl -nle '($k, $v) = split; $s{$k} += $v; END {$, = " "; foreach $k (sort keys %s) {print $k, $s{$k}}}' inputfile
Run Code Online (Sandbox Code Playgroud)


saa*_*aaj 6

这可以通过以下单线轻松实现:

cat /path/to/file | termsql "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"
Run Code Online (Sandbox Code Playgroud)

或者。

termsql -i /path/to/file "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"
Run Code Online (Sandbox Code Playgroud)

这里使用了一个 Python 包termsql,它是 SQLite 的包装器。请注意,目前它还不能上传到PyPI,也只能在系统范围内安装(setup.py有点损坏),例如:

pip install --user https://github.com/tobimensch/termsql/archive/master.zip
Run Code Online (Sandbox Code Playgroud)

更新

2020年1.0版本终于上传到PyPI了,pip install --user termsql可以使用了。