从 shell 进行 GROUP BY/SUM
- 2024-10-30 08:36:00
- admin 原创
- 51
问题描述:
我有一个包含如下数据的大文件:
a 23
b 8
a 22
b 1
我希望能够得到这个:
a 45
b 9
我可以先对这个文件进行排序,然后通过扫描文件一次在 Python 中执行此操作。有什么好的直接命令行方法可以做到这一点?
解决方案 1:
编辑:现代(GNU / Linux)解决方案,正如几年前的评论中所提到的;-)。
awk '{
arr[$1]+=$2
}
END {
for (key in arr) printf("%s %s
", key, arr[key])
}' file \n | sort -k1,1
最初发布的解决方案基于旧的 Unixsort
选项:
awk '{
arr[$1]+=$2
}
END {
for (key in arr) printf("%s %s
", key, arr[key])
}' file \n | sort +0n -1
我希望这会有所帮助。
解决方案 2:
这里不需要 awk,甚至不需要排序——如果您有 Bash 4.0,您可以使用关联数组:
#!/bin/bash
declare -A values
while read key value; do
values["$key"]=$(( $value + ${values[$key]:-0} ))
done
for key in "${!values[@]}"; do
printf "%s %s
" "$key" "${values[$key]}"
done
...或者,如果您先对文件进行排序(这将更节省内存;GNU sort 能够使用技巧对大于内存的文件进行排序,而简单的脚本 —— 无论是在 awk、python 还是 shell 中 —— 通常都无法做到这一点),您可以以一种在旧版本中可以正常工作的方式执行此操作(我希望以下内容可以在 bash 2.0 中工作):
#!/bin/bash
read cur_key cur_value
while read key value; do
if [[ $key = "$cur_key" ]] ; then
cur_value=$(( cur_value + value ))
else
printf "%s %s
" "$cur_key" "$cur_value"
cur_key="$key"
cur_value="$value"
fi
done
printf "%s %s
" "$cur_key" "$cur_value"
解决方案 3:
这个 Perl 单行代码似乎可以完成这个工作:
perl -nle '($k, $v) = split; $s{$k} += $v; END {$, = " "; foreach $k (sort keys %s) {print $k, $s{$k}}}' inputfile
解决方案 4:
使用下面的命令就可以轻松实现这一点:
cat /path/to/file | termsql "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"
或者。
termsql -i /path/to/file "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"
这里使用了一个 Python 包termsql,它是 SQLite 的包装器。请注意,目前它还未上传到PyPI,并且只能在系统范围内安装(setup.py
有点问题),例如:
pip install --user https://github.com/tobimensch/termsql/archive/master.zip
更新
2020年1.0版本终于上传到PyPI,pip install --user termsql
可以使用了。
解决方案 5:
一种使用方式perl
:
perl -ane '
next unless @F == 2;
$h{ $F[0] } += $F[1];
END {
printf qq[%s %d
], $_, $h{ $_ } for sort keys %h;
}
' infile
内容infile
:
a 23
b 8
a 22
b 1
输出:
a 45
b 9
解决方案 6:
使用GNU awk(版本低于 4):
WHINY_USERS= awk 'END {
for (E in a)
print E, a[E]
}
{ a[$1] += $2 }' infile
使用GNU awk >= 4:
awk 'END {
PROCINFO["sorted_in"] = "@ind_str_asc"
for (E in a)
print E, a[E]
}
{ a[$1] += $2 }' infile
解决方案 7:
使用sort
+awk
组合可以尝试以下操作,而无需创建数组。
sort -k1 Input_file |
awk '
prev!=$1 && prev{
print prev,(prevSum?prevSum:"N/A")
prev=prevSum=""
}
{
prev=$1
prevSum+=$2
}
END{
if(prev){
print prev,(prevSum?prevSum:"N/A")
}
}'
说明:添加以上内容的详细解释。
sort -k1 file1 | ##Using sort command to sort Input_file by 1st field and sending output to awk as an input.
awk ' ##Starting awk program from here.
prev!=$1 && prev{ ##Checking condition prev is NOT equal to first field and prev is NOT NULL.
print prev,(prevSum?prevSum:"N/A") ##Printing prev and prevSum(if its NULL then print N/A).
prev=prevSum="" ##Nullify prev and prevSum here.
}
{
prev=$1 ##Assigning 1st field to prev here.
prevSum+=$2 ##Adding 2nd field to prevSum.
}
END{ ##Starting END block of this awk program from here.
if(prev){ ##Checking condition if prev is NOT NULL then do following.
print prev,(prevSum?prevSum:"N/A") ##Printing prev and prevSum(if its NULL then print N/A).
}
}'
相关推荐
热门文章
项目管理软件有哪些?
- 2024年20款好用的项目管理软件推荐,项目管理提效的20个工具和技巧
- 2024年开源项目管理软件有哪些?推荐5款好用的项目管理工具
- 项目管理软件有哪些?推荐7款超好用的项目管理工具
- 项目管理软件哪个最好用?盘点推荐5款好用的项目管理工具
- 项目管理软件有哪些最好用?推荐6款好用的项目管理工具
- 项目管理软件有哪些,盘点推荐国内外超好用的7款项目管理工具
- 2024项目管理软件排行榜(10类常用的项目管理工具全推荐)
- 项目管理软件排行榜:2024年项目经理必备5款开源项目管理软件汇总
- 2024年常用的项目管理软件有哪些?推荐这10款国内外好用的项目管理工具
- 项目管理必备:盘点2024年13款好用的项目管理软件
热门标签
云禅道AD