从 shell 进行 GROUP BY/SUM

2024-10-30 08:36:00
admin
原创
51
摘要:问题描述:我有一个包含如下数据的大文件:a 23 b 8 a 22 b 1 我希望能够得到这个:a 45 b 9 我可以先对这个文件进行排序,然后通过扫描文件一次在 Python 中执行此操作。有什么好的直接命令行方法可以做到这一点?解决方案 1:编辑:现代(GNU / Linux)解决方案,正如几年前的评论...

问题描述:

我有一个包含如下数据的大文件:

a 23
b 8
a 22
b 1

我希望能够得到这个:

a 45
b 9

我可以先对这个文件进行排序,然后通过扫描文件一次在 Python 中执行此操作。有什么好的直接命令行方法可以做到这一点?


解决方案 1:

编辑:现代(GNU / Linux)解决方案,正如几年前的评论中所提到的;-)。

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s    %s
", key, arr[key])
   }' file \n   | sort -k1,1

最初发布的解决方案基于旧的 Unixsort选项:

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s    %s
", key, arr[key])
   }' file \n   | sort +0n -1

我希望这会有所帮助。

解决方案 2:

这里不需要 awk,甚至不需要排序——如果您有 Bash 4.0,您可以使用关联数组:

#!/bin/bash
declare -A values
while read key value; do
  values["$key"]=$(( $value + ${values[$key]:-0} ))
done
for key in "${!values[@]}"; do
  printf "%s %s
" "$key" "${values[$key]}"
done

...或者,如果您先对文件进行排序(这将更节省内存;GNU sort 能够使用技巧对大于内存的文件进行排序,而简单的脚本 —— 无论是在 awk、python 还是 shell 中 —— 通常都无法做到这一点),您可以以一种在旧版本中可以正常工作的方式执行此操作(我希望以下内容可以在 bash 2.0 中工作):

#!/bin/bash
read cur_key cur_value
while read key value; do
  if [[ $key = "$cur_key" ]] ; then
    cur_value=$(( cur_value + value ))
  else
    printf "%s %s
" "$cur_key" "$cur_value"
    cur_key="$key"
    cur_value="$value"
  fi
done
printf "%s %s
" "$cur_key" "$cur_value"

解决方案 3:

这个 Perl 单行代码似乎可以完成这个工作:

perl -nle '($k, $v) = split; $s{$k} += $v; END {$, = " "; foreach $k (sort keys %s) {print $k, $s{$k}}}' inputfile

解决方案 4:

使用下面的命令就可以轻松实现这一点:

cat /path/to/file | termsql "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"

或者。

termsql -i /path/to/file "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"

这里使用了一个 Python 包termsql,它是 SQLite 的包装器。请注意,目前它还未上传到PyPI,并且只能在系统范围内安装(setup.py有点问题),例如:

pip install --user https://github.com/tobimensch/termsql/archive/master.zip

更新

2020年1.0版本终于上传到PyPI,pip install --user termsql可以使用了。

解决方案 5:

一种使用方式perl

perl -ane '
    next unless @F == 2; 
    $h{ $F[0] } += $F[1]; 
    END { 
        printf qq[%s %d
], $_, $h{ $_ } for sort keys %h;
    }
' infile

内容infile

a 23
b 8
a 22
b 1

输出:

a 45
b 9

解决方案 6:

使用GNU awk(版本低于 4):

WHINY_USERS= awk 'END {
  for (E in a)
    print E, a[E]
    }
{ a[$1] += $2 }' infile

使用GNU awk >= 4:

awk 'END {
  PROCINFO["sorted_in"] = "@ind_str_asc"
  for (E in a)
    print E, a[E]
    }
{ a[$1] += $2 }' infile

解决方案 7:

使用sort+awk组合可以尝试以下操作,而无需创建数组。

sort -k1 Input_file | 
awk '
  prev!=$1 && prev{
    print prev,(prevSum?prevSum:"N/A")
    prev=prevSum=""
  }
  {
    prev=$1
    prevSum+=$2
  }
  END{
    if(prev){
       print prev,(prevSum?prevSum:"N/A")
    }
}'

说明:添加以上内容的详细解释。

sort -k1 file1 |                          ##Using sort command to sort Input_file by 1st field and sending output to awk as an input.
awk '                                     ##Starting awk program from here.
  prev!=$1 && prev{                       ##Checking condition prev is NOT equal to first field and prev is NOT NULL.
    print prev,(prevSum?prevSum:"N/A")    ##Printing prev and prevSum(if its NULL then print N/A).
    prev=prevSum=""                       ##Nullify prev and prevSum here.
  }
  {
    prev=$1                               ##Assigning 1st field to prev here.
    prevSum+=$2                           ##Adding 2nd field to prevSum.
  }
  END{                                    ##Starting END block of this awk program from here.
    if(prev){                             ##Checking condition if prev is NOT NULL then do following.
       print prev,(prevSum?prevSum:"N/A") ##Printing prev and prevSum(if its NULL then print N/A).
    }
}'
相关推荐
  为什么项目管理通常仍然耗时且低效?您是否还在反复更新电子表格、淹没在便利贴中并参加每周更新会议?这确实是耗费时间和精力。借助软件工具的帮助,您可以一目了然地全面了解您的项目。如今,国内外有足够多优秀的项目管理软件可以帮助您掌控每个项目。什么是项目管理软件?项目管理软件是广泛行业用于项目规划、资源分配和调度的软件。它使项...
项目管理软件   601  
  华为IPD与传统研发模式的8大差异在快速变化的商业环境中,产品研发模式的选择直接决定了企业的市场响应速度和竞争力。华为作为全球领先的通信技术解决方案供应商,其成功在很大程度上得益于对产品研发模式的持续创新。华为引入并深度定制的集成产品开发(IPD)体系,相较于传统的研发模式,展现出了显著的差异和优势。本文将详细探讨华为...
IPD流程是谁发明的   7  
  如何通过IPD流程缩短产品上市时间?在快速变化的市场环境中,产品上市时间成为企业竞争力的关键因素之一。集成产品开发(IPD, Integrated Product Development)作为一种先进的产品研发管理方法,通过其结构化的流程设计和跨部门协作机制,显著缩短了产品上市时间,提高了市场响应速度。本文将深入探讨如...
华为IPD流程   9  
  在项目管理领域,IPD(Integrated Product Development,集成产品开发)流程图是连接创意、设计与市场成功的桥梁。它不仅是一个视觉工具,更是一种战略思维方式的体现,帮助团队高效协同,确保产品按时、按质、按量推向市场。尽管IPD流程图可能初看之下显得错综复杂,但只需掌握几个关键点,你便能轻松驾驭...
IPD开发流程管理   8  
  在项目管理领域,集成产品开发(IPD)流程被视为提升产品上市速度、增强团队协作与创新能力的重要工具。然而,尽管IPD流程拥有诸多优势,其实施过程中仍可能遭遇多种挑战,导致项目失败。本文旨在深入探讨八个常见的IPD流程失败原因,并提出相应的解决方法,以帮助项目管理者规避风险,确保项目成功。缺乏明确的项目目标与战略对齐IP...
IPD流程图   8  
热门文章
项目管理软件有哪些?
云禅道AD
禅道项目管理软件

云端的项目管理软件

尊享禅道项目软件收费版功能

无需维护,随时随地协同办公

内置subversion和git源码管理

每天备份,随时转为私有部署

免费试用