如何使用 Red Hat Linux 上的标准工具随机化文件中的行?

2024-10-29 08:34:00
admin
原创
192
摘要:问题描述:如何使用 Red Hat Linux 上的标准工具随机化文件中的行?我没有shuf命令,所以我正在寻找类似perl或awk单行完成相同任务的东西。解决方案 1:嗯,别忘了sort --random-sort 解决方案 2:shuf是最好的方法。sort -R速度慢得令人难以忍受。我刚刚尝试对 5GB...

问题描述:

如何使用 Red Hat Linux 上的标准工具随机化文件中的行?

我没有shuf命令,所以我正在寻找类似perlawk单行完成相同任务的东西。


解决方案 1:

嗯,别忘了

sort --random-sort

解决方案 2:

shuf是最好的方法。

sort -R速度慢得令人难以忍受。我刚刚尝试对 5GB 文件进行排序。2.5 小时后我放弃了。然后shuf在一分钟内就完成了排序。

解决方案 3:

您将获得一行 Perl 代码!

perl -MList::Util -e 'print List::Util::shuffle <>'

它使用了一个模块,但该模块是 Perl 代码分发的一部分。如果这还不够好,您可以考虑自己动手。

我尝试使用标志-i(“就地编辑”)来编辑文件。文档表明它应该可以工作,但实际上却不行。它仍然将打乱顺序的文件显示到 stdout,但这次它会删除原始文件。我建议你不要使用它。

考虑一个 shell 脚本:

#!/bin/sh

if [[ $# -eq 0 ]]
then
  echo "Usage: $0 [file ...]"
  exit 1
fi

for i in "$@"
do
  perl -MList::Util -e 'print List::Util::shuffle <>' $i > $i.new
  if [[ `wc -c $i` -eq `wc -c $i.new` ]]
  then
    mv $i.new $i
  else
    echo "Error for file $i!"
  fi
done

未经测试,但希望有效。

解决方案 4:

cat yourfile.txt | while IFS= read -r f; do printf "%05d %s
" "$RANDOM" "$f"; done | sort -n | cut -c7-

读取文件,在每行前面添加一个随机数,根据这些随机前缀对文件进行排序,然后剪切前缀。一行代码应该可以在任何半现代的 shell 中使用。

编辑:纳入了理​​查德汉森的评论。

解决方案 5:

Python 的一行程序:

python -c "import random, sys; lines = open(sys.argv[1]).readlines(); random.shuffle(lines); print ''.join(lines)," myFile

仅打印一行随机行:

python -c "import random, sys; print random.choice(open(sys.argv[1]).readlines())," myFile

但是请参阅这篇文章以了解 python 的缺点random.shuffle()。它无法很好地处理许多(超过 2080 个)元素。

解决方案 6:

与吉姆的回答相关:

我的~/.bashrc包含以下内容:

unsort ()
{
    LC_ALL=C sort -R "$@"
}

使用 GNU coreutils 的排序,-R= --random-sort,它会生成每行的随机哈希值并根据它进行排序。在某些较旧(有缺陷)版本的某些语言环境中,随机哈希值实际上不会使用,导致它返回正常的排序输出,这就是我设置的原因LC_ALL=C


与克里斯的回答相关:

perl -MList::Util=shuffle -e'print shuffle<>'

是稍微短一点的单行代码。(-Mmodule=a,b,c是的简写-e 'use module qw(a b c);'。)

给它一个简单的方法-i不能用于就地改组,是因为 Perl 期望发生print在读取文件的同一循环中,并且print shuffle <>直到读取并关闭所有输入文件后才会输出。

作为一种较短的解决方法,

perl -MList::Util=shuffle -i -ne'BEGIN{undef$/}print shuffle split/^/m'

将会就地对文件进行混排。(-n意思是“将代码包装在一个while (<>) {...}循环中;BEGIN{undef$/}使 Perl 一次对一个文件进行操作而不是一次对一行进行操作,这split/^/m是必需的,因为$_=<>已经隐式地对整个文件而不是行进行了操作。)

解决方案 7:

当我使用 homebrew 安装 coreutils 时

brew install coreutils

shuf变为可用n

解决方案 8:

带有 DarwinPorts 的 Mac OS X:

sudo port install unsort
cat $file | unsort | ...

解决方案 9:

FreeBSD 有自己的随机实用程序:

cat $file | random | ...

它位于 /usr/games/random,因此如果您还没有安装游戏,那您就倒霉了。

您可以考虑安装像 textproc/rand 或 textproc/msort 这样的端口。如果考虑可移植性,这些端口可能在 Linux 和/或 Mac OS X 上可用。

解决方案 10:

在 OSX 上,从http://ftp.gnu.org/gnu/coreutils/获取最新版本,然后类似

./配置制作 sudo 制作安装

...应该给你 /usr/local/bin/sort --random-sort

不会弄乱 /usr/bin/sort

解决方案 11:

或者从 MacPorts 获取:

$ sudo port install coreutils

和/或

$ /opt/local//libexec/gnubin/sort --random-sort
相关推荐
  政府信创国产化的10大政策解读一、信创国产化的背景与意义信创国产化,即信息技术应用创新国产化,是当前中国信息技术领域的一个重要发展方向。其核心在于通过自主研发和创新,实现信息技术应用的自主可控,减少对外部技术的依赖,并规避潜在的技术制裁和风险。随着全球信息技术竞争的加剧,以及某些国家对中国在科技领域的打压,信创国产化显...
工程项目管理   1565  
  为什么项目管理通常仍然耗时且低效?您是否还在反复更新电子表格、淹没在便利贴中并参加每周更新会议?这确实是耗费时间和精力。借助软件工具的帮助,您可以一目了然地全面了解您的项目。如今,国内外有足够多优秀的项目管理软件可以帮助您掌控每个项目。什么是项目管理软件?项目管理软件是广泛行业用于项目规划、资源分配和调度的软件。它使项...
项目管理软件   1354  
  信创国产芯片作为信息技术创新的核心领域,对于推动国家自主可控生态建设具有至关重要的意义。在全球科技竞争日益激烈的背景下,实现信息技术的自主可控,摆脱对国外技术的依赖,已成为保障国家信息安全和产业可持续发展的关键。国产芯片作为信创产业的基石,其发展水平直接影响着整个信创生态的构建与完善。通过不断提升国产芯片的技术实力、产...
国产信创系统   21  
  信创生态建设旨在实现信息技术领域的自主创新和安全可控,涵盖了从硬件到软件的全产业链。随着数字化转型的加速,信创生态建设的重要性日益凸显,它不仅关乎国家的信息安全,更是推动产业升级和经济高质量发展的关键力量。然而,在推进信创生态建设的过程中,面临着诸多复杂且严峻的挑战,需要深入剖析并寻找切实可行的解决方案。技术创新难题技...
信创操作系统   27  
  信创产业作为国家信息技术创新发展的重要领域,对于保障国家信息安全、推动产业升级具有关键意义。而国产芯片作为信创产业的核心基石,其研发进展备受关注。在信创国产芯片的研发征程中,面临着诸多复杂且艰巨的难点,这些难点犹如一道道关卡,阻碍着国产芯片的快速发展。然而,科研人员和相关企业并未退缩,积极探索并提出了一系列切实可行的解...
国产化替代产品目录   28  
热门文章
项目管理软件有哪些?
云禅道AD
禅道项目管理软件

云端的项目管理软件

尊享禅道项目软件收费版功能

无需维护,随时随地协同办公

内置subversion和git源码管理

每天备份,随时转为私有部署

免费试用