如何使用 Red Hat Linux 上的标准工具随机化文件中的行?
- 2024-10-29 08:34:00
- admin 原创
- 69
问题描述:
如何使用 Red Hat Linux 上的标准工具随机化文件中的行?
我没有shuf
命令,所以我正在寻找类似perl
或awk
单行完成相同任务的东西。
解决方案 1:
嗯,别忘了
sort --random-sort
解决方案 2:
shuf
是最好的方法。
sort -R
速度慢得令人难以忍受。我刚刚尝试对 5GB 文件进行排序。2.5 小时后我放弃了。然后shuf
在一分钟内就完成了排序。
解决方案 3:
您将获得一行 Perl 代码!
perl -MList::Util -e 'print List::Util::shuffle <>'
它使用了一个模块,但该模块是 Perl 代码分发的一部分。如果这还不够好,您可以考虑自己动手。
我尝试使用标志-i
(“就地编辑”)来编辑文件。文档表明它应该可以工作,但实际上却不行。它仍然将打乱顺序的文件显示到 stdout,但这次它会删除原始文件。我建议你不要使用它。
考虑一个 shell 脚本:
#!/bin/sh
if [[ $# -eq 0 ]]
then
echo "Usage: $0 [file ...]"
exit 1
fi
for i in "$@"
do
perl -MList::Util -e 'print List::Util::shuffle <>' $i > $i.new
if [[ `wc -c $i` -eq `wc -c $i.new` ]]
then
mv $i.new $i
else
echo "Error for file $i!"
fi
done
未经测试,但希望有效。
解决方案 4:
cat yourfile.txt | while IFS= read -r f; do printf "%05d %s
" "$RANDOM" "$f"; done | sort -n | cut -c7-
读取文件,在每行前面添加一个随机数,根据这些随机前缀对文件进行排序,然后剪切前缀。一行代码应该可以在任何半现代的 shell 中使用。
编辑:纳入了理查德汉森的评论。
解决方案 5:
Python 的一行程序:
python -c "import random, sys; lines = open(sys.argv[1]).readlines(); random.shuffle(lines); print ''.join(lines)," myFile
仅打印一行随机行:
python -c "import random, sys; print random.choice(open(sys.argv[1]).readlines())," myFile
但是请参阅这篇文章以了解 python 的缺点random.shuffle()
。它无法很好地处理许多(超过 2080 个)元素。
解决方案 6:
与吉姆的回答相关:
我的~/.bashrc
包含以下内容:
unsort ()
{
LC_ALL=C sort -R "$@"
}
使用 GNU coreutils 的排序,-R
= --random-sort
,它会生成每行的随机哈希值并根据它进行排序。在某些较旧(有缺陷)版本的某些语言环境中,随机哈希值实际上不会使用,导致它返回正常的排序输出,这就是我设置的原因LC_ALL=C
。
与克里斯的回答相关:
perl -MList::Util=shuffle -e'print shuffle<>'
是稍微短一点的单行代码。(-Mmodule=a,b,c
是的简写-e 'use module qw(a b c);'
。)
给它一个简单的方法-i
不能用于就地改组,是因为 Perl 期望发生print
在读取文件的同一循环中,并且print shuffle <>
直到读取并关闭所有输入文件后才会输出。
作为一种较短的解决方法,
perl -MList::Util=shuffle -i -ne'BEGIN{undef$/}print shuffle split/^/m'
将会就地对文件进行混排。(-n
意思是“将代码包装在一个while (<>) {...}
循环中;BEGIN{undef$/}
使 Perl 一次对一个文件进行操作而不是一次对一行进行操作,这split/^/m
是必需的,因为$_=<>
已经隐式地对整个文件而不是行进行了操作。)
解决方案 7:
当我使用 homebrew 安装 coreutils 时
brew install coreutils
shuf
变为可用n
。
解决方案 8:
带有 DarwinPorts 的 Mac OS X:
sudo port install unsort
cat $file | unsort | ...
解决方案 9:
FreeBSD 有自己的随机实用程序:
cat $file | random | ...
它位于 /usr/games/random,因此如果您还没有安装游戏,那您就倒霉了。
您可以考虑安装像 textproc/rand 或 textproc/msort 这样的端口。如果考虑可移植性,这些端口可能在 Linux 和/或 Mac OS X 上可用。
解决方案 10:
在 OSX 上,从http://ftp.gnu.org/gnu/coreutils/获取最新版本,然后类似
./配置制作 sudo 制作安装
...应该给你 /usr/local/bin/sort --random-sort
不会弄乱 /usr/bin/sort
解决方案 11:
或者从 MacPorts 获取:
$ sudo port install coreutils
和/或
$ /opt/local//libexec/gnubin/sort --random-sort
- 2024年20款好用的项目管理软件推荐,项目管理提效的20个工具和技巧
- 2024年开源项目管理软件有哪些?推荐5款好用的项目管理工具
- 项目管理软件有哪些?推荐7款超好用的项目管理工具
- 项目管理软件哪个最好用?盘点推荐5款好用的项目管理工具
- 项目管理软件有哪些最好用?推荐6款好用的项目管理工具
- 2024年常用的项目管理软件有哪些?推荐这10款国内外好用的项目管理工具
- 项目管理软件有哪些,盘点推荐国内外超好用的7款项目管理工具
- 2024项目管理软件排行榜(10类常用的项目管理工具全推荐)
- 项目管理软件排行榜:2024年项目经理必备5款开源项目管理软件汇总
- 项目管理必备:盘点2024年13款好用的项目管理软件