如何根据指定的行数拆分 CSV 文件?

2024-10-22 08:29:00
admin
原创
252
摘要:问题描述:我在 LINUX 服务器上存储了一个 CSV 文件(大约 10,000 行;每行有 300 列)。我想将此 CSV 文件拆分为 500 个 CSV 文件,每个文件有 20 条记录。(每个 CSV 文件的 CSV 标题与原始 CSV 文件的标题相同)是否有任何 Linux 命令可以帮助这种转换?解决方...

问题描述:

我在 LINUX 服务器上存储了一个 CSV 文件(大约 10,000 行;每行有 300 列)。我想将此 CSV 文件拆分为 500 个 CSV 文件,每个文件有 20 条记录。(每个 CSV 文件的 CSV 标题与原始 CSV 文件的标题相同)

是否有任何 Linux 命令可以帮助这种转换?


解决方案 1:

使用 Linux split 命令:

split -l 20 file.txt new    

将文件“file.txt”拆分为以名称“new”开头的文件,每个文件包含 20 行文本。

在 Unix 提示符下输入man split更多信息。但是,您必须先从 file.txt 中删除标题(tail例如,使用命令),然后将其重新添加到每个拆分文件中。

解决方案 2:

将其变成一个函数。您现在可以调用splitCsv <Filename> [chunkSize]

splitCsv() {
    HEADER=$(head -1 $1)
    if [ -n "$2" ]; then
        CHUNK=$2
    else 
        CHUNK=1000
    fi
    tail -n +2 $1 | split -l $CHUNK - $1_split_
    for i in $1_split_*; do
        sed -i -e "1i$HEADER" "$i"
    done
}

发现于: http: //edmondscommerce.github.io/linux/linux-split-file-eg-csv-and-keep-header-row.html

解决方案 3:

单行 csv 拆分器,保留每个拆分文件中的标题行。此示例为每个文件提供 999 行数据和一个标题行。

cat bigFile.csv | parallel --header : --pipe -N999 'cat >split_file_{#}.csv'

有关安装 parallel 的提示,请参阅https://stackoverflow.com/a/53062251/401226,其中的答案包含有关为 macos 和 Debian/Ubuntu 安装正确版本的 parallel 的评论(在 ubuntu 中使用专门命名的 parallel 包,它比 moreutils 中捆绑的包更新)

解决方案 4:

这应该有效!

file_name= 您要拆分的文件的名称。

10000= 每个拆分文件包含的行数

file_part_= 拆分文件名的前缀(file_part_0、file_part_1、file_part_2……等等)

split -d -l 10000 文件名.csv 文件部分

解决方案 5:

这应该可以帮你搞定——你的所有文件最终都会被命名为 Part1-Part500。

#!/bin/bash
FILENAME=10000.csv
HDR=$(head -1 $FILENAME)   # Pick up CSV header line to apply to each file
split -l 20 $FILENAME xyz  # Split the file into chunks of 20 lines each
n=1
for f in xyz*              # Go through all newly created chunks
do
   echo $HDR > Part${n}    # Write out header to new file called "Part(n)"
   cat $f >> Part${n}      # Add in the 20 lines from the "split" command
   rm $f                   # Remove temporary file
   ((n++))                 # Increment name of output part
done

解决方案 6:

这个问题是很多年前提出的,但对于未来的读者,我想提一下,最方便的工具是xsv来自https://github.com/BurntSushi/xsv

子命令split旨在执行原始问题中要求的操作。文档中写道:

split - Split one CSV file into many CSV files of N chunks

每个分割块都保留标题行。

相关推荐
  政府信创国产化的10大政策解读一、信创国产化的背景与意义信创国产化,即信息技术应用创新国产化,是当前中国信息技术领域的一个重要发展方向。其核心在于通过自主研发和创新,实现信息技术应用的自主可控,减少对外部技术的依赖,并规避潜在的技术制裁和风险。随着全球信息技术竞争的加剧,以及某些国家对中国在科技领域的打压,信创国产化显...
工程项目管理   1565  
  为什么项目管理通常仍然耗时且低效?您是否还在反复更新电子表格、淹没在便利贴中并参加每周更新会议?这确实是耗费时间和精力。借助软件工具的帮助,您可以一目了然地全面了解您的项目。如今,国内外有足够多优秀的项目管理软件可以帮助您掌控每个项目。什么是项目管理软件?项目管理软件是广泛行业用于项目规划、资源分配和调度的软件。它使项...
项目管理软件   1354  
  信创国产芯片作为信息技术创新的核心领域,对于推动国家自主可控生态建设具有至关重要的意义。在全球科技竞争日益激烈的背景下,实现信息技术的自主可控,摆脱对国外技术的依赖,已成为保障国家信息安全和产业可持续发展的关键。国产芯片作为信创产业的基石,其发展水平直接影响着整个信创生态的构建与完善。通过不断提升国产芯片的技术实力、产...
国产信创系统   21  
  信创生态建设旨在实现信息技术领域的自主创新和安全可控,涵盖了从硬件到软件的全产业链。随着数字化转型的加速,信创生态建设的重要性日益凸显,它不仅关乎国家的信息安全,更是推动产业升级和经济高质量发展的关键力量。然而,在推进信创生态建设的过程中,面临着诸多复杂且严峻的挑战,需要深入剖析并寻找切实可行的解决方案。技术创新难题技...
信创操作系统   27  
  信创产业作为国家信息技术创新发展的重要领域,对于保障国家信息安全、推动产业升级具有关键意义。而国产芯片作为信创产业的核心基石,其研发进展备受关注。在信创国产芯片的研发征程中,面临着诸多复杂且艰巨的难点,这些难点犹如一道道关卡,阻碍着国产芯片的快速发展。然而,科研人员和相关企业并未退缩,积极探索并提出了一系列切实可行的解...
国产化替代产品目录   28  
热门文章
项目管理软件有哪些?
云禅道AD
禅道项目管理软件

云端的项目管理软件

尊享禅道项目软件收费版功能

无需维护,随时随地协同办公

内置subversion和git源码管理

每天备份,随时转为私有部署

免费试用