有没有numpy group by函数？

2024-12-17 08:30:00

admin

原创

148

摘要：问题描述：numpy 中是否有任何函数可以按第一列对该数组进行分组？我在网上找不到任何好的答案。>>> a array([[ 1, 275], [ 1, 441], [ 1, 494], [ 1, 593], [ 2, 679...

问题描述：

numpy 中是否有任何函数可以按第一列对该数组进行分组？

我在网上找不到任何好的答案。

>>> a
array([[  1, 275],
       [  1, 441],
       [  1, 494],
       [  1, 593],
       [  2, 679],
       [  2, 533],
       [  2, 686],
       [  3, 559],
       [  3, 219],
       [  3, 455],
       [  4, 605],
       [  4, 468],
       [  4, 692],
       [  4, 613]])

想要的输出：

array([[[275, 441, 494, 593]],
       [[679, 533, 686]],
       [[559, 219, 455]],
       [[605, 468, 692, 613]]], dtype=object)

解决方案 1：

受到Eelco Hoogendoorn 的图书馆的启发，但没有他的图书馆，并且利用了数组第一列始终在增加的事实（如果不是，请先用排序a = a[a[:, 0].argsort()]）

>>> np.split(a[:,1], np.unique(a[:, 0], return_index=True)[1][1:])
[array([275, 441, 494, 593]),
 array([679, 533, 686]),
 array([559, 219, 455]),
 array([605, 468, 692, 613])]

我没有“计时”（[编辑]见下文）但这可能是解决问题的更快方法：

没有 Python 原生循环
结果列表是 numpy 数组，如果你需要对它们进行其他 numpy 操作，则不需要进行新的转换
复杂度看起来是 O(n) （如果进行排序则为 O(n log(n))

[2021 年 9 月编辑] 我在 Macbook M1 上运行了 timeit，用于处理包含 10k 个随机整数的表。持续时间为 1000 次调用。

>>> a = np.random.randint(5, size=(10000, 2))  # 5 different "groups"

# Only the sort
>>> a = a[a[:, 0].argsort()]
⏱ 116.9 ms

# Group by on the already sorted table
>>> np.split(a[:, 1], np.unique(a[:, 0], return_index=True)[1][1:])
⏱ 35.5 ms

# Total sort + groupby
>>> a = a[a[:, 0].argsort()]
>>> np.split(a[:, 1], np.unique(a[:, 0], return_index=True)[1][1:])

相关推荐

置顶 政府信创国产化的10大政策解读

政府信创国产化的10大政策解读

政府信创国产化的10大政策解读一、信创国产化的背景与意义信创国产化，即信息技术应用创新国产化，是当前中国信息技术领域的一个重要发展方向。其核心在于通过自主研发和创新，实现信息技术应用的自主可控，减少对外部技术的依赖，并规避潜在的技术制裁和风险。随着全球信息技术竞争的加剧，以及某些国家对中国在科技领域的打压，信创国产化显...

工程项目管理 1565

置顶 2025年20款好用的项目管理软件推荐，项目管理提效的20个工具和技巧

2025年20款好用的项目管理软件推荐，项目管理提效的20个工具和技巧

为什么项目管理通常仍然耗时且低效？您是否还在反复更新电子表格、淹没在便利贴中并参加每周更新会议？这确实是耗费时间和精力。借助软件工具的帮助，您可以一目了然地全面了解您的项目。如今，国内外有足够多优秀的项目管理软件可以帮助您掌控每个项目。什么是项目管理软件？项目管理软件是广泛行业用于项目规划、资源分配和调度的软件。它使项...

项目管理软件 1354

信创国产芯片如何推动自主可控生态建设

信创国产芯片如何推动自主可控生态建设

信创国产芯片作为信息技术创新的核心领域，对于推动国家自主可控生态建设具有至关重要的意义。在全球科技竞争日益激烈的背景下，实现信息技术的自主可控，摆脱对国外技术的依赖，已成为保障国家信息安全和产业可持续发展的关键。国产芯片作为信创产业的基石，其发展水平直接影响着整个信创生态的构建与完善。通过不断提升国产芯片的技术实力、产...

国产信创系统 21

信创生态建设中的5个关键挑战与解决方案

信创生态建设中的5个关键挑战与解决方案

信创生态建设旨在实现信息技术领域的自主创新和安全可控，涵盖了从硬件到软件的全产业链。随着数字化转型的加速，信创生态建设的重要性日益凸显，它不仅关乎国家的信息安全，更是推动产业升级和经济高质量发展的关键力量。然而，在推进信创生态建设的过程中，面临着诸多复杂且严峻的挑战，需要深入剖析并寻找切实可行的解决方案。技术创新难题技...

信创操作系统 27

信创国产芯片的研发难点与解决方案

信创国产芯片的研发难点与解决方案

信创产业作为国家信息技术创新发展的重要领域，对于保障国家信息安全、推动产业升级具有关键意义。而国产芯片作为信创产业的核心基石，其研发进展备受关注。在信创国产芯片的研发征程中，面临着诸多复杂且艰巨的难点，这些难点犹如一道道关卡，阻碍着国产芯片的快速发展。然而，科研人员和相关企业并未退缩，积极探索并提出了一系列切实可行的解...

国产化替代产品目录 28

热门文章

政府信创国产化的10大政策解读

2025年20款好用的项目管理软件推荐，项目管理提效的20个工具和技巧

使用 Python 'Requests' 模块的代理

10个项目管理常见问题解答：包括难点和解决方法

项目延期的原因有哪些？如何有效预防和管理？

项目里程碑计划模板怎么写?设定项目里程碑的5个方法

项目管理指南：制定项目实施计划的6大步骤有哪些？

项目管理软件有哪些？

云禅道AD

禅道项目管理软件

云端的项目管理软件

尊享禅道项目软件收费版功能

无需维护，随时随地协同办公

内置subversion和git源码管理

每天备份，随时转为私有部署