将 Pandas 列转换为日期时间

2024-11-21 08:33:00
admin
原创
6
摘要:问题描述:我在 pandas DataFrame 中有一个字段以字符串格式导入。它应该是一个日期时间变量。如何将其转换为日期时间列,然后根据日期进行过滤?例子:raw_data = pd.DataFrame({'Mycol': ['05SEP2014:00:00:00.000']}) 解决方案 1:使用该to...

问题描述:

我在 pandas DataFrame 中有一个字段以字符串格式导入。

它应该是一个日期时间变量。如何将其转换为日期时间列,然后根据日期进行过滤?

例子:

raw_data = pd.DataFrame({'Mycol': ['05SEP2014:00:00:00.000']})

解决方案 1:

使用该to_datetime函数,指定与您的数据匹配的格式。

df['Mycol'] = pd.to_datetime(df['Mycol'], format='%d%b%Y:%H:%M:%S.%f')

解决方案 2:

如果有多个列需要转换,您可以执行以下操作:

df[["col1", "col2", "col3"]] = df[["col1", "col2", "col3"]].apply(pd.to_datetime)

解决方案 3:

编辑:建议使用pd.to_datetime()而不是这个,因为.apply()通常比较慢。

可以使用DataFrame方法.apply()对Mycol中的值进行操作:

>>> df = pd.DataFrame(['05SEP2014:00:00:00.000'], columns=['Mycol'])
>>> df
                    Mycol
0  05SEP2014:00:00:00.000
>>> import datetime as dt
>>> df['Mycol'] = df['Mycol'].apply(lambda x: 
...     dt.datetime.strptime(x, '%d%b%Y:%H:%M:%S.%f'))
>>> df
       Mycol
0 2014-09-05

解决方案 4:

使用 pandasto_datetime函数将列解析为 DateTime。此外,通过使用infer_datetime_format=True,它将自动检测格式并将提到的列转换为 DateTime。

import pandas as pd
raw_data['Mycol'] = pd.to_datetime(raw_data['Mycol'], infer_datetime_format=True)

解决方案 5:

节省时间:

raw_data['Mycol'] = pd.to_datetime(raw_data['Mycol'])

解决方案 6:

设置正确的format=比让熊猫发现要快得多1

长话短说,像chrisb 的帖子format=中那样从一开始就传递正确的格式比让 pandas 找出格式要快得多,尤其是当格式包含时间组件时。对于大于 10k 行的数据帧,运行时间差异很大(快约 25 倍,所以我们说的是几分钟 vs 几秒钟)。所有有效的格式选项都可以在https://strftime.org/找到。

性能图

errors='coerce'有用

如果某些行的格式不正确或根本不是日期时间,则errors=参数非常有用,以便您可以转换有效行并稍后处理包含无效值的行。

df['date'] = pd.to_datetime(
    df['date'], format='%d%b%Y:%H:%M:%S.%f', errors='coerce')

# for multiple columns
df[['start', 'end']] = df[['start', 'end']].apply(
    pd.to_datetime, format='%d%b%Y:%H:%M:%S.%f', errors='coerce')
沉默SettingWithCopyWarning

顺便提一下,如果您收到此警告,则意味着您的数据框可能是通过过滤另一个数据框创建的。启用写时复制,您就可以开始了。(有关更多信息,请参阅此帖子)。

pd.set_option('copy_on_write', True)
df['date'] = pd.to_datetime(df['date'], format='%d%b%Y:%H:%M:%S.%f')

1用于生成 timeit 测试图的代码。

import perfplot
from random import choices
from datetime import datetime

mdYHMSf = range(1,13), range(1,29), range(2000,2024), range(24), *[range(60)]*2, range(1000)
perfplot.show(
    kernels=[lambda x: pd.to_datetime(x), 
             lambda x: pd.to_datetime(x, format='%m/%d/%Y %H:%M:%S.%f'), 
             lambda x: pd.to_datetime(x, infer_datetime_format=True),
             lambda s: s.apply(lambda x: datetime.strptime(x, '%m/%d/%Y %H:%M:%S.%f'))],
    labels=["pd.to_datetime(df['date'])", 
            "pd.to_datetime(df['date'], format='%m/%d/%Y %H:%M:%S.%f')", 
            "pd.to_datetime(df['date'], infer_datetime_format=True)", 
            "df['date'].apply(lambda x: datetime.strptime(x, '%m/%d/%Y %H:%M:%S.%f'))"],
    n_range=[2**k for k in range(20)],
    setup=lambda n: pd.Series([f"{m}/{d}/{Y} {H}:{M}:{S}.{f}" 
                               for m,d,Y,H,M,S,f in zip(*[choices(e, k=n) for e in mdYHMSf])]),
    equality_check=pd.Series.equals,
    xlabel='len(df)'
)

如果列包含多种格式,请参阅将混合格式字符串的列转换为日期时间 Dtype。

解决方案 7:

就像我们将对象数据类型转换为浮点数或整数一样,使用astype()。

raw_data['Mycol'] = raw_data['Mycol'].astype('datetime64[ns]')
相关推荐
  为什么项目管理通常仍然耗时且低效?您是否还在反复更新电子表格、淹没在便利贴中并参加每周更新会议?这确实是耗费时间和精力。借助软件工具的帮助,您可以一目了然地全面了解您的项目。如今,国内外有足够多优秀的项目管理软件可以帮助您掌控每个项目。什么是项目管理软件?项目管理软件是广泛行业用于项目规划、资源分配和调度的软件。它使项...
项目管理软件   601  
  华为IPD与传统研发模式的8大差异在快速变化的商业环境中,产品研发模式的选择直接决定了企业的市场响应速度和竞争力。华为作为全球领先的通信技术解决方案供应商,其成功在很大程度上得益于对产品研发模式的持续创新。华为引入并深度定制的集成产品开发(IPD)体系,相较于传统的研发模式,展现出了显著的差异和优势。本文将详细探讨华为...
IPD流程是谁发明的   7  
  如何通过IPD流程缩短产品上市时间?在快速变化的市场环境中,产品上市时间成为企业竞争力的关键因素之一。集成产品开发(IPD, Integrated Product Development)作为一种先进的产品研发管理方法,通过其结构化的流程设计和跨部门协作机制,显著缩短了产品上市时间,提高了市场响应速度。本文将深入探讨如...
华为IPD流程   9  
  在项目管理领域,IPD(Integrated Product Development,集成产品开发)流程图是连接创意、设计与市场成功的桥梁。它不仅是一个视觉工具,更是一种战略思维方式的体现,帮助团队高效协同,确保产品按时、按质、按量推向市场。尽管IPD流程图可能初看之下显得错综复杂,但只需掌握几个关键点,你便能轻松驾驭...
IPD开发流程管理   8  
  在项目管理领域,集成产品开发(IPD)流程被视为提升产品上市速度、增强团队协作与创新能力的重要工具。然而,尽管IPD流程拥有诸多优势,其实施过程中仍可能遭遇多种挑战,导致项目失败。本文旨在深入探讨八个常见的IPD流程失败原因,并提出相应的解决方法,以帮助项目管理者规避风险,确保项目成功。缺乏明确的项目目标与战略对齐IP...
IPD流程图   8  
热门文章
项目管理软件有哪些?
云禅道AD
禅道项目管理软件

云端的项目管理软件

尊享禅道项目软件收费版功能

无需维护,随时随地协同办公

内置subversion和git源码管理

每天备份,随时转为私有部署

免费试用