Python Regex 引擎 - “后视需要固定宽度模式”错误

2025-02-11 09:51:00
admin
原创
56
摘要:问题描述:我正在尝试处理 CSV 格式的字符串内不匹配的双引号。确切地说,"It "does "not "make "sense", Well, "Does "it" 应更正为"It" "d...

问题描述:

我正在尝试处理 CSV 格式的字符串内不匹配的双引号。

确切地说,

"It "does "not "make "sense", Well, "Does "it"

应更正为

"It" "does" "not" "make" "sense", Well, "Does" "it"

所以基本上我想做的是

替换所有“”

  1. 前面没有行首或逗号(和)

  2. 后面没有逗号或行尾

和 ' ” ” '

为此我使用以下正则表达式

(?<!^|,)"(?!,|$)

问题是,虽然 Ruby 正则表达式引擎(http://www.rubular.com/)能够解析正则表达式,但 python 正则表达式引擎(https://pythex.org/http://www.pyregex.com/ )会抛出以下错误

Invalid regular expression: look-behind requires fixed-width pattern

使用 python 2.7.3 时会抛出

sre_constants.error: look-behind requires fixed-width pattern

有人能告诉我这里有什么让 Python 恼火的事情吗?


编辑:

根据 Tim 的回复,我得到了以下多行字符串的输出

>>> str = """ "It "does "not "make "sense", Well, "Does "it"
... "It "does "not "make "sense", Well, "Does "it"
... "It "does "not "make "sense", Well, "Does "it"
... "It "does "not "make "sense", Well, "Does "it" """
>>> re.sub(r's*"(?!,|$)', '" "', str)
' "It" "does" "not" "make" "sense", Well, "Does" "it" "
"It" "does" "not" "make" "sense", Well, "Does" "it" "
"It" "does" "not" "make" "sense", Well, "Does" "it" "
"It" "does" "not" "make" "sense", Well, "Does" "it" " '

在每一行的末尾,在“it”旁边添加了两个双引号。

因此我对正则表达式做了很小的改动来处理换行符。

re.sub(r's*"(?!,|$)', '" "', str,flags=re.MULTILINE)

但这给出了输出

>>> re.sub(r's*"(?!,|$)', '" "', str,flags=re.MULTILINE)
' "It" "does" "not" "make" "sense", Well, "Does" "it"
... "It" "does" "not" "make" "sense", Well, "Does" "it"
... "It" "does" "not" "make" "sense", Well, "Does" "it"
... "It" "does" "not" "make" "sense", Well, "Does" "it" " '

仅最后一个“it”就有两个双引号。

但是我想知道为什么行尾字符“$”不能标识该行已经结束。


最终答案是

re.sub(r's*"(?!,|[     ]*$)', '" "', str,flags=re.MULTILINE)

解决方案 1:

Python 后re视确实需要固定宽度,并且当后视模式中的交替长度不同时,有几种方法可以处理这种情况:

  • 重写模式,这样您就不必使用交替(例如,Tim 的上述答案使用单词边界,或者您也可以使用(?<=[^,])"(?!,|$)当前模式的完全等价物,该模式需要在双引号前使用逗号以外的字符,或者使用常用模式来匹配用空格括起来的单词,,(?<=s|^)w+(?=s|$)可以写成(?<!S)w+(?!S)),或者

  • 拆分后视:

    • 正向后视需要在组中交替进行(例如,(?<=a|bc)应重写为(?:(?<=a)|(?<=bc))

    • 如果后视模式是锚点与单个字符的交替,则可以反转后视的符号并使用包含字符的否定字符类。例如,(?<=s|^)匹配空格或字符串/行的开头(如果re.M使用)。因此,在 Python 中re,使用(?<!S)(?<=^|;)将转换为(?<![^;])。并且,如果您还想确保行的开头也匹配,请添加`
      到否定字符类,例如(?<![^;

])(请参阅Python Regex:匹配行首、分号或字符串开头,无捕获组(?<!S))。注意,由于S`不匹配换行符,因此没有必要这样做。

+ 负向后视可以直接连接起来(例如`(?<!^|,)"(?!,|$)`看起来像`(?<!^)(?<!,)"(?!,|$)`)。

或者,只需使用(或) 安装PyPi 正则表达式模块并享受无限宽度后视。pip install regex`pip3 install regex`

解决方案 2:

Python 后视断言需要固定宽度,但您可以尝试这样做:

>>> s = '"It "does "not "make "sense", Well, "Does "it"'
>>> re.sub(r's*"(?!,|$)', '" "', s)
'"It" "does" "not" "make" "sense", Well, "Does" "it"'

解释:

      # Start the match at the end of a "word"
s*     # Match optional whitespace
"       # Match a quote
(?!,|$) # unless it's followed by a comma or end of string

解决方案 3:

最简单的解决方案是:

import regex as re

regex 支持不同长度的后视模式。

相关推荐
  政府信创国产化的10大政策解读一、信创国产化的背景与意义信创国产化,即信息技术应用创新国产化,是当前中国信息技术领域的一个重要发展方向。其核心在于通过自主研发和创新,实现信息技术应用的自主可控,减少对外部技术的依赖,并规避潜在的技术制裁和风险。随着全球信息技术竞争的加剧,以及某些国家对中国在科技领域的打压,信创国产化显...
工程项目管理   1590  
  为什么项目管理通常仍然耗时且低效?您是否还在反复更新电子表格、淹没在便利贴中并参加每周更新会议?这确实是耗费时间和精力。借助软件工具的帮助,您可以一目了然地全面了解您的项目。如今,国内外有足够多优秀的项目管理软件可以帮助您掌控每个项目。什么是项目管理软件?项目管理软件是广泛行业用于项目规划、资源分配和调度的软件。它使项...
项目管理软件   1361  
  信创产品在政府采购中的占比分析随着信息技术的飞速发展以及国家对信息安全重视程度的不断提高,信创产业应运而生并迅速崛起。信创,即信息技术应用创新,旨在实现信息技术领域的自主可控,减少对国外技术的依赖,保障国家信息安全。政府采购作为推动信创产业发展的重要力量,其对信创产品的采购占比情况备受关注。这不仅关系到信创产业的发展前...
信创和国产化的区别   18  
  信创,即信息技术应用创新产业,旨在实现信息技术领域的自主可控,摆脱对国外技术的依赖。近年来,国货国用信创发展势头迅猛,在诸多领域取得了显著成果。这一发展趋势对科技创新产生了深远的推动作用,不仅提升了我国在信息技术领域的自主创新能力,还为经济社会的数字化转型提供了坚实支撑。信创推动核心技术突破信创产业的发展促使企业和科研...
信创工作   18  
  信创技术,即信息技术应用创新产业,旨在实现信息技术领域的自主可控与安全可靠。近年来,信创技术发展迅猛,对中小企业产生了深远的影响,带来了诸多不可忽视的价值。在数字化转型的浪潮中,中小企业面临着激烈的市场竞争和复杂多变的环境,信创技术的出现为它们提供了新的发展机遇和支撑。信创技术对中小企业的影响技术架构变革信创技术促使中...
信创国产化   19  
热门文章
项目管理软件有哪些?
云禅道AD
禅道项目管理软件

云端的项目管理软件

尊享禅道项目软件收费版功能

无需维护,随时随地协同办公

内置subversion和git源码管理

每天备份,随时转为私有部署

免费试用