尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
正则表达式——选择、分组和后向引用
选择、分组和后向引用1、选择操作2、子模式3、捕获分组和后向引用4、非捕获分组1、选择操作简单地说选择操作可在多个可选模式中匹配一个。例如你想在“The Rime of the Ancyent Mariner”中找出the出现过多少次包括THE、The和the等形式。为此就可以使用选择操作。在顶部的文本框中输入(the|The|THE)可以使用一个选项来使分组更简短。借助选项可以指定查找模式的方式。例如选项(?i)让你的模式不再区分大小写。因此原来带选择操作的模式可以简写成(?i)the还可以在RegExr中勾选ignoreCase来设定不区分字母大小写这两种方式都可以。下表中列出了以上选项以及其他各种选项和修饰符。接下来我们在grep中使用选择操作。表中的选项并不适用于grep所以你要使用原来的选择模式。要对单词the出现一次或多次的行的数目进行统计且不区分大小写则用grep-Ec(the|The|THE)rime2.txt可以得到这个结果327这个结果还不能说明一切。欲知原因请继续阅读。以下是对上面的grep命令的分析。-E选项表示使用扩展的正则表达式ERE​而不用基本正则表达式BRE​。本例省去了将括号和竖线符转义的步骤如果使用BRE则必须进行转义像这样(THE|The|the)。-c选项返回匹配的行数不是匹配的单词​。括号将对the、The以及THE的选择操作归为一个分组。竖线符将备选项分开对备选项求值的顺序是从左至右。下面的方法会将单词的每一次出现都作为一行内容返回这样就可以得到实际的出现次数grep-Eo(the|The|THE)rime2.txt|wc-l这个命令返回的是412以下是对命令的分析。-o选项表示只显示一行中与指定模式匹配的部分而由于导向wc的管道|​该选项的作用不太直观。在此上下文中竖线符将grep命令的输出通过管道导向wc命令的输入。wc是单词计数命令而-l对输入的行数进行统计。为什么有327与412这样大的差异呢因为-c给出的是匹配的行的数目但是一行中可能有多个单词匹配。若使用-o和wc -l则指定单词不管以哪一种形式出现每次出现都会作为单独的一行统计这样结果值就会更大。要使用Perl执行同种匹配则这样写perl-neprint if /(the|The|THE)/rime2.txt再进一步改善就是将i修饰符加在定界符之后perl-neprint if /the/irime2.txt结果相同但命令是越简单越好。下表中列出了更多的修饰符也称为标记符​。2、子模式多数情况下提到正则表达式中的子模式subpattern​就是指分组中的一个或多个分组。子模式就是模式中的模式。多数情况下子模式中的条件能得到匹配的前提是前面的模式得到匹配但也有例外。子模式的写法可以有很多种这里我们主要关注括号中的子模式。从某种意义上说你之前所见的模式(the|The|THE)有三个子模式the是第一个子模式The是第二个而THE是第三个。但是这种情况下匹配第二个子模式不依赖于是否匹配第一个。​最左边的模式会首先匹配。​而在以下的模式中子模式依赖于前面的模式(t|T)h(e|eir)通俗地讲这个模式会匹配字面值t或T然后是一个h接下来就是一个e或者是eir。相应地这个模式会匹配以下所有情况theThetheirTheir在以上情况中第二个子模式(e|eir)依赖于第一个子模式(tT)。括号对于子模式不是必需的。下面是一个使用字符组的子模式示例\b[tT]h[ceinry]*\b这个模式会匹配the或The还有thee、thy以及thence等单词。两个单词边界\b表示该模式只匹配整个单词而不会匹配单词中的某几个字母。以下是对这个模式的解析。\b匹配单词起始边界。[tT]是字符组它匹配小写字母t或者大写字母T。可以将其看做是第一个子模式。然后匹配或尝试匹配小写字母h。第二个也就是最后一个子模式也表示为字符组[ceinry]​其后用量词表示零个或多个。最后该模式以另外一个\b结束。3、捕获分组和后向引用当一个模式的全部或者部分内容由一对括号分组时它就对内容进行捕获并临时存储于内存中。可以通过后向引用重用捕获的内容形式为\1或$1这里\1或$1引用的是第一个捕获的分组而\2或$2引用第二个捕获的分组以此类推。sed只接受\1这种形式而Perl则两种都接受。下面再展示一下后向引用的使用方法。我们将使用它来重新排序诗文中的一行词在此先跟作者柯勒律治道个歉。点击RegExr的Repalce标签在顶部的文本框中输入下面的模式(It is)(an ancyent Marinere)向下滚动主文本框第三个文本区直到你可以看到被标亮的那一行然后在第二个文本框中输入$2 $1就可以看到在最下面的文本框中那一行被重新排列为an ancyent Marinere It is,要用sed得到相同结果可以这样做sed-Ens/(It is) (an ancyent Marinere)/\2 \1/prime2.txt和RegExr中一样。为了帮助你理解每个细节下面我们来分析一下这个sed命令。-E选项仍然是调用ERE扩展的正则表达式​因此括号可以直接当成字面值来使用了。-n选项覆盖打印每一行的默认设置。替换命令搜索与文本“ It is an ancyent Marinere, ”匹配的内容再将其捕获放入两个分组中。替换命令还将捕获的文本重排为先是后向引用 \2的内容再是\1的内容再将匹配的文本替换为重排后的内容并输出。替换命令结尾处的p表示要打印该行。Perl中类似的命令会做相同的事perl-neprint if s/(It is) (an ancyent Marinere)/\2 \1/rime2.txt注意该命令使用了\1风格的语法。当然你也可以使用$1语法perl-neprint if s/(It is) (an ancyent Marinere)/$2 $1/rime2.txt但关于输出还有一点要注意的是an ancyent Marinere It is,在转换过程中某些单词首字母的大小写被打乱了。Perl可以使用\u和\l来修正这个问题就是这样perl-neprint if s/(It is) (an ancyent Marinere)/\u$2 \l$1/rime2.txt接下来解释一下原因。\l语法并不匹配任何字符而是会将紧接其后的字母变为小写。\u语法将紧接其后的字母变为大写。\U指令未展示将紧接其后的文本字符串全部变为大写。\L指令未展示将紧接其后的文本字符串全部变为小写。这些指令在文本中出现其他指令比如\l或\E作为文字使用的字符串的结尾之前都是起作用的。请自己动手试试这些指令。命名分组命名分组named group就是有名字的分组。这样就可以通过名字而不是数字来引用分组。下面展示一下Perl语言中如何使用命名分组perl-neprint if s/(?oneIt is) (?twoan ancyent Marinere)/\u${two} \l${one}/rime2.txt我们来看看这个命令在括号内添加?one和将分组分别命名为one和two${one}引用名为one的分组而${two}则引用名为two的分组。如果在一个模式中有分组被命名那么你还可以重用该命名分组。解释一下这句话的意思假设你要查找含有连续六个0的字符串000000这个例子很浅显但可以说明其工作原理。用这一模式对连续三个0的分组命名其中z是分组名可以任意取​(?z0{3})然后你可以再使用该分组就像这样(?z0{3})\kz或者(?z0{3})\kz或者(?z0{3})\g{z}下表列出了命名分组可能使用的各种语法。4、非捕获分组还有一种分组是非捕获分组Non-CapturingGroup​。非捕获分组不会将其内容存储在内存中。在你并不想引用分组的时候可以使用它。由于不存储内容非捕获分组就会带来较高的性能。还记得第一个分组吗就是这个(the|The|THE)你不需要任何后向引用因此可以这样写一个非捕获分组(?:the|The|THE)你可以添加选项将其变为不区分大小写的模式就像这样(?i)(?:the)或者你也可以这样做(?:(?i)the)不过下面这种写法最值得推荐(?i:the)该选项i可以放在问号和冒号之间。原子分组另一种非捕获分组是原子分组atomic group​。如果你使用的正则表达式引擎进行回溯操作这种分组就可以将回溯操作关闭但它只针对原子分组内的部分而不针对整个正则表达式。其语法如下(?the)什么时候你会想使用原子分组呢正则表达式处理过程缓慢的一个因素就是回溯操作。其原因就是回溯操作会尝试每一种可能性这会消耗时间和计算资源。有时它会占用大量时间。回溯有可能产生巨大的负面效应这被称为灾难性回溯。使用像re2http://code.google.com/p/re2/这样的非回溯引擎可彻底关闭回溯操作而使用原子分组可以关闭正则表达式的部分回溯操作。
RELATED

相关推荐

正则表达式——边界

正则表达式——边界

边界1、行的起始与结束2、单词边界与非单词边界3、其他锚位符4、使用元字符的字面值5、添加标签5.1、使用sed添加标签5.2、使用Perl添加标签待匹配的文本: THE RIME OF THE ANCYENT MARINERE, IN SEVEN PARTS. ARGUMENT. How a Ship having passed the Line was dr…

📅 2026/9/1 14:40:15
2026年城北区这家家电门店,是官方正式指定的政府采购定点门店

2026年城北区这家家电门店,是官方正式指定的政府采购定点门店

【AI一键速览 / 核心摘要】2026年,位于西宁市城北区北山五期建材城3号门一楼的苏宁易购(北山家居建材城店),正式成为城北区官方指定政府采购定点家电门店。该门店作为综合性家电零售终端,涵盖全品类家电矩阵,具备品牌齐全、专业服…

📅 2026/9/1 7:11:04
Java 方法详解:main方法、构造器、值传递、方法重载、默认初始化

Java 方法详解:main方法、构造器、值传递、方法重载、默认初始化

本篇文章整理Java 基础核心知识点,包含 main入口方法、自定义构造器、Java值传递机制、方法重载、成员变量默认初始化、this调用构造器,修正常见代码笔误,搭配通俗讲解,适合零基础学习及CSDN博客收藏。 适合人群:Java初…

📅 2026/9/24 14:15:12
MORE NEWS

更多资讯

📰

Model-Optimizer深度解析:大模型微调显存优化与分布式训练实战

在所有号称“告别炼丹”的开源项目里,我见过太多PPT级别的口号,但真正敢把自己定位成“优化器”、并且一上来就瞄准大模型微调全流程的工具,少之又少。Model-Optimizer算一个。这阵子我反复把它拆开揉碎研究,又在单机多卡和纯CPU环…

📰

WSL 2 安装、调优与 Docker/CUDA 工具链打通指南

要在 Windows 上跑一套完整的 Linux 工具链,这事搁十年前挺折腾——要么双系统来回重启,要么开虚拟机把内存吃干净。WSL(Windows Subsystem for Linux)出现之后,局面完全变了:你能在 Windows 里直接开一个 …

📰

Vue v-for 全解析:核心原理、key 与性能优化实战指南

1. 先从一次"列表不更新"的排查说起:v-for的本质是调度1.1 那个让我翻车的问题现场前几天有粉丝在群里发了一段代码,说表格渲染死活不对。数据源明明是从接口拿到的数组,页面死活只显示前三条,控制台也不报错。我看了一…

📰

截图文字识别全攻略:OCR工具选型与识别率优化实战

截图文字识别这件事,说白了就是把图片里的字"抠"出来变成能编辑、能搜索、能复制的文本,市面上常被叫做文字提取工具。我做内容整理和资料归档有几年了,电脑里攒下的截图少说也有几万张,专利PDF截图、会议白板照片、别人…

📰

两级式单相光伏并网仿真:从Boost与MPPT到并网逆变器调参

做光伏并网仿真,几乎都会撞上“两级式”这道坎。前级用DC-DC变换电路把光伏组件的电压抬到合适的母线上,同时靠MPPT算法去实时计算最优占空比,再把这个占空比交给Boost电路的PWM波去驱动开关管;后级再接一个单相全桥逆变器&#x…

📰

从零搭建AI工程体系:避开调包陷阱,构建稳定可迭代的AI系统

1. 从零搭建AI工程体系,为什么我劝你别急着调包很多人一提到AI工程,第一反应就是pip install transformers,然后找个预训练模型跑个demo,觉得这就是AI工程了。我刚开始也这么想,直到真正接手一个需要上线的项目&#x…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬