Linux -- 正则表达式基础

Linux -- 正则表达式基础

码农世界 2024-06-16 后端 80 次浏览 0个评论

提示:制作不易,可以点个关注和收藏哦。


前言

        虽然我们这一节的标题是正则表达式,但实际这一节实验只是介绍grep,sed,awk这三个命令,而正则表达式作为这三个命令的一种使用方式(命令输出中可以包含正则表达式)。正则表达式本身的内容很多,要把它说明清楚需要单独一门课程来实现,不过我们这一节中涉及到的相关内容通常也能够满足很多情况下的需求了。


提示:以下是本篇文章正文内容,下面案例可供参考。

一、什么是正则表达式呢?

        正则表达式,又称正规表示式、正规表示法、正规表达式、规则表达式、常规表示法(英语:Regular Expression,在代码中常简写为 regex、regexp 或 RE),计算机科学的一个概念。正则表达式使用单个字符串来描述、匹配一系列符合某个句法规则的字符串。在很多文本编辑器里,正则表达式通常被用来检索、替换那些符合某个模式的文本。

        许多程序设计语言都支持利用正则表达式进行字符串操作。例如,在 Perl 中就内建了一个功能强大的正则表达式引擎。正则表达式这个概念最初是由 UNIX 中的工具软件(例如sed和grep)普及开的。正则表达式通常缩写成“regex”,单数有 regexp、regex,复数有 regexps、regexes、regexen。

        简单的说形式和功能上正则表达式和我们前面讲的通配符很像,不过它们之间又有很大差别,特别在于一些特殊的匹配字符的含义上,希望初学者注意不要将两者弄混淆。


二、grep模式匹配命令

        grep命令用于打印输出文本中匹配的模式串,它使用正则表达式作为模式匹配的条件。grep支持三种正则表达式引擎,分别用三个参数指定:

Linux -- 正则表达式基础

        不过在你没学过perl语言的大多数情况下你将只会使用到ERE和BRE,所以我们接下来的内容都不会讨论到PCRE中特有的一些正则表达式语法。(它们之间大部分内容是存在交集的,所以你不用担心会遗漏多少重要内容)

        在通过grep命令使用正则表达式之前,先介绍一下它的常用参数:

Linux -- 正则表达式基础

注:在大多数发行版中是默认设置了grep的颜色的,你可以通过参数指定或修改GREP_COLOR环境变量。


实操:

        实验环境中没有test文件,先建立test文件,利用vim命令编辑test文件

Linux -- 正则表达式基础

输入以下内容:

Linux -- 正则表达式基础

输入完成后,按esc键,输入:wq   ,保存退出。

Linux -- 正则表达式基础

完成后续操作命令,具体操作参数意义查看上面说明:

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础


使用基本正则表达式,BRE

*  位置

        查找/etc/group文件中以"shiyanlou"为开头的行,当^放到括号内为排除字符,否则表示行首。

Linux -- 正则表达式基础

Linux -- 正则表达式基础


*  数量(注意:其中\n为换行符)

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础


*  选择

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

下面包含完整的特殊符号及说明:

Linux -- 正则表达式基础Linux -- 正则表达式基础

注意:之所以要使用特殊符号,是因为上面的[a-z]不是在所有情况下都管用,这还与主机当前的语系有关,即设置在LANG环境变量的值,zh_CN.UTF-8的话[a-z],即为所有小写字母,其它语系可能是大小写交替的如,"a A b B...z Z",[a-z]中就可能包含大写字母。所以在使用[a-z]时请确保当前语系的影响,使用[:lower:]则不会有这个问题。

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

注意:当^放到中括号内为排除字符,否则表示行首。


使用扩展正则表达式,ERE

        要通过grep使用扩展正则表达式需要加上-E参数,或使用egrep

*  数量

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

注意:推荐掌握{n,m}即可,+,?,*,这几个不太直观,且容易弄混淆。

*  选择(注意:因为.号有特殊含义,所以需要转义)

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

        关于正则表达式和grep命令的内容就介绍这么多,下面会介绍两个更强大的工具sed和awk,但同样也正是因为这两个工具的强大,我们的内容无法包含它们的全部,这里将只对基本内容作介绍。


三、sed 流编辑器

        sed工具在 man 手册里面的全名为"sed - stream editor for filtering and transforming text ",意即,用于过滤和转换文本的流编辑器。

        在 Linux/UNIX 的世界里敢称为编辑器的工具,大都非等闲之辈,比如前面的"vi/vim(编辑器之神)","emacs(神的编辑器)","gedit"这些个编辑器。sed与上述的最大不同之处在于它是一个非交互式的编辑器,下面我们就开始介绍sed这个编辑器。


sed 命令基本格式:

Linux -- 正则表达式基础

Linux -- 正则表达式基础


sed执行命令格式:

Linux -- 正则表达式基础

        其中n1,n2表示输入内容的行号,它们之间为,逗号则表示从n1到n2行,如果为~波浪号则表示从n1开始以step为步进的所有行;command为执行动作,下面为一些常用动作指令:

Linux -- 正则表达式基础


sed操作举例

我们先找一个用于练习的文本文件:

Linux -- 正则表达式基础

Linux -- 正则表达式基础

打印指定行

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

Linux -- 正则表达式基础

行内替换

Linux -- 正则表达式基础

Linux -- 正则表达式基础

注意: 行内替换可以结合正则表达式使用。

删除某行

Linux -- 正则表达式基础

Linux -- 正则表达式基础


四、awk文本处理语言

        看到上面的标题,你可能会感到惊异,难道我们这里要学习的是一门“语言”么,确切的说,我们是要在这里学习awk文本处理语言,只是我们并不会在这里学习到比较完整的关于awk的内容,还是因为前面的原因,它太强大了,它的应用无处不在,我们无法在这里以简短的文字描述面面俱到,如果你有目标成为一个 linux 系统管理员,确实想学好 awk,不用担心,实验楼会在之后陆续上线linux系统管理员的学习路径,里面会有单独的关于正则表达式,awk,sed等相关课程,敬请期待吧。下面的内容,我们就作为一个关于awk的入门体验章节吧,其中会介绍一些awk的常用操作。


awk介绍

        AWK是一种优良的文本处理工具,Linux及Unix环境中现有的功能最强大的数据处理引擎之一.其名称得自于它的创始人Alfred Aho(阿尔佛雷德·艾侯)、Peter Jay Weinberger(彼得·温伯格)和Brian Wilson Kernighan(布莱恩·柯林汉)姓氏的首个字母.AWK程序设计语言,三位创建者已将它正式定义为“样式扫描和处理语言”。它允许您创建简短的程序,这些程序读取输入文件、为数据排序、处理数据、对输入执行计算以及生成报表,还有无数其他的功能。最简单地说,AWK是一种用于处理文本的编程语言工具。

        在大多数linux发行版上面,实际我们使用的是gawk(GNU awk,awk的GNU版本),在我们的环境中ubuntu上,默认提供的是mawk,不过我们通常可以直接使用awk命令(awk语言的解释器),因为系统已经为我们创建好了awk指向mawk的符号链接。

Linux -- 正则表达式基础

Linux -- 正则表达式基础

        nawk: 在 20 世纪 80 年代中期,对 awk语言进行了更新,并不同程度地使用一种称为 nawk(new awk) 的增强版本对其进行了替换。许多系统中仍然存在着旧的awk 解释器,但通常将其安装为 oawk (old awk) 命令,而 nawk 解释器则安装为主要的 awk 命令,也可以使用 nawk 命令。Dr. Kernighan 仍然在对 nawk 进行维护,与 gawk 一样,它也是开放源代码的,并且可以免费获得; gawk: 是 GNU Project 的awk解释器的开放源代码实现。尽管早期的 GAWK 发行版是旧的 AWK 的替代程序,但不断地对其进行了更新,以包含 NAWK 的特性; mawk 也是awk编程语言的一种解释器,mawk遵循 POSIX 1003.2 (草案 11.3)定义的 AWK 语言,包含了一些没有在AWK 手册中提到的特色,同时 mawk 提供一小部分扩展,另外据说mawk是实现最快的awk。


 awk操作体验

先用vim新建一个文本文档

Linux -- 正则表达式基础

Linux -- 正则表达式基础

包含如下内容:

Linux -- 正则表达式基础

Linux -- 正则表达式基础

*  使用awk将文本内容打印到终端

Linux -- 正则表达式基础Linux -- 正则表达式基础

        说明:在这个操作中我是省略了pattern,所以awk会默认匹配输入文本的全部内容,然后在"{}"花括号中执行动作,即print打印所有匹配项,这里是全部文本内容


*  将test的第一行的每个字段单独显示为一行

Linux -- 正则表达式基础Linux -- 正则表达式基础

        说明:你首先应该注意的是,这里我使用了awk语言的分支选择语句if,它的使用和很多高级语言如C/C++语言基本一致,如果你有这些语言的基础,这里将很好理解。另一个你需要注意的是NR与OFS,这两个是awk内建的变量,NR表示当前读入的记录数,你可以简单的理解为当前处理的行数,OFS表示输出时的字段分隔符,默认为" "空格,如上图所见,我们将字段分隔符设置为\n换行符,所以第一行原本以空格为字段分隔的内容就分别输出到单独一行了。然后是$N其中N为相应的字段号,这也是awk的内建变量,它表示引用相应的字段,因为我们这里第一行只有三个字段,所以只引用到了$3。除此之外另一个这里没有出现的$0,它表示引用当前记录(当前行)的全部内容。


*  将test的第二行的以点为分段的字段换成以空格为分隔

Linux -- 正则表达式基础Linux -- 正则表达式基础

        说明:这里的-F参数,前面已经介绍过,它是用来预先指定待处理记录的字段分隔符。我们需要注意的是除了指定OFS我们还可以在print 语句中直接打印特殊符号如这里的\t,print打印的非变量内容都需要用""一对引号包围起来。上面另一个版本,展示了实现预先指定变量分隔符的另一种方式,即使用BEGIN,就这个表达式指示了,其后的动作将在所有动作之前执行,这里是FS赋值了新的"."点号代替默认的" "空格

        注意:首先说明一点,我们在学习和使用awk的时候应该尽可能将其作为一门程序语言来理解,这样将会使你学习起来更容易,所以初学阶段在练习awk时应该尽量按照我那样的方式分多行按照一般程序语言的换行和缩进来输入,而不是全部写到一行(当然这在你熟练了之后是没有任何问题的)。


总结

        以上就是今天要讲的内容,本文仅仅简单介绍了正则表达式基础。

转载请注明来自码农世界,本文标题:《Linux -- 正则表达式基础》

百度分享代码,如果开启HTTPS请参考李洋个人博客
每一天,每一秒,你所做的决定都会改变你的人生!

发表评论

快捷回复:

评论列表 (暂无评论,80人围观)参与讨论

还没有评论,来说两句吧...

Top