正则表达式性能优化方法（高效正则表达式书写）

2020-01-20 22:06:03

字体：大中小

来源：转载

供稿：网友

这里说的正则表达式优化，主要是针对目前常用的NFA模式正则表达式，详细可以参考：正则表达式匹配解析过程探讨分析（正则表达式匹配原理）。从上面例子，我们可以推断出，影响NFA类正则表达式（常见语言：GNU Emacs,Java,ergp,less,more,.NET语言,
PCRE library,Perl,PHP,Python,Ruby,sed,vi )其实主要是它的“回溯”，减少“回溯”次数（减少循环查找同一个字符次数），是提高性能的主要方法。我们来看个例子：

源字符串：<script type="text/javascript">adsfadfsdasfsdafdsfsadfsa</script>

匹配要求，匹配<script….>….</script>标签里面所有内容，包括改标签

常见写法(1)，因为<script后面可能出现字符、空白、特殊符号等，还有标签里面也可能出现各种js代码。我们简单方法是：

正则表达式：<script.*?>.*?</script> (测试工具使用了：regexBuddy)

总共花费115步，回溯了：48次。因为我们使用”.”字符，匹配默认情况下除了/n之外所有字符。
方法（2），我们分析特点发现，<script…>后面，应该是除了”>”之外都可以字符，然后一对<script>标签里面js内容。可以定义为除了”<”之外。（这里面我只是举例说明优化方法，实际网页中script标签里面，常见都会出现有”<”字符了）

正则表达式：<script[^?>]+>[^<]+</script>