字符串匹配的Boyer-Moore算法

标签： Algorithm | 发表时间：2013-05-03 13:47 | 作者：阮一峰

出处：http://www.ruanyifeng.com/blog/

上一篇文章，我介绍了 KMP算法。

但是，它并不是效率最高的算法，实际采用并不多。各种文本编辑器的"查找"功能（Ctrl+F），大多采用 Boyer-Moore算法。

Boyer-Moore算法不仅效率高，而且构思巧妙，容易理解。1977年，德克萨斯大学的Robert S. Boyer教授和J Strother Moore教授发明了这种算法。

下面，我根据Moore教授自己的例子来解释这种算法。

假定字符串为"HERE IS A SIMPLE EXAMPLE"，搜索词为"EXAMPLE"。

首先，"字符串"与"搜索词"头部对齐，从尾部开始比较。

这是一个很聪明的想法，因为如果尾部字符不匹配，那么只要一次比较，就可以知道前7个字符肯定不是要找的结果。

我们看到，"S"与"E"不匹配。这时， "S"就被称为"坏字符"（bad character），即不匹配的字符。我们还发现，"S"不包含在搜索词"EXAMPLE"之中，这意味着可以把搜索词直接移到"S"的后一位。

依然从尾部开始比较，发现"P"与"E"不匹配，所以"P"是"坏字符"。但是，"P"包含在搜索词"EXAMPLE"之中。所以，将搜索词后移两位，两个"P"对齐。

我们由此总结出 "坏字符规则"：

　　后移位数 = 坏字符的位置 - 搜索词中的上一次出现位置

如果"坏字符"不包含在搜索词之中，则上一次出现位置为 -1。

以"P"为例，它作为"坏字符"，出现在搜索词的第6位（从0开始编号），在搜索词中的上一次出现位置为4，所以后移 6 - 4 = 2位。再以前面第二步的"S"为例，它出现在第6位，上一次出现位置是 -1（即未出现），则整个搜索词后移 6 - (-1) = 7位。

依然从尾部开始比较，"E"与"E"匹配。

比较前面一位，"LE"与"LE"匹配。

比较前面一位，"PLE"与"PLE"匹配。

比较前面一位，"MPLE"与"MPLE"匹配。 我们把这种情况称为"好后缀"（good suffix），即所有尾部匹配的字符串。注意，"MPLE"、"PLE"、"LE"、"E"都是好后缀。

比较前一位，发现"I"与"A"不匹配。所以，"I"是"坏字符"。

10.

根据"坏字符规则"，此时搜索词应该后移 2 - （-1）= 3 位。问题是，此时有没有更好的移法？

11.

我们知道，此时存在"好后缀"。所以，可以采用 "好后缀规则"：

　　后移位数 = 好后缀的位置 - 搜索词中的上一次出现位置

计算时，位置的取值以"好后缀"的最后一个字符为准。如果"好后缀"在搜索词中没有重复出现，则它的上一次出现位置为 -1。

所有的"好后缀"（MPLE、PLE、LE、E）之中，只有"E"在"EXAMPLE"之中出现两次，所以后移 6 - 0 = 6位。

12.

可以看到，"坏字符规则"只能移3位，"好后缀规则"可以移6位。所以， Boyer-Moore算法的基本思想是，每次后移这两个规则之中的较大值。

更巧妙的是，这两个规则的移动位数，只与搜索词有关，与原字符串无关。因此，可以预先计算生成《坏字符规则表》和《好后缀规则表》。使用时，只要查表比较一下就可以了。

13.

继续从尾部开始比较，"P"与"E"不匹配，因此"P"是"坏字符"。根据"坏字符规则"，后移 6 - 4 = 2位。

14.

从尾部开始逐位比较，发现全部匹配，于是搜索结束。如果还要继续查找（即找出全部匹配），则根据"好后缀规则"，后移 6 - 0 = 6位，即头部的"E"移到尾部的"E"的位置。

（完）

文档信息

版权声明：自由转载-非商用-非衍生-保持署名 | Creative Commons BY-NC-ND 3.0
原文网址： http://www.ruanyifeng.com/blog/2013/05/boyer-moore_string_search_algorithm.html
最后修改时间：2013年5月 3日 15:08
付费支持： |

[ 广告]　优衫（Ushan）是国内顶尖的定制西服店，常年为众多政商名流、影视明星、跨国高管定制衬衫与西服。以工艺精良、用料考究、版型出色、性价比高等特点广受各界好评。

字符串匹配的Boyer-Moore算法

- - 阮一峰的网络日志

上一篇文章，我介绍了 KMP算法. 但是，它并不是效率最高的算法，实际采用并不多. 各种文本编辑器的"查找"功能（Ctrl+F），大多采用 Boyer-Moore算法. Boyer-Moore算法不仅效率高，而且构思巧妙，容易理解. 1977年，德克萨斯大学的Robert S. Boyer教授和J Strother Moore教授发明了这种算法.

字符串匹配那些事（一）

- jiessie - 搜索技术博客－淘宝

本系列文章主要介绍几种常用的字符串比较算法，包括但不限于蛮力匹配算法，KMP算法，BM算法，Horspool算法，Sunday算法，fastsearch算法，KR算法等等. 本文主要介绍KMP算法和BM算法，它们分别是前缀匹配和后缀匹配的经典算法. 所谓前缀匹配是指：模式串和母串的比较从左到右，模式串的移动也是从左到右；所谓后缀匹配是指：模式串和母串的的比较从右到左，模式串的移动从左到右.

字符串匹配的KMP算法

- - 博客园_知识库

　　字符串匹配是计算机的基本任务之一. 　　举例来说，有一个字符串"BBC ABCDAB ABCDABCDABDE"，我想知道，里面是否包含另一个字符串"ABCDABD". 　　许多算法可以完成这个任务， Knuth-Morris-Pratt算法（简称KMP）是最常用的之一. 它以三个发明者命名，起头的那个K就是著名科学家Donald Knuth.

字符串匹配 KMP 算法 Java实现

- - ITeye博客

字符串匹配过程中，如果使用蛮力算法，效率非常的差，在此介绍一种较为高效的匹配算法KMP算法. 其主要思想是从匹配的模版去分析，即去分析Pattern串的自身规律，进而去优化匹配的效率. 例如字符串“ababcb”，明显看出是ab出现一组重复，若出现如下匹配模式：. 此时发生错误，一般情况下会选择移动Pattern一个位置来继续，事实证明效果不佳.

字符串匹配一直是计算机领域热门的研究问题之一，多种算法层出不穷. 字符串匹配算法有着很强的实用价值，应用于信息搜索，拼写检查，生物信息学等多个领域. 今天介绍几种比较有名的算法：. BF(Brute Force)算法又称为暴力匹配算法，是普通模式匹配算法. 其算法思想很简单，从主串S的第pos个字符开始，和模式串T的第一个字符进行比较，若相等，则主串和模式串都后移一个字符继续比较；若不相同，则回溯到主串S的第pos+1个字符重新开始比较.

最佳字符串匹配算法（Damerau-Levenshtein距离算法）的Java实现

- - Java - 编程语言 - ITeye博客

原文： http://www.javacodegeeks.com/2013/11/java-implementation-of-optimal-string-alignment.html. It implements a few well known tricks to use less memory by only hanging on to two arrays instead of allocating a huge n x m table for the memoisation table.

字符串匹配的Boyer-Moore算法

文档信息

相关 [字符串匹配 boyer] 推荐：

字符串匹配的Boyer-Moore算法

字符串匹配那些事（一）

字符串匹配的KMP算法

字符串匹配 KMP 算法 Java实现

字符串匹配(BF,BM,Sunday,KMP算法解析)

最佳字符串匹配算法（Damerau-Levenshtein距离算法）的Java实现

转载一篇单字符串匹配KMP算法最好理解的文章

KMP、AC自动机在字符串匹配类动态规划问题中的应用

JavaScript中的字符串操作

相关文章

订阅

字符串匹配的Boyer-Moore算法

文档信息

相关 [字符串 匹配 boyer] 推荐：

相关文章

订阅

相关 [字符串匹配 boyer] 推荐：