Lucene实践：全文检索的基本原理

- - 开源软件 - ITeye博客

http://lucene.apache.org/java/docs/index.html 定义：. 是一个高效的，基于Java. 所以在了解Lucene之前要费一番工夫了解一下全文检索. 我们生活中的数据总体分为两种：. 结构化数据：指具有固定格式或有限长度的数据，如数据库，元数据等. 非结构化数据：指不定长或无固定格式的数据，如邮件，word文档等.

lucene排序

- - 开源软件 - ITeye博客

排序是对于全文检索来言是一个必不可少的功能，在实际运用中，排序功能能在某些时候给我们带来很大的方便，比如在淘宝，京东等一些电商网站我们可能通过排序来快速找到价格最便宜的商品，或者通过排序来找到评论数最高或卖的最好的商品，再比如在Iteye里的博客栏里，每天都会以降序的方式，来显示出最新发出的几篇博客，有了排序，我们就能在某些时候很方便快速的得到某些有效信息，所以说排序功能，无处不在 ^_^.

MySQL全文检索笔记

- - 博客园_首页

MySQL 4.x版本及以上版本提供了全文检索支持，但是表的存储引擎类型必须为MyISAM，以下是建表SQL，注意其中显式设置了存储引擎类型. 其中FULLTEXT(title, body) 给title和body这两列建立全文索引，之后检索的时候注意必须同时指定这两列. 说明全文匹配时忽略大小写.

[原]Lucene系列-facet

- - 文武天下

facet：面、切面、方面. 个人理解就是维度，在满足query的前提下，观察结果在各维度上的分布（一个维度下各子类的数目）. 如jd上搜“手机”，得到4009个商品. 其中品牌、网络、价格就是商品的维度(facet)，点击某个品牌或者网络，获取更细分的结果. 点击品牌小米，获得小米手机的结果，显示27个.

[原]Lucene系列-FieldCache

- - 文武天下

域缓存，加载所有文档中某个特定域的值到内存，便于随机存取该域值. 当用户需要访问各文档中某个域的值时，IndexSearcher.doc(docId)获得Document的所有域值，但访问速度比较慢，而且只能获得Stored域的值. FieldCache能获得域值数组，根据docId random access域值.

Lucene 使用教程

- - 行业应用 - ITeye博客

1 lucene简介 . 1.1 什么是lucene . Lucene是一个全文搜索框架，而不是应用产品. 因此它并不像 http://www.baidu.com/ 或者google Desktop那么拿来就能用，它只是提供了一种工具让你能实现这些产品. 1.2 lucene能做什么 . 要回答这个问题，先要了解lucene的本质.

在Lucene 3.x时代，《Lucene In Action》是一本相当不错的参考书，书中详细介绍了Lucene各种高级使用技术，对于开发者来说非常实用. 但是近期Lucene升级到了4.x版本，在性能等各方面有了很大的提高，值得在新项目中使用. 然而Lucene 4.x中的API相比3.x来说有了很大的改变，《Lucene In Action》中的很多内容都已经过时了，并且由于4.x推出的时间不长，还没有比较好的文档来对用法进行说明，这个系列文章就是想记录下自己使用Lucene 4.x的经验体会，供大家参考使用.

Term	Document ID
student	1
allow	1
go	1
their	1
friend	1
allow	1
drink	1
beer	1
my	2
friend	2
jerry	2
go	2
school	2
see	2
his	2
student	2
find	2
them	2
drink	2
allow	2

Term	Document ID
allow	1
allow	1
allow	2
beer	1
drink	1
drink	2
find	2
friend	1
friend	2
go	1
go	2
his	2
jerry	2
my	2
school	2
see	2
student	1
student	2
their	1
them	2

	t1	t2	t3	t4	t5	t6	t7	t8	t9	t10	t11
D1	0	0	.477	0	.477	.176	0	0	0	.176	0
D2	0	.176	0	.477	0	0	0	0	.954	0	.176
D3	0	.176	0	0	0	.176	0	0	0	.176	.176
Q	0	0	0	0	0	.176	0	0	.477	0	.176

Lucene实践：全文检索的基本原理

一、总论

二、索引里面究竟存些什么

三、如何创建索引

第一步：一些要索引的原文档(Document)。

第二步：将原文档传给分词器(Tokenizer)。

第三步：将得到的词元(Token)传给语言处理组件(Linguistic Processor)。

第四步：将得到的词(Term)传给索引组件(Indexer)。

三、如何对索引进行搜索？

第一步：用户输入查询语句。

第二步：对查询语句进行词法分析，语法分析，及语言处理。

第三步：搜索索引，得到符合语法树的文档。

第四步：根据得到的文档和查询语句的相关性，对结果进行排序。

1. 计算权重(Term weight)的过程。

2. 判断Term之间的关系从而得到文档相关性的过程，也即向量空间模型的算法(VSM)。

相关 [lucene 实践全文检索] 推荐：