Lucene基于IKAnalyzer配置的词典扩充

纪成礼

2023-12-01

在web项目的src目录下创建IKAnalyzer.cfg.xml文件,内容如下

<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE properties SYSTEM "http://java.sun.com/dtd/properties.dtd">  
<properties>  

    <comment>IK Analyzer 扩展配置</comment>
    <!-- 用户可以在这里配置自己的扩展字典 -->
     <entry key="ext_dict">use.dic.dic;googlepy.dic</entry> 
     <!-- 用户可以在这里配置自己的扩展停止词字典    -->
    <entry key="ext_stopwords">dicdata/ext_stopword.dic</entry> 

</properties>

注意：

1. use.dic的格式是无BOM 的UTF-8 编码的中文文本文件，文件扩展名不限。词典中，每个中文词汇独立占一行，使用\r\n 的DOS 方式换行。（注，如果您不了解什么是无BOM 的UTF-8 格式，请保证您的词典使用UTF-8 存储，并在文件的头部添加一空行）。您可以参考分词器源码org.wltea.analyzer.dic 包下的.dic 文件。

2. use.dic文件应部署在src中。（推荐同IKAnalyzer.cfg.xml 放在一起）.

3.IKAnalyzer.cfg.xml中路径的写法：前面不能加/，否则是绝对路径。

http://www.cnblogs.com/dennisit/archive/2013/04/07/3005847.html

http://blog.sina.com.cn/s/blog_4c9d7da201013wv2.html

http://www.itzhai.com/ikanalyzer-lucene-demo-performance-test.html#read-more

转载于:https://www.cnblogs.com/NickyYe/p/4533267.html

Lucene基于IKAnalyzer配置的词典扩充

相关阅读

相关文章

相关问答

相关文档