NLPIR分词系统:Java环境下的高效中文处理
自然语言的处理, 其第一步是分词, 近期运用了中科院分词系统NLPIR/ 2016, 在2014版本且之前称作, 之后的版本均更名为NLPIR, 新版简介依此如下:张华平博士基于多年研究工作积累, 研制出了NLPIR分词系统, 该系统主要功能中有中文分词。有英文分词。有词性标注。有命名实体识别。有新词识别。有关键词提取。还支持用户专业词典与微博分析, 而词法分析是自然语言处理的基础和关键。NLPIR系统支撑多种编码, 那是GBK编码、UTF8编码、BIG5编码, 还支持多种操作系统, 包含Linux等等所有主流操作系统, 并且支持多种开发语言与平台, 涵盖 C/C/C#、Java等等。我的开发环境是win10 64位操作系统。先是下载俩压缩包, 一个是分词包, 另一个是接口包, 它是用纯C编写而成, 在java上面运用就得要JNI, 也就是c语言再加上一个java接口方可, NLPIR存在java版本的说, 我采用的是添加一个接口的办法。分词包的下载地址是: , 接口包的下载地址JNI: 。分别解压后待用。创建一个新的项目, 去把分词包里头的Data目录复制到file目录, 然后解压开JNI包, 把NLPIR.dll动态链接库放置到项目目录下, 使其与file目录处于同一层级。自己修改编写的测试及使用代码如下import java.io.BufferedReader; import java.io.File; import java.io.FileInputStream; import java.io.InputStreamReader; import java.io.UnsupportedEncodingExcepti