基于CRF序列标注的中文依存句法分析器的Java实现_JAVA_编程开发_程序员俱乐部

中国优秀的程序员网站

程序员频道

地图

最新资讯 | 百度新闻 | GOOGLE地图 | RSS订阅 | 更多

非技术区

生活休闲恋爱交友

职业发展求职面试程序人生

移动开发

开发工具

DB2

MySql Sybase

开发

JAVA .NET PHPC/C++

数据库

SQL Server Oracle

互联网

运营推广营销 SEO

系统

Linux UnixWindows

资讯

动态产品人物

创业

职场学习管理

您所在的位置：程序员俱乐部 > 编程开发 > JAVA > 基于CRF序列标注的中文依存句法分析器的Java实现

基于CRF序列标注的中文依存句法分析器的Java实现

2019/1/16 15:32:37 adnb34g 程序员俱乐部我要评论(0)

摘要：这是一个基于CRF的中文依存句法分析器，内部CRF模型的特征函数采用双数组Trie树(DoubleArrayTrie)储存，解码采用特化的维特比后向算法。相较于《最大熵依存句法分析器的实现》，分析速度翻了一倍，达到了1262.8655sent/s开源项目本文代码已集成到HanLP中开源项目中，最新hanlp1.7版本已经发布CRF简介CRF是序列标注场景中常用的模型，比HMM能利用更多的特征，比MEMM更能抵抗标记偏置的问题。在生产中经常使用的训练工具是CRF++
标签：实现 Java 分析

这是一个基于CRF的中文依存句法分析器，内部CRF模型的特征函数采用双数组Trie树(DoubleArrayTrie)储存，解码采用特化的维特比后向算法。相较于《最大熵依存句法分析器的实现》，分析速度翻了一倍，达到了1262.8655 sent/s

开源项目

本文代码已集成到HanLP中开源项目中，最新hanlp1.7版本已经发布

CRF简介

CRF是序列标注场景中常用的模型，比HMM能利用更多的特征，比MEMM更能抵抗标记偏置的问题。在生产中经常使用的训练工具是CRF++，关于CRF++的使用以及模型格式请参阅《CRF++模型格式说明》。

CRF训练

语料库

与《最大熵依存句法分析器的实现》相同，采用清华大学语义依存网络语料的20000句作为训练集。

预处理

依存关系事实上由三个特征构成——起点、终点、关系名称。在本CRF模型中暂时忽略掉关系名称（在下文可以利用其它模型补全）。

根据依存文法理论, 我们可以知道决定两个词之间的依存关系主要有二个因素: 方向和距离。因此我们将类别标签定义为具有如下的形式:

[ + |- ] dPOS

其中, [ + | – ]表示方向, + 表示支配词在句中的位置出现在从属词的后面, – 表示支配词出现在从属词的前面; POS表示支配词具有的词性类别; d表示距离。

比如原树库：

?

转换后：

?

特征模板

?

?

训练参数

?

1.crf_learn?-f?3?-c?4.0?-p?3?template.txt?train.txt?model?-t

?

我的试验条件（机器性能）有限，每迭代一次要花5分钟，最后只能设定最大迭代数为100。经过痛苦的迭代，得到了一个效果非常有限的模型，其serr高达50%，暂时只做算法测试用。

解码

标准的维特比算法假定所有标签都是合法的，但是在本CRF模型中，标签还受到句子的约束。比如最后一个词的标签不可能是+nPos，必须是负数，而且任何词的[+/-]nPos都得保证后面（或前面，当符号为负的时候）有n个词语的标签是Pos。所以我覆写了CRF的维特比tag算法，代码如下：

?

?

注意上面的

?

?1.if (!isLegal(j, i, table)) continue;

?

保证了标签的合法性。

这一步的结果：

?

?

后续处理

有了依存的对象，还需要知道这条依存关系到底是哪种具体的名称。我从树库中统计了两个词的词与词性两两组合出现概率，姑且称其为2gram模型，用此模型接受依存边两端的词语，输出其最可能的关系名称。

最终结果

转换为CoNLL格式输出：

?

?

?

查看图片附件

上一篇：使用systemd为php程序建立守护进程下一篇：没有下一篇了!

基于CRF序列标注的中文依存句法分析器的Java实现

基于结构化平均感知机的分词器Java实现

分析 Java 任务的执行

Java实现的有道云笔记图片批量下载工具

ABAP SICF服务和Java Servlet的比较

查看所有评论(0)

发表评论

用户名: 匿名

最新文章

基于CRF序列标注的中文依存句法分析器的Java实现

基于CRF序列..

基于结构化平均感知机的分词器Java实现

基于结构化平均..

最新标签

歌德巴赫猜想

今日热点

推荐文章

unable to find valid certification path to requested target 的简单解决办法

unable ..

老三携剑出山，Swing法力无边

老..

English | 关于我们 | 诚聘英才 | 联系我们 | 网站大事 | 友情链接 | 意见反馈 | 网站地图

Powered by 程序员俱乐部程序提供： HugoCMS 2.0
网站备案：苏ICP备11048748号-1