驾驭文本
文本处理是目前互联网内容应用(如搜索引擎、推荐引擎)的关键技术。本书涵盖了文本处理概念和技术的多个方面,包括文本预处理、搜索、字符串匹配、信息抽取、命名实体识别、分类、聚类、标签生成、摘要、问答等。本书的特点在于通过实例来理解文本处理的这些概念和技术,读者利用现有的开源工具就可以自己实现这些实例。
Grant Ingersoll是一位工程师、讲师和培训师,也是Lucene代码的提交者已经机器学习项目Mahout的联合创始人。
Thomas Morton是OpenNLP和Maximum Entropy(最大熵)的主要开发者。
Drew Farris是一位技术顾问、软件开发人员及Mahout、Lucene和Solr的贡献者。
译者简介
王斌,博士,中国科学院信息工程研究所研究员,博士生导师,研究方向为信息检索与自然语言处理。主持国家级、省部级科研项目20余项,发表学术论文120余篇。现为中国中文信息学会理事、信息检索专委会、社会媒体处理专委会及语言与知识计算专业委员会委员,《中文信息学报》编委,中国计算机学会高级会员及中文信息处理专委会委员。
评论