收藏本站
《第五届全国青年计算语言学研讨会论文集》2010年
收藏 | 手机打开
二维码
手机客户端打开本文

一种基于认知情景框架的文本分类方法

李月伦  李湘  常宝宝  袁毓林  
【摘要】:在文本分类领域,常用的特征选择方法(如文档频率)是基于概率统计信息的。本文从一个全新的角度,即基于认知情境的语义框架的角度进行特征选择,这种方法可以较准确地抓住文本类别的特征,对提高分类精度与分类效率起到促进作用。由于基于机器学习的文本分类方法近年来得到了广泛的关注与快速的发展,本文运用最大熵分类器,以"罢餐"类文本为例进行文本分类实验,召回率可达96.8%。

【参考文献】
中国期刊全文数据库 前6条
1 周茜,赵明生,扈旻;中文文本分类中的特征选择研究[J];中文信息学报;2004年03期
2 李荣陆,王建会,陈晓云,陶晓鹏,胡运发;使用最大熵模型进行中文文本分类[J];计算机研究与发展;2005年01期
3 胡佳妮,徐蔚然,郭军,邓伟洪;中文文本分类中的特征选择算法研究[J];光通信研究;2005年03期
4 秦进,陈笑蓉,汪维家,陆汝占;文本分类中的特征抽取[J];计算机应用;2003年02期
5 苏金树;张博锋;徐昕;;基于机器学习的文本分类技术研究进展[J];软件学报;2006年09期
6 高洁,吉根林;文本分类技术研究[J];计算机应用研究;2004年07期
【共引文献】
中国期刊全文数据库 前10条
1 王煜,张明,马力;基于词条聚合和决策树的文本分类方法[J];河北大学学报(自然科学版);2005年03期
2 程泽凯,陆小艺;文本分类中的特征选择方法[J];安徽工业大学学报(自然科学版);2004年03期
3 袁方,杨柳,张红霞;基于k-近邻方法的渐进式中文文本分类技术[J];华南理工大学学报(自然科学版);2004年S1期
4 万乐;刘万春;;类别特征词权重加权文本分类方法[J];军民两用技术与产品;2006年03期
5 尚文倩;黄厚宽;刘玉玲;林永民;瞿有利;董红斌;;文本分类中基于基尼指数的特征选择算法研究[J];计算机研究与发展;2006年10期
6 丁文斌,李斌,罗浩;基于改进贝叶斯的垃圾邮件过滤系统设计与实现[J];计算机工程与应用;2005年18期
7 贾宁;;使用概念基元特征进行自动文本分类[J];计算机工程与应用;2007年01期
8 顾益军,樊孝忠,于江德,李良富;受限领域中文文本主题标引系统研究[J];计算机应用;2004年01期
9 陈治纲,何丕廉,孙越恒,郑小慎;基于向量空间模型的文本分类方法的研究与实现[J];计算机应用;2004年S1期
10 郝占刚,王正欧;基于模式聚类和遗传算法的文本特征提取方法[J];计算机应用;2005年07期
中国重要会议论文全文数据库 前10条
1 董学春;胡学钢;谢飞;吴共庆;;基于词向量空间模型的文本分类方法[A];计算机技术与应用进展——全国第17届计算机科学与技术应用(CACIS)学术会议论文集(上册)[C];2006年
2 黄文良;李石坚;刘菊新;徐从富;;大规模垃圾短信实时过滤系统的设计与实现[A];中国通信学会第五届学术年会论文集[C];2008年
3 谷波;刘开瑛;;决策树模型和最大熵模型在文本分类中的比较研究[A];全国第八届计算语言学联合学术会议(JSCL-2005)论文集[C];2005年
4 张永;陈思睿;杨志勇;;一种改进的文本分类方法的研究[A];第二届全国信息检索与内容安全学术会议(NCIRCS-2005)论文集[C];2005年
5 李军辉;朱巧明;李培峰;;一个基于最大熵模型的文本分类方法[A];第二届全国信息检索与内容安全学术会议(NCIRCS-2005)论文集[C];2005年
6 王素格;张武;李德玉;杨军玲;彭其伟;;基于最大熵模型的汉语动词与动词搭配识别[A];中文信息处理前沿进展——中国中文信息学会二十五周年学术会议论文集[C];2006年
7 张玮;孙乐;冯元勇;吕元华;;一种结合分类模型的中文输入法[A];中文信息处理前沿进展——中国中文信息学会二十五周年学术会议论文集[C];2006年
8 倪茂树;林鸿飞;;基于词共现概念的文本分类研究[A];中国计算技术与语言问题研究——第七届中文信息处理国际会议论文集[C];2007年
9 李文波;孙乐;黄瑞红;冯元勇;张大鲲;;基于Labeled-LDA模型的文本分类新算法[A];第三届全国信息检索与内容安全学术会议论文集[C];2007年
10 王辉;左万利;;利用质心向量构建增量式分类器(英文)[A];第三届全国信息检索与内容安全学术会议论文集[C];2007年
中国博士学位论文全文数据库 前10条
1 徐建锁;知识管理和文本挖掘的若干问题研究[D];天津大学;2004年
2 王明春;基于粗糙集的数据及文本挖掘方法研究[D];天津大学;2005年
3 孙越恒;基于统计的NLP技术在中文信息检索中的应用研究[D];天津大学;2005年
4 孟静;光学层析图像的重建技术研究[D];苏州大学;2006年
5 古平;基于贝叶斯模型的文档分类及相关技术研究[D];重庆大学;2006年
6 郝占刚;基于遗传算法等技术的数据与文本聚分类研究[D];天津大学;2006年
7 石陆魁;非线性维数约减算法中若干关键问题的研究[D];天津大学;2005年
8 杨传耀;中文信息检索索引模型及相关技术研究[D];复旦大学;2007年
9 王树梅;信息检索相关技术研究[D];南京理工大学;2007年
10 潘冠宇;基于粗糙集和群体智能的数据挖掘方法研究[D];吉林大学;2007年
中国硕士学位论文全文数据库 前10条
1 徐爱华;面向文本分类的中文文本挖掘技术研究及实现[D];武汉理工大学;2004年
2 贝雨馨;基于意义信息增益的文本特征项权重计算方法[D];延边大学;2004年
3 马哲;垃圾邮件过滤系统的研究与实现[D];浙江大学;2005年
4 田震生;基于文本聚类技术的邮件分类系统的研究与实现[D];河海大学;2005年
5 吴志峰;基于概念特征的中文文本分类研究[D];河北大学;2005年
6 崔彩霞;基于支持向量机的文本分类方法研究[D];山西大学;2005年
7 马志柔;中文信息检索分类技术的研究[D];北京化工大学;2005年
8 杨翔宇;SVM在Web文本挖掘中的应用与研究[D];哈尔滨工程大学;2005年
9 郭琛;数字图书馆的中文网页文本分类器研究[D];武汉理工大学;2005年
10 凌菁;基于数据挖掘的中文垃圾邮件过滤方法研究与实现[D];广东工业大学;2005年
【二级参考文献】
中国期刊全文数据库 前10条
1 李荣陆,王建会,陈晓云,陶晓鹏,胡运发;使用最大熵模型进行中文文本分类[J];计算机研究与发展;2005年01期
2 苏伟峰,李绍滋,李堂秋;一个基于概念的中文文本分类模型[J];计算机工程与应用;2002年06期
3 朱华宇,孙正兴,张福炎;一个基于向量空间模型的中文文本自动分类系统[J];计算机工程;2001年02期
4 贺海军,王建芬,周青,曹元大;基于决策支持向量机的中文网页分类器[J];计算机工程;2003年02期
5 庞剑锋,卜东波,白硕;基于向量空间模型的文本自动分类系统的研究与实现[J];计算机应用研究;2001年09期
6 黄萱菁,吴立德,石崎洋之,徐国伟;独立于语种的文本分类方法[J];中文信息学报;2000年06期
7 刘斌,黄铁军,程军,高文;一种新的基于统计的自动文本分类方法[J];中文信息学报;2002年06期
8 王梦云,曹素青;基于字频向量的中文文本自动分类系统[J];情报学报;2000年06期
9 李勇,桑艳艳;网络文本数据分类技术与实现算法[J];情报学报;2002年01期
10 解冲锋,李 星;基于序列的文本自动分类算法[J];软件学报;2002年04期
【相似文献】
中国期刊全文数据库 前10条
1 高金勇;徐朝军;冯奕竸;;基于迭代的TFIDF在短文本分类中的应用[J];情报理论与实践;2011年06期
2 唐云;罗俊松;;基于粗糙集和BP神经网络的文本分类研究[J];计算机仿真;2011年06期
3 胥桂仙;向春丞;翁彧;赵小兵;杨国胜;;基于栏目的藏文网页文本自动分类方法[J];中文信息学报;2011年04期
4 张国梁;肖超锋;;基于SVM新闻文本分类的研究[J];电子技术;2011年08期
5 刘新生;厉锟;;基于BP神经网络的旅游突发事件文本分类系统的设计与实现[J];计算机与现代化;2011年07期
6 王斌;朴顺姬;邵华清;;基于粗糙集的KNN的WEB文本分类的研究[J];数字技术与应用;2011年08期
7 张春元;;基于条件随机场的文本分类模型[J];计算机技术与发展;2011年07期
8 卢志翔;蒙丽莉;;文本分类中特征项权重算法的改进[J];柳州师专学报;2011年04期
9 甄志龙;曾晓勤;韩立新;;文本分类中基于图模型的特征提取方法[J];情报科学;2011年08期
10 奉国和;;文本分类性能评价研究[J];情报杂志;2011年08期
中国重要会议论文全文数据库 前10条
1 陈克利;宗成庆;王霞;;基于大规模真实文本的平衡语料分析与文本分类方法[A];语言计算与基于内容的文本处理——全国第七届计算语言学联合学术会议论文集[C];2003年
2 杜长海;吉根林;;模糊聚类的最大树法在文本分类中的应用研究[A];第二十二届中国数据库学术会议论文集(研究报告篇)[C];2005年
3 刘秉权;李博;孙林;王宝勋;刘远超;;标签特征和正文特征融合的SVM博客文本分类算法研究[A];第六届全国信息检索学术会议论文集[C];2010年
4 海丽且木·艾沙;维尼拉·木沙江;;Web文本分类及其维、哈、柯多文种信息检索中的应用研究[A];少数民族青年自然语言处理技术研究与进展——第三届全国少数民族青年自然语言信息处理、第二届全国多语言知识库建设联合学术研讨会论文集[C];2010年
5 商炳章;白清源;;基于特征项权重改进的关联文本分类[A];第二十五届中国数据库学术会议论文集(二)[C];2008年
6 胡俊;黄厚宽;;一种基于SVM的可视化文本分类的方法[A];第二十一届中国数据库学术会议论文集(技术报告篇)[C];2004年
7 朱慕华;陈文亮;朱靖波;;词聚类在文本分类中的应用[A];第二届全国学生计算语言学研讨会论文集[C];2004年
8 王小华;陆蓓;张国煊;;文本自动分类的模糊方法[A];自然语言理解与机器翻译——全国第六届计算语言学联合学术会议论文集[C];2001年
9 庞剑锋;程学旗;;反馈方法在文本分类系统中的应用[A];自然语言理解与机器翻译——全国第六届计算语言学联合学术会议论文集[C];2001年
10 贾会强;刘晓丽;于洪志;;基于词性特征提取的藏文文本分类方法研究[A];CCF NCSC 2011——第二届中国计算机学会服务计算学术会议论文集[C];2011年
中国重要报纸全文数据库 前6条
1 中国科学院计算技术研究所 王 斌;内容为王[N];计算机世界;2004年
2 高利华;传承陆游风骨 推进国际交流[N];人民日报海外版;2005年
3 林木树;反垃圾邮件有待新突破[N];人民邮电;2004年
4 希安;微软试水信息检索[N];经济日报;2004年
5 王培森;从Web挖到竞争情报[N];中国计算机报;2003年
6 应晓敏 窦文华;技术架构[N];计算机世界;2003年
中国博士学位论文全文数据库 前10条
1 章舜仲;文本分类中词共现关系的研究及其应用[D];南京理工大学;2010年
2 孟佳娜;迁移学习在文本分类中的应用研究[D];大连理工大学;2011年
3 李智星;用于文本分类的简明语义分析技术研究[D];重庆大学;2011年
4 刘伍颖;面向垃圾信息过滤的主动多域学习文本分类方法研究[D];国防科学技术大学;2011年
5 王博;文本分类中特征选择技术的研究[D];国防科学技术大学;2009年
6 冯国忠;文本分类中的贝叶斯特征选择[D];东北师范大学;2011年
7 程军;基于统计的文本分类技术研究[D];中国科学院研究生院(文献情报中心);2003年
8 万源;基于语义统计分析的网络舆情挖掘技术研究[D];武汉理工大学;2012年
9 祝翠玲;基于类别结构的文本层次分类方法研究[D];山东大学;2011年
10 宋枫溪;自动文本分类若干基本问题研究[D];南京理工大学;2004年
中国硕士学位论文全文数据库 前10条
1 张彪;文本分类中特征选择算法的分析与研究[D];中国科学技术大学;2010年
2 叶磊;电子公告系统环境中的数据挖掘技术设计与实现[D];华东交通大学;2009年
3 张保富;基于粗糙集的中文文本分类算法研究及应用[D];江苏大学;2010年
4 蒋健;文本分类中特征提取和特征加权方法研究[D];重庆大学;2010年
5 闫晨;KNN文本分类研究[D];燕山大学;2010年
6 苏小康;基于维基百科构建语义知识库及其在文本分类领域的应用研究[D];华中师范大学;2010年
7 李璇;基于坐标下降法的半监督学习算法及其在文本分类中的应用[D];华南理工大学;2010年
8 宋志理;基于LDA模型的文本分类研究[D];西安理工大学;2010年
9 郭志毅;基于EM算法的半监督文本分类方法研究[D];重庆邮电大学;2010年
10 吕小勇;多标签文本分类算法研究[D];山西财经大学;2010年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026