加载中...
首页专利查询专利详情

*来源于国家知识产权局数据,仅供参考,实际以国家知识产权局展示为准

一种站点语种分类的方法和系统

发明专利有效专利
  • 申请号:
    CN201310514221.6
  • IPC分类号:G06F17/30
  • 申请日期:
    2013-10-25
  • 申请人:
    北大方正集团有限公司;北京大学;北京北大方正电子有限公司
著录项信息
专利名称一种站点语种分类的方法和系统
申请号CN201310514221.6申请日期2013-10-25
法律状态授权申报国家中国
公开/公告日2015-04-29公开/公告号CN104572767A
优先权暂无优先权号暂无
主分类号G06F17/30IPC分类号G;0;6;F;1;7;/;3;0查看分类表>
申请人北大方正集团有限公司;北京大学;北京北大方正电子有限公司申请人地址
北京市海淀区成府路298号方正大厦 变更 专利地址、主体等相关变化,请及时变更,防止失效
权利人北大方正集团有限公司,北京大学,北京北大方正电子有限公司当前权利人北大方正集团有限公司,北京大学,北京北大方正电子有限公司
发明人甘文杰;于晓明;杨建武;张涛
代理机构北京路浩知识产权代理有限公司代理人李相雨
摘要
本发明提供一种站点语种分类的方法和系统,包括:对于每一种语种,利用该语种的预设搜索词进行搜索,得到对应于该语种的所有页面链接;根据所述所有页面链接的链接地址,将所有页面链接分类,每一类对应一个站点;从每一个站点对应的分类中抽样部分页面链接,组成样本集合,根据样本集合中页面链接的数量和语种信息,生成对应于该语种的训练模型;将需检测的网页资源的页面链接集合按照站点进行分类,得到各个需检测的站点;根据所述语种训练模型,得到每一个所述需检测的站点的语种预测值。本发明基于网页单页面语种识别技术,给出了一种合理高效的站点语种分类方法,系统架构简单易维护,满足了现代搜索引擎技术的要求。

专利服务由北京酷爱智慧知识产权代理公司提供