互联网信息采集系统-西南科技大学国家大学科技园

您当前的位置:首页>>成果转化>>成果搜索 成果搜索

互联网信息采集系统
作者:管理员  发布时间:2012-11-29    阅读次数:351

1、软件著作权:

互联网信息采集系统(2012SR011819)

2、项目内容;

互联网信息采集系统是为挖掘和分析互联网数据提供大量格式化数据的采集系统,系统提供了采集网站入口地址管理、网页增量抓取、BBS信息抽取模板设置、网页正文信息抽取、网页元数据(发布时间、标题、关键词等)抽取、索引建立、格式化网页数据存储(XML)、采集状态浏览等功能,实现了采集制定网站集合的网页,并抽取出网页中的各种元数据存储为XML文件,便于挖掘和分析。

3、成果技术特点(含主要技术指标):

系统主要为各种互联网信息分析与检索系统提供格式化数据。系统采用JAVA语言开发,不受操作系统限制;在网页抓取阶段采用了先进的链接分析算法,有效提高了采集速度;在信息抽取阶段采用文本密度结合模板的方式,提高了信息抽取的精度;系统提供了基于浏览器的采集状态监视界面,可以实时了解并控制系统状态。系统可在1小时左右完成40个网站的扫描,采集指定时间段的数据。

4、应用范围:互联网信息挖掘,舆情监测。

5、技术成熟度:成熟

6、投资估算及资金来源:

    投资:10~50万。

7、市场前景及经济效益分析:

在互联网高速发展的今天,及时、全面掌握相关网络信息是各级地方政府和企业面临的一个主要问题,该系统可以实现及时的网络数据采集,具有广阔的应用市场。

8、合作方式:产品推广。

西南科技大学国家大学科技园  版权所有
四川省绵阳市涪城区青龙大道中段59号 邮编:621010 联系电话:(0816)6089819 6089818 6089816