Windows配置heritrix3做网络爬虫开发实例

2024-07-16 17:45:35

字体：大中小

来源：转载

供稿：网友

一、引言：

最近在忙某个商业银行的项目，需要引入外部互联网数据作为参考，作为技术选型阶段的工作，之前已经确定了中文分词工具，下一个话题就是网络爬虫的选择，目标很明确，需要下载一些财经网站的新闻信息，然后进行文本计算。记得上一次碰爬虫还是5年前，时过境迁，不知道爬虫的世界里是否有了新的崛起。比较过一些之后，初步认定Heritrix基本能够满足需要，当然肯定是需要定制的了。

二、版本选择

Heritrix当前版本3.1.0，安装后发现，启动任务时，Windows平台有BDBOpen的错误（具体原因不详），Linux环境没有测试。度娘了一把，没啥实质性收获，如果从源码去看，又太费时间。就换到了3.0.5，这个版本也有问题，就是创建Job时，总是提示文件夹有问题，可以选择手动创建下载任务。操作界面如下图所示：

三、配置任务-手动

　　1.jobs目录下新建文件夹sohu；

　　2.拷贝模板文件profile-crawler-beans.cxml到sohu目录

　　3.重命名profile-crawler-beans.cxml文件为crawler-beans.cxml

4.手动修改文件crawler-beans.cxml，设置目标网站和存储方式：

复制代码代码如下:
# This Properties map is specified in the Java 'property list' text format
# <a href="http://java.sun.com/javase/6/docs/api/java/util/Properties.html#load%28java.io.Reader%29">http://java.sun.com/javase/6/docs/api/java/util/Properties.html#load%28java.io.Reader%29</a>metadata.operatorContactUrl=http://localhost
metadata.jobName=sohu
metadata.description=sohujingxuan##..more?..##
</value>
</property>
</bean> 
<bean id="longerOverrides" class="org.springframework.beans.factory.config.PropertyOverrideConfigurer">
<property name="properties">
<props>
<prop key="seeds.textSource.value"># URLS HERE
<a href="http://t.sohu.com/jingxuan">http://t.sohu.com/jingxuan</a> </prop>
</props>
</property>
</bean> 
<bean id="metadata" class="org.archive.modules.CrawlMetadata" autowire="byName">
<property name="operatorContactUrl" value="<a href="http://localhost"/">http://localhost"/</a>>
<property name="jobName" value="sohu"/>
<property name="description" value="sohujingxuan"/>

上一篇：Notepad++快捷键&amp;正则表达式替换字符串&amp;插件使用介绍

下一篇：LiteIDE开发工具简明使用指南(Go语言基础学习)

学习交流

如何查找有故障的配件

如何查找有故障的配件...

热门图片

猜你喜欢的新闻

猜你喜欢的关注