Spiderman Java网络蜘蛛/网络爬虫

程序名称:Spiderman

授权协议: Apache

操作系统: 跨平台

开发语言: Java

Spiderman 介绍

Spiderman - 又一个Java网络蜘蛛/爬虫

Spiderman 是一个基于微内核+插件式架构的网络蜘蛛,它的目标是通过简单的方法就能将复杂的目标网页信息抓取并解析为自己所需要的业务数据。

最新提示:* 欢迎来体验最新版本Spiderman2,
**http://git.oschina.net/l-weiwei/Spiderman2**
重新打造,重新起步,努力做更好用的爬虫!*

主要特点

* 灵活、可扩展性强,微内核+插件式架构,Spiderman提供了多达 10 个扩展点。横跨蜘蛛线程的整个生命周期。
* 通过简单的配置就可以将复杂的网页内容解析为自己需要的业务数据,无需编写一句代码
* 多线程

怎么使用?

  • 首先,确定好你的目标网站以及目标网页(即某一类你想要获取数据的网页,例如网易新闻的新闻页面
  • 然后,打开目标页面,分析页面的HTML结构,得到你想要数据的XPath,具体XPath怎么获取请看下文。
  • 最后,在一个xml配置文件里填写好参数,运行Spiderman吧!

这里有个抓取案例

这里有篇文章介绍示例: http://my.oschina.net/laiweiwei/blog/100866

XPath获取技巧?

最新提示:发现Chrome浏览器的控制台可以直接对网页执行xpath调试,只需要输入$x(“xpath
表达式”)即可实时进行当前打开网页的xpath调试,非常棒!

这里只说下Chrome浏览器,其他浏览器估计也差不多,只不过插件不同而已。

Spiderman 官网

http://git.oschina.net/l-weiwei/spiderman

相关编程语言

Pacman 是一个软件包管理器, 作为 ArchLinux 发行版...
Smb4K 是KDE下的网络共享浏览器 更多屏幕截图请看:...
Wine (“Wine Is Not an Emulator” 的首字母缩写)...
虚拟桌面软件,可管理最多9个虚拟桌面,你可以用热键...
UNetbootin (Universal Netboot Installer)为一种跨...
Cobbler 可以用来快速建立 Linux 网络安装环境,它已...