PHP实现最简单爬虫原型_PHP_编程开发_程序员俱乐部

中国优秀的程序员网站程序员频道CXYCLUB技术地图
热搜:
更多>>
 
您所在的位置: 程序员俱乐部 > 编程开发 > PHP > PHP实现最简单爬虫原型

PHP实现最简单爬虫原型

 2011/10/14 9:38:11  屾顶洞人  http://topcaver.iteye.com  我要评论(0)
  • 摘要:最简单的爬虫模型应该是这样的:给一个初始url,爬虫把内容扒下拉,找页面里的url,在以这些url为起点,开始爬。下面是一个最简单的php实现的爬虫模型。<?php/***爬虫程序--原型**BookMoth2009-02-21*//***从给定的url获取html内容**@paramstring$url*@returnstring*/function_getUrlContent($url){$handle=fopen($url,"r");if($handle)
  • 标签:PHP 实现

最简单的爬虫模型应该是这样的:给一个初始url,爬虫把内容扒下拉,找页面里的url,在以这些url为起点,开始爬。

下面是一个最简单的php实现的爬虫模型。

当然这只爬虫还需要进行下面的进化才可以:

1、拼接更准确的url链接。现在的链接有可能是格式错误的。

2、能够去掉重复的url链接。现在的爬虫会做非常多非常多的重复工作。

3、避免爬虫怕成环路,一个永远右转的车,只能是300内环,它只会跑在三环路上,去不了别的地方。

4、多线程或者多进程。因为php没有线程的概念,所以可能需要shell这样的东西来模拟了。

5、……略去2的N次方个汉字。

反正是意思一下就好了~

发表评论
用户名: 匿名