使用curl的多线程,另外curl可以设置请求时间,遇到很慢的url资源,可以果断的放弃,这样没有阻塞,另外有多线程请求,效率应该比较高,参考:《CURL的学习和应用[附多线程]》,我们再来测试一下;
核心代码:
/** * curl 多线程 * * @param array $array 并行网址 * @param int $timeout 超时时间 * @return mix */ public function Curl_http($array,$timeout='15'){ $res = array(); $mh = curl_multi_init();//创建多个curl语柄 foreach($array as $k=>$url){ $conn[$k]=curl_init($url);//初始化 curl_setopt($conn[$k], CURLOPT_TIMEOUT, $timeout);//设置超时时间 curl_setopt($conn[$k], CURLOPT_USERAGENT, 'Mozilla/5.0 (compatible; MSIE 5.01; Windows NT 5.0)'); curl_setopt($conn[$k], CURLOPT_MAXREDIRS, 7);//HTTp定向级别 ,7最高 curl_setopt($conn[$k], CURLOPT_HEADER, false);//这里不要header,加块效率 curl_setopt($conn[$k], CURLOPT_FOLLOWLOCATION, 1); // 302 redirect curl_setopt($conn[$k], CURLOPT_RETURNTRANSFER,1);//要求结果为字符串且输出到屏幕上 curl_setopt($conn[$k], CURLOPT_HTTPGET, true); curl_multi_add_handle ($mh,$conn[$k]); } //防止死循环耗死cpu 这段是根据网上的写法 do { $mrc = curl_multi_exec($mh,$active);//当无数据,active=true } while ($mrc == CURLM_CALL_MULTI_PERFORM);//当正在接受数据时 while ($active and $mrc == CURLM_OK) {//当无数据时或请求暂停时,active=true if (curl_multi_select($mh) != -1) { do { $mrc = curl_multi_exec($mh, $active); } while ($mrc == CURLM_CALL_MULTI_PERFORM); } } foreach ($array as $k => $url) { if(!curl_errno($conn[$k])){ $data[$k]=curl_multi_getcontent($conn[$k]);//数据转换为array $header[$k]=curl_getinfo($conn[$k]);//返回http头信息 curl_close($conn[$k]);//关闭语柄 curl_multi_remove_handle($mh , $conn[$k]); //释放资源 }else{ unset($k,$url); } } curl_multi_close($mh); return $data; } //参数接收 $callback = $_GET['callback']; $hrefs = $_GET['hrefs']; $urlarray = explode(',',trim($hrefs,',')); $date = date('Ymd',time()); //实例化 $img = new HttpImg(); $stime = $img->getMicrotime();//开始时间 $data = $img->Curl_http($urlarray,'20');//列表数据 mkdir('./img/'.$date,0777); foreach ((array)$data as $k=>$v){ preg_match_all("/(href|src)=([\"|']?)([^ \"'>]+\.(jpg|png|PNG|JPG|gif))\\2/i", $v, $matches[$k]); if(count($matches[$k][3])>0){ $dataimg = $img->Curl_http($matches[$k][3],'20');//全部图片数据二进制 $j = 0; foreach ((array)$dataimg as $kk=>$vv){ if($vv !=''){ $rand = rand(1000,9999); $basename = time()."_".$rand.".".jpg;//保存为jpg格式的文件 $fname = './img/'.$date."/"."$basename"; file_put_contents($fname, $vv); $j++; echo "创建第".$j."张图片"."$fname"."<br/>"; }else{ unset($kk,$vv); } } }else{ unset($matches); } } $etime = $img->getMicrotime();//结束时间 echo "用时".($etime-$stime)."秒"; exit;
测试一下效果
337张图片用时260秒左右,基本上可以做到一秒内就可以采集一张的效果,而且发现图片越到优势采集速度越明显。
我们可以看一下文件命名:也就可以做到同一时刻可以生成10张图片,
由于采用了20秒请求的时间限制,有些图片生成后有明显不全,也就是图片资源在20秒内未能完全采集,这个时间大家可以自行设置。
发表评论
-
Yaf框架安装指南
2018-06-29 15:44 621http://www.php.cn/php-weizij ... -
phpize是干嘛的 phpize的深入理解
2018-06-29 15:11 423安装(fastcgi模式)的时候,常常有这样一句命令:/usr ... -
php-cgi和php-fpm有什么关系
2018-06-20 16:43 520转:https://segmentfault ... -
php strip_tags 去HTML标记
2018-06-06 13:32 586只保留 p img 换行符 $c ... -
thinkphp3.2.3用redis3.0.7做session共享
2017-12-28 15:08 1029第一步:在主服务器(www服务器)和从服务器上安装red ... -
php 如何给关键词自动添加超链接
2017-02-24 13:04 738$string = "a a b b c c&qu ... -
php 去掉字符串的最后一个字符 及 截取
2016-10-26 16:48 785原字符串1,2,3,4,5,6, 去掉最后一个 ... -
php 获取月第一天和最后一天
2016-07-20 13:42 484PHP获取某一天前后任意时间 date(" ... -
PHP 过滤,替换 超链接
2014-06-09 14:19 678#过滤掉超链接 ereg_replace("&l ... -
PHP二维数组排序函数
2014-04-10 17:31 784#对二维数组进行排序,$keys就是要排序的键名, 第三参 ... -
一组PHP可逆加密解密算法
2014-04-10 17:20 663对于大部分密码加密,我们可以采用md5、sha1等方法。可以 ... -
php在linux系统下实现百度文库功能 doc或pdf转swf预览功能
2013-07-30 15:29 1502php在linux系统下实现百度文库功能 doc或pdf转s ... -
msql 只查年月日
2013-03-15 10:18 871msql 只查年月日 where TO_DA ... -
使用PHP+Sphinx建立高效的站内搜索引擎
2013-03-11 15:07 9011. 为什么要使用Sphinx 假设你现在运营 ... -
ThinkPHP模板运用指南
2012-10-18 10:44 1576使用例子: {$webTitle|md5|strtou ... -
文件夹不存在则创建
2012-10-10 16:25 0#文件夹不存在则创建 private function cr ... -
thinkPHP中CURD
2012-09-13 17:36 2435thinkPHP中CURD 一:thinkPHP中多 ... -
文件夹不存在则创建
2012-08-29 16:20 913#文件夹不存在则创建 private function cr ... -
test
2012-08-09 16:19 0DROP TABLE IF EXISTS `city`; ... -
TP 路由
2012-07-31 23:15 752/*路由定义*/ 'URL_ROUTE_RULES ...
相关推荐
分享一个使用php多线程批量采集下载图片的实现代码函数类,curl的多线程,另外curl可以设置请求时间,遇到很慢的url资源,可以果断的放弃,这样没有阻塞,另外有多线程请求,效率应该比较高
在PHP中,多线程处理任务通常通过pthreads扩展来实现,这在处理大量I/O密集型任务,如批量采集和下载图片时非常有用。由于PHP本身是单线程的,使用多线程可以显著提高并发性和执行效率。在描述中提到了curl库的多...
PHP实现多线程批量采集下载图片的代码是一个针对网络爬虫效率改进的实践示例。这篇文章可以看作是之前作品《PHP批量采集下载美女图片》的延伸,针对原有基于file_get_contents实现的图片采集方式进行优化。在原始...
【标题】:“图片采集程序 PHP源码”是一个用于自动化收集网络上图片的PHP脚本,它可以帮助用户批量获取并下载指定网站上的图像资源。这样的程序在网页数据抓取、图片库构建、网络监控等领域有着广泛的应用。 ...
- 虽然PHP不支持原生多线程,但可以利用`pthreads`扩展实现多线程,或者使用`curl_multi_exec()`函数进行并发请求,提高采集效率。 - 另外,可以采用队列技术,如`beanstalkd`或`RabbitMQ`,配合后台工作进程实现...
批量采集用于处理程序内部接口的并发使用,偶尔代替一下多线程并发处理操作 如果使用请自行测试! 就目前来说,使用该类足以应付大部分的采集工作需求!无需其他工具 采集回来的网页使用正则处理...
同时,考虑到性能问题,可以考虑使用多线程或者异步请求来并行下载图片,以减少总体耗时。 总的来说,批量抓取远程图片并保存到本地是Web开发中的一个实用技能,尤其对于数据抓取和自动化任务。通过理解并实践上述...
5. **并发处理**:利用多线程或多进程实现并行抓取,提高效率。 在实际的视频教程中,`第84讲.ppt`可能会详细讲解上述理论知识,并给出具体的代码示例。而`84.wmv`视频文件则会演示整个过程,包括代码编写、运行及...
优点:功能强大,不需要写任何规则,软件使用简单,多线程,速度快,可以多个关键词采集,可以批量采集批量入库,傻瓜式采集,可以定时采集和发布,无人值守,适合做网站专题。能够和任意CMS,如PHP、ASP.NET(C#)、...
批量采集用于处理程序内部接口的并发使用,偶尔代替一下多线程并发处理操作 如果使用请自行测试! 就目前来说,使用该类足以应付大部分的采集工作需求!无需其他工具 采集回来的网页使用正则处理即可
批量采集通常涉及到多线程或者并发处理,以提高数据抓取的效率。PHP中可以使用cURL库或者file_get_contents函数实现这种功能,通过循环或递归遍历目标网页,获取大量数据。 2. **cURL模式单采集**: `tester1--curl...
5. **性能优化**:探究插件是如何设计以提高效率,例如使用缓存、批量处理、多线程或多进程等技术。 6. **代码结构与设计模式**:分析代码的组织结构,看看是否采用了MVC(模型-视图-控制器)或其他设计模式,这...
支持SHELL收录量、BR、PR、快照时间多线程批量查询并保存 真正及时同步百度算法优化,只要百度算法更新,第二天软件就更新 支持多线程状态查询,查询正确率高达99% 支持批量多线程删除上传下载,弥补旧菜刀无法...
支持SHELL收录量、BR、PR、快照时间多线程批量查询并保存 真正及时同步百度算法优化,只要百度算法更新,第二天软件就更新 支持多线程状态查询,查询正确率高达99% 支持批量多线程删除上传下载,弥补旧菜刀无法批量...
一、软件功能 1.查询旁站域名,快速查询网站信息 2.目录扫描,支持ASP,PHP,ASPX,JSP,网站目录,等扫描方式,配置... 11.iP/域名多线程快速扫描 12.增加EXP批量扫描功能 13.增加SQL注入功能 14.增加MD5加密解密功能
- **采集功能**:支持多种编码,智能分析链接,多线程采集。 - **搜索引擎优化**:符合sitemaps 0.9规范,提高收录率。 测试总结表明,飞飞影视系统PHP版在安装简易度、采集功能和SEO优化上表现出色,适合新手...
6. **异步与批量处理**:为了提高效率,数据采集可能需要采用多线程或异步处理。PHP的pthreads扩展(仅在CLI环境下可用)或利用cURL的多连接特性可以实现多任务并发。 7. **IP代理**:为了避免频繁请求导致IP被封,...
1.查询旁站域名,快速查询网站信息 2.目录扫描,支持ASP,PHP,ASPX,JSP,网站目录,网站识别等扫描方式,配置可自定义更改 3.EXP漏洞扫描,可扫描一个脚本,也可全部脚本进行扫描,支持...增加iP/域名多线程快速扫描
这种程序的核心功能是数据采集,即从目标网站上批量下载图片资源,通常用于个人收藏、网站填充内容或研究图片处理技术等目的。 在PHP源代码层面,"非主流图片小偷程序"会涉及到以下几个关键知识点: 1. **HTTP请求...