网站建设 >

查看其它板块

php采集别人网页数据,php自动采集如何实现

PHP采集网页中指定的内容

你如果是单个页面的话不需要正规表达式，只要找到自己需要的部分看看前面和后面有什么唯一性的标识，截取出来就可以了。

公司主营业务：成都网站设计、成都网站制作、外贸网站建设、移动网站开发等业务。帮助企业客户真正实现互联网宣传，提高企业的竞争能力。成都创新互联公司是一支青春激扬、勤奋敬业、活力青春激扬、勤奋敬业、活力澎湃、和谐高效的团队。公司秉承以“开放、自由、严谨、自律”为核心的企业文化，感谢他们对我们的高要求，感谢他们从不同领域给我们带来的挑战，让我们激情的团队有机会用头脑与智慧不断的给客户带来惊喜。成都创新互联公司推出蓬江免费做网站回馈大家。

php获取别的网页数值

php不能获取其它网页的变量（当然除post,get等传值方法外），只能获取值，静态的值。

要获取某个指定的内容，只能是通过获取到所有的内容然后再查找。

所有的代码都必须守互联网规则，不然就不被浏览器接受，用户也不敢去用呀。

phpstudy怎么抓取网页数据

什么网页数据？

是打开本地网页还是打开网上网页

如果是本地网页的话在浏览器上输入127.0.0.1或者localhost进行访问

如果是外网我理解的是你要获取外网的一个网页，可以用代码或者程序来实现

（一般称为采集程序，或者小偷程序）

//个人认为curl好一点，因为curl可以模拟浏览器，有的网站会过滤机器人

//1.php代码

//把网页读入一个字符串

$contone = file_get_contents('url');

print_r($contone);

//curl采集

#初始化curl （true/false）

$ch=curl_init();

#请求url地址

$params[CURLOPT_URL]='网址';

#是否返回响应头信息

$params[CURLOPT_HEADER] = true;

#是否将结果返回

$params[CURLOPT_RETURNTRANSFER] = true;

#是否重定向

$params[CURLOPT_FOLLOWLOCATION] = true;

#伪造浏览器

$params[CURLOPT_USERAGENT] = 'Mozilla/5.0 (Windows NT 5.1; rv:9.0.1) Gecko/20100101 Firefox/9.0.1';

curl_setopt_array($ch, $params);

$content=curl_exec($ch);

//输出网页内容

print_r($content);

//下面是整个curl采集类

class Curl{

#采集的地址

public $url;

#匹配的正则

public $preg;

#模拟登录需要的用户名

public $username;

#模拟登录需要的密码;

public $pwd;

#cookie存储的路径

private $cookie_path;

#采集数据的字符集

public $charset;

/**

* 构造方法，初始化采集基本信息

* @param $url 采集的url

* @param $preg 匹配的正则

* @param string $username 用户名

* @param string $pwd 密码

* @param string $charset 字符集

public function __construct($info){

extract($info);

$this-url=$url;

$this-preg=$preg;

if(isset($charset)){

header("content-type:text/html;charset=".$this-charset);

}else{

header("content-type:text/html;charset=utf-8");

}

if(isset($username)){

$this-username=$username;

}

if(isset($pwd)){

$this-pwd=$pwd;

}

* 采集数据，非表单提交方式，直接采集的

public function get_info(){

#初始化curl

$ch=curl_init();

#请求url地址

$params[CURLOPT_URL]=$this-url;

#是否返回响应头信息

$params[CURLOPT_HEADER] = true;

#是否将结果返回

$params[CURLOPT_RETURNTRANSFER] = true;

#是否重定向

$params[CURLOPT_FOLLOWLOCATION] = true;

#伪造浏览器

$params[CURLOPT_USERAGENT] = 'Mozilla/5.0 (Windows NT 5.1; rv:9.0.1) Gecko/20100101 Firefox/9.0.1';

//判断是否有cookie,有的话直接使用

//if (isset($_COOKIE['cookie_jar']) ($_COOKIE['cookie_jar'] || is_file($_COOKIE['cookie_jar']))){

// $params[CURLOPT_COOKIEFILE] = $_COOKIE['cookie_jar']; //这里判断cookie

//} else {

// $cookie_jar = tempnam($this-cookie_path, 'cookie'); //产生一个cookie文件

// $params[CURLOPT_COOKIEJAR] = $cookie_jar; //写入cookie信息

// setcookie('cookie_jar', $cookie_jar); //保存cookie路径

//}

#开始发送请求，传入curl参数

curl_setopt_array($ch, $params);

$content=curl_exec($ch);

preg_match_all($this-preg,$content,$arr);

return $arr;

}

/**

* 采集远程图片

* @param $img 图片路径是一个数组

* @param $save_path 图片保存在你本地的路径

* @return bool

public function get_img($img,$save_path){

for($i=0;$icount($img);$i++) {

$res=@file_get_contents($img[$i]);

$img_type=substr($img[$i], strrpos($img[$i], "."));

$path=$save_path.time().rand(1,9999999).mt_rand() .$img_type;

$img[$i] = $path;

file_put_contents($path,$res);

}

return $img;

}

//登录后采集

public function register_info(){

//采集的信息需要先登录的就要先模拟登录

//设置cookie保存路径

$ch = curl_init();

//组装用户名和密码

$info['username'] = $this-username;

$info['password'] = $this-pwd;

//模拟表单提交

$params[CURLOPT_URL] = $this-url; //请求url地址

$params[CURLOPT_HEADER] = true; //是否返回响应头信息

$params[CURLOPT_RETURNTRANSFER] = true; //是否将结果返回

$params[CURLOPT_FOLLOWLOCATION] = true; //是否重定向

$params[CURLOPT_USERAGENT] = 'Mozilla/5.0 (Windows NT 5.1; rv:9.0.1) Gecko/20100101 Firefox/9.0.1';

$postfields = '';

//将表单要提交的数据编程URL拼接方式

foreach ($info as $key = $value){

$postfields .= urlencode($key) . '=' . urlencode($value) . '';

}

$params[CURLOPT_POST] = true;

$params[CURLOPT_POSTFIELDS] = $postfields;

//判断是否有cookie,有的话直接使用

if (isset($_COOKIE['cookie_jar'])($_COOKIE['cookie_jar']||is_file($_COOKIE['cookie_jar']))){

$params[CURLOPT_COOKIEFILE] = $_COOKIE['cookie_jar']; //这里判断cookie

}else{

$cookie_jar = tempnam($this-cookie_path, 'cookie'); //产生一个cookie文件

$params[CURLOPT_COOKIEJAR] = $cookie_jar; //写入cookie信息

setcookie('cookie_jar', $cookie_jar); //保存cookie路径

}

curl_setopt_array($ch, $params); //传入curl参数

$content = curl_exec($ch); //执行

return $content;

}

php获取网页源码内容有哪些办法

可以参考以下几种方法：

方法一： file_get_contents获取

span style="white-space:pre" /span$url="";

span style="white-space:pre" /span$fh= file_get_contents

('');span style="white-space:pre" /spanecho $fh;

方法二：使用fopen获取网页源代码

span style="white-space:pre" /span$url="";

span style="white-space:pre" /span$handle = fopen ($url, "rb");

span style="white-space:pre" /span$contents = "";

span style="white-space:pre" /spanwhile (!feof($handle)) {

span style="white-space:pre" /span$contents .= fread($handle, 8192);

span style="white-space:pre" /span}

span style="white-space:pre" /spanfclose($handle);

span style="white-space:pre" /spanecho $contents; //输出获取到得内容。

方法三：使用CURL获取网页源代码

$url="";

$UserAgent = 'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 6.0; SLCC1; .NET CLR 2.0.50727; .NET CLR 3.0.04506; .NET CLR 3.5.21022; .NET CLR 1.0.3705; .NET CLR 1.1.4322)';

$curl = curl_init(); //创建一个新的CURL资源

curl_setopt($curl, CURLOPT_URL, $url); //设置URL和相应的选项

curl_setopt($curl, CURLOPT_HEADER, 0); //0表示不输出Header，1表示输出

curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1); //设定是否显示头信息,1显示，0不显示。//如果成功只将结果返回，不自动输出任何内容。如果失败返回FALSE

curl_setopt($curl, CURLOPT_SSL_VERIFYPEER, false);

curl_setopt($curl, CURLOPT_SSL_VERIFYHOST, false);

curl_setopt($curl, CURLOPT_ENCODING, ''); //设置编码格式，为空表示支持所有格式的编码

//header中“Accept-Encoding: ”部分的内容，支持的编码格式为："identity"，"deflate"，"gzip"。

curl_setopt($curl, CURLOPT_USERAGENT, $UserAgent);

curl_setopt($curl, CURLOPT_FOLLOWLOCATION, 1);

//设置这个选项为一个非零值(象 “Location: “)的头，服务器会把它当做HTTP头的一部分发送(注意这是递归的，PHP将发送形如 “Location: “的头)。

$data = curl_exec($curl);

echo $data;

//echo curl_errno($curl); //返回0时表示程序执行成功

curl_close($curl); //关闭cURL资源，并释放系统资源

拓展资料

PHP（外文名:PHP: Hypertext Preprocessor，中文名：“超文本预处理器”）是一种通用开源脚本语言。语法吸收了C语言、Java和Perl的特点，利于学习，使用广泛，主要适用于Web开发领域。PHP 独特的语法混合了C、Java、Perl以及PHP自创的语法。它可以比CGI或者Perl更快速地执行动态网页。

用PHP做出的动态页面与其他的编程语言相比，PHP是将程序嵌入到HTML（标准通用标记语言下的一个应用）文档中去执行，执行效率比完全生成HTML标记的CGI要高许多；PHP还可以执行编译后代码，编译可以达到加密和优化代码运行，使代码运行更快。

参考资料：PHP（超文本预处理器)-百度百科

PHP获取网页内容的几种方法

简单的收集下PHP下获取网页内容的几种方法:

用file_get_contents,以get方式获取内容。

用fopen打开url,以get方式获取内容。

使用curl库，使用curl库之前，可能需要查看一下php.ini是否已经打开了curl扩展。

用file_get_contents函数，以post方式获取url。

用fopen打开url，以post方式获取内容。

用fsockopen函数打开url，获取完整的数据，包括header和body。

php获取网页源码内容有哪些办法？

1、使用file_get_contents获得网页源代码。这个方法最常用，只需要两行代码即可，非常简单方便。

2、使用fopen获得网页源代码。这个方法用的人也不少，不过代码有点多。

3、使用curl获得网页源代码。使用curl获得网页源代码的做法，往往是需要更高要求的人使用，例如当你需要在抓取网页内容的同时，得到网页header信息，还有ENCODING编码的使，USERAGENT的使用等等。

所谓的网页代码，就是指在网页制作过程中需要用到的一些特殊的"语言"，设计人员通过对这些"语言"进行组织编排制作出网页，然后由浏览器对代码进行"翻译"后才是我们最终看到的效果。

制作网页时常用的代码有HTML，JavaScript，ASP，PHP，CGI等，其中超文本标记语言(标准通用标记语言下的一个应用、外语简称:HTML)是最基础的网页代码。

网页题目：php采集别人网页数据,php自动采集如何实现
URL网址：http://cdkjz.cn/article/heepoj.html

返回首页了解更多建站资讯

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

大客户专线成都：13518219792 座机：028-86922220

在线咨询提交需求

友情链接交换友情链接

全网整合营销网站制作高端网站建设天泽尚品装饰服务器机柜成都手机网站开发成都雪糕加盟轻质隔墙板四川中宇建业 zyfdjwx.com

成都网站建设公司地址：成都市青羊区太升南路288号锦天国际A座10层建设咨询028-86922220

专家团队为您提供成都网站建设,成都网站设计,成都品牌网站设计,成都营销型网站制作等服务,成都建网站就找快上网！ | 成都网站建设哪家好？ | 网站建设地图

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

php采集别人网页数据,php自动采集如何实现

PHP采集网页中指定的内容

php获取别的网页数值

phpstudy怎么抓取网页数据

php获取网页源码内容有哪些办法

PHP获取网页内容的几种方法

php获取网页源码内容有哪些办法？

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

php采集别人网页数据,php自动采集如何实现

PHP采集网页中指定的内容

php获取别的网页数值

phpstudy怎么抓取网页数据

php获取网页源码内容有哪些办法

PHP获取网页内容的几种方法

php获取网页源码内容有哪些办法？

相关资讯

jquery图文滚动 jquery无缝滚动

ios开发环境切换工具 ios开发环境搭建windows

r怎么连接mysql 锋兰达华为hicar怎么连接

mysql怎么加图形界面 mysql怎么添加图片

linux启动微服务命令 linux启动web服务器的命令

android的结构 android项目的结构

最新的jquery 最新的油价调整预测

linux网路对时命令的简单介绍

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接