Node爬虫实践-快上网网站建设公司

Node爬虫实践

爬虫的原理很好理解，就是在服务端请求另一个服务器的资源，前端有跨域问题，而服务端没有，这是天然优势。掌握node的前端可以为所欲为了。 Node爬虫实践

成都网站设计、网站制作的开发，更需要了解用户，从用户角度来建设网站，获得较好的用户体验。成都创新互联公司多年互联网经验，见的多，沟通容易、能帮助客户提出的运营建议。作为成都一家网络公司，打造的就是网站建设产品直销的概念。选择成都创新互联公司，不只是建站，我们把建站作为产品，不断的更新、完善，让每位来访用户感受到浩方产品的价值服务。

1 首先，根据请求资源的协议选择合适的模块，比如csdn是https协议，就用https的方法取请求，之前没有注意到这个问题。

var https = require('https');

2 用get方法请求需要抓去内容的网页地址，试过用request方法，没有反应。

 https.get('https://www.xxx.net',function(res){
        ......
 })

3 用cheerio模块查找dom元素，抓取需要的内容。cheerio是服务端的dom操作工具，以jquery为内核。

var cheerio = require('cheerio');
     res.on('data', (chunk) => {
        const $ = cheerio.load(chunk);
        let content=$('.company_list');
     })

4 把图片的绝对地址改成本地路径，前端页面无法直接访问跨域受保护图片。

let imgsrc=[];
content.find('img').each((index,e)=>{
    
    var originsrc=e.attribs.src;
    e.attribs.src ='/images/'+e.attribs.src.split('?')[0].split('/').pop();
    imgsrc.push(originsrc);

})

5 最后一步，也是最重要的一步：把图片保存在本地文件夹。试过fs.readFile 和fs.writeFile，保存下来的图片受损打不开；试过直接get请求，返回的图片都是0字节。正确的方法是用request方法，至于为什么？我也不清楚啊。可能是binary二进制的优势，毕竟再怎么伪装，所有数据本质还是二进制吧。

var request = require('request');
imgsrc.forEach(item=>{

    var filename = item.split('?')[0].split('/').pop();

    request({ url: item, encoding: null }, (err, response, body) => { 
        fs.writeFileSync('./public/images/'+filename, body, { encoding: 'binary' });
    })

})

到此为止，爬虫的功能就结束了。 Node爬虫实践

分享标题：Node爬虫实践
网页路径：http://cdkjz.cn/article/giepoe.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

Node爬虫实践

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

Node爬虫实践

相关资讯

Swift类型嵌套-创新互联

高中数学ln的知识点数学ln是什么？-创新互联

购买虚拟主机需要注意哪些事项-创新互联

VBS中HelpFile属性的用法-创新互联

零基础学习编程应该先学什么？-创新互联

Linux系统中安装和配置Samba服务器的步骤-创新互联

HTML5中ApplicationCache的示例分析-创新互联

如何理解Yii目录结构、入口文件及路由设置-创新互联

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接