从品牌网站建设到网络营销策划,从策略到执行的一站式服务
用到的模块有:requesst、re、pandas
步骤:1.得到url
2.设置请求头伪装浏览器,防止被反爬
3.请求获得文本文件
4.用re.compile()方法复制文本
5.用pd.DataFrame()让爬取的信息根据可读性,条理性。
成都创新互联是一家专注于网站设计制作、成都网站设计与策划设计,宁河网站建设哪家好?成都创新互联做网站,专注于网站建设十年,网设计领域的专业建站公司;建站业务涵盖:宁河等地区。宁河做网站价格咨询:13518219792
import requests
import re
import pandas as pd
url = "https://tophub.today/n/Jb0vmloB1G"
headers = {
"user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)"
" AppleWebKit/537.36 (KHTML, like Gecko) "
"Chrome/100.0.4896.127 Safari/537.36 Edg/100.0.1185.44"
}
r = requests.get(url,headers=headers).text # 得到text文本。
title = re.compile('itemid="[0-9]*">(.*?)') # 这些信息在网页开发者模式下可以获取
titles = title.findall(r)[0:31] # 用findall方法和切片获得1-30的排行榜
num = re.compile("(.*?) ") #复制热度信息
nums = num.findall(r)[0:31]
m = {"今日热点":titles,"热度":nums}
file = pd.DataFrame(m) # 使用DataFrame方法使爬取的数据更具可读性。
print(file)
爬取后的样子:
如果你把这段代码复制运行,你可能会发现爬取不到,因为热榜信息在更新,写的不太严谨,因为作者见解有限,在不断学习中,有啥不足或者补充的,欢迎各位大佬评论!
成都网站建设公司地址:成都市青羊区太升南路288号锦天国际A座10层 建设咨询028-86922220
成都快上网科技有限公司-四川网站建设设计公司 | 蜀ICP备19037934号 Copyright 2020,ALL Rights Reserved cdkjz.cn | 成都网站建设 | © Copyright 2020版权所有.
专家团队为您提供成都网站建设,成都网站设计,成都品牌网站设计,成都营销型网站制作等服务,成都建网站就找快上网! | 成都网站建设哪家好? | 网站建设地图