百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

使用 Python 在 5 分钟内抓取网站数据

myzbx 2024-12-13 15:06 29 浏览

行动计划

在制作我的表情机器人时,我遇到了一个很大的不便——没有公开的表情数据库! 在找了几个小时之后,我决定是时候采取主动并自己制作了。

附: 如果你碰巧找到了一个文字表情数据库,请告诉我(这样我就可以嘲笑自己浪费了多少时间)。

总体策略:

  1. 使用 BeautifulSoup 制作解析器
  2. 使此解析器避免验证码和 HTTP 错误 403
  3. 找到所有包含表情符号的容器
  4. 根据情绪将它们放入一维数组中(一个代表快乐,一个代表愤怒等等)
  5. 将我们所有的数组组合成一个 Pandas 数据框
  6. 没有剧透,但我对生成的数据框看起来多么不寻常感到非常惊讶:)


第 1 步 — 获取网站和库

表情符号以字符串形式出现,因此从 HTML 代码中检索它们应该相对容易。

这个网站有一个小技巧:

如您所见,网站每个部分的 URL 都会有所不同。 这没问题,只是需要注意的一些事情,并且会在我们的抓取过程中增加一些工作。

让我们导入库:

from urllib.request import Request, urlopen
from bs4 import BeautifulSoup as soup

现在让我们创建请求。 这将打开网页并检查其内容。 您可以放置任何您想要的浏览器,我选择了 Mozilla,因为它似乎造成的麻烦最少(澄清一下,我使用 Chrome 作为浏览器来抓取,您不需要输入实际浏览器的名称!)

url = "https://www.emoticonstext.com/flip-table.html"

req = Request(url, headers = {'User-Agent': 'Mozilla/5.0'})

webpage = urlopen(req).read()

好的,解析器时间!

page_soup = soup(webpage, 'html.parser')


第 2 步 — 检索数据

以下是该过程背后的逻辑:

  1. 我们获取 url 并设置我们的解析器
  2. 解析器将寻找一个特定的容器(在我们的例子中是 span 容器)
  3. 我们将收集到的数据放入一维数组中
  4. 我们确保数组的长度相同(这将有助于我们稍后创建数据框)

这有点拗口,让我们开始吧!

首先,获取 url 并设置解析器:

def makeArray(url):
  url_add = url
  req = Request(url_add, headers = {'User-Agent': 'Mozilla/5.0'})
  webpage = urlopen(req).read()
  page_soup = soup(webpage, 'html.parser')
  containers = page_soup.findAll("span", "emoticon")
  arr_name = []
  for i in containers:
    arr_name.append(i)
  return arr_name

很好,我们为网站的 1 个部分返回了一个数组。 我将使用这个函数制作 7 个不同的数组——每种情绪 1 个。 尽管这看起来又长又难,但它只是对每种情感的前两行代码的重复!

#create the 'laughing' array
laughing_arr = makeArray("https://www.emoticonstext.com/laughing.html")
#print its length (it was 29 values long
print(len(laughing_arr))

#create the 'surprised' array
surprised_arr = makeArray("https://www.emoticonstext.com/surprised.html")
#get its length (its 45)
print(len(surprised_arr))
#trim it down to make it 29
del surprised_arr[29:45]

###### REPEAT! ######

thinking_arr = makeArray("https://www.emoticonstext.com/thinking.html")
print(len(thinking_arr))
del thinking_arr[29:43]

confused_arr = makeArray("https://www.emoticonstext.com/confused.html")
print(len(confused_arr))
del confused_arr[29:38]

depressed_arr = makeArray("https://www.emoticonstext.com/depressed.html")
print(len(depressed_arr))
del depressed_arr[29:49]

helpless_arr = makeArray("https://www.emoticonstext.com/helpless.html")
print(len(helpless_arr))
del helpless_arr[29:35]

scared_arr = makeArray("https://www.emoticonstext.com/scared.html")
print(len(scared_arr))
del scared_arr[29:46]

恭喜,你刚刚制作了很多一维数组!


第三步——制作数据框

制作数据框所需要做的就是将我们的数组作为列添加到其中。 我们将使用 Pandas 创建我们的数据框。

import pandas as pd
df = pd.DataFrame()

df['happy'] = list(laughing_arr)
df['surprised'] = list(surprised_arr)
df['thinking'] = list(thinking_arr)
df['confused'] = list(confused_arr)
df['depressed'] = list(depressed_arr)
df['helpless'] = list(helpless_arr)
df['scared'] = list(scared_arr)

df.head(29)

好吧,让我们看看我们辛勤工作的成果:

你现在可以在这个数据框上使用 Pandas 并用它做任何你喜欢的事情!

相关推荐

砌体植筋拉拔试验检验值到底是6.0KN,还是10.2KN,如何计算确定

砌体拉结筋植筋养护完成后,需对所植钢筋进行拉拔试验,以检验植筋的锚固强度是否满足设计要求。检测时,按照一定的抽样比例进行拉拔试验。根据《混凝土结构后锚固技术规程》JGJ145-2013,以同品种、同...

柴油机功率如何计算?计算柴油机功率需要哪些参数?

在汽车领域,对于柴油机功率的计算是一项重要的工作,它有助于我们更好地了解柴油机的性能和适用场景。下面我们就来详细探讨一下柴油机功率的计算方法以及所需的参数。首先,我们要了解计算柴油机功率常用的公式。在...

变压器短路阻抗的作用和计算方法(变压器短路阻抗的作用和计算方法是什么)

变压器短路阻抗的作用和计算方法短路阻抗是在负载试验中测量的一项数据,它是二次侧短接并流过额定电流时,一次侧施加的电压与额定电压的的百分数。那么测量变压器的短路阻抗有什么意义呢?其实变压器的阻抗电压乃是...

9.35m层高高支模支撑架计算书(支模架多高属于高支模)

某工厂新扩建的建筑面积为1989.2m^2,建筑物总体分为2层,但局部为4层。建筑物檐高19.4m,建筑物总高23m。建筑物呈长方形设置,长度为48.20m,宽度为23.88m,结构形式为框架结构...

吊篮(悬挂装置前梁加长)安全复核计算书

吊篮(悬挂装置前梁加长)安全复核计算书一种超常规搭设的高处作业吊篮,因使用要求将吊篮悬挂装置前梁加长设置,本计算书针对这种工况的校核,以作参考。计算依据:1、《高处作业吊篮》GB/T19155-...

电功率计算公式精编汇总(电功率计算视频讲解)

一、电功率计算公式:1在纯直流电路中:P=UIP=I2RP=U2/R式中:P---电功率(W),U---电压(V),I----电流(A),R---电阻(Ω)。2在单相交流电路中:P=UIcosφ...

灌注桩承载力检测方法及步骤(灌注桩承载力不够怎么办)

检测灌注桩的承载力是确保基础工程安全可靠的关键环节,检测结果的精细能准确为我们提供可靠的数据,让我们能准确判断桩基础的承载力,方便后续施工安排,同样也能让我们根据数据分辨出有问题桩基,采取可靠有效的措...

很哇塞的体积计算方法:向量叉乘 很哇塞的体积计算方法

高中数学必看:向量叉乘,体积的神。大家都知道a、b的向量是什么意思,但是a、b的向量又是什么?很多同学都不知道,向量的向量在高中阶段非常有用,虽然它是大学的知识,在高中阶段可以干两件事。·第一件事,表...

施工升降机基础(设置在地库顶板回顶)计算书

施工升降机基础(设置在地库顶板回顶)计算书计算依据:1、《施工现场设施安全设计计算手册》谢建民编著2、《建筑地基基础设计规范》GB50007-20113、《混凝土结构设计标准》GB/T50010-2...

剪力墙水平钢筋根数如何计算?(剪力墙水平钢筋绑扎搭接规范)

剪力墙水平钢筋根数的计算需综合考虑墙高、起步距离、间距及构造要求等因素,具体步骤如下及依据:1.基本计算公式水平钢筋根数计算公式为:根数=(墙高-起步距离)/间距(墙高-起步距离)/间距...

直流电路常用计算公式(直流电路常用计算公式有哪些)

1、电阻导体阻碍电流通过的能力叫做电阻,用字母R表示,单位欧(Ω)。R=ρl/s式中R-导体的电阻,欧(Ω);ρ-导体的电阻率,欧·米(Ω·m);l-导体的长度,米(m);s-导体的截面积,平方米(m...

电气主电路图的绘制特点(电气原理图主电路)

1、电气主电路图中的电气设备、元件,如电源进线、变压器、隔离开关、断路器、熔断器、避雷器等都垂直绘制,而母线则水平绘制。电气主电路图除特殊情况外,几乎无一例外地画成单线图,并以母线为核心将各个项目(如...

中考总复习:物理专题 功和机械能 (功的计算、功率、动能、势能)

中考物理专题:功与机械能解析一、力学中的功——能量转化的桥梁功是力对物体能量变化的量度,需满足两要素:作用在物体上的力、物体沿力方向移动距离。例如推箱子时,若箱子未移动,推力不做功;若箱子滑动,推力做...

40亿QQ号,不超过1G内存,如何去重?

分享一道网上很火的面试题:40亿QQ号,不超过1G的内存,如何去重?这是一个非常经典的海量数据去重问题,并且做了内存限制,最多只能1GB,本文跟大家探讨一下~~一、常规思路我们日常开发中,如果谈到去重...

填充墙体拉结筋植筋深度、孔径、拉拔试验承载力计算!

今天分享下植筋间距及保护层要求:根据JGJ145-2013混凝土后锚固技术规程要求植筋与混凝土结构边缘不应小于5mm,植筋为两根及以上时水平间距为不应小于5d(d为钢筋直径)。根据混凝土结构后锚固技...