关于python爬虫实现post的信息

本文目录一览：

1、python总结-post请求
2、python爬虫使用request发送get和post请求
3、Python爬虫传送post请求要携带哪些参数
4、Python爬虫杂记 - POST之multipart/form-data请求
5、Python爬虫笔记（二）requests模块get，post，代理

python总结-post请求

一个现象：

很多情况下，我们需要登陆账号，才能爬取更多的信息。

而我们想要登陆的话，则需要带上 cookies。

以 ]() 作为爬虫范例吧。

账号：spiderman，密码：crawler334566

这里又来了一个post请求？

（1）post和get都可以带着参数请求，不过get请求的参数会在url上显示出来。

（2）post请求的参数就不会直接显示，而是隐藏起来。像账号密码这种私密的信息，就应该用post的请求。

（3）get请求会应用于获取网页数据，比如我们之前学的requests.get()。post请求则应用于向网页提交数据，比如提交表单类型数据（像账号密码就是网页表单的数据）。

【requests headers】存储的是浏览器的请求信息，【response headers】存储的是服务器的响应信息。我们要找的cookies就在其中。

【response headers】里有set cookies的参数。set cookies是什么意思？就是服务器往浏览器写入了cookies。

明天接着写cookies吧，难的地方分多步完成！

python爬虫使用request发送get和post请求

输出为一个网页的 html 代码；

输出内容如下：

输出结果为一个网页的 html 代码；

输出结果如下：

其他的参数和 GET 一样，直接使用即可，这里就不再一一举例了。

输出信息如下：

剩余内容请转至VX公众号 “运维家” ，回复 “170” 查看。

------ “运维家” ，回复 “170” ------

linux卸载硬盘，win7共享linux，linuxgdal安装，Linux7忘记密码，linux怎么进入文件的子目录，高通开源代码linux，linuxusr大小，重启服务器的linux命令，linux的jdk怎么安装啊；

linuxtar文件打不开，linux常用状态检测，linux成功开机界面，linux七种文件，linux命令，Linux+删除数据的命令，linux自动监听重启服务器，如何快速担任linux运维，Linux返回到波浪线，linux大数据架构搭建。

Python爬虫传送post请求要携带哪些参数

调用requests库，发送post请求，通过data参数来传递

import requests

payload = {'a':'杨','b':'hello'}

r = requests.post(", data=payload)

print r.text

Python爬虫杂记 - POST之multipart/form-data请求

原以为requests请求十分强大，但遇到了模拟multipart/form-data类型的post请求，才发现requests库还是有一丢丢的不足。不过也可能是我理解的不足，还希望读者老爷不吝指教！在此感谢！

enctype属性:

enctype：规定了form表单在发送到服务器时候编码方式，它有如下的三个值。

①application/x-www-form-urlencoded：默认的编码方式。但是在用文本的传输和MP3等大型文件的时候，使用这种编码就显得效率低下。

②multipart/form-data：指定传输数据为二进制类型，比如图片、mp3、文件。

③text/plain：纯文体的传输。空格转换为 “+” 加号，但不对特殊字符编码。

值得注意的是：请求头的Content-Type属性与其他post请求的不同

总注：上边这两种构建参数的方式各有不同，用起来感觉并不是那么的灵活，所以感叹requests有那么一丢丢丢的不足。值的注意的是，requests.post中files参数接收字典的形式和encode_multipart_formdata中params参数接收字典形式的区别！人生苦短......

Python爬虫笔记（二）requests模块get，post，代理

import requests

base_url = ''

response = requests.get(base_url)

url=请求url，

headers =请求头字典，

params = 请求参数字典。

timeout = 超时时长，

)----response对象

服务器响应包含：状态行（协议，状态码）、响应头，空行，响应正文

字符串格式：response.text

bytes类型：response.content

response.headers['cookie']

response.text获取到的字符串类型的响应正文，

其实是通过下面的步骤获取的：

response.text = response.content.decode(response.encoding)

产生的原因：编码和解码的编码格式不一致造成的。

str.encode('编码')---将字符串按指定编码解码成bytes类型

bytes.decode('编码')---将bytes类型按指定编码编码成字符串。

a、response.content.decode('页面正确的编码格式')

meta http-equiv="content-type" content="text/html;charset=utf-8"

b、找到正确的编码，设置到response.encoding中

response.encoding = 正确的编码

response.text---正确的页面内容。

a、没有请求参数的情况下，只需要确定url和headers字典。

b、get请求是有请求参数。

在chrome浏览器中，下面找query_string_params,

将里面的参数封装到params字典中。

c、分页主要是查看每页中，请求参数页码字段的变化，

找到变化规律，用for循环就可以做到分页。

requests.post(

url=请求url，

headers = 请求头字典，

data=请求数据字典

timeout=超时时长

)---response对象

post请求一般返回数据都是json数据。

（1）response.json()---json字符串所对应的python的list或者dict

（2）用 json 模块。

json.loads(json_str)----json_data(python的list或者dict)

json.dumps(json_data)---json_str

post请求能否成功，关键看**请求参数**。

如何查找是哪个请求参数在影响数据获取？

---通过对比，找到变化的参数。

变化参数如何找到参数的生成方式，就是解决这个ajax请求数据获取的途径。

**寻找的办法**有以下几种：

（1）写死在页面。

（2）写在js中。

（3）请求参数是在之前的一条ajax请求的数据里面提前获取好的。

代理形象的说，他是网络信息中转站。

实际上就是在本机和服务器之间架了一座桥。

a、突破自身ip访问现实，可以访问一些平时访问不到网站。

b、访问一些单位或者团体的资源。

c、提高访问速度。代理的服务器主要作用就是中转，

所以一般代理服务里面都是用内存来进行数据存储的。

d、隐藏ip。

FTP代理服务器---21,2121

HTTP代理服务器---80,8080

SSL/TLS代理：主要用访问加密网站。端口：443

telnet代理：主要用telnet远程控制，端口一般为23

高度匿名代理：数据包会原封不动转化，在服务段看来，就好像一个普通用户在访问，做到完全隐藏ip。

普通匿名代理：数据包会做一些改动，服务器有可能找到原ip。

透明代理：不但改动数据，还会告诉服务，是谁访问的。

间谍代理：指组织或者个人用于记录用户传输数据，然后进行研究，监控等目的的代理。

proxies = {

'代理服务器的类型':'代理ip'

}

response = requests.get(proxies = proxies)

代理服务器的类型:http,https,ftp

代理ip: