用Python爬取淘宝2000款T T-轻识

各位同学们，好久没写原创技术文章了，最近有些忙，所以进度很慢，给各位道个歉！

警告：本教程仅用作学习交流，请勿用作商业盈利，违者后果自负！如本文有侵犯任何组织集团公司的隐私或利益，请告知联系猪哥删除！！！

一、淘宝登录复习

前面我们已经介绍过了如何使用requests库登录淘宝，收到了很多同学的反馈和提问，猪哥感到很欣慰，同时对那些没有及时回复的同学说声抱歉！

顺便再提一下这个登录功能，代码是完全没有问题。如果你登录出现申请st码失败的错误时候，可以更换_verify_password方法中的所有请求参数。

在淘宝登录2.0改进中我们增加了cookies序列化的功能，目的就是为了方便爬取淘宝数据，因为如果你同一个ip频繁登录淘宝的话可能就会触发淘宝的反扒机制！

关于淘宝登录的成功率，在猪哥实际的使用中基本都能成功，如果不成功就按上面的方法更换登录参数！

二、淘宝商品信息爬取

这篇文章主要是讲解如何爬取数据，数据的分析放在下一篇。之所以分开是因为爬取淘宝遇到的问题太多，而猪哥又打算详细再详细的为大家讲解如何爬取，所以考虑篇幅及同学吸收率方面就分两篇讲解吧！宗旨还会不变：让小白也能看得懂！

本次爬取是调用淘宝pc端搜索接口，对返回的数据进行提取、然后保存为excel文件！

看似一个简单的功能却包含了很多问题，我们来一点一点往下看吧！

三、爬取单页数据

开始写一个爬虫项目我们都需要量化后再分步，而一般第一步便是先爬取一页试试！

1.查找加载数据URL

我们在网页中打开淘宝网，然后登录，打开chrome的调试窗口，点击network，然后勾选上Preserve log，在搜索框中输入你想要搜索的商品名称

这是第一页的请求，我们查看了数据发现：返回的商品信息数据插入到了网页里面，而不是直接返回的纯json数据！

2. 是否有返回纯json数据接口？

然后猪哥就好奇有没有返回纯json的数据接口呢？于是我就点了下一页（也就是第二页）

请求第二页后猪哥发现返回的数据竟然是纯json，然后比较两次请求url，找到只返回json数据的参数！

通过比较我们发现搜索请求url中如果带ajax=true参数的话就直接返回json数据，那我们是不是可以直接模拟直接请求json数据！

所以猪哥就直接使用第二页的请求参数去请求数据（也就是直接请求json数据），但是请求第一页就出现错误：

直接返回一个链接而不是json数据，这个链接是什么鬼？点一下。。。

铛铛铛，滑块出现，有同学会问：用requests能搞定淘宝滑块吗？猪哥咨询过几个爬虫大佬，滑块的原理是收集响应时间，拖拽速度，时间，位置，轨迹，重试次数等然后判断是否是人工滑动。而且还经常变算法，所以猪哥选择放弃这条路！