最新文章
2024年最全你们都说淘宝是最难爬的网站了?用我这个方法包你学会!(1)
2024-12-20 05:08

今天就教大家如何采集淘宝数据并实现数据分析

今天就给大家带来一个淘宝商品数据小爬虫吧。顺便按老规矩把抓取到的数据可视化一波。废话不多说,让我们愉快地开始吧~

**Python****版本:**3.6.4

相关模块

DecryptLogin模块

pyecharts模块

以及一些Python自带的模块。

既然说了是模拟登录相关的爬虫小案例,首先自然是要实现一下淘宝的模拟登录啦。这里还是利用我们开源的DecryptLogin库来实现,只需三行代码即可

‘’‘模拟登录淘宝’‘’

@staticmethod

def login():

lg = login.Login()

infos_return, session = lg.taobao()

return session

另外,顺便提一句,经常有人想让我在DecryptLogin库里加入cookies持久化功能。其实你自己多写两行代码就能实现了

if os.path.isfile(‘session.pkl’):

self.session = pickle.load(open(‘session.pkl’, ‘rb’))

else:

self.session = TBGoodsCrawler.login()

f = open(‘session.pkl’, ‘wb’)

pickle.dump(self.session, f)

f.close()

我真不想在这个库里添加这个功能,后面我倒是想添加一些其他爬虫相关的功能,这个之后再说吧。好的,偏题了,言归正传吧。接着,我们去网页版的淘宝抓一波包吧。比如F12打开开发者工具后,在淘宝的商品搜索栏里随便输入点东西,就像这样

全局搜索一下诸如search这样的关键词,可以发现如下链接

看看它返回的数据是啥

看来应该没错了。另外,如果小伙伴们自己实战的时候没有找到这个接口api,可以尝试再点击一下右上角的下一页商品按钮

这样就肯定能抓到这个请求接口啦。简单测试一下,可以发现尽管请求这个接口所需携带的参数看上去很多,但实际上必须要提交的参数只有两个,即

q: 商品名称 s: 当前页码的偏移量

好啦,根据这个接口,以及我们的测试结果,现在就可以愉快地开始实现淘宝商品数据的抓取啦。具体而言,主代码实现如下

‘’‘外部调用’‘’

def run(self):

search_url = ‘https://s.taobao.com/search?’

while True:

goods_name = input('请输入想要抓取的商品信息名称: ')

offset = 0

page_size = 44

goods_infos_dict = {}

page_interval = random.randint(1, 5)

page_pointer = 0

while True:

params = {

‘q’: goods_name,

‘ajax’: ‘true’,

‘ie’: ‘utf8’,

‘s’: str(offset)

}

response = self.session.get(search_url, params=params)

if (response.status_code != 200):

break

response_json = response.json()

all_items = response_json.get(‘mods’, {}).get(‘itemlist’, {}).get(‘data’, {}).get(‘auctions’, [])

if len(all_items) == 0:

break

for item in all_items:

学好 Python 不论是就业还是做副业赚钱都不错,但要学会 Python 还是要有一个学习规划。最后大家分享一份全套的 Python 学习资料,给那些想学习 Python 的小伙伴们一点帮助

一、Python所有方向的学习路线

Python所有方向路线就是把Python常用的技术点做整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。

二、学习软件

工欲善其事必先利其器。学习Python常用的开发软件都在这里了,给大家节省了很多时间。

三、全套PDF电子书

书籍的好处就在于权威和体系健全,刚开始学习的时候你可以只看视频或者听某个人讲课,但等你学完之后,你觉得你掌握了,这时候建议还是得去看一下书籍,看权威技术书籍也是每个程序员必经之路。

四、入门学习视频

我们在看视频学习的时候,不能光动眼动脑不动手,比较科学的学习方法是在理解之后运用它们,这时候练手项目就很适合了。

五、实战案例

光学理论是没用的,要学会跟着一起敲,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。

六、面试资料

我们学习Python必然是为了找到高薪的工作,下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料,并且有阿里大佬给出了权威的解答,刷完这一套面试资料相信大家都能找到满意的工作。

网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友,可以戳这里无偿获取

    以上就是本篇文章【2024年最全你们都说淘宝是最难爬的网站了?用我这个方法包你学会!(1)】的全部内容了,欢迎阅览 ! 文章地址:http://ww.kub2b.com/quote/7160.html 
     栏目首页      相关文章      动态      同类文章      热门文章      网站地图      返回首页 企库往资讯移动站http://ww.kub2b.com/mobile/,查看更多   
发表评论
0评