【GUI软件】用python采集百度搜索结果，并开发成exe桌面软件！

日期：2024-12-21 作者：8r2jv caijiyuan 评论：0 移动：http://ww.kub2b.com/mobile/news/9916.html

核心提示：你好，我是 @马哥python说的小迷弟。但是，很多不懂python编程的小伙伴无法使用它，非常痛苦！

你好，我是 @马哥python说的小迷弟。

但是，很多不懂python编程的小伙伴无法使用它，非常痛苦！

于是，我把这个程序封装成了一个桌面软件（exe文件），无需python运行环境也可以使用。

通过python爬虫技术，爬取百度搜索结果数据，包含字段：

页码、标题、百度链接、真实链接、简介、网站名称。

并把源码封装成exe文件，方便没有python环境，或者不懂技术的人使用它。

首先，导入需要用到的库：

定义一个请求头：

cookie是个关键，如果不加cookie，响应码可能不是200，获取不到数据，而且cookie值是有有效期的，需要定期更换，如果发现返回无数据或响应码非200，尝试替换最新的cookie。

按照图示顺序，依次：

wd=后面是搜索关键字"马哥python说"，pn=后面是10（规律：第一页是0，第二页是10，第三页是20，以此类推），其他URL参数可以忽略。

每一条搜索结果，都是class=“result c-container new-pmd”，下层结构里有简介、链接等内容，解析内部子元素不再赘述。

所以根据这个逻辑，开发爬虫代码。

其中，获取到的标题链接，一般是这种结构：

http://www.baidu.com/link?url=7sxpKz_qoESU5b1BHZThKRAnXxPngB5kx1nZdUBCaXh7a4BgUgx9Zz-IqpeqDZTOIjvfY0u6ebnJdVWIfm5Tz_

这显然是百度的一个跳转前的地址，不是目标地址，怎么获取它背后的真实地址呢？

向这个跳转前地址，发送一个请求，然后逻辑处理下：

如果响应码是302，就从响应头中的Location参数获取真实地址。

如果是其他响应码，就从响应内容中用正则表达式提取出URL真实地址。

把爬取到的数据，保存到csv文件：

to_csv的时候需加上选项（encoding=‘utf_8_sig’），否则存入数据会产生乱码，尤其是windows用户！

界面部分代码：

软件运行过程中，会在同级目录下生成logs文件夹，文件夹内会出现log文件，记录下软件在整个运行过程中的日志，方便长时间运行、无人值守，出现问题后的debug。

部分核心代码：

演示视频：
【爬虫GUI演示】用python爬百度搜索，并开发成exe桌面软件！

特别提示：本信息由相关用户自行提供，真实性未证实，仅供参考。请谨慎采用，风险自负。

更多>同类最新文章

0 条相关评论

文章列表

相关文章

最新动态

推荐图文

最新文章

点击排行

• 智能家居“伪智能”、直播间买到的羽绒服穿不了	• 智能手机传感器及作用大盘点手机的作用「智能手
• 您知道唐僧师徒在南通长牌中分别是谁吗？	• 【华为】新版模拟器eNSP Lite安装攻略提前解锁
• Android监控虚拟键 android手机虚拟摄像头手机I	• 微信语音怎么提取到电脑【苹果安卓手机】苹果手
• 修成正果！安东尼已被通知入选2025年奈史密斯篮	• 在任意手机上使用带有图形化界面（GUI）的完整L
• 腾讯史上最大就业计划技术岗超六成，大厂加码AI	• 纪律处罚消息两则：海港主教练穆斯卡特停赛1场