ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Python 网络爬虫入门到实战 第 03 章:爬虫环境搭建|Anaconda3 + PyCharm Community + requests 全套安装 + 入门代码

Python 网络爬虫入门到实战 第 03 章:爬虫环境搭建|Anaconda3 + PyCharm Community + requests 全套安装 + 入门代码 专栏Python 网络爬虫入门到实战零基础连载全套 本章定位从理论落地实战前两章我们吃透了爬虫核心原理与 HTTP 协议本章使用 Anaconda3PyCharm 社区版搭建爬虫专属开发环境安装爬虫核心库 requests手把手带你写出人生第一行爬虫代码彻底告别只看理论不会写代码的困境。✅ 学习目标理解 Anaconda 的作用学会安装 Anaconda3创建独立虚拟环境掌握 PyCharm Community社区免费版安装与项目配置关联 conda 环境掌握 conda 与 pip 包管理器的基础使用解决包安装常见报错在 conda 虚拟环境安装 requests 第三方库理解虚拟环境隔离的意义在 PyCharm 中编写 GET 请求爬虫代码运行并查看返回结果看懂响应对象属性状态码、响应文本、响应编码掌握基础反爬手段请求头 headers 伪装浏览器访问学会捕获基础异常简单优化代码健壮性一、环境选型说明很多新手直接使用系统自带 Python容易出现包版本冲突多个项目依赖打架。Anaconda3集成 Python 解释器 conda 包管理自带大量科学计算依赖支持虚拟环境爬虫、数据分析项目首选。PyCharm CommunityJetBrains 免费社区版 IDE代码提示、运行调试功能齐全适合 Python 开发。推荐版本Anaconda3 2023 及以上Python3.8~3.10PyCharm Community 2023二、Anaconda3 下载与安装官网下载地址Download Anaconda Distribution | Anaconda 选择对应操作系统安装包Windows / Mac国内下载慢可使用清华镜像站下载 Anaconda 安装包Windows 安装要点安装路径不要带中文、空格例如D:\Anaconda3安装选项 ✅ 勾选 Add Anaconda to my PATH environment variable可选新手建议勾选 ✅ Register Anaconda as my default Python 3.9安装完成后打开开始菜单找到Anaconda Prompt (anaconda3)验证 Anaconda 是否安装成功 在 Anaconda Prompt 输入conda --version python --version输出版本号即代表安装成功。创建爬虫专用虚拟环境重点虚拟环境可以隔离不同项目的依赖包防止版本冲突。# 创建名为spider_env的环境指定python3.10 conda create -n spider_env python3.10输入y确认安装。激活虚拟环境conda activate spider_env激活成功后命令行前面会出现(spider_env)标识代表当前处于爬虫独立环境。三、PyCharm Community 社区版安装与配置下载地址Download PyCharm: The Python IDE for data science and web development by JetBrains选择 Community 免费社区版安装一路默认勾选创建桌面快捷方式Windows 可勾选添加到右键菜单。在 PyCharm 中关联 Anaconda 虚拟环境打开 PyCharm新建项目 New ProjectLocation选择项目存放路径路径禁止中文Python interpreter 选择Existing environment点击... 浏览解释器路径找到Anaconda3/envs/spider_env/python.exe确认创建此时项目就绑定了我们刚刚创建的 spider_env 虚拟环境。验证PyCharm 底部 Terminal 终端会自动激活(spider_env)环境。四、requests 库安装在 spider_env 虚拟环境内执行两种方式任选其一推荐 pip 安装 requests。 打开 PyCharm 内置 Terminal确保前面有(spider_env)方式 1pip 安装推荐pip install requests国内加速镜像pip install requests -i https://pypi.tuna.tsinghua.edu.cn/simple方式 2conda 安装conda install requests验证 requests 安装成功在 PyCharm 终端输入 python 进入交互环境import requests无报错代表安装成功。五、第一个爬虫最简单 GET 请求在 PyCharm 项目中新建文件demo01_first_spider.py复制下面代码# 导入requests库 import requests # 目标网页地址 url https://httpbin.org/get # 发送GET请求 resp requests.get(url) # 打印状态码 print(响应状态码, resp.status_code) # 打印网页文本内容 print(网页源码) print(resp.text)右键文件Run 运行代码控制台输出返回内容。代码逐行解析import requests导入我们安装好的第三方库url定义请求目标网址requests.get(url)发送 GET 网络请求服务器返回的数据存入 resp 响应对象resp.status_codeHTTP 状态码200 代表请求成功resp.text网页返回的文本内容字符串格式六、核心知识点Response 响应对象常用属性属性作用resp.status_codeHTTP 响应状态码200 成功404 页面不存在403 拒绝访问resp.text网页文本内容字符串格式resp.content二进制原始数据图片、文件下载使用resp.encoding获取 / 设置网页编码resp.headers服务器返回的响应头七、实战进阶headers 请求头伪装新手必学很多网站会直接拒绝 Python 程序访问识别依据就是请求头里的 User-Agent默认 requests 的 UA 会暴露是爬虫程序。 我们可以手动传入 headers伪装成 Chrome 浏览器访问。import requests url https://httpbin.org/get # 请求头伪装成Chrome浏览器 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36 } # 携带请求头发送请求 resp requests.get(url, headersheaders) print(resp.text)User-Agent 获取方法浏览器 F12 开发者工具 - Network随便点开一条请求查看 Request Headers 中的 User-Agent。八、增加异常捕获提升代码容错性网络请求极易出现超时、断网、服务器无响应使用 try-except 捕获异常防止程序直接崩溃。import requests url https://httpbin.org/get headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36 } try: # 设置超时时间5秒超过时间直接报错防止程序卡死 resp requests.get(url, headersheaders, timeout5) resp.raise_for_status() # 如果状态码不是200主动抛出异常 print(请求成功状态码, resp.status_code) print(resp.text) except requests.exceptions.RequestException as e: print(请求出错, e)九、常见踩坑汇总PyCharm 里 import requests 提示红色原因当前项目解释器没有选中我们创建的 spider_env 虚拟环境。 解决File → Settings → Project → Python Interpreter切换为 spider_env 的 python.exe。conda 创建环境慢 添加 conda 国内镜像源清华源加速下载包。路径包含中文 Anaconda 安装路径、PyCharm 项目路径严禁中文极易引发各种奇怪报错。十、课后实战习题练习建议独立手写代码不要直接复制加深理解使用 Anaconda Prompt 新建名为 spider_test 的虚拟环境python 版本 3.10在该虚拟环境安装 requests 库在 PyCharm 绑定这个环境访问 httpbin.org/get打印响应状态码与返回文本修改代码添加 headers伪装浏览器发送请求给请求加上 timeout 超时参数增加异常捕获拓展打印响应头 resp.headers 查看服务器返回信息十一、本章小结Anaconda 可以创建独立虚拟环境隔离项目依赖解决包版本冲突爬虫项目强烈推荐。PyCharm 社区版免费需要手动指定 conda 虚拟环境作为项目解释器。pip 是 Python 包管理器用来安装第三方库 requests网络慢时可以使用国内镜像源加速。requests.get()用于发送 GET 网络请求返回响应对象 Response。User-Agent 是基础反爬绕过手段伪装浏览器是爬虫必备操作。网络请求一定要设置 timeout 超时并且捕获网络异常避免程序卡死。状态码 200 代表请求正常404 页面不存在403 服务器拒绝访问。
返回列表