Python 爬虫零基础实战:25 讲批量抓取小说与图片
社区首页 (3677)
请编写您的帖子内容
社区频道(1)
显示侧栏
卡片版式
Python 爬虫零基础实战:25 讲批量抓取小说与图片
最新发布
最新回复
标题
阅读量
内容评分
精选

31
评分
回复
Python 爬虫零基础实战:25 讲批量抓取小说与图片
课程名称适应人群Python 爬虫零基础实战:25 讲批量抓取小说与图片适合人群 1. 想入门爬虫但不知从何下手的零基础学习者 2. 会一点 Python 但不会解析网页数据的初学者 3. 需要批量采集网页文本 / 图片数据的学生、研究员、运营人员
复制链接 扫一扫
分享

15
评分
回复
标签的属性访问
课时名称课时知识点标签的属性访问讲解通过 select () 定位元素后如何访问标签属性,使用 get () 方法安全获取属性值并设置默认值,理解 Tag 对象的属性字典特性。
复制链接 扫一扫
分享

15
评分
回复
新闻网站抓取实战 1—— 抓取图片信息
课时名称课时知识点新闻网站抓取实战 1—— 抓取图片信息以新闻网站为目标,分析页面中图片元素结构,通过选择器定位 img 标签,提取图片 URL、alt 文本等信息,为后续下载做准备。
复制链接 扫一扫
分享

19
评分
回复
获取网络 HTML 内容
课时名称课时知识点获取网络 HTML 内容讲解用 requests 库发送 HTTP GET 请求获取真实网页 HTML,将 response.text 传入 BeautifulSoup 解析,实现从本地文件到真实网络的跨越。
复制链接 扫一扫
分享

16
评分
回复
prettify 与深度 copy
课时名称课时知识点prettify 与深度 copy讲解 prettify () 将 HTML 格式化为易读的缩进结构,以及 copy 模块的 deepcopy () 对 soup 对象深拷贝,避免引用共享问题。
复制链接 扫一扫
分享

14
评分
回复
在页面找选择器的参数
课时名称课时知识点在页面找选择器的参数实战演示在真实网页中定位目标元素,通过开发者工具分析 DOM 结构,提取准确的 CSS 选择器参数,解决选择器编写中的实际问题。
复制链接 扫一扫
分享

16
评分
回复
新闻网站抓取实战 2—— 保存图片信息
课时名称课时知识点新闻网站抓取实战 2—— 保存图片信息将抓取到的图片信息进行处理,通过 requests 下载图片二进制内容并保存到本地文件,实现图片资源的批量下载与本地归档。
复制链接 扫一扫
分享

16
评分
回复
Selenium
课时名称课时知识点Selenium介绍 Selenium 浏览器自动化工具,讲解安装 selenium 库和各浏览器 driver(Chrome / Edge / Firefox / Safari),演示启动浏览器、访问网页、获取 page_sour
复制链接 扫一扫
分享

16
评分
回复
详解 get_text ()
课时名称课时知识点详解 get_text ()讲解 get_text () 提取标签内纯文本,支持对嵌套标签递归提取,对比 get_text () 与 .string 的区别,处理换行和空白字符。
复制链接 扫一扫
分享

16
评分
回复
详解 SoupStrainer
课时名称课时知识点详解 SoupStrainer讲解 SoupStrainer 实现按需解析,构建 BS4 时通过 parse_only 参数只解析符合条件的标签(按标签名、id、文本函数),提升大页面解析性能。
复制链接 扫一扫
分享

16
评分
回复
修改标签内容
课时名称课时知识点修改标签内容讲解 BS4 标签修改能力:修改 tag.name 和属性、.string 修改文本、append () /extend () 追加内容、decompose () 删除标签、replace_with () 替换元素。
复制链接 扫一扫
分享

16
评分
回复
CSS 选择器高级用法
课时名称课时知识点CSS 选择器高级用法深入讲解高级选择器:ID 选择器(#id)、相邻兄弟(+)、通用兄弟(~)、属性选择器([href]、[href^=]、[href$=]、[href*=])、类选择器([class~=])。
复制链接 扫一扫
分享

14
评分
回复
详解 find_all ()(1)
课时名称课时知识点详解 find_all ()(1)深入讲解 find_all () 的标签筛选能力,支持按字符串、标签列表、正则表达式、True(所有标签)、自定义函数匹配,以及按 id 属性筛选。
复制链接 扫一扫
分享

15
评分
回复
CSS 选择器初级用法
课时名称课时知识点CSS 选择器初级用法讲解 select () 函数基础用法:标签选择器(a)、分组选择器(p,li)、后代选择器(li a)、子元素选择器(body> table)。
复制链接 扫一扫
分享

15
评分
回复
环境安装及配置
课时名称课时知识点环境安装及配置指导安装 Python 3.11、BeautifulSoup 4、lxml 解析器,配置 VSCode 开发环境,验证各组件安装是否成功。
复制链接 扫一扫
分享

14
评分
回复
创建及遍历 BeautifulSoup 对象
课时名称课时知识点创建及遍历 BeautifulSoup 对象从本地 HTML 文件或字符串构建 BeautifulSoup 对象,演示通过 find /find_all 遍历 head、title、meta 等标签,建立文档树基本操作概念。
复制链接 扫一扫
分享

15
评分
回复
BeautifulSoup 的解析器
课时名称课时知识点BeautifulSoup 的解析器讲解 BS4 支持的多种解析器(html.parser、lxml、html5lib、xml),对比各自优缺点与适用场景,说明 lxml 的性能优势及安装方式。
复制链接 扫一扫
分享

14
评分
回复
遍历 soup 的其它方法
课时名称课时知识点遍历 soup 的其它方法介绍文档树多种遍历方式:parent(父节点)、children(直接子节点)、next_sibling /previous_sibling(兄弟节点)、next_element(下一元素)。
复制链接 扫一扫
分享

21
评分
回复
初识 CSS 选择器之开发者模式
课时名称课时知识点初识 CSS 选择器之开发者模式引入 CSS 选择器概念,演示用浏览器开发者工具(F12)检查页面元素结构,复制元素的 CSS 选择器路径,为后续 select () 操作做准备。
复制链接 扫一扫
分享

13
评分
回复
详解 find_all ()(2)
课时名称课时知识点详解 find_all ()(2)继续讲解 find_all () 高级参数:attrs(按属性字典筛选)、string(按文本内容匹配)、recursive(是否递归查找)、limit(限制返回数量)。
复制链接 扫一扫
分享

14
评分
回复
tag 的 name 和 attribute
课时名称课时知识点tag 的 name 和 attribute讲解 Tag 对象的 name 属性获取标签名,通过 get () 方法访问标签属性(如 content),理解标签名与属性的读取方式。
复制链接 扫一扫
分享
为您搜索到以下结果:
1
社区成员
22
社区内容
发帖
与我相关
我的任务
邱洋的课程社区_NO_1
一个平凡的人,有着不平凡的经历。
复制链接 扫一扫
分享确定
社区描述
一个平凡的人,有着不平凡的经历。
加入社区
获取链接或二维码
- 近7日
- 近30日
- 至今
加载中
社区公告
暂无公告