Python爬虫爬取美剧网站-电子发烧友网

一直有爱看美剧的习惯，一方面锻炼一下英语听力，一方面打发一下时间。之前是能在视频网站上面在线看的，可是自从广电总局的限制令之后，进口的美剧英剧等貌似就不在像以前一样同步更新了。但是，作为一个宅diao的我又怎甘心没剧追呢，所以网上随便查了一下就找到一个能用迅雷下载的美剧下载网站【天天美剧】，各种资源随便下载，最近迷上的BBC的高清纪录片，大自然美得不要不要的。

虽说找到了资源网站可以下载了，但是每次都要打开浏览器，输入网址，找到该美剧，然后点击链接才能下载。时间长了就觉得过程好繁琐，而且有时候网站链接还会打不开，会有点麻烦。正好一直在学习Python爬虫，所以今天就心血来潮来写了个爬虫，抓取该网站上所有美剧链接，并保存在文本文档中，想要哪部剧就直接打开复制链接到迅雷就可以下载啦。

其实一开始打算写那种发现一个url，使用requests打开抓取下载链接，从主页开始爬完全站。但是，好多重复链接，还有其网站的url不是我想的那么规则，写了半天也没有写出我想要的那种发散式的爬虫，也许是自己火候还不到吧，继续努力。。。

后来发现，其电视剧链接都是在文章里面，然后文章url后面有个数字编号，就像这样的http://cn163.net/archives/24016/，所以机智的我又用了之前写过的爬虫经验，解决方法就是自动生成url，其后面的数字不是可以变的吗，而且每部剧的都是唯一的，所以尝试了一下大概有多少篇文章，然后用range函数直接连续生成数来构造url。

但是很多url是不存在的，所以会直接挂掉，别担心，我们用的可是requests，其自带的status_code就是用来判断请求返回的状态的，所以只要是返回的状态码是404的我们都把它跳过，其他的都进去爬取链接，这就解决了url的问题了。

以下就是上述步骤的实现代码。

def get_urls(self): try: for i in range(2015,25000): base_url='http://cn163.net/archives/' url=base_url+str(i)+'/' if requests.get(url).status_code == 404: continue else: self.save_links(url) except Exception,e: pass

其余的就进行的很顺利了，网上找到前人写的类似的爬虫，但是只是爬取一篇文章的，所以借鉴了一下其正则表达式。自己用了BeautifulSoup还没有正则效果好，所以果断弃了，学海无涯啊。但是效果也不是那么理想，有一半左右的链接不能正确抓取，还需继续优化。

# -*- coding:utf-8 -*- import requests import re import sys import threading import time reload(sys) sys.setdefaultencoding('utf-8') class Archives(object): def save_links(self,url): try: data=requests.get(url,timeout=3) content=data.text link_pat='"(ed2k://\|file\|[^"]+?\.(S\d+)(E\d+)[^"]+?1024X\d{3}[^"]+?)"' name_pat=re.compile(r'

(.*?)

',re.S) links = set(re.findall(link_pat,content)) name=re.findall(name_pat,content) links_dict = {} count=len(links) except Exception,e: pass for i in links: links_dict[int(i[1][1:3]) * 100 + int(i[2][1:3])] = i#把剧集按s和e提取编号 try: with open(name[0].replace('/',' ')+'.txt','w') as f: print name[0] for i in sorted(list(links_dict.keys())):#按季数+集数排序顺序写入 f.write(links_dict[i][0] + '\n') print "Get links ... ", name[0], count except Exception,e: pass def get_urls(self): try: for i in range(2015,25000): base_url='http://cn163.net/archives/' url=base_url+str(i)+'/' if requests.get(url).status_code == 404: continue else: self.save_links(url) except Exception,e: pass def main(self): thread1=threading.Thread(target=self.get_urls()) thread1.start() thread1.join() if __name__ == '__main__': start=time.time() a=Archives() a.main() end=time.time() print end-start

完整版代码，其中还用到了多线程，但是感觉没什么用，因为Python的GIL的缘故吧，看似有两万多部剧，本以为要很长时间才能抓取完成，但是除去url错误的和没匹配到的，总共抓取时间20分钟不到。搞得我本来还想使用Redis在两台Linux上爬取，但是折腾了一番之后感觉没必要，所以就这样吧，后面需要更大数据的时候再去弄。

还有过程中遇到一个很折磨我的问题是文件名的保存，必须在此抱怨一下，txt文本格式的文件名能有空格，但是不能有斜线、反斜线、括号等。就是这个问题，一早上的时间都花在这上面的，一开始我以为是抓取数据的错误，后面查了半天才发现是爬取的剧名中带有斜杠，这可把我坑苦了。

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表电子发烧友网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

函数

函数

+关注

关注
3

文章
4327

浏览量
62573
python

python

+关注

关注
56

文章
4792

浏览量
84630
爬虫

爬虫

+关注

关注
0

文章
82

浏览量
6867

原文标题：Python爬虫爬取美剧网站

文章出处：【微信号：magedu-Linux，微信公众号：马哥Linux运维】欢迎添加关注！文章转载请注明出处。

python实现网页爬虫爬取图片

来实现这样一个简单的爬虫功能，把我们想要的代码爬取到本地，功能有点类似我们之前学过的批处理。下面就看看如何使用python来实现这样一个功能，主要分为三步，如下：一. 获取整个页面数据首先我们可以先

发表于 04-05 15:32

Python爬虫与Web开发库盘点

Python爬虫和Web开发均是与网页相关的知识技能，无论是自己搭建的网站还是爬虫爬去别人的网站

发表于 05-10 15:21

基于Python实现一只小爬虫爬取拉勾网职位信息的方法

通俗易懂的分析如何用Python实现一只小爬虫，爬取拉勾网的职位信息

发表于 05-17 06:54

python爬取音频文件的步骤

python爬虫爬取音频文件

发表于 08-22 14:23

爬虫可以采集哪些数据

一、爬虫可以采集哪些数据　　1.图片、文本、视频　　爬取商品（店铺）评论以及各种图片网站，获得图片资源以及评论文本数据。　　掌握正确的方法，在短时间内做到能够

发表于 10-15 17:25

Python爬取豆瓣电影信息和存储数据库

Python——爬取豆瓣电影信息并存储数据库

发表于 03-11 11:19

0基础入门Python爬虫实战课

，爬虫功不可没。通过爬虫，可以从知乎、微博爬取热门话题，筛选优质答案，分析用户偏好；从淘宝、京东爬取

发表于 07-25 09:28

python基础语法及流程控制

爬虫复习1.python基础python基础语法流程控制函数封装2.防爬措施整体防爬User-AgentrefererIP代理池Cook

发表于 08-31 07:41

Python爬虫简介与软件配置

Python爬虫练习一、爬虫简介1. 介绍2. 软件配置二、爬取南阳理工OJ题目三、爬

发表于 01-11 06:32

python网络爬虫概述

大的网络覆盖率，如搜索引擎(百度、雅虎和谷歌等…)。聚焦网络爬虫：有目标性，选择性地访问万维网来爬取信息。增量式网络爬虫：只爬取新产生的或

发表于 03-21 16:51

Python 一个超快的公共情报搜集爬虫——Photon

Photon是一个由s0md3v开源的情报搜集爬虫，其主要功能有：1.爬取链接(内链、外链)。2.爬取带参数的链接，如(pythondict

发表于 06-23 16:35

labview实现网络爬虫功能

借助.NET，labview实现爬虫功能。爬取12306上的票务信息。懒得搭建python的环境了。用C#编写票务信息爬虫库，然后用labv

发表于 04-02 17:20

Python 爬取CSDN的极客头条

Python 如何爬取CSDN的极客头条呢？

发表于 03-21 14:58 •4824次阅读

如何使用Scrapy爬取网站数据

网页抓取的主要目标是从无结构的来源提取出结构信息。Scrapy爬虫以Python字典的形式返回提取数据。尽管Python字典既方便又熟悉，但仍然不够结构化：字段名容易出现拼写错误，返回不一致的信息，特别是在有多个

发表于 07-26 09:06 •5173次阅读

如何用python爬取抖音app数据

记录一下如何用python爬取app数据，本文以爬取抖音视频app为例。

发表于 03-16 09:07 •5328次阅读

搜索历史

Python爬虫爬取美剧网站

(.*?)

评论

python实现网页爬虫爬取图片

Python爬虫与Web开发库盘点

基于Python实现一只小爬虫爬取拉勾网职位信息的方法

python爬取音频文件的步骤

爬虫可以采集哪些数据

Python爬取豆瓣电影信息和存储数据库

0基础入门Python爬虫实战课

python基础语法及流程控制

Python爬虫简介与软件配置

python网络爬虫概述

Python 一个超快的公共情报搜集爬虫——Photon

labview实现网络爬虫功能

Python 爬取CSDN的极客头条

如何使用Scrapy爬取网站数据

如何用python爬取抖音app数据