xiaolinBot（Twitter笑话集锦爬虫Bot） Step2－代码优化

HelKyle 发布于2019-07-25 10:23 / 1684人阅读

摘要：代码优化简介这篇我们简要的讨论一下代码优化，这里主要讨论两点过程到函数加入对的处理我们在中的编码是面向过程的，这个不利于复用，所以我们简单的将我们前面的代码函数化，方便以后扩展及别人的调用另外，代码最好符合规范，方便自己和别人阅读编码创建

Step2 - 代码优化 简介

这篇我们简要的讨论一下代码优化，这里主要讨论两点

过程到函数

加入对media的处理

PEP8

我们在Step1中的编码是面向过程的，这个不利于复用，所以我们简单的将我们前面的代码函数化，方便以后扩展及别人的调用

另外，Python代码最好符合PEP8规范，方便自己和别人阅读

编码 创建 utils/common.py

import os
import requests

PROXIES = None

HEADERS = {
    "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1)"
                  " AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/38.0.2125.122 Safari/537.36",
    "Accept": "text/html,application/xhtml+xml,"
              "application/xml;q=0.9,image/webp,*/*;q=0.8",
    "Accept-Encoding": "gzip,deflate,sdch",
    "Accept-Language": "zh-CN,zh;q=0.8"
}


################################
#
# requests Operation
#
################################


def GetPage(url, proxies=PROXIES, headers=HEADERS):
    r = requests.get(url, proxies=proxies, headers=headers)
    assert r.status_code == 200
    return r.text


def GetMedia(
        url, proxies=PROXIES, headers=HEADERS, chunk_size=512,
        media_type="pic"):
    r = requests.get(url, proxies=proxies, headers=headers, stream=True)
    filename = "download/" + media_type + "/" + os.path.basename(url)
    with open(filename, "wb") as fd:
        for chunk in r.iter_content(chunk_size):
            fd.write(chunk)
    return filename

这里主要封装了两个方法： GetPage 与 GetMedia

GetPage: 传入页面url 获得整个页面

GetMeida: 传入图片或者视频的url，下载媒体文件到 download/pic 或者 download/video（主要为了后续支持百思不得姐的视频）

main.py 更改为：

# coding: utf-8

from pyquery import PyQuery as pq
from utils.common import GetMedia, GetPage

__author__ = "BONFY CHEN "


####################
#
# main function
#
####################

def qiushi():
    url = "http://www.qiushibaike.com/"
    page = GetPage(url)
    d = pq(page)
    contents = d("div .article")
    for item in contents:
        i = pq(item)
        pic_url = i("div .thumb img").attr.src
        content = i("div .content").text()
        id = i.attr.id
        if pic_url:
            pic_path = GetMedia(pic_url)
            print("pic - {id}: {content} 
pic下载到{pic_path}".format(
                id=id, content=content, pic_path=pic_path))
        else:
            print("text - {id}: {content}".format(id=id, content=content))


def main():
    qiushi()


if __name__ == "__main__":
    main()

运行结果：

PEP8

$ pip install pep8
$ pep8 xiaolinBot

然后如果有不符合规范的代码，会显示提示，然后去更改就行了

完整代码

详情见 https://github.com/bonfy/xiaolinBot

欢迎关注一起交流

敬请期待下一篇：适配器

文章版权归作者所有，未经允许请勿转载,若此文章存在违规行为，您可以联系管理员删除。

转载请注明本文地址：https://www.ucloud.cn/yun/37936.html

xiaolinBot（Twitter笑话集锦爬虫Bot） Step1－最简爬虫

摘要：最简爬虫环境准备最好使用另外需要两个必要的库一个封装了服务的库类似，使用非常方便开始实现第一个应用我们第一个应用实现的功能主要如下访问一个页面这里我们以糗事百科为例获得页面的内容进行简单的处理，获得我们需要的内容结果简单分析利用获得页面 Step1 - 最简爬虫环境准备 Python3.5 最好使用venv 另外需要两个必要的库： requests : 一个封装了HTTP服务的py...

zr_hebo 2019-07-25 10:23 评论0 收藏0

发表评论

登陆后可评论

0条评论

HelKyle

男|高级讲师

我要关注我要私信

TA的文章

Arduino--数字电位器AD5252/1的使用

阅读 1571·2021-11-22 09:34
做完自动化测试，但别让不会汇报毁了你...

阅读 2746·2021-11-12 10:36
【手把手带你刷LeetCode】——11.二叉搜索树的范围和（DFS）

阅读 1258·2021-11-11 16:55
企业成功过渡到云计算需要彻底改革的IT部门

阅读 2409·2020-06-22 14:43
IOS 底部margin失效

阅读 1538·2019-08-30 15:55
小于12px的文本居中问题

阅读 2057·2019-08-30 15:53
BFC：块级格式上下文详解

阅读 1842·2019-08-30 10:50
Bootstrap 网格系统布局

阅读 1296·2019-08-29 12:15

资讯专栏INFORMATION COLUMN

上云采购季！| 2核2G4M爆款云服务器低至59元/年，更有多台、长期优惠，快来选购！

xiaolinBot（Twitter笑话集锦爬虫Bot） Step2－代码优化

相关文章

xiaolinBot（Twitter笑话集锦爬虫Bot） Step1－最简爬虫

发表评论

0条评论

HelKyle

男|高级讲师

TA的文章

Arduino--数字电位器AD5252/1的使用

做完自动化测试，但别让不会汇报毁了你...

【手把手带你刷LeetCode】——11.二叉搜索树的范围和（DFS）

企业成功过渡到云计算需要彻底改革的IT部门

IOS 底部margin失效

小于12px的文本居中问题

BFC：块级格式上下文详解

Bootstrap 网格系统布局

最新活动