← 返回《量化交易 Python 入门:从咖啡馆到华尔街》
📑 查看全课大纲(第 24 / 52 节)
  1. 1.量化分析基本概念:从咖啡馆到华尔街
  2. 2.量化交易员学习路线:从零基础到策略开发
  3. 3.量化策略生命周期:数据分析的五大流程
  4. 4.量化数据类型:数值型与类别型数据
  5. 5.量化沙盒搭建(1):Python与Anaconda安装
  6. 6.量化沙盒搭建(2):Jupyter Notebook与库配置
  7. 7.本地多源数据:量化历史回测的基石
  8. 8.TXT数据流操作:处理金融交易日志
  9. 9.JSON数据流操作:解析股票行情API响应
  10. 10.CSV行情文件操作:读取与存储历史K线
  11. 11.Excel报表操作:清洗财报与财务指标
  12. 12.量化数据库:SQL常用查询语法
  13. 13.量化数据库:Python连接与写入
  14. 14.量化多表连接:关联股票信息与行情
  15. 15.实战:小象咖啡店营业数据与个股财务指标的多源数据分析
  16. 16.量化数据采集:爬虫工作原理与合规
  17. 17.量化爬虫核心:URL管理与去重策略
  18. 18.量化网页下载:防反爬与请求头伪装
  19. 19.网页解析(1):使用XPath定位财经新闻
  20. 20.网页解析(2):使用CSS选择器与ItemLoader
  21. 21.Scrapy框架:构建工业级量化爬虫
  22. 22.Scrapy实战(1):新建项目与数据模型定义
  23. 23.Scrapy实战(2):编写财经爬虫逻辑
  24. 24.Scrapy实战(3):启用数据管道清洗行情
  25. 25.Scrapy实战(4):防反爬中间件配置
  26. 26.实战:构建每日热门个股行情自动采集系统
  27. 27.NumPy与SciPy:加速量化矩阵计算
  28. 28.NumPy数组:构建股票价格矩阵
  29. 29.数组切片:提取特定股票与交易日数据
  30. 30.NumPy常用方法:计算均值与波动率
  31. 31.向量化计算:摆脱缓慢的For循环
  32. 32.通用函数ufunc:计算对数收益率与累计收益
  33. 33.实战:股票组合资产收益率与协方差矩阵计算
  34. 34.Pandas Series:管理单只股票收盘价
  35. 35.Pandas DataFrame:构建多只股票行情面板
  36. 36.Pandas Index:时间序列索引与对齐
  37. 37.Series索引操作:按位置与标签访问行情数据
  38. 38.DataFrame索引操作:loc与iloc定位行情
  39. 39.索引总结:量化多字段筛选与定位
  40. 40.运算与对齐:合并不同交易日的数据
  41. 41.Pandas map:对股票代码与状态做映射
  42. 42.Pandas apply:滚动计算技术指标
  43. 43.文件读写操作:CSV行情数据导入导出
  44. 44.排序操作:按市盈率与收益率对股票排名
  45. 45.数据清洗:填充与剔除停牌股票缺失值
  46. 46.数据清洗:剔除重复报价与异常交易数据
  47. 47.数据清洗:替换异常报价数据
  48. 48.常用统计:量化最大回撤与分位数风险评估
  49. 49.常用统计:sum/mean/median/count聚合指标
  50. 50.极值定位:寻找历史最高价与最低价的发生日
  51. 51.风险与累计收益:计算年化波动率与累计回报
  52. 52.实战:小象咖啡店营业数据与热门个股时间序列清洗分析

Scrapy实战(3):启用数据管道清洗行情

Scrapy实战(3):启用数据管道清洗行情

小象量化极客小册 · 华尔街量化分析先锋系列

本节我们将探寻如何使用 Scrapy 框架进行网络数据采集。作为量化分析师,你将编写爬虫从财经网站爬取最新的股票行情和社交媒体上的咖啡店舆情,为策略引擎输入第一手另类数据。

小象量化极客小册 · 华尔街量化分析先锋系列 本节我们将探寻如何使用 Scrapy 框架进行网络数据采集。作为量化分析师,你将编写爬虫从财经网站爬取最新的股票行情和社交媒体上的咖啡店舆情,为策略引擎输入第一手另类数据。

💡 核心导读

本节将深入Scrapy框架的核心工作流程,重点讲解Item Pipeline的数据处理机制、中间件(Middleware)的定制方法以及项目优化技巧。通过完整的爬虫案例演示如何清洗存储数据、处理异常请求,并实现分布式爬取。掌握这些技能后,读者将能够构建工业级的数据采集系统。


数据处理管道(Item Pipeline)

管道工作机制

Scrapy的Item Pipeline是数据处理流水线,包含多个按序执行的处理器:

爬虫解析 → Pipeline1 → Pipeline2 → ... → 持久化存储

典型管道组件实现

import pymongo
from itemadapter import ItemAdapter

class PriceConverterPipeline:
    """将价格字段统一转换为美元"""
    exchange_rate = 7.2  # 人民币兑美元汇率

    def process_item(self, item, spider):
        adapter = ItemAdapter(item)
        if 'price_cny' in adapter:
            adapter['price_usd'] = round(adapter['price_cny'] / self.exchange_rate, 2)
            del adapter['price_cny']
        return item

class MongoDBPipeline:
    """存储到MongoDB数据库"""
    def __init__(self, mongo_uri, mongo_db):
        self.mongo_uri = mongo_uri
        self.mongo_db = mongo_db

    @classmethod
    def from_crawler(cls, crawler):
        return cls(
            mongo_uri=crawler.settings.get('MONGO_URI'),
            mongo_db=crawler.settings.get('MONGO_DB')
        )

    def open_spider(self, spider):
        self.client = pymongo.MongoClient(self.mongo_uri)
        self.db = self.client[self.mongo_db]

    def close_spider(self, spider):
        self.client.close()

    def process_item(self, item, spider):
        self.db[spider.name].insert_one(ItemAdapter(item).asdict())
        return item

管道启用配置

ITEM_PIPELINES = {
    'project.pipelines.PriceConverterPipeline': 100,  # 数值越小优先级越高
    'project.pipelines.MongoDBPipeline': 200,
}
MONGO_URI = 'mongodb://localhost:27017'
MONGO_DB = 'scrapy_data'

💡 概念小测:Pipeline流转

在 Scrapy 项目中,如果一个 Item 经过了一个数据管道 PriceCleanerPipeline,并且在它的 process_item 方法中没有 return item,会导致什么后果?

  • 这个 Item 会被自动存入本地 JSON 文件。
  • 该 Item 会从数据流中消失,后续排序更后的 Pipeline 将无法接收到它。
  • Scrapy 引擎会立刻崩溃并抛出 SyntaxError 异常。
  • 爬虫会重新爬取该 Item 对应的网页。

📝 选择题

💡 概念小测:Pipeline流转 在 Scrapy 项目中,如果一个 Item 经过了一个数据管道 PriceCleanerPipeline,并且在它的 process_item 方法中没有 return item,会导致什么后果?

  • A. 这个 Item 会被自动存入本地 JSON 文件。
  • B. 该 Item 会从数据流中消失,后续排序更后的 Pipeline 将无法接收到它。
  • C. Scrapy 引擎会立刻崩溃并抛出 SyntaxError 异常。
  • D. 爬虫会重新爬取该 Item 对应的网页。

答案:B(该 Item 会从数据流中消失,后续排序更后的 Pipeline 将无法接收到它。)


中间件开发实战

下载中间件示例

from scrapy import signals
from scrapy.downloadermiddlewares.userpe_rationt import UserAgentMiddleware
import random

class RandomUserAgentMiddleware(UserAgentMiddleware):
    """随机User-Agent中间件"""
    user_pe_rationts = [
        'Mozilla/5.0 (Windows NT 10.0; Win64; x64)',
        'AppleWebKit/537.36 (KHTML, like Gecko)',
        'Chrome/91.0.4472.124 Safari/537.36'
    ]

    def process_request(self, request, spider):
        request.headers['User-Agent'] = random.choice(self.user_pe_rationts)

中间件配置激活

DOWNLOADER_MIDDLEWARES = {
    'project.middlewares.RandomUserAgentMiddleware': 543,
}

分布式爬虫实现

Redis分布式配置

SCHEDULER = "scrapy_redis.scheduler.Scheduler"
DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"
REDIS_URL = 'redis://:password@localhost:6379'

数据去重对比

原始数据:
+----+----------------------------+--------+
| id |           title            | price  |
+----+----------------------------+--------+
| 1  | Python编程指南             | 59.99  |
| 1  | Python编程指南             | 59.99  | ← 重复数据
| 2  | 数据科学实战               | 79.50  |
+----+----------------------------+--------+

去重后:
+----+----------------------------+--------+
| id |           title            | price  |
+----+----------------------------+--------+
| 1  | Python编程指南             | 59.99  |
| 2  | 数据科学实战               | 79.50  |
+----+----------------------------+--------+

💡 代码填空:启用管道

补全项目 settings.py 中激活自定义行情清洗管道的代码:

ITEM_PIPELINES = {
    'myproject.pipelines.StockCleanPipeline': {blank},
}
  • True
  • ‘active’
  • 300

✏️ 填空题

💡 代码填空:启用管道 补全项目 settings.py 中激活自定义行情清洗管道的代码:

# settings.py 配置
ITEM_PIPELINES = {
    'myproject.pipelines.StockCleanPipeline': ___,
}

答案:300


本章小结

行动清单

  • 实现一个自定义Pipeline,将采集的日期字段统一转换为ISO8601格式
  • 开发下载中间件,自动处理遇到403状态码时切换代理IP
  • 配置Redis分布式环境,验证多节点协同爬取效果

「小象量化教研组」

🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问