← 返回《量化交易 Python 入门:从咖啡馆到华尔街》
📑 查看全课大纲(第 16 / 52 节)
  1. 1.量化分析基本概念:从咖啡馆到华尔街
  2. 2.量化交易员学习路线:从零基础到策略开发
  3. 3.量化策略生命周期:数据分析的五大流程
  4. 4.量化数据类型:数值型与类别型数据
  5. 5.量化沙盒搭建(1):Python与Anaconda安装
  6. 6.量化沙盒搭建(2):Jupyter Notebook与库配置
  7. 7.本地多源数据:量化历史回测的基石
  8. 8.TXT数据流操作:处理金融交易日志
  9. 9.JSON数据流操作:解析股票行情API响应
  10. 10.CSV行情文件操作:读取与存储历史K线
  11. 11.Excel报表操作:清洗财报与财务指标
  12. 12.量化数据库:SQL常用查询语法
  13. 13.量化数据库:Python连接与写入
  14. 14.量化多表连接:关联股票信息与行情
  15. 15.实战:小象咖啡店营业数据与个股财务指标的多源数据分析
  16. 16.量化数据采集:爬虫工作原理与合规
  17. 17.量化爬虫核心:URL管理与去重策略
  18. 18.量化网页下载:防反爬与请求头伪装
  19. 19.网页解析(1):使用XPath定位财经新闻
  20. 20.网页解析(2):使用CSS选择器与ItemLoader
  21. 21.Scrapy框架:构建工业级量化爬虫
  22. 22.Scrapy实战(1):新建项目与数据模型定义
  23. 23.Scrapy实战(2):编写财经爬虫逻辑
  24. 24.Scrapy实战(3):启用数据管道清洗行情
  25. 25.Scrapy实战(4):防反爬中间件配置
  26. 26.实战:构建每日热门个股行情自动采集系统
  27. 27.NumPy与SciPy:加速量化矩阵计算
  28. 28.NumPy数组:构建股票价格矩阵
  29. 29.数组切片:提取特定股票与交易日数据
  30. 30.NumPy常用方法:计算均值与波动率
  31. 31.向量化计算:摆脱缓慢的For循环
  32. 32.通用函数ufunc:计算对数收益率与累计收益
  33. 33.实战:股票组合资产收益率与协方差矩阵计算
  34. 34.Pandas Series:管理单只股票收盘价
  35. 35.Pandas DataFrame:构建多只股票行情面板
  36. 36.Pandas Index:时间序列索引与对齐
  37. 37.Series索引操作:按位置与标签访问行情数据
  38. 38.DataFrame索引操作:loc与iloc定位行情
  39. 39.索引总结:量化多字段筛选与定位
  40. 40.运算与对齐:合并不同交易日的数据
  41. 41.Pandas map:对股票代码与状态做映射
  42. 42.Pandas apply:滚动计算技术指标
  43. 43.文件读写操作:CSV行情数据导入导出
  44. 44.排序操作:按市盈率与收益率对股票排名
  45. 45.数据清洗:填充与剔除停牌股票缺失值
  46. 46.数据清洗:剔除重复报价与异常交易数据
  47. 47.数据清洗:替换异常报价数据
  48. 48.常用统计:量化最大回撤与分位数风险评估
  49. 49.常用统计:sum/mean/median/count聚合指标
  50. 50.极值定位:寻找历史最高价与最低价的发生日
  51. 51.风险与累计收益:计算年化波动率与累计回报
  52. 52.实战:小象咖啡店营业数据与热门个股时间序列清洗分析

量化数据采集:爬虫工作原理与合规

量化数据采集:爬虫工作原理与合规

小象量化极客小册 · 华尔街量化分析先锋系列

本节我们将探寻如何使用 Scrapy 框架进行网络数据采集。作为量化分析师,你将编写爬虫从财经网站爬取最新的股票行情和社交媒体上的咖啡店舆情,为策略引擎输入第一手另类数据。

小象量化极客小册 · 华尔街量化分析先锋系列 本节我们将探寻如何使用 Scrapy 框架进行网络数据采集。作为量化分析师,你将编写爬虫从财经网站爬取最新的股票行情和社交媒体上的咖啡店舆情,为策略引擎输入第一手另类数据。

💡 核心导读

本节将带你认识网络爬虫的核心概念与技术原理。通过实战演示,你将掌握:1)HTTP请求与响应基础;2)网页解析的三种主流方法;3)使用Scrapy框架创建基础爬虫。重点学习如何通过XPath定位元素,以及处理动态加载内容的技巧。最终完成一个能自动提取电商产品信息的可运行爬虫示例。


爬虫工作原理

基础通信流程

网络爬虫本质是模拟浏览器行为的自动化程序,核心流程为:

发送HTTP请求 -> 接收响应 -> 解析内容 -> 存储数据

关键组件对比

+------------------+-----------------------------+
|   组件           | 功能说明                    |
+------------------+-----------------------------+
| Downloader       | 下载网页原始内容            |
| Parser           | 提取结构化数据              |
| Scheduler        | 管理待抓取URL队列           |
| Item Pipeline    | 数据清洗与存储              |
+------------------+-----------------------------+

💡 概念小测:合规与反爬

作为一名合规的量化分析师,在编写爬虫爬取交易所或行情网站的价格数据时,以下哪个行为是完全合规且安全的?

  • 设定高并发(比如每秒 1000 次请求),以便在最短时间内把网站的数据拉完。
  • 遵守目标网站的 robots.txt 协议,控制抓取速度,设置合理的请求间隔和重试限制。
  • 刻意伪装成虚假用户,突破对方的登录验证防线,强行下载未公开的数据。
  • 在深夜对网站进行分布式 DDOS 攻击,迫使对方临时关闭反爬防火墙。

📝 选择题

💡 概念小测:合规与反爬 作为一名合规的量化分析师,在编写爬虫爬取交易所或行情网站的价格数据时,以下哪个行为是完全合规且安全的?

  • A. 设定高并发(比如每秒 1000 次请求),以便在最短时间内把网站的数据拉完。
  • B. 遵守目标网站的 robots.txt 协议,控制抓取速度,设置合理的请求间隔和重试限制。
  • C. 刻意伪装成虚假用户,突破对方的登录验证防线,强行下载未公开的数据。
  • D. 在深夜对网站进行分布式 DDOS 攻击,迫使对方临时关闭反爬防火墙。

答案:B(遵守目标网站的 robots.txt 协议,控制抓取速度,设置合理的请求间隔和重试限制。)


实战:豆瓣图书爬虫

安装必备库

pip install scrapy parsel requests

基础请求示例

import requests
from parsel import Selector

url = 'https://book.douban.com/top250'
headers = {'User-Agent': 'Mozilla/5.0'}

response = requests.get(url, headers=headers)
selector = Selector(text=response.text)

titles = selector.xpath('//div[@class="pl2"]/a/@title').getall()
print(f"获取到{len(titles)}本书籍:\n{titles[:3]}...")

输出示例

获取到25本书籍:
['追风筝的人', '小王子', '活着']...


Scrapy框架速成

创建爬虫项目

scrapy startproject douban_books
cd douban_books
scrapy genspider book_spider book.douban.com

核心组件配置

import scrapy

class BookSpider(scrapy.Spider):
    name = "book_spider"
    start_urls = ['https://book.douban.com/top250']

    def parse(self, response):
        for book in response.css('tr.item'):
            yield {
                'title': book.css('div.pl2 a::attr(title)').get(),
                'rating': book.css('span.rating_nums::text').get(),
                'price': book.xpath('.//p[@class="pl"]/text()').re_first(r'(\d+\.\d+)')
            }

执行爬虫

scrapy crawl book_spider -o books.json


反爬应对策略

常见防御手段

  1. User-Agent检测
  2. IP频率限制
  3. 验证码挑战
  4. 动态数据加载(AJAX)

解决方案代码

DOWNLOAD_DELAY = 2
ROBOTSTXT_OBEY = False
DEFAULT_REQUEST_HEADERS = {
    'Accept': 'text/html,application/xhtml+xml',
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64)'
}

from fake_userpe_rationt import UserAgent
class RandomUserAgentMiddleware:
    def process_request(self, request, spider):
        request.headers['User-Agent'] = UserAgent().random

💡 代码填空:获取网页HTML

补全以下 requests 代码,向目标行情页面发送一个 GET 请求并获取其 HTML 文本内容:

import requests

url = "https://example-finance.com/quotes"
headers = {'User-Agent': 'QuantBot/1.0'}
response = requests.{blank}(url, headers=headers)
html_content = response.text
print(response.status_code)
  • post
  • get
  • request

✏️ 填空题

💡 代码填空:获取网页HTML 补全以下 requests 代码,向目标行情页面发送一个 GET 请求并获取其 HTML 文本内容:

import requests
url = "https://example-finance.com/quotes"
headers = {'User-Agent': 'QuantBot/1.0'}
response = requests.___(url, headers=headers)
html_content = response.text
print(response.status_code)

答案:get


本章小结

行动清单

  • 使用requests+parsel抓取豆瓣股票持仓Top250的投资经理信息
  • 创建Scrapy项目抓取京东商品页面的价格和评论数
  • 实现自动翻页功能,连续抓取5页知乎热榜问题

「小象量化教研组」提示:请遵守robots.txt协议,控制请求频率避免对目标服务器造成压力。

🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问