← 返回《Python 数据分析实战》
📑 查看全课大纲(第 6 / 101 节)
  1. 1.数据分析基本概念
  2. 2.学习数据分析的一般路线
  3. 3.数据分析的流程
  4. 4.数据类型
  5. 5.环境部署(1)
  6. 6.环境部署(2)
  7. 7.课程介绍
  8. 8.TXT文件操作
  9. 9.JSON文件操作
  10. 10.CSV文件操作
  11. 11.Excel文件操作
  12. 12.数据库及SQL常用语法
  13. 13.数据库基本操作
  14. 14.数据库多表连接
  15. 15.实战:欧洲职业足球数据库分析
  16. 16.爬虫简介
  17. 17.URL管理模块
  18. 18.网页下载模块
  19. 19.网页解析模块(1)
  20. 20.网页解析模块(2)
  21. 21.Scrapy简介
  22. 22.Scrapy使用步骤(1)
  23. 23.Scrapy使用步骤(2)
  24. 24.Scrapy使用步骤(3)
  25. 25.Scrapy使用步骤(4)
  26. 26.实战:获取国内城市空气质量指数数据
  27. 27.NumPy和SciPy介绍
  28. 28.多维数组
  29. 29.多维数组操作
  30. 30.NumPy的常用方法
  31. 31.向量化介绍
  32. 32.向量化及通用函数
  33. 33.实战:2016美国大选分析
  34. 34.数据结构-Series
  35. 35.数据结构-DataFrame
  36. 36.数据结构-Index
  37. 37.Series的索引操作
  38. 38.DataFrame的索引操作
  39. 39.索引操作总结
  40. 40.运算与对齐
  41. 41.函数应用操作(1) -- map
  42. 42.函数应用操作 (2) -- apply applymap
  43. 43.文件读写操作
  44. 44.排序操作
  45. 45.数据清洗--处理缺失数据
  46. 46.数据清洗--处理重复数据
  47. 47.数据清洗--替换数据
  48. 48.常用统计方法(1) -- describe quantile
  49. 49.常用统计方法(2) -- sum mean median count
  50. 50.常用统计方法(3) -- max min idxmax idxmin
  51. 51.常用统计方法(4) -- mad var std cumsum
  52. 52.实战:全球食品数据分析
  53. 53.层级索引
  54. 54.分组与聚合介绍
  55. 55.分组操作(1) -- GroupBy对象及常用聚合操作
  56. 56.分组操作(2) -- 自定义分组及聚合操作
  57. 57.透视表介绍
  58. 58.透视表操作
  59. 59.数据规整(1) -- 数据合并concat
  60. 60.数据规整(2) -- 数据连接merge
  61. 61.数据重构(3) -- 数据重构stack unstack
  62. 62.实战:互联网电影资料库分析
  63. 63.探索性数据分析EDA介绍
  64. 64.EDA的目的
  65. 65.EDA常用工具
  66. 66.Matplotlib绘图基本介绍
  67. 67.Matplotlib画布
  68. 68.散点图和柱状图的绘制
  69. 69.直方图的绘制
  70. 70.矩阵绘图
  71. 71.子图的使用
  72. 72.Matplotlib颜色、标记、线型
  73. 73.Matplotlib坐标刻度、标签、图例、标题
  74. 74.Seaborn介绍
  75. 75.数据集分布可视化(1) -- 单变量分布、双变量分布
  76. 76.数据集分布可视化(2) -- 变量关系可视化
  77. 77.类别数据可视化 -- 类别散布图、类别内数据分布、类别内统计图
  78. 78.交互式数据可视化工具Bokeh介绍
  79. 79.Bokeh绘制散点图、柱状图、盒子图、弦图
  80. 80.Bokeh绘制常用图形元素
  81. 81.D绘图 -- mplot3d
  82. 82.D曲线可视化
  83. 83.D散点图可视化
  84. 84.D柱状图可视化
  85. 85.Pandas绘图
  86. 86.实战:Lending Club借贷数据探索性分析及可视化
  87. 87.机器学习介绍及应用场景
  88. 88.机器学习建模介绍 (1) -- 分类
  89. 89.机器学习建模介绍 (2) -- 回归
  90. 90.机器学习建模介绍 (3) -- 聚类
  91. 91.机器学习分类
  92. 92.机器学习工具scikit-learn
  93. 93.使用scikit-learn的流程
  94. 94.数据集准备及划分
  95. 95.模型选择
  96. 96.数据预处理及特征工程
  97. 97.过拟合与欠拟合
  98. 98.模型调参介绍
  99. 99.模型调参方法
  100. 100.模型测试及评价
  101. 101.实战:通过移动设备行为数据预测性别和年龄

环境部署(2)

约 13 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

数据分析利器:Jupyter Notebook 与 PyCharm 开发环境配置

小象实战讲义 · Python数据分析实战

在完成 Anaconda 科学计算环境的安装后,接下来需要选择并配置适合数据分析实战的开发工具。在数据科学界,有两种工具占据绝对主流地位:一种是极其适合探索性数据分析(EDA)与交互式图表展示的 Jupyter Notebook,另一种是专为工程化代码编写与大型项目组织设计的专业 IDE PyCharm。本节将详细拆解这两款神器的使用场景、安装配置流程,并彻底厘清 Python、Anaconda 与 PyCharm 之间的三者协同关系。

💡 核心导读

  • Jupyter Notebook 交互神器:掌握基于 Web 的单元格交互、Markdown 笔记混排与启动技巧。
  • PyCharm 工程化 IDE:掌握社区版下载、跨平台安装与 Project Interpreter(解释器)关联配置。
  • 工具选型指南:明确数据探索(Notebook)与生产工程(PyCharm)的适用边界。
  • 核心关系大解密:彻底理清 Python 解释器、Anaconda 库集合与 PyCharm 编辑器三者的协作机理。
  • Python 交互式执行逻辑实战:通过 Python 代码模拟 Jupyter Notebook 的单元格状态保持机制。

1. 交互式探索利器:Jupyter Notebook

1.1 什么是 Jupyter Notebook?

Jupyter Notebook 是一款基于 Web 浏览器的交互式计算笔记本。它是全世界数据分析师与数据科学家进行数据探索、模型验证与成果汇报的首选工具。

  • Anaconda 原生预装:只要安装了 Anaconda,系统便已自带 Jupyter Notebook,无需额外安装;
  • 分块交互执行(Cell-by-Cell):代码被拆分为独立的“单元格(Cell)”,可以单步运行、单独调试并即时查看变量状态与图表输出;
  • 图文与代码混排:支持在代码块之间插入 Markdown 格式的文本、数学公式与注释,完美记录思考过程;
  • 标准分享格式:所有代码、富文本和运行结果均保存在 .ipynb 文件中,方便团队交流。
┌─────────────────────────────────────────────────────────────┐
│                 Jupyter Notebook 界面结构                    │
├─────────────────────────────────────────────────────────────┤
│ [Markdown Cell] # 探索性分析:销售数据分析报告               │
│ [Code Cell]     import pandas as pd; df = pd.read_csv(...)  │
│ [Output Area]   (即时渲染出格式整齐的交互式数据表格)          │
│ [Code Cell]     df.plot(kind='bar'); plt.show()             │
│ [Output Area]   (直接在网页下方嵌入生成的可视化图表)          │
└─────────────────────────────────────────────────────────────┘

1.2 启动与常用操作

  1. 打开操作系统终端(Windows 下可在目标文件夹的地址栏直接输入 cmd 并回车);
  2. 在终端中输入以下启动命令:
    jupyter notebook
  3. 系统将自动在默认浏览器中打开 http://localhost:8888 控制台,点击右上角 New ➔ Python 3 即可新建笔记本开始实操。

2. 工业级工程 IDE:PyCharm

当数据分析任务逐渐演变为复杂的自动化脚本、长期运行的网络爬虫或企业级数据服务时,网页端的 Notebook 在模块管理与代码重构上就显得力不从心。此时需要引入专业的 Python IDE——PyCharm

2.1 PyCharm 社区版下载与安装

  • 官方下载地址https://www.jetbrains.com/pycharm/download/(选择免费且功能完备的 Community 社区版);
  • 跨平台安装要点
    • Windows:双击 .exe,选择安装路径(无空格无中文),勾选“创建桌面快捷方式”与“添加 bin 目录至 PATH”;
    • macOS:下载 .dmg 文件,将 PyCharm 图标直接拖拽至 Applications 应用程序目录;
    • Linux:解压 .tar.gz 压缩包到自定义目录,在终端中执行 ./bin/pycharm.sh 即可启动。

2.2 核心步骤:关联 Anaconda 解释器(Project Interpreter)

刚安装好的 PyCharm 只是一个纯粹的“代码编辑器”,必须将其与我们预装好科学计算库的 Anaconda 解释器连接起来,代码才能正确调用 Pandas 等库:

[PyCharm 编辑器] ──(关联解释器)──> [Anaconda 安装目录中的 python.exe] ──> [执行 NumPy/Pandas 代码]
  1. 打开 PyCharm,进入设置界面(Windows/Linux 为 File ➔ Settings,macOS 为 PyCharm ➔ Preferences);
  2. 找到 Project: <项目名> ➔ Python Interpreter
  3. 点击右上角齿轮图标选择 Add… ➔ Conda Environment
  4. 选择 Existing environment(已有环境),点击浏览按钮指向 Anaconda 安装根目录下的 Python 可执行文件(如 D:\Anaconda3\python.exe 或 macOS 下的 /opt/anaconda3/bin/python);
  5. 点击 Apply 保存,PyCharm 即可自动识别所有已安装的数据分析库。

3. 核心概念辨析:Python vs Anaconda vs PyCharm

许多初学者常常混淆这三个名词,我们通过一张简明的对照表彻底理清它们的分工:

角色本质定位打个通俗比方核心职责
Python编程语言与解释器汽车的“发动机”负责逐行解释并执行你编写的代码指令
Anaconda科学计算集成大礼包预装好各种改装件的“整车”自带 Python 发动机 + 1500+ 数据科学库 + Conda 环境管理器
PyCharm集成开发环境(IDE)舒适且功能齐全的“驾驶舱”提供代码高亮、智能补全、断点调试与项目文件管理

4. Python 代码实战:模拟交互式单元格运行与变量持久化

为了加深对 Jupyter Notebook“按单元格执行、全局变量共享”特性的理解,我们编写一段 Python 脚本,模拟 Notebook 交互环境的核心运行逻辑。

# 示例:模拟 Jupyter Notebook 交互式执行与状态空间保持机制

class MiniNotebookEngine:
    def __init__(self):
        # 模拟 Notebook 全局命名空间(保持运行状态)
        self.namespace = {}

    def execute_cell(self, cell_id, code_str):
        print(f"\n--- [执行 Cell #{cell_id}] ---")
        try:
            # 在持久化的全局命名空间中执行代码
            exec(code_str, self.namespace)
            print(f"✅ Cell #{cell_id} 执行成功!当前命名空间变量数: {len(self.namespace)}")
        except Exception as e:
            print(f"❌ Cell #{cell_id} 执行报错: {e}")

# 实例化交互引擎
engine = MiniNotebookEngine()

# 模拟 Cell 1:加载与准备基础数据
cell_1_code = """
import math
dataset = [12, 15, 18, 22, 25, 30]
print(f"Cell 1 产出:成功加载原始数据集,共 {len(dataset)} 条记录")
"""
engine.execute_cell(1, cell_1_code)

接下来,我们在 Cell 2 中直接引用 Cell 1 中定义的全局变量 dataset 进行统计计算:

# 模拟 Cell 2:直接引用前面 Cell 产生的变量并计算均值与方差
cell_2_code = """
mean_val = sum(dataset) / len(dataset)
variance = sum((x - mean_val) ** 2 for x in dataset) / len(dataset)
std_dev = math.sqrt(variance)

print(f"Cell 2 计算结果:")
print(f"• 样本均值: {mean_val:.2f}")
print(f"• 样本标准差: {std_dev:.2f}")
"""
engine.execute_cell(2, cell_2_code)

运行上述代码,Cell 2 可以无缝读取 Cell 1 中产生的 dataset 变量,这正是 Jupyter Notebook 区别于传统一次性执行脚本的核心魅力所在。


📝 动手练一练

  1. 选择题:在以下哪种开发场景下,你应该优先选择 Jupyter Notebook 而非 PyCharm?

    • A. 编写一套自动化定时爬虫服务,每天凌晨自动抓取数据并持久化到 MySQL
    • B. 对业务方提供的 5 万行用户问卷进行探索性统计分析,并配合图表向团队做即时汇报
    • C. 开发一个包含 20 个模块的商业 Web 后端应用
    • D. 编写一套需要严格单元测试与 CI/CD 自动部署的机器学习预测微服务
    👉 点击查看参考答案

    参考答案B。Jupyter Notebook 的核心优势在于交互式单步执行与即时图表渲染,是探索性数据分析(EDA)与成果汇报的绝佳工具。而 A、C、D 属于工程化系统开发,更适合在 PyCharm 等专业 IDE 中组织。

  2. 操作与编程练习:请在电脑终端中启动 Jupyter Notebook,新建一个笔记本,并在第一个单元格中编写 Python 代码导入 numpypandas,打印其版本号;在第二个单元格中创建一个包含 5 个城市名称的列表并打印。

    👉 点击查看参考答案

    参考答案: 在浏览器新建的 Notebook 单元格中分别输入:

    • 单元格 1:
      import numpy as np
      import pandas as pd
      print(f"NumPy 版本: {np.__version__} | Pandas 版本: {pd.__version__}")
    • 单元格 2(按 Shift+Enter 执行并新建):
      cities = ["北京", "上海", "广州", "深圳", "杭州"]
      print("城市列表:", cities)

    如果两个单元格均能正常输出,说明你的 Jupyter Notebook 环境已完全就绪!


本章小结

在本节中,我们完成了数据分析开发工具链的闭环搭建:

  • Jupyter Notebook 是数据探索、统计计算与图表分享的交互神器;
  • PyCharm 是代码重构、模块化组织与工程化项目交付的专业工作台;
  • 理清了 Python 语言、Anaconda 发行版与 PyCharm 编辑器之间的依赖与协作链路。

📋 行动清单

  • 在本地命令行中运行 jupyter notebook 成功打开网页控制台。
  • 若有工程开发需求,安装 PyCharm 社区版并在设置中正确关联 Anaconda 解释器。
  • 全面回顾第 1 章的 6 节内容,准备开启第 2 章《本地数据的采集与操作》代码实战!

—— 小象教研组

配套学习资源与课件
  • 本节课件:环境部署(2)(PDF · 810KB)
    下载
  • 全套课件打包(第1-5章)(ZIP · 12.8MB)
    下载
  • 全套课件打包(第6-8章)(ZIP · 15MB)
    下载
  • 实战数据集:AppleStore 应用商城分析(ZIP · 329KB)
    下载
  • 实战数据集:女性服装电商分析(ZIP · 2.8MB)
    下载
  • Python 数据分析环境搭建指南(PDF · 2MB)
    下载
  • Scrapy 安装教程(PDF · 12.7MB)
    下载
  • 附加实战项目:AppleStore 应用商城数据分析(ZIP · 0.3MB · ipynb + CSV 数据)
    下载
  • 附加实战项目:银行电话营销数据分析(ZIP · 0.4MB · ipynb + CSV 数据)
    下载
  • 附加实战项目:女性服装电商评论数据分析(ZIP · 2.7MB · ipynb + CSV 数据)
    下载
  • 附加实战项目:美国化学学会杂志数据分析(ZIP · 34.2MB · ipynb + SQLite 数据库)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问