📑 查看全课大纲(第 6 / 101 节)
- 1.数据分析基本概念
- 2.学习数据分析的一般路线
- 3.数据分析的流程
- 4.数据类型
- 5.环境部署(1)
- 6.环境部署(2)
- 7.课程介绍
- 8.TXT文件操作
- 9.JSON文件操作
- 10.CSV文件操作
- 11.Excel文件操作
- 12.数据库及SQL常用语法
- 13.数据库基本操作
- 14.数据库多表连接
- 15.实战:欧洲职业足球数据库分析
- 16.爬虫简介
- 17.URL管理模块
- 18.网页下载模块
- 19.网页解析模块(1)
- 20.网页解析模块(2)
- 21.Scrapy简介
- 22.Scrapy使用步骤(1)
- 23.Scrapy使用步骤(2)
- 24.Scrapy使用步骤(3)
- 25.Scrapy使用步骤(4)
- 26.实战:获取国内城市空气质量指数数据
- 27.NumPy和SciPy介绍
- 28.多维数组
- 29.多维数组操作
- 30.NumPy的常用方法
- 31.向量化介绍
- 32.向量化及通用函数
- 33.实战:2016美国大选分析
- 34.数据结构-Series
- 35.数据结构-DataFrame
- 36.数据结构-Index
- 37.Series的索引操作
- 38.DataFrame的索引操作
- 39.索引操作总结
- 40.运算与对齐
- 41.函数应用操作(1) -- map
- 42.函数应用操作 (2) -- apply applymap
- 43.文件读写操作
- 44.排序操作
- 45.数据清洗--处理缺失数据
- 46.数据清洗--处理重复数据
- 47.数据清洗--替换数据
- 48.常用统计方法(1) -- describe quantile
- 49.常用统计方法(2) -- sum mean median count
- 50.常用统计方法(3) -- max min idxmax idxmin
- 51.常用统计方法(4) -- mad var std cumsum
- 52.实战:全球食品数据分析
- 53.层级索引
- 54.分组与聚合介绍
- 55.分组操作(1) -- GroupBy对象及常用聚合操作
- 56.分组操作(2) -- 自定义分组及聚合操作
- 57.透视表介绍
- 58.透视表操作
- 59.数据规整(1) -- 数据合并concat
- 60.数据规整(2) -- 数据连接merge
- 61.数据重构(3) -- 数据重构stack unstack
- 62.实战:互联网电影资料库分析
- 63.探索性数据分析EDA介绍
- 64.EDA的目的
- 65.EDA常用工具
- 66.Matplotlib绘图基本介绍
- 67.Matplotlib画布
- 68.散点图和柱状图的绘制
- 69.直方图的绘制
- 70.矩阵绘图
- 71.子图的使用
- 72.Matplotlib颜色、标记、线型
- 73.Matplotlib坐标刻度、标签、图例、标题
- 74.Seaborn介绍
- 75.数据集分布可视化(1) -- 单变量分布、双变量分布
- 76.数据集分布可视化(2) -- 变量关系可视化
- 77.类别数据可视化 -- 类别散布图、类别内数据分布、类别内统计图
- 78.交互式数据可视化工具Bokeh介绍
- 79.Bokeh绘制散点图、柱状图、盒子图、弦图
- 80.Bokeh绘制常用图形元素
- 81.D绘图 -- mplot3d
- 82.D曲线可视化
- 83.D散点图可视化
- 84.D柱状图可视化
- 85.Pandas绘图
- 86.实战:Lending Club借贷数据探索性分析及可视化
- 87.机器学习介绍及应用场景
- 88.机器学习建模介绍 (1) -- 分类
- 89.机器学习建模介绍 (2) -- 回归
- 90.机器学习建模介绍 (3) -- 聚类
- 91.机器学习分类
- 92.机器学习工具scikit-learn
- 93.使用scikit-learn的流程
- 94.数据集准备及划分
- 95.模型选择
- 96.数据预处理及特征工程
- 97.过拟合与欠拟合
- 98.模型调参介绍
- 99.模型调参方法
- 100.模型测试及评价
- 101.实战:通过移动设备行为数据预测性别和年龄
环境部署(2)
约 13 分钟
数据分析利器:Jupyter Notebook 与 PyCharm 开发环境配置
小象实战讲义 · Python数据分析实战
在完成 Anaconda 科学计算环境的安装后,接下来需要选择并配置适合数据分析实战的开发工具。在数据科学界,有两种工具占据绝对主流地位:一种是极其适合探索性数据分析(EDA)与交互式图表展示的 Jupyter Notebook,另一种是专为工程化代码编写与大型项目组织设计的专业 IDE PyCharm。本节将详细拆解这两款神器的使用场景、安装配置流程,并彻底厘清 Python、Anaconda 与 PyCharm 之间的三者协同关系。
💡 核心导读
- Jupyter Notebook 交互神器:掌握基于 Web 的单元格交互、Markdown 笔记混排与启动技巧。
- PyCharm 工程化 IDE:掌握社区版下载、跨平台安装与 Project Interpreter(解释器)关联配置。
- 工具选型指南:明确数据探索(Notebook)与生产工程(PyCharm)的适用边界。
- 核心关系大解密:彻底理清 Python 解释器、Anaconda 库集合与 PyCharm 编辑器三者的协作机理。
- Python 交互式执行逻辑实战:通过 Python 代码模拟 Jupyter Notebook 的单元格状态保持机制。
1. 交互式探索利器:Jupyter Notebook
1.1 什么是 Jupyter Notebook?
Jupyter Notebook 是一款基于 Web 浏览器的交互式计算笔记本。它是全世界数据分析师与数据科学家进行数据探索、模型验证与成果汇报的首选工具。
- Anaconda 原生预装:只要安装了 Anaconda,系统便已自带 Jupyter Notebook,无需额外安装;
- 分块交互执行(Cell-by-Cell):代码被拆分为独立的“单元格(Cell)”,可以单步运行、单独调试并即时查看变量状态与图表输出;
- 图文与代码混排:支持在代码块之间插入 Markdown 格式的文本、数学公式与注释,完美记录思考过程;
- 标准分享格式:所有代码、富文本和运行结果均保存在
.ipynb文件中,方便团队交流。
┌─────────────────────────────────────────────────────────────┐
│ Jupyter Notebook 界面结构 │
├─────────────────────────────────────────────────────────────┤
│ [Markdown Cell] # 探索性分析:销售数据分析报告 │
│ [Code Cell] import pandas as pd; df = pd.read_csv(...) │
│ [Output Area] (即时渲染出格式整齐的交互式数据表格) │
│ [Code Cell] df.plot(kind='bar'); plt.show() │
│ [Output Area] (直接在网页下方嵌入生成的可视化图表) │
└─────────────────────────────────────────────────────────────┘1.2 启动与常用操作
- 打开操作系统终端(Windows 下可在目标文件夹的地址栏直接输入
cmd并回车); - 在终端中输入以下启动命令:
jupyter notebook - 系统将自动在默认浏览器中打开
http://localhost:8888控制台,点击右上角 New ➔ Python 3 即可新建笔记本开始实操。
2. 工业级工程 IDE:PyCharm
当数据分析任务逐渐演变为复杂的自动化脚本、长期运行的网络爬虫或企业级数据服务时,网页端的 Notebook 在模块管理与代码重构上就显得力不从心。此时需要引入专业的 Python IDE——PyCharm。
2.1 PyCharm 社区版下载与安装
- 官方下载地址:
https://www.jetbrains.com/pycharm/download/(选择免费且功能完备的 Community 社区版); - 跨平台安装要点:
- Windows:双击
.exe,选择安装路径(无空格无中文),勾选“创建桌面快捷方式”与“添加 bin 目录至 PATH”; - macOS:下载
.dmg文件,将 PyCharm 图标直接拖拽至Applications应用程序目录; - Linux:解压
.tar.gz压缩包到自定义目录,在终端中执行./bin/pycharm.sh即可启动。
- Windows:双击
2.2 核心步骤:关联 Anaconda 解释器(Project Interpreter)
刚安装好的 PyCharm 只是一个纯粹的“代码编辑器”,必须将其与我们预装好科学计算库的 Anaconda 解释器连接起来,代码才能正确调用 Pandas 等库:
[PyCharm 编辑器] ──(关联解释器)──> [Anaconda 安装目录中的 python.exe] ──> [执行 NumPy/Pandas 代码]- 打开 PyCharm,进入设置界面(Windows/Linux 为
File ➔ Settings,macOS 为PyCharm ➔ Preferences); - 找到 Project: <项目名> ➔ Python Interpreter;
- 点击右上角齿轮图标选择 Add… ➔ Conda Environment;
- 选择 Existing environment(已有环境),点击浏览按钮指向 Anaconda 安装根目录下的 Python 可执行文件(如
D:\Anaconda3\python.exe或 macOS 下的/opt/anaconda3/bin/python); - 点击 Apply 保存,PyCharm 即可自动识别所有已安装的数据分析库。
3. 核心概念辨析:Python vs Anaconda vs PyCharm
许多初学者常常混淆这三个名词,我们通过一张简明的对照表彻底理清它们的分工:
| 角色 | 本质定位 | 打个通俗比方 | 核心职责 |
|---|---|---|---|
| Python | 编程语言与解释器 | 汽车的“发动机” | 负责逐行解释并执行你编写的代码指令 |
| Anaconda | 科学计算集成大礼包 | 预装好各种改装件的“整车” | 自带 Python 发动机 + 1500+ 数据科学库 + Conda 环境管理器 |
| PyCharm | 集成开发环境(IDE) | 舒适且功能齐全的“驾驶舱” | 提供代码高亮、智能补全、断点调试与项目文件管理 |
4. Python 代码实战:模拟交互式单元格运行与变量持久化
为了加深对 Jupyter Notebook“按单元格执行、全局变量共享”特性的理解,我们编写一段 Python 脚本,模拟 Notebook 交互环境的核心运行逻辑。
# 示例:模拟 Jupyter Notebook 交互式执行与状态空间保持机制
class MiniNotebookEngine:
def __init__(self):
# 模拟 Notebook 全局命名空间(保持运行状态)
self.namespace = {}
def execute_cell(self, cell_id, code_str):
print(f"\n--- [执行 Cell #{cell_id}] ---")
try:
# 在持久化的全局命名空间中执行代码
exec(code_str, self.namespace)
print(f"✅ Cell #{cell_id} 执行成功!当前命名空间变量数: {len(self.namespace)}")
except Exception as e:
print(f"❌ Cell #{cell_id} 执行报错: {e}")
# 实例化交互引擎
engine = MiniNotebookEngine()
# 模拟 Cell 1:加载与准备基础数据
cell_1_code = """
import math
dataset = [12, 15, 18, 22, 25, 30]
print(f"Cell 1 产出:成功加载原始数据集,共 {len(dataset)} 条记录")
"""
engine.execute_cell(1, cell_1_code)接下来,我们在 Cell 2 中直接引用 Cell 1 中定义的全局变量 dataset 进行统计计算:
# 模拟 Cell 2:直接引用前面 Cell 产生的变量并计算均值与方差
cell_2_code = """
mean_val = sum(dataset) / len(dataset)
variance = sum((x - mean_val) ** 2 for x in dataset) / len(dataset)
std_dev = math.sqrt(variance)
print(f"Cell 2 计算结果:")
print(f"• 样本均值: {mean_val:.2f}")
print(f"• 样本标准差: {std_dev:.2f}")
"""
engine.execute_cell(2, cell_2_code)运行上述代码,Cell 2 可以无缝读取 Cell 1 中产生的 dataset 变量,这正是 Jupyter Notebook 区别于传统一次性执行脚本的核心魅力所在。
📝 动手练一练
选择题:在以下哪种开发场景下,你应该优先选择 Jupyter Notebook 而非 PyCharm?
- A. 编写一套自动化定时爬虫服务,每天凌晨自动抓取数据并持久化到 MySQL
- B. 对业务方提供的 5 万行用户问卷进行探索性统计分析,并配合图表向团队做即时汇报
- C. 开发一个包含 20 个模块的商业 Web 后端应用
- D. 编写一套需要严格单元测试与 CI/CD 自动部署的机器学习预测微服务
👉 点击查看参考答案
参考答案: B。Jupyter Notebook 的核心优势在于交互式单步执行与即时图表渲染,是探索性数据分析(EDA)与成果汇报的绝佳工具。而 A、C、D 属于工程化系统开发,更适合在 PyCharm 等专业 IDE 中组织。
操作与编程练习:请在电脑终端中启动 Jupyter Notebook,新建一个笔记本,并在第一个单元格中编写 Python 代码导入
numpy和pandas,打印其版本号;在第二个单元格中创建一个包含 5 个城市名称的列表并打印。👉 点击查看参考答案
参考答案: 在浏览器新建的 Notebook 单元格中分别输入:
- 单元格 1:
import numpy as np import pandas as pd print(f"NumPy 版本: {np.__version__} | Pandas 版本: {pd.__version__}") - 单元格 2(按 Shift+Enter 执行并新建):
cities = ["北京", "上海", "广州", "深圳", "杭州"] print("城市列表:", cities)
如果两个单元格均能正常输出,说明你的 Jupyter Notebook 环境已完全就绪!
- 单元格 1:
本章小结
在本节中,我们完成了数据分析开发工具链的闭环搭建:
- Jupyter Notebook 是数据探索、统计计算与图表分享的交互神器;
- PyCharm 是代码重构、模块化组织与工程化项目交付的专业工作台;
- 理清了 Python 语言、Anaconda 发行版与 PyCharm 编辑器之间的依赖与协作链路。
📋 行动清单
- 在本地命令行中运行
jupyter notebook成功打开网页控制台。 - 若有工程开发需求,安装 PyCharm 社区版并在设置中正确关联 Anaconda 解释器。
- 全面回顾第 1 章的 6 节内容,准备开启第 2 章《本地数据的采集与操作》代码实战!
—— 小象教研组
- 本节课件:环境部署(2)(PDF · 810KB)下载
- 全套课件打包(第1-5章)(ZIP · 12.8MB)下载
- 全套课件打包(第6-8章)(ZIP · 15MB)下载
- 实战数据集:AppleStore 应用商城分析(ZIP · 329KB)下载
- 实战数据集:女性服装电商分析(ZIP · 2.8MB)下载
- Python 数据分析环境搭建指南(PDF · 2MB)下载
- Scrapy 安装教程(PDF · 12.7MB)下载
- 附加实战项目:AppleStore 应用商城数据分析(ZIP · 0.3MB · ipynb + CSV 数据)下载
- 附加实战项目:银行电话营销数据分析(ZIP · 0.4MB · ipynb + CSV 数据)下载
- 附加实战项目:女性服装电商评论数据分析(ZIP · 2.7MB · ipynb + CSV 数据)下载
- 附加实战项目:美国化学学会杂志数据分析(ZIP · 34.2MB · ipynb + SQLite 数据库)下载
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加课程顾问,免费获取网盘下载链接
微信扫码添加顾问