← 返回《Python 数据分析实战》
📑 查看全课大纲(第 5 / 101 节)
  1. 1.数据分析基本概念
  2. 2.学习数据分析的一般路线
  3. 3.数据分析的流程
  4. 4.数据类型
  5. 5.环境部署(1)
  6. 6.环境部署(2)
  7. 7.课程介绍
  8. 8.TXT文件操作
  9. 9.JSON文件操作
  10. 10.CSV文件操作
  11. 11.Excel文件操作
  12. 12.数据库及SQL常用语法
  13. 13.数据库基本操作
  14. 14.数据库多表连接
  15. 15.实战:欧洲职业足球数据库分析
  16. 16.爬虫简介
  17. 17.URL管理模块
  18. 18.网页下载模块
  19. 19.网页解析模块(1)
  20. 20.网页解析模块(2)
  21. 21.Scrapy简介
  22. 22.Scrapy使用步骤(1)
  23. 23.Scrapy使用步骤(2)
  24. 24.Scrapy使用步骤(3)
  25. 25.Scrapy使用步骤(4)
  26. 26.实战:获取国内城市空气质量指数数据
  27. 27.NumPy和SciPy介绍
  28. 28.多维数组
  29. 29.多维数组操作
  30. 30.NumPy的常用方法
  31. 31.向量化介绍
  32. 32.向量化及通用函数
  33. 33.实战:2016美国大选分析
  34. 34.数据结构-Series
  35. 35.数据结构-DataFrame
  36. 36.数据结构-Index
  37. 37.Series的索引操作
  38. 38.DataFrame的索引操作
  39. 39.索引操作总结
  40. 40.运算与对齐
  41. 41.函数应用操作(1) -- map
  42. 42.函数应用操作 (2) -- apply applymap
  43. 43.文件读写操作
  44. 44.排序操作
  45. 45.数据清洗--处理缺失数据
  46. 46.数据清洗--处理重复数据
  47. 47.数据清洗--替换数据
  48. 48.常用统计方法(1) -- describe quantile
  49. 49.常用统计方法(2) -- sum mean median count
  50. 50.常用统计方法(3) -- max min idxmax idxmin
  51. 51.常用统计方法(4) -- mad var std cumsum
  52. 52.实战:全球食品数据分析
  53. 53.层级索引
  54. 54.分组与聚合介绍
  55. 55.分组操作(1) -- GroupBy对象及常用聚合操作
  56. 56.分组操作(2) -- 自定义分组及聚合操作
  57. 57.透视表介绍
  58. 58.透视表操作
  59. 59.数据规整(1) -- 数据合并concat
  60. 60.数据规整(2) -- 数据连接merge
  61. 61.数据重构(3) -- 数据重构stack unstack
  62. 62.实战:互联网电影资料库分析
  63. 63.探索性数据分析EDA介绍
  64. 64.EDA的目的
  65. 65.EDA常用工具
  66. 66.Matplotlib绘图基本介绍
  67. 67.Matplotlib画布
  68. 68.散点图和柱状图的绘制
  69. 69.直方图的绘制
  70. 70.矩阵绘图
  71. 71.子图的使用
  72. 72.Matplotlib颜色、标记、线型
  73. 73.Matplotlib坐标刻度、标签、图例、标题
  74. 74.Seaborn介绍
  75. 75.数据集分布可视化(1) -- 单变量分布、双变量分布
  76. 76.数据集分布可视化(2) -- 变量关系可视化
  77. 77.类别数据可视化 -- 类别散布图、类别内数据分布、类别内统计图
  78. 78.交互式数据可视化工具Bokeh介绍
  79. 79.Bokeh绘制散点图、柱状图、盒子图、弦图
  80. 80.Bokeh绘制常用图形元素
  81. 81.D绘图 -- mplot3d
  82. 82.D曲线可视化
  83. 83.D散点图可视化
  84. 84.D柱状图可视化
  85. 85.Pandas绘图
  86. 86.实战:Lending Club借贷数据探索性分析及可视化
  87. 87.机器学习介绍及应用场景
  88. 88.机器学习建模介绍 (1) -- 分类
  89. 89.机器学习建模介绍 (2) -- 回归
  90. 90.机器学习建模介绍 (3) -- 聚类
  91. 91.机器学习分类
  92. 92.机器学习工具scikit-learn
  93. 93.使用scikit-learn的流程
  94. 94.数据集准备及划分
  95. 95.模型选择
  96. 96.数据预处理及特征工程
  97. 97.过拟合与欠拟合
  98. 98.模型调参介绍
  99. 99.模型调参方法
  100. 100.模型测试及评价
  101. 101.实战:通过移动设备行为数据预测性别和年龄

环境部署(1)

约 14 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

Python 科学计算环境部署:Anaconda 安装与包管理精讲

小象实战讲义 · Python数据分析实战

工欲善其事,必先利其器。进行 Python 数据分析与科学计算,第一步也是最关键的一步就是搭建一套稳定、纯净且开箱即用的开发环境。很多初学者直接从 Python 官网下载纯净版解释器,但在后续安装 NumPy、Pandas 或 Scikit-Learn 等科学计算库时,往往会遭遇复杂的 C/C++ 底层依赖编译失败与环境冲突。本节将带你使用业界主流的 Anaconda 科学计算发行版,手把手在 Windows、macOS 与 Linux 上完成环境部署与包管理工具配置。

💡 核心导读

  • 为什么选择 Anaconda:理解 Anaconda 发行版与原生 Python 的本质区别及巨大优势。
  • 三大操作系统安装要点:掌握 Windows、macOS 与 Linux 下的标准安装与环境变量配置。
  • 环境验证三部曲:通过终端命令快速检验 pythoncondapip 的运行状态。
  • Conda 与 Pip 包管理速查:掌握库安装、升级、卸载与镜像源加速的核心命令。
  • Python 运行环境自检代码:编写 Python 脚本自动检测当前环境的关键科学计算库版本。

1. 认识 Anaconda:数据分析师的首选平台

什么是 Anaconda?

Anaconda 是专为数据分析、科学计算与机器学习而生的 Python 发行版。它不仅包含了标准 Python 解释器,更预装了数百个数据科学领域最核心的第三方库(包括 NumPy、Pandas、SciPy、Matplotlib、Scikit-Learn 等),并自带强大的包管理与虚拟环境工具 conda

┌─────────────────────────────────────────────────────────────┐
│                       Anaconda 发行版                        │
├───────────────────────────────┬─────────────────────────────┤
│      标准 Python 解释器       │      Conda 包与环境管理器    │
├───────────────────────────────┴─────────────────────────────┤
│                   预装 1500+ 核心数据科学库                  │
│ [NumPy] [Pandas] [SciPy] [Matplotlib] [Seaborn] [Scikit-Learn]│
└─────────────────────────────────────────────────────────────┘

为什么不推荐直接安装原生 Python?

  • 依赖冲突极少:科学计算库底层依赖许多优化编译的数学库(如 BLAS/LAPACK/MKL)。Anaconda 提供的都是预编译好的二进制包,避免了本地编译失败的噩梦;
  • 虚拟环境隔离:通过 conda 可以为不同项目创建完全隔离的独立 Python 环境,互不干扰。

2. 三大操作系统安装与配置指南

2.1 下载地址与版本选择

  • 官方下载站https://www.anaconda.com/download/
  • 清华大学开源镜像站(国内加速推荐)https://mirrors.tuna.tsinghua.edu.cn/anaconda/archive/

注意:请务必根据自己的操作系统架构(Windows x64、macOS ARM64/Apple Silicon 或 Intel x64、Linux x86_64)选择对应的安装程序。

2.2 各平台安装要点

1. Windows 系统安装

  1. 双击运行 .exe 安装程序,点击 Next 并同意用户协议(I Agree);
  2. 选择 All Users(或 Just Me),选择安装路径(建议安装在非中文、无空格的路径下,如 D:\Anaconda3);
  3. 关键步骤:勾选 “Add Anaconda3 to my PATH environment variable”(将其添加至系统环境变量),便于在 CMD/PowerShell 中直接调用;
  4. 点击 Install 开始安装,直至提示安装完成。

2. macOS 系统安装

  1. 下载图形化 .pkg 安装包,双击打开按照安装向导点击“继续”;
  2. 采用默认安装路径(通常位于 /Users/用户名/opt/anaconda3/Users/用户名/anaconda3);
  3. 安装完成后打开系统“终端(Terminal)”,终端提示符前若出现 (base) 即表示环境配置成功。

3. Linux 系统安装

在终端中切换到安装包下载目录,执行 Bash 脚本安装:

# 运行安装脚本(以实际下载的脚本名为准)
bash ./Anaconda3-latest-Linux-x86_64.sh
  1. 连续按回车滚动阅读用户协议,最后输入 yes 同意;
  2. 按回车确认默认安装路径(/home/用户名/anaconda3);
  3. 安装结束时提示是否执行 conda init,输入 yes 自动写入环境变量。

3. 环境验证与常用包管理命令

安装完成后,打开操作系统终端(Windows 下打开 CMD 或 PowerShell,macOS/Linux 下打开 Terminal),依次执行以下三条验证命令:

# 1. 验证 Python 版本
python --version

# 2. 验证 Conda 版本
conda --version

# 3. 验证 Pip 包管理器
pip --version

如果三条命令均能正常输出版本号(无 command not found 报错),则表示科学计算基础环境已成功就绪!

常用包管理命令对比速查

操作类型Conda 命令Pip 命令
安装新库conda install <库名>pip install <库名>
升级指定库conda update <库名>pip install --upgrade <库名>
卸载库conda uninstall <库名>pip uninstall <库名>
列出已安装库conda listpip list
国内镜像加速修改 .condarc 配置镜像源pip install <库名> -i https://pypi.tuna.tsinghua.edu.cn/simple

4. Python 代码实战:开发环境依赖自动体检脚本

下面我们编写一段 Python 脚本,自动检测当前 Python 运行时环境,并体检常用数据科学库(numpypandasmatplotlib 等)的安装情况与版本号。

# 示例:检测当前运行环境并进行核心依赖库体检

import sys
import platform

print("=== Python 基础运行环境诊断 ===")
print(f"操作系统平台: {platform.system()} {platform.release()} ({platform.machine()})")
print(f"Python 解释器版本: {platform.python_version()}")
print(f"解释器执行路径: {sys.executable}")
print("-" * 50)

接下来,我们编写模块化检查函数,批量体检数据科学核心库是否安装就绪:

# 核心数据分析依赖清单
required_libraries = [
    ("numpy", "数值计算核心库"),
    ("pandas", "数据清洗与结构化分析库"),
    ("scipy", "科学与统计计算库"),
    ("matplotlib", "数据可视化基础库"),
    ("seaborn", "高级统计图表库"),
    ("sklearn", "经典机器学习库")
]

print("=== 核心数据分析库安装体检 ===")
missing_libs = []

for lib_name, lib_desc in required_libraries:
    try:
        # 动态导入模块并读取版本号
        module = __import__(lib_name)
        version = getattr(module, "__version__", "已安装(无明确版本号)")
        print(f"✅ {lib_name:<12} | 版本: {version:<10} | 说明: {lib_desc}")
    except ImportError:
        print(f"❌ {lib_name:<12} | [未安装]   | 说明: {lib_desc}")
        missing_libs.append(lib_name)

print("-" * 50)
if not missing_libs:
    print("🎉 恭喜!当前环境已集齐全部核心科学计算库,可无缝开启后续课程实战!")
else:
    print(f"⚠️ 提示:检测到缺少以下依赖库: {', '.join(missing_libs)}")
    print(f"💡 建议在终端执行安装: pip install {' '.join(missing_libs)}")

📝 动手练一练

  1. 问答题:如果你在公司的内网服务器上通过终端输入 conda install pandas 时提示连接超时(Connection Timeout),应该如何解决?

    👉 点击查看参考答案

    参考答案: 造成连接超时的常见原因是国外官方源网络受限。解决方法为: ① 配置国内镜像源:在用户目录下编辑或创建 .condarc 配置文件,添加清华大学、中科大或阿里云的 Anaconda 镜像源频道; ② 或者临时改用国内镜像源运行 pip install pandas -i https://pypi.tuna.tsinghua.edu.cn/simple 进行安装。

  2. 操作与编程练习:请在你的电脑上新建一个名为 test_env.py 的文件,将本节实战中的环境检测脚本复制进去并运行,观察输出的 Python 版本号与操作系统名称。

    👉 点击查看参考答案

    参考答案: 在终端中运行 python test_env.py,预期将完整打印出当前电脑的系统版本、Python 解释器路径以及各个科学计算库的安装状态。只要输出中没有报错提示,即代表当前开发环境运行正常。


本章小结

在本节中,我们完成了数据分析基石环境的搭建:

  • Anaconda 发行版是数据科学领域的工业级标准,一站式解决了依赖编译与库冲突难题;
  • 正确配置系统环境变量是确保在任意命令行工具中全局调用 pythonconda 的关键;
  • 掌握 condapip 的基本管理命令,能够轻松应对后续第三方库的增量安装。

📋 行动清单

  • 在个人电脑上完成 Anaconda 的下载与安装。
  • 打开命令行终端,运行 python --versionconda --version 完成安装校验。

—— 小象教研组

配套学习资源与课件
  • 本节课件:环境部署(1)(PDF · 1003KB)
    下载
  • 全套课件打包(第1-5章)(ZIP · 12.8MB)
    下载
  • 全套课件打包(第6-8章)(ZIP · 15MB)
    下载
  • 实战数据集:AppleStore 应用商城分析(ZIP · 329KB)
    下载
  • 实战数据集:女性服装电商分析(ZIP · 2.8MB)
    下载
  • Python 数据分析环境搭建指南(PDF · 2MB)
    下载
  • Scrapy 安装教程(PDF · 12.7MB)
    下载
  • 附加实战项目:AppleStore 应用商城数据分析(ZIP · 0.3MB · ipynb + CSV 数据)
    下载
  • 附加实战项目:银行电话营销数据分析(ZIP · 0.4MB · ipynb + CSV 数据)
    下载
  • 附加实战项目:女性服装电商评论数据分析(ZIP · 2.7MB · ipynb + CSV 数据)
    下载
  • 附加实战项目:美国化学学会杂志数据分析(ZIP · 34.2MB · ipynb + SQLite 数据库)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问