← 返回《人工智能数学基础》
📑 查看全课大纲(第 18 / 93 节)
  1. 1.概论和集合的定义
  2. 2.逼疯康托的实数集理论
  3. 3.常用不等式与映射
  4. 4.函数及特殊函数
  5. 5.序列极限的定义
  6. 6.序列极限的性质与夹逼定理
  7. 7.重要极限
  8. 8.无穷小量,无穷大量和一组重要的阶的比较关系
  9. 9.聚点原理
  10. 10.函数极限及其性质
  11. 11.重要极限与等价无穷小
  12. 12.连续函数
  13. 13.导数的概念(那些年,扛起牛顿的胡克)
  14. 14.定义法求导
  15. 15.函数四则运算的导数与反函数求导法则
  16. 16.复合函数,隐函数,参数式求导
  17. 17.不定式求导之“洛必达与伯努利的师生情”
  18. 18.一阶微分
  19. 19.高阶导数
  20. 20.高阶微分
  21. 21.罗尔中值定理与拉格朗日中值定理
  22. 22.柯西空降科学院遭排挤
  23. 23.泰勒公式与泰勒的克妻属性
  24. 24.利用泰勒展开唯一性定理计算泰勒展开
  25. 25.泰勒公式的余项估计
  26. 26.极值问题与导数
  27. 27.函数凹凸性
  28. 28.无卵用的渐近线与函数作图
  29. 29.不定积分的定义
  30. 30.第一换元法
  31. 31.第二换元法
  32. 32.分部积分法
  33. 33.有理式积分
  34. 34.三角替换
  35. 35.定积分的概念
  36. 36.定积分的性质与积分中值定理
  37. 37.变上限定积分
  38. 38.微积分基本定理之“高斯教你如何优雅地装逼”
  39. 39.定积分的换元法
  40. 40.奇偶函数与周期函数的定积分
  41. 41.曲线求长与不可求长曲线(海岸线居然算不出长度?)
  42. 42.旋转体体积
  43. 43.旋转体侧面积
  44. 44.极坐标下图形的面积(数学系常用表白曲线)
  45. 45.欧式空间
  46. 46.点列极限,开集与闭集
  47. 47.多元函数的定义
  48. 48.多元函数的极限
  49. 49.多元连续函数
  50. 50.一阶偏导数
  51. 51.高阶偏导数
  52. 52.全微分
  53. 53.方向导数与梯度
  54. 54.链式法则
  55. 55.一阶全微分形式的不变性与高阶微分
  56. 56.多元函数的泰勒公式
  57. 57.隐函数存在定理与逆映射存在定理
  58. 58.多元函数的极值
  59. 59.矩阵基础知识
  60. 60.行列式的定义与特殊矩阵的行列式
  61. 61.行列式的性质
  62. 62.行列式按k行展开
  63. 63.线性方程组初步与高斯消元法
  64. 64.齐次线性方程组与Cramer法则
  65. 65.线性空间
  66. 66.线性相关与线性无关
  67. 67.向量组的秩
  68. 68.矩阵的秩与线性方程组有解的充要条件
  69. 69.齐次线性方程组的解集结构
  70. 70.非齐次线性方程组解集结构
  71. 71.基与维数
  72. 72.矩阵的乘法
  73. 73.特殊矩阵
  74. 74.矩阵乘积的秩与行列式
  75. 75.矩阵的逆
  76. 76.正交矩阵
  77. 77.矩阵对角化与特征值特征向量
  78. 78.实对称矩阵对角化
  79. 79.二次型与正定矩阵
  80. 80.LU分解
  81. 81.Cholesky分解
  82. 82.SVD分解
  83. 83.线搜索
  84. 84.步长
  85. 85.最速下降法和牛顿法
  86. 86.共轭梯度法
  87. 87.拟牛顿法
  88. 88.无约束优化
  89. 89.若干知识点补充(一)
  90. 90.若干知识点补充(二)
  91. 91.凸优化问题
  92. 92.对偶问题(一)
  93. 93.对偶问题(二)

一阶微分

约 22 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

一阶微分

小象实战讲义 · 人工智能数学基础

在上一章我们学习了导数,它描述了函数在某一点变化的瞬时速率。然而,在算法实现和数值计算中,我们更关心的是:当输入发生一个微小变化时,输出会如何近似地线性变化?这正是微分要回答的核心问题。本节将建立微分的严格定义,揭示其与导数的等价关系,并通过“线性主部”这一几何直观,为你理解后续的优化算法(如梯度下降)奠定坚实的数学基础。

💡 核心导读

本节你将掌握:

  1. 微分的定义:理解函数增量 Δy\Delta y 如何被分解为“线性主部” AΔxA\Delta x 与一个更高阶的无穷小量 o(Δx)o(\Delta x)
  2. 可微与可导的等价性:证明对于一元函数,在某点可微与在该点可导是完全等价的,且微分系数 AA 就是导数 f(x0)f’(x_0)
  3. 微分的几何意义:从图形上认识微分 dydy 是函数增量 Δy\Delta y 的线性近似,其误差是当 Δx0\Delta x \to 0 时更快趋于零的量。
  4. 一阶微分形式不变性:掌握复合函数微分计算的便捷法则,并了解其适用范围(仅对一元函数的一阶微分成立)。
  5. 微分在近似计算中的应用:学习如何利用微分公式 f(x0+Δx)f(x0)+f(x0)Δxf(x_0+\Delta x) \approx f(x_0) + f’(x_0)\Delta x 进行快速估算。

1. 微分的概念:变化的线性近似

考虑一个函数 y=f(x)y = f(x) 在点 x0x_0 的某个邻域内有定义。给自变量 xx 一个增量 Δx\Delta x,函数值相应地产生增量 Δy\Delta yΔy=f(x0+Δx)f(x0)\Delta y = f(x_0 + \Delta x) - f(x_0)

定义(微分):如果函数增量 Δy\Delta y 可以表示为 Δx\Delta x 的一个线性函数与一个比 Δx\Delta x 更高阶的无穷小量之和,即存在一个与 Δx\Delta x 无关的常数 AA,使得 Δy=AΔx+o(Δx)(Δx0)\Delta y = A \Delta x + o(\Delta x) \quad (\Delta x \to 0) 其中 o(Δx)o(\Delta x) 满足 limΔx0o(Δx)Δx=0\lim_{\Delta x \to 0} \frac{o(\Delta x)}{\Delta x} = 0,则称函数 f(x)f(x) 在点 x0x_0可微

并称 AΔxA \Delta x 为函数 f(x)f(x) 在点 x0x_0 处的微分,记作 dydydf(x0)df(x_0),即: dy=df(x0)=AΔxdy = df(x_0) = A \Delta x 通常,记自变量的微分 dx=Δxdx = \Delta x,于是微分可以写作: dy=Adxdy = A dx

几何直观: 让我们通过图形来理解微分。下图展示了函数 y=f(x)y=f(x) 在点 (x0,f(x0))(x_0, f(x_0)) 附近的情况。

  • Δy\Delta y 是曲线上两点间的纵向实际变化(BCBC 段)。
  • dydy 是函数在该点切线上的纵向变化(BDBD 段),即 dy=f(x0)dxdy = f’(x_0) dx
  • 两者的差值 Δydy=CD\Delta y - dy = CD 就是高阶无穷小量 o(Δx)o(\Delta x)。当 Δx\Delta x 非常小时,CDCD 的长度远小于 BDBD,因此可以用切线上的变化 dydy 来很好地近似实际变化 Δy\Delta y

微分几何意义示意图

微分的核心思想在于局部线性化:在 x0x_0 的一个极小邻域内,复杂的函数 f(x)f(x) 可以用一条简单的直线(其切线)来近似替代。这个线性近似的“主部”就是微分 dydy,而近似的误差是一个更高阶的无穷小量。

2. 可微与可导的等价性

对于一元函数,可微性与我们熟悉的可导性有着深刻的内在联系。

定理:函数 y=f(x)y = f(x) 在点 x0x_0 处可微的充分必要条件是它在点 x0x_0 处可导。并且当可微(或可导)时,有 A=f(x0)A = f’(x_0),即 dy=f(x0)dxdy = f’(x_0) dx

证明

  1. 可微 \Rightarrow 可导: 由可微定义, Δy=AΔx+o(Δx)\Delta y = A \Delta x + o(\Delta x)。两边同除以 Δx\Delta x (Δx0\Delta x \neq 0): ΔyΔx=A+o(Δx)Δx\frac{\Delta y}{\Delta x} = A + \frac{o(\Delta x)}{\Delta x}Δx0\Delta x \to 0,对上式取极限: limΔx0ΔyΔx=A+limΔx0o(Δx)Δx=A+0=A\lim_{\Delta x \to 0} \frac{\Delta y}{\Delta x} = A + \lim_{\Delta x \to 0} \frac{o(\Delta x)}{\Delta x} = A + 0 = A 根据导数定义,该极限存在且等于 AA,因此 f(x)f(x)x0x_0 处可导,且 f(x0)=Af’(x_0) = A

  2. 可导 \Rightarrow 可微: 由可导定义, limΔx0ΔyΔx=f(x0)\lim_{\Delta x \to 0} \frac{\Delta y}{\Delta x} = f’(x_0)。 根据极限与无穷小量的关系,上式等价于: ΔyΔx=f(x0)+α\frac{\Delta y}{\Delta x} = f’(x_0) + \alpha 其中 α\alpha 是当 Δx0\Delta x \to 0 时的无穷小量,即 α=o(1)\alpha = o(1)。 将上式改写为: Δy=f(x0)Δx+αΔx\Delta y = f’(x_0) \Delta x + \alpha \Delta x 由于 limΔx0αΔxΔx=limΔx0α=0\lim_{\Delta x \to 0} \frac{\alpha \Delta x}{\Delta x} = \lim_{\Delta x \to 0} \alpha = 0,所以 αΔx=o(Δx)\alpha \Delta x = o(\Delta x)。 因此,Δy\Delta y 被表示成了 f(x0)Δxf’(x_0) \Delta x(线性主部)与 o(Δx)o(\Delta x)(高阶无穷小)之和,满足可微的定义。且此时 A=f(x0)A = f’(x_0)

这个定理告诉我们,对于一元函数,“可微”和“可导”是描述同一现象的两个侧面:

  • 可导:侧重于变化的瞬时比率dy/dxdy/dx)。
  • 可微:侧重于变化的线性近似值dy=f(x0)dxdy = f’(x_0)dx)。

由于 dx=Δxdx = \Delta x,导数也常被称为微商,即微分之商:f(x)=dydxf’(x) = \frac{dy}{dx}

import numpy as np
import matplotlib.pyplot as plt

# 验证可微与可导的等价性:以 f(x) = sin(x) 在 x0=0 为例
x0 = 0
f = lambda x: np.sin(x)
f_prime = lambda x: np.cos(x) # 导函数

# 取一系列逐渐减小的 Δx
delta_xs = np.array([0.5, 0.1, 0.05, 0.01, 0.005, 0.001])
print("Δx\t\tΔy\t\t\tf'(x0)Δx\t\t差值 (Δy - f'(x0)Δx)\t比值 (差值/Δx)")
print("-" * 90)

for dx in delta_xs:
    delta_y = f(x0 + dx) - f(x0) # 实际增量 Δy
    linear_approx = f_prime(x0) * dx # 线性近似 dy = f'(x0)dx
    error = delta_y - linear_approx # 近似误差 o(Δx)
    ratio = error / dx if dx != 0 else np.nan # 误差与 Δx 的比值
    print(f"{dx:.4f}\t{delta_y:.8f}\t{linear_approx:.8f}\t{error:.8f}\t\t{ratio:.8f}")

# 可视化:当 Δx 变小时,误差与 Δx 的比值趋于 0
plt.figure(figsize=(10, 4))
plt.subplot(1, 2, 1)
plt.loglog(delta_xs, np.abs(delta_xs), 'b--', label='|Δx| (参考线)')
plt.loglog(delta_xs, np.abs([f(x0+dx)-f(x0) - f_prime(x0)*dx for dx in delta_xs]), 'ro-', label='|Δy - f\'(x0)Δx|')
plt.xlabel('Δx')
plt.ylabel('绝对值')
plt.title('误差随 Δx 减小的趋势')
plt.legend()
plt.grid(True, which="both", ls="--")

plt.subplot(1, 2, 2)
ratios = [(f(x0+dx)-f(x0) - f_prime(x0)*dx)/dx for dx in delta_xs]
plt.semilogx(delta_xs, ratios, 'go-')
plt.axhline(y=0, color='k', linestyle=':', alpha=0.5)
plt.xlabel('Δx')
plt.ylabel('(Δy - f\'(x0)Δx) / Δx')
plt.title('误差与 Δx 的比值趋于 0')
plt.grid(True, which="both", ls="--")
plt.tight_layout()
plt.show()

3. 微分的运算与一阶微分形式不变性

由于 dy=f(x)dxdy = f’(x)dx,微分的运算法则可以直接从导数的运算法则推导出来。

微分四则运算法则:设 u=u(x)u=u(x), v=v(x)v=v(x) 可微,则 d(u±v)=du±dvd(uv)=vdu+udvd(uv)=vduudvv2(v0)\begin{aligned} d(u \pm v) &= du \pm dv \ d(uv) &= v du + u dv \ d\left(\frac{u}{v}\right) &= \frac{v du - u dv}{v^2} \quad (v \neq 0) \end{aligned}

基本初等函数的微分公式:只需在对应的导数公式后乘以 dxdxd(C)=0d(xμ)=μxμ1dxd(sinx)=cosxdxd(cosx)=sinxdxd(lnx)=1xdxd(ex)=exdx\begin{aligned} d(C) &= 0 \ d(x^\mu) &= \mu x^{\mu-1} dx \ d(\sin x) &= \cos x , dx \ d(\cos x) &= -\sin x , dx \ d(\ln x) &= \frac{1}{x} dx \ d(e^x) &= e^x dx \ &\vdots \end{aligned}

一阶微分形式不变性:这是一个非常实用且重要的性质。 设 y=f(u)y = f(u),而 u=g(x)u = g(x),即 y=f(g(x))y = f(g(x)) 是复合函数。

  • 如果 uu自变量,则微分 dy=f(u)dudy = f’(u) du
  • 如果 uu中间变量(即 u=g(x)u = g(x)),我们先用链式法则求导再写微分: dy=dydxdx=f(u)g(x)dx=f(u)[g(x)dx]=f(u)dudy = \frac{dy}{dx} dx = f’(u) g’(x) dx = f’(u) \cdot [g’(x) dx] = f’(u) du 其中 du=g(x)dxdu = g’(x) dx 正是中间变量 uu 作为 xx 的函数时的微分。

结论:无论 uu 是自变量还是中间变量,函数 y=f(u)y=f(u) 的微分形式都保持为 dy=f(u)dudy = f’(u) du。这就是一阶微分形式的不变性

重要限制:此性质仅对一元函数一阶微分成立。对于高阶微分或多元函数的微分,该形式不变性一般不再成立。

4. 微分的应用:函数值的近似计算

由微分定义 Δydy\Delta y \approx dy,我们可以得到一个实用的近似公式: f(x0+Δx)f(x0)+f(x0)Δxf(x_0 + \Delta x) \approx f(x_0) + f’(x_0) \Delta xΔx|\Delta x| 很小时,这个线性近似具有足够的精度。

实例:估算 804\sqrt[4]{80} 的近似值。

  1. 构造函数:令 f(x)=x4=x1/4f(x) = \sqrt[4]{x} = x^{1/4}
  2. 选择易计算的点:取 x0=81x_0 = 81,因为 f(81)=814=3f(81) = \sqrt[4]{81} = 3 是精确值。此时 Δx=8081=1\Delta x = 80 - 81 = -1
  3. 计算导数:f(x)=14x3/4f’(x) = \frac{1}{4} x^{-3/4}。在 x0=81x_0=81 处, f(81)=14×813/4=14×(34)3/4=14×33=14×27=1108f’(81) = \frac{1}{4} \times 81^{-3/4} = \frac{1}{4} \times (3^4)^{-3/4} = \frac{1}{4} \times 3^{-3} = \frac{1}{4 \times 27} = \frac{1}{108}
  4. 应用近似公式: f(80)f(81)+f(81)Δx=3+1108×(1)=311082.99074074f(80) \approx f(81) + f’(81) \cdot \Delta x = 3 + \frac{1}{108} \times (-1) = 3 - \frac{1}{108} \approx 2.99074074 使用计算器可得 8042.990697…\sqrt[4]{80} \approx 2.990697…,我们的近似值与之非常接近,误差约为 4.3×1054.3 \times 10^{-5}

这个例子展示了微分近似的威力:通过在一个已知的“锚点”(x0x_0)进行线性外推,可以快速估算其邻近点的函数值,这在数值分析和工程估算中非常有用。

📝 动手练一练

  1. 微分计算:设函数 y=ln(1+ex2)y = \ln(1 + e^{x^2}),利用一阶微分形式不变性,求 dydy

  2. 近似计算:利用微分近似计算 sin31\sin 31^\circ 的值。(提示:将角度转换为弧度,取 x0=30=π/6x_0 = 30^\circ = \pi/6Δx=1=π/180\Delta x = 1^\circ = \pi/180 弧度。)

参考答案

  1. dy=2xex21+ex2dxdy = \frac{2x e^{x^2}}{1 + e^{x^2}} dx。 (解析:令 u=1+ex2u = 1 + e^{x^2},则 y=lnuy = \ln u。由形式不变性,dy=1ududy = \frac{1}{u} du。又 du=d(1+ex2)=ex2d(x2)=2xex2dxdu = d(1 + e^{x^2}) = e^{x^2} d(x^2) = 2x e^{x^2} dx。代入即得。)

  2. sin31sin(π6)+cos(π6)π180=12+32π1800.5+0.866025×0.0174530.515115\sin 31^\circ \approx \sin(\frac{\pi}{6}) + \cos(\frac{\pi}{6}) \cdot \frac{\pi}{180} = \frac{1}{2} + \frac{\sqrt{3}}{2} \cdot \frac{\pi}{180} \approx 0.5 + 0.866025 \times 0.017453 \approx 0.515115。 (计算器值约为 0.515038。)

本章小结

本节我们深入探讨了一元函数微分的核心思想与应用:

要点回顾

  1. 微分定义:函数增量 Δy\Delta y 可表示为线性主部 AΔxA\Delta x 与高阶无穷小 o(Δx)o(\Delta x) 之和,AΔxA\Delta x 即称为微分 dydy
  2. 几何意义:微分 dydy 是函数曲线在一点处切线的纵坐标增量,它是实际增量 Δy\Delta y 的最佳线性近似。
  3. 核心定理:一元函数在一点可微     \iff 在该点可导,且 dy=f(x0)dxdy = f’(x_0) dx。导数即微商 dy/dxdy/dx
  4. 形式不变性:一阶微分具有形式不变性 dy=f(u)dudy = f’(u) du,无论 uu 是自变量还是中间变量,这极大简化了复合函数的微分计算。
  5. 核心应用:近似计算公式 f(x0+Δx)f(x0)+f(x0)Δxf(x_0+\Delta x) \approx f(x_0) + f’(x_0)\Delta x,在 Δx|\Delta x| 较小时能提供快速有效的估算。

行动清单: 学完本节,你可以立即:

  1. 练习推导:任选一个基本初等函数,手动推导其微分公式 dy=f(x)dxdy = f’(x)dx,并与导数公式对比,加深对“微商”的理解。
  2. 代码验证:模仿示例代码,用 Python 对另一个函数(如 f(x)=cos(x)f(x)=\cos(x))验证可微性,即观察 Δyf(x0)Δx|\Delta y - f’(x_0)\Delta x| 是否随 Δx\Delta x 减小而更快地趋于零。
  3. 解决一个估算问题:尝试用微分近似计算 65\sqrt{65}e0.02e^{0.02} 的值,并与计算器结果对比,体会近似公式的精度与局限性。

— 小象教研组

配套学习资源与课件
  • 第5章讲义:微分与高阶微分(PDF · 2.0MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问