这不是同济《高等数学》教材习题的搬运,也不是习题全解。它是一份面向模型学习的原创高数题单:用同济高数第八版上册的知识范围,筛出对理解深度学习、优化、损失函数、训练动力学最有帮助的 25 道题。
我按官方高教社产品页确认的第八版范围来组织:同济大学数学科学学院编《高等数学》第八版上册,2023 年 6 月出版,上册包括函数与极限、导数与微分、微分中值定理与导数应用、不定积分、定积分及应用、微分方程等内容。本文只借用知识范围,不复刻教材原题。
读这篇时,重点不是“刷完 25 题”,而是建立一条模型学习的数学骨架:
flowchart LR
A["极限"] --> B["局部近似"]
B --> C["导数/梯度"]
C --> D["优化与损失"]
D --> E["积分:累计量/平均量"]
E --> F["微分方程:训练动力学"]
每题都有三块:
- 题目:尽量小,但抓住一个核心技能。
- 解答:写出关键步骤,不跳到结论。
- 模型连接:说明这题为什么对理解模型有用。
排版上,正文公式统一用 KaTeX 渲染;推导尽量拆成短公式,答案单独放在 答案 小节下,方便以后按题复习。
一、函数、极限与连续:看懂“局部”和“稳定”
1. 用极限看平方根的局部变化
题目:求
x→0limx1+x−1
解答:
直接代入会得到 0/0,需要变形。分子有根号,常用有理化:
x1+x−1⋅1+x+11+x+1=x(1+x+1)1+x−1
化简得:
1+x+11
令 x→0:
x→0lim1+x+11=21
答案:
21
模型连接:这题是“局部线性化”的入口。它说明 1+x 在 x=0 附近大约像 1+2x。训练模型时,我们也经常只看当前位置附近的变化,而不是一次看完整函数。
2. 对数函数的小量近似
题目:求
x→0limxln(1+3x)
解答:
令 u=3x,当 x→0 时,u→0。原式变为:
xln(1+3x)=3⋅3xln(1+3x)=3⋅uln(1+u)
基本极限:
u→0limuln(1+u)=1
所以:
x→0limxln(1+3x)=3
答案:
3
模型连接:交叉熵、似然、softmax 都离不开 ln。这题告诉你:当变化很小时,ln(1+u) 近似等于 u。很多损失函数的局部分析都靠这种近似。
3. 指数函数从离散增长到连续增长
题目:求
n→∞lim(1+n2)n
解答:
基本极限:
n→∞lim(1+n1)n=e
更一般地:
n→∞lim(1+na)n=ea
这里 a=2,所以:
n→∞lim(1+n2)n=e2
答案:
e2
模型连接:指数函数是 softmax 的核心。离散步数越来越细时,会自然出现 ex,这也是为什么连续增长、概率归一化、梯度流里经常见到指数函数。
4. 判断分段函数能否平滑衔接
题目:设
f(x)={ax+b,x2,x<1,x≥1.
求 a,b,使 f(x) 在 x=1 处连续且可导。
解答:
连续要求左极限等于函数值:
x→1−limf(x)=f(1)
左侧为 a+b,右侧函数值为 12=1,所以:
a+b=1
可导要求左右导数相等。左侧 ax+b 的导数是 a;右侧 x2 的导数是 2x,在 x=1 处为 2。所以:
a=2
代入 a+b=1:
2+b=1
所以:
b=−1
答案:
a=2,b=−1
模型连接:激活函数、损失函数最好不要有太奇怪的断点。连续性保证输出不突然跳,可导性保证梯度能传。ReLU 虽然在 0 点不可导,但工程上会用次梯度处理;这题帮你理解“平滑”为什么重要。
5. 比较两个函数的增长速度
题目:求
x→∞limx0.1lnx
解答:
当 x→∞ 时,分子分母都趋于无穷,可以用洛必达法则。
分子导数:
(lnx)′=x1
分母导数:
(x0.1)′=0.1x−0.9
所以原极限等于:
x→∞lim0.1x−0.91/x=x→∞lim10x−0.1=0
答案:
0
模型连接:学习 scaling law 时会频繁比较 logx、xa、ex 的增长速度。这题告诉你:任何正幂函数最终都比对数函数增长快。
二、导数与微分:梯度的前身
6. sigmoid 的导数
题目:设
σ(x)=1+e−x1
求 σ′(x),并把结果写成只含 σ(x) 的形式。
解答:
先写成幂形式:
σ(x)=(1+e−x)−1
求导:
σ′(x)=−(1+e−x)−2⋅(−e−x)=(1+e−x)2e−x
现在把它写成 σ(x) 的形式。因为:
σ(x)=1+e−x1
并且:
1−σ(x)=1−1+e−x1=1+e−xe−x
所以:
σ(x)(1−σ(x))=1+e−x1⋅1+e−xe−x=(1+e−x)2e−x
答案:
σ′(x)=σ(x)(1−σ(x))
模型连接:sigmoid 是经典激活函数和二分类概率函数。这个导数形式很重要:当 σ(x) 接近 0 或 1 时,导数接近 0,这就是梯度变小的一个直观来源。
7. logistic 损失的一维梯度
题目:设二分类标签 y∈{−1,1},模型分数为 wx,损失函数为
L(w)=ln(1+e−ywx)
求 L′(w)。
解答:
令:
u=−ywx
则:
L(w)=ln(1+eu)
先对 u 求导:
dudln(1+eu)=1+eueu
再乘上:
dwdu=−yx
所以:
L′(w)=1+e−ywxe−ywx⋅(−yx)
也可写为:
L′(w)=1+eywx−yx
答案:
L′(w)=1+eywx−yx
模型连接:这就是最小版的“反向传播”:损失对参数求导。理解这题,就能理解模型为什么会按梯度方向更新参数。
8. 用微分估算平方根
题目:不用计算器,估算 4.04。
解答:
令:
f(x)=x
在 x=4 附近做线性近似。先算:
f(4)=2
导数为:
f′(x)=2x1
所以:
f′(4)=41
从 4 到 4.04,变化量为:
Δx=0.04
微分近似:
f(4.04)≈f(4)+f′(4)Δx=2+41⋅0.04=2.01
答案:
4.04≈2.01
模型连接:微分就是一阶 Taylor 近似。训练时每次小步更新参数,本质上也是用局部线性近似判断损失会怎么变。
9. 用洛必达法则读出二阶小量
题目:求
x→0limx2ex−1−x
解答:
直接代入为 0/0。用洛必达法则一次:
x→0lim2xex−1
仍是 0/0,再用一次:
x→0lim2ex=21
答案:
21
模型连接:这题说明 ex 在 0 附近除了 1+x,还多出一个约 2x2 的二阶修正。二阶项对应曲率,是理解 Newton 法、Hessian、损失曲面弯曲的入口。
10. 判断 softplus 的单调性与凸性
题目:设
f(x)=ln(1+ex)
证明 f(x) 单调递增且为凸函数。
解答:
先求一阶导数:
f′(x)=1+exex
因为 ex>0,且 1+ex>0,所以:
f′(x)>0
因此 f(x) 单调递增。
再求二阶导数:
f′′(x)=(1+exex)′=(1+ex)2ex(1+ex)−exex=(1+ex)2ex
因为:
f′′(x)>0
所以 f(x) 为凸函数。
答案:f(x) 单调递增,且为凸函数。
模型连接:softplus 是 ReLU 的平滑版本。凸性说明局部斜率越来越大,也让你初步理解为什么凸损失比非凸损失更好分析。
三、中值定理、Taylor 与优化
11. Taylor 展开 ln(1+x)
题目:写出 ln(1+x) 在 x=0 处到三阶的 Taylor 展开。
解答:
令:
f(x)=ln(1+x)
逐阶求导:
f(0)=0
f′(x)=1+x1,f′(0)=1
f′′(x)=−(1+x)21,f′′(0)=−1
f′′′(x)=(1+x)32,f′′′(0)=2
Taylor 公式:
f(x)≈f(0)+f′(0)x+2!f′′(0)x2+3!f′′′(0)x3
代入:
ln(1+x)≈x−2x2+3x3
答案:
ln(1+x)=x−2x2+3x3+o(x3)
模型连接:很多损失函数的近似分析都靠 Taylor 展开。比如参数扰动很小时,损失变化可以拆成一阶梯度项和二阶曲率项。
12. 一个带正则项的最小化问题
题目:求函数
f(x)=x2+λ(x−1)2,λ>0
的最小值点。
解答:
先求导:
f′(x)=2x+2λ(x−1)
令导数为 0:
2x+2λ(x−1)=0
两边除以 2:
x+λx−λ=0
合并:
(1+λ)x=λ
所以:
x=1+λλ
再看二阶导数:
f′′(x)=2+2λ>0
所以这是最小值点。
答案:
x∗=1+λλ
模型连接:这是正则化的最小模型。第一项想让 x 靠近 0,第二项想让 x 靠近 1,λ 控制两种目标的权重。模型训练里经常是“拟合数据”和“控制复杂度”之间的拉扯。
13. Newton 法求 2 的一次迭代
题目:用 Newton 法求方程 x2−2=0 的近似根。取初值 x0=1,求 x1。
解答:
设:
f(x)=x2−2
Newton 法公式:
xn+1=xn−f′(xn)f(xn)
求导:
f′(x)=2x
代入 x0=1:
f(1)=12−2=−1
f′(1)=2
所以:
x1=1−2−1=1.5
答案:
x1=1.5
模型连接:Newton 法用到二阶思想,比普通梯度下降更懂曲率。大模型里完整 Newton 法太贵,但二阶优化、自然梯度、K-FAC 等方法都和这个思想有关。
14. 用中值定理证明指数函数的下界
题目:证明当 x>0 时,
ex>1+x
解答:
设:
f(t)=et
在区间 [0,x] 上使用拉格朗日中值定理,存在 ξ∈(0,x),使得:
x−0f(x)−f(0)=f′(ξ)
即:
xex−1=eξ
因为 x>0 且 ξ>0,所以:
eξ>1
于是:
xex−1>1
两边乘以 x>0:
ex−1>x
所以:
ex>1+x
模型连接:很多概率不等式、凸函数不等式都来自中值定理或凸性。这些不等式是理解优化收敛和泛化界的基础语言。
15. 找出一个一维损失的所有驻点
题目:设
f(x)=x4−2x2
求驻点,并判断它们是极大值点、极小值点还是其他。
解答:
先求导:
f′(x)=4x3−4x=4x(x2−1)
令 f′(x)=0:
4x(x−1)(x+1)=0
所以驻点为:
x=−1,x=0,x=1
再求二阶导数:
f′′(x)=12x2−4
在 x=−1:
f′′(−1)=8>0
所以 x=−1 是极小值点。
在 x=1:
f′′(1)=8>0
所以 x=1 是极小值点。
在 x=0:
f′′(0)=−4<0
所以 x=0 是极大值点。
答案:x=±1 是极小值点,x=0 是极大值点。
模型连接:非凸损失可能有多个谷和山。深度学习优化不是只面对一个碗形函数,而是在复杂地形上找低损失区域。
四、不定积分与定积分:从局部变化到累计量
16. 一个常见换元积分
题目:求不定积分
∫1+x2xdx
解答:
令:
u=1+x2
则:
du=2xdx
所以:
xdx=21du
原积分变为:
∫1+x2xdx=21∫u1du=21ln∣u∣+C
代回:
21ln(1+x2)+C
答案:
21ln(1+x2)+C
模型连接:换元积分对应“换坐标看问题”。概率分布变换、归一化常数、连续变量建模都需要这种能力。
17. 分部积分入门
题目:求
∫xexdx
解答:
用分部积分公式:
∫udv=uv−∫vdu
取:
u=x,dv=exdx
则:
du=dx,v=ex
所以:
∫xexdx=xex−∫exdx=xex−ex+C
答案:
ex(x−1)+C
模型连接:分部积分背后是“乘积求导的反向使用”。连续概率、变分推导、物理启发的机器学习里经常会出现这种技巧。
18. 计算一个简单平均值
题目:求函数 f(x)=x2 在区间 [0,1] 上的平均值。
解答:
函数在 [a,b] 上的平均值为:
fˉ=b−a1∫abf(x)dx
这里:
fˉ=1−01∫01x2dx
计算:
∫01x2dx=3x301=31
所以平均值为:
31
答案:
31
模型连接:训练损失就是样本损失的平均。连续情形下,“平均损失”会变成积分,这题是期望和风险函数的前置概念。
19. 用定积分看归一化常数
题目:设
p(x)=cx,0≤x≤1
若 p(x) 是区间 [0,1] 上的概率密度,求 c。
解答:
概率密度的总面积必须等于 1:
∫01p(x)dx=1
代入:
∫01cxdx=1
计算:
c2x201=1
所以:
2c=1
得到:
c=2
答案:
c=2
模型连接:概率密度必须归一化,softmax 也必须归一化。一个是连续积分等于 1,一个是离散求和等于 1。
20. 计算连续随机变量的期望
题目:接上一题,若 p(x)=2x,0≤x≤1,求 X 的期望。
解答:
连续随机变量的期望为:
E[X]=∫01xp(x)dx
代入 p(x)=2x:
E[X]=∫01x⋅2xdx=∫012x2dx
计算:
∫012x2dx=23x301=32
答案:
E[X]=32
模型连接:机器学习里的期望风险、平均预测、连续分布采样都要用期望。积分就是连续版“加权平均”。
21. 由速度求位移
题目:某训练指标的变化率可近似为
v(t)=3e−t,t≥0
求从 t=0 到 t=T 的累计变化量。
解答:
累计变化量就是速度积分:
Δ=∫0T3e−tdt
计算:
∫3e−tdt=−3e−t+C
所以:
Δ=−3e−t0T=−3e−T+3=3(1−e−T)
答案:
3(1−e−T)
模型连接:很多训练收益是前期快、后期慢。指数衰减积分告诉你:继续训练会有收益,但边际收益越来越小。
22. 用积分估计面积和累计损失
题目:计算
∫02∣x−1∣dx
解答:
绝对值函数在 x=1 处分段:
当 0≤x<1 时:
∣x−1∣=1−x
当 1≤x≤2 时:
∣x−1∣=x−1
所以:
∫02∣x−1∣dx=∫01(1−x)dx+∫12(x−1)dx
第一项:
∫01(1−x)dx=x−2x201=21
第二项:
∫12(x−1)dx=2(x−1)212=21
总和:
1
答案:
1
模型连接:绝对值对应 L1 损失。它不像平方损失那样对大误差特别敏感,因此在鲁棒回归里常见。
五、微分方程:训练过程的连续化视角
23. 指数衰减方程
题目:解微分方程
dtdy=−ky,k>0,y(0)=y0
解答:
分离变量:
y1dy=−kdt
两边积分:
∫y1dy=∫−kdt
得到:
ln∣y∣=−kt+C
两边取指数:
y=Ce−kt
由初值 y(0)=y0:
y0=C
所以:
y(t)=y0e−kt
答案:
y(t)=y0e−kt
模型连接:这是衰减过程的基本模型。学习率衰减、权重衰减、误差指数下降都可以从这个方程获得直觉。
24. 连续梯度下降的最小模型
题目:设损失函数
L(w)=21w2
连续梯度下降满足:
dtdw=−L′(w)
求 w(t),已知 w(0)=w0。
解答:
先求导:
L′(w)=w
所以微分方程为:
dtdw=−w
这就是上一题 k=1 的指数衰减方程,因此:
w(t)=w0e−t
答案:
w(t)=w0e−t
模型连接:梯度下降可以看成沿损失下降的动力系统。这个最简单例子说明:在碗形损失里,参数会指数式靠近最优点。
25. 带外力项的训练动态
题目:解
dtdy+y=e−t,y(0)=0
解答:
这是线性一阶微分方程。注意左侧若乘以 et:
etdtdy+ety
而:
dtd(ety)=etdtdy+ety
所以方程两边乘以 et:
dtd(ety)=ete−t=1
两边积分:
ety=t+C
所以:
y=(t+C)e−t
代入初值 y(0)=0:
0=(0+C)e0
所以 C=0。
答案:
y=te−t
模型连接:训练不是只有单纯衰减,也可能有“驱动力”和“阻尼”同时存在。这个方程的解先上升后下降,很像很多指标先积累、再被衰减机制压下去。
上册 25 题的主线
如果只记一条线:
极限让你看局部,导数让你知道往哪变,Taylor 让你近似损失,积分让你从局部累计到整体,微分方程让你把训练过程看成随时间变化的系统。
这就是同济高数上册对模型学习最值得保留的骨架。
参考