这是“线性代数到模型学习 50 题”的下篇,覆盖第 26 到 50 题。
上篇讲矩阵、方程组、秩、子空间和最小二乘。本文继续往模型学习最常见的线性代数工具走:特征值、对角化、二次型、正交投影、PCA、SVD、线性变换、低秩更新。
如果说上篇回答“模型怎么算”,这篇回答:
模型里的方向、曲率、压缩、稳定性、低秩结构到底怎么用线性代数看
flowchart LR
A["特征值"] --> B["动力系统稳定性"]
B --> C["二次型和正定性"]
C --> D["投影和最小二乘"]
D --> E["PCA/SVD"]
E --> F["低秩压缩和 LoRA"]
排版约定:公式块里不放句号或逗号,避免标点被渲染进公式;每题固定为 题目 / 解答 / 答案 / 模型连接。
一、特征值与特征向量:矩阵最偏爱的方向
26. 求二阶矩阵的特征值
题目:求矩阵
A=[2003]
的特征值。
解答:
特征值满足:
det(A−λI)=0
先写:
A−λI=[2−λ003−λ]
行列式为:
det(A−λI)=(2−λ)(3−λ)
令其为 0:
(2−λ)(3−λ)=0
所以:
λ1=2,λ2=3
答案:
2,3
模型连接:对角矩阵最容易看懂:它沿不同坐标轴分别缩放。特征值就是这些特殊方向上的缩放倍数。
27. 求特征向量
题目:对矩阵
A=[2013]
求特征值 λ=2 对应的特征向量。
解答:
特征向量满足:
(A−2I)x=0
计算:
A−2I=[0011]
设:
x=[xy]
方程为:
y=0
x 可以任取非零数,所以特征向量为:
x=t[10],t=0
答案:
span{[10]}
去掉零向量后都是对应特征向量。
模型连接:特征向量是经过矩阵变换后方向不变的向量。理解它,就能理解为什么 PCA 会找“最稳定、最重要”的方向。
28. 用特征值看反复迭代
题目:设
A=[0.5002],x0=[11]
求 Anx0。
解答:
对角矩阵的幂很简单:
An=[0.5n002n]
所以:
Anx0=[0.5n002n][11]=[0.5n2n]
答案:
Anx0=[0.5n2n]
模型连接:反复乘矩阵时,特征值大于 1 的方向会放大,小于 1 的方向会衰减。RNN 梯度爆炸和梯度消失可以先用这个模型理解。
29. 对角化的基本计算
题目:若
A=PDP−1,D=[2003]
求 A5 的表达式。
解答:
因为:
A=PDP−1
所以:
A2=PDP−1PDP−1=PD2P−1
中间的 P−1P 抵消为 I。同理:
A5=PD5P−1
而:
D5=[250035]=[3200243]
所以:
A5=P[3200243]P−1
答案:
A5=P[3200243]P−1
模型连接:对角化就是换到矩阵最容易理解的坐标系。很多复杂动态在特征向量坐标下会变成“各方向独立缩放”。
30. 对称矩阵的特征向量正交
题目:验证矩阵
A=[2003]
的两个特征方向正交。
解答:
该矩阵的两个特征方向分别是:
e1=[10],e2=[01]
计算点积:
e1⊤e2=1⋅0+0⋅1=0
点积为 0,说明它们正交。
答案:两个特征方向正交。
模型连接:实对称矩阵有一组正交特征向量。PCA、协方差矩阵、Hessian 分析都特别依赖这个性质。
二、二次型与正定性:损失曲面的形状
31. 计算二次型
题目:设
A=[2005],x=[34]
求 x⊤Ax。
解答:
先算:
Ax=[2005][34]=[620]
再算:
x⊤Ax=[34][620]=18+80=98
答案:
98
模型连接:二次型是局部损失曲面的标准形状。Taylor 二阶项常写成 Δw⊤HΔw。
32. 判断二次型是否正定
题目:判断
A=[2005]
是否正定。
解答:
对任意非零向量:
x=[xy]
有:
x⊤Ax=2x2+5y2
只要 (x,y)=(0,0),则 x2 和 y2 不会同时为 0,所以:
2x2+5y2>0
因此 A 正定。
答案:A 正定。
模型连接:正定 Hessian 表示当前位置像一个向上开的碗,是局部极小点的典型条件。
33. 用主子式判断正定
题目:判断
A=[2112]
是否正定。
解答:
二阶实对称矩阵正定可用顺序主子式判断。
第一阶主子式:
Δ1=2>0
第二阶主子式,即行列式:
Δ2=det(A)=2⋅2−1⋅1=3>0
两个顺序主子式都大于 0,所以 A 正定。
答案:A 正定。
模型连接:正定矩阵定义了一种“合理的距离”或“能量”。协方差、Mahalanobis 距离、二阶优化都用到这类矩阵。
34. 二次型配方
题目:化简二次型
q(x,y)=x2+2xy+y2
并判断其是否正定。
解答:
观察:
x2+2xy+y2=(x+y)2
所以:
q(x,y)=(x+y)2
它总是非负:
q(x,y)≥0
但当 x=1,y=−1 时:
q(1,−1)=0
而 (1,−1) 不是零向量。因此它不是正定,只是半正定。
答案:q(x,y) 半正定,不是正定。
模型连接:半正定意味着有些非零方向上的曲率为 0。损失曲面里这类平坦方向很常见,尤其在过参数化模型中。
35. Hessian 的特征值与曲率
题目:设某损失在一点附近的 Hessian 为
H=[10000.1]
哪个方向曲率更大?
解答:
该矩阵已经是对角矩阵。两个坐标方向的曲率分别是:
10
和:
0.1
第一个方向曲率更大,说明沿第一坐标方向损失变化更陡。
答案:第一坐标方向曲率更大。
模型连接:优化时如果不同方向曲率差距很大,梯度下降会很难调学习率。学习率太大可能在陡方向震荡,太小又会在平方向走得很慢。
三、正交、投影与最小二乘
36. 正交矩阵保持长度
题目:设
Q=[01−10]
验证它保持向量长度。
解答:
正交矩阵满足:
Q⊤Q=I
先算:
Q⊤=[0−110]
于是:
Q⊤Q=[0−110][01−10]=[1001]
所以 Q 是正交矩阵。对任意 x:
∥Qx∥2=(Qx)⊤(Qx)=x⊤Q⊤Qx=x⊤x=∥x∥2
答案:Q 保持长度。
模型连接:正交变换不会放大或缩小向量长度。初始化、旋转位置编码、稳定训练都关心这种性质。
37. 投影到一条直线
题目:将
y=[34]
投影到
u=[10]
张成的直线上。
解答:
投影公式:
projuy=u⊤uu⊤yu
计算:
u⊤y=3,u⊤u=1
所以:
projuy=3[10]=[30]
答案:
[30]
模型连接:投影是把信息保留到某个子空间。PCA、低秩压缩、表示降维都可以看作找一个好子空间再投影。
38. Gram-Schmidt 正交化
题目:对
a1=(1,1),a2=(1,0)
做 Gram-Schmidt,求一组正交向量。
解答:
取:
u1=a1=(1,1)
将 a2 减去它在 u1 上的投影:
u2=a2−u1⋅u1a2⋅u1u1
计算:
a2⋅u1=1,u1⋅u1=2
所以:
u2=(1,0)−21(1,1)=(21,−21)
验证正交:
(1,1)⋅(21,−21)=0
答案:
u1=(1,1),u2=(21,−21)
模型连接:正交化能消除重复方向。很多数值算法会尽量保持向量正交,避免信息混在一起导致不稳定。
39. 最小二乘的投影解释
题目:求点
y=123
到向量
a=111
张成直线上的投影。
解答:
投影为:
y^=a⊤aa⊤ya
计算:
a⊤y=1+2+3=6
a⊤a=1+1+1=3
所以:
y^=2a=222
答案:
222
模型连接:最小二乘就是把目标投影到模型能表达的子空间里。模型表达能力有限时,只能找最近的可表达输出。
40. 投影误差与正交性
题目:接上一题,求误差
e=y−y^
并验证它与 a 正交。
解答:
由上一题:
y^=222
所以:
e=123−222=−101
验证:
a⊤e=(1,1,1)⋅(−1,0,1)=0
答案:
e=−101,a⊤e=0
模型连接:最小二乘解的残差与模型子空间正交。这是正规方程 A⊤(Ax−b)=0 的几何意义。
四、PCA、SVD 与低秩结构
41. 协方差矩阵的直觉
题目:两个中心化样本为
x1=[11],x2=[−1−1]
计算未除以样本数的散布矩阵
S=x1x1⊤+x2x2⊤
解答:
先算:
x1x1⊤=[11][11]=[1111]
再算:
x2x2⊤=[−1−1][−1−1]=[1111]
相加:
S=[2222]
答案:
S=[2222]
模型连接:协方差矩阵描述数据在哪些方向变化大。PCA 会找最大变化方向,这里数据主要沿 (1,1) 方向变化。
42. PCA 第一主成分
题目:对矩阵
S=[2222]
求最大特征值对应的方向。
解答:
观察:
S[11]=[44]=4[11]
所以 (1,1) 是特征方向,特征值为 4。
再看:
S[1−1]=[00]
另一个方向特征值为 0。
最大特征值为 4,对应方向为 (1,1)。单位化后:
21[11]
答案:
21[11]
模型连接:PCA 第一主成分就是数据变化最大的方向。表示学习和降维都依赖“主要信息方向”的概念。
43. SVD 的最小例子
题目:写出
A=[3001]
的一个 SVD。
解答:
这个矩阵已经是对角且对角元素非负。SVD 形式为:
A=UΣV⊤
可以取:
U=I,Σ=[3001],V=I
于是:
UΣV⊤=IΣI=Σ=A
答案:
A=I[3001]I⊤
模型连接:SVD 把矩阵拆成输入方向、缩放强度、输出方向。奇异值越大,表示该方向越重要。
44. 低秩近似
题目:对
A=[3001]
给出保留最大奇异值的秩 1 近似。
解答:
该矩阵奇异值为 3 和 1。保留最大奇异值 3,对应第一坐标方向。
秩 1 近似为:
A1=[3000]
它只保留最重要的方向,丢掉第二个较小方向。
答案:
A1=[3000]
模型连接:低秩近似是模型压缩的核心思想之一。大矩阵里如果只有少数方向重要,就可以用更小的矩阵近似。
45. LoRA 参数量对比
题目:一个权重矩阵为
W∈R1000×1000
若用秩 r=4 的 LoRA 更新:
ΔW=BA,B∈R1000×4,A∈R4×1000
求原矩阵参数量和 LoRA 更新参数量。
解答:
原矩阵参数量:
1000×1000=1,000,000
LoRA 中 B 的参数量:
1000×4=4,000
A 的参数量:
4×1000=4,000
合计:
4,000+4,000=8,000
答案:原矩阵 1,000,000 个参数,LoRA 更新 8,000 个参数。
模型连接:LoRA 的关键就是低秩更新。它不直接训练完整大矩阵,而是训练两个小矩阵,显著减少可训练参数量。
五、线性空间、线性变换与稳定性
46. 判断集合是否为子空间
题目:判断集合
S={(x,y)∈R2∣x+y=1}
是否为 R2 的子空间。
解答:
子空间必须包含零向量。
零向量为:
(0,0)
代入条件:
0+0=0=1
所以零向量不在集合中。该集合不是子空间。
答案:不是子空间。
模型连接:子空间必须过原点。仿射空间可以不经过原点,线性层加 bias 后得到的就是仿射变换,不再是纯线性变换。
47. 判断映射是否线性
题目:判断
T(x,y)=(x+y, 2x)
是否为线性变换。
解答:
若 T 能写成矩阵乘法形式,就是线性的。这里:
T(x,y)=[1210][xy]
因此它是线性变换。
答案:是线性变换。
模型连接:没有激活函数时,神经网络层就是线性变换或仿射变换。多层线性层叠在一起仍然是线性层,所以非线性激活很关键。
48. 非线性映射的反例
题目:判断
T(x,y)=(x2,y)
是否为线性变换。
解答:
线性变换必须满足齐次性:
T(cx)=cT(x)
取:
x=(1,0),c=2
则:
T(2,0)=(4,0)
而:
2T(1,0)=2(1,0)=(2,0)
两者不相等,所以不是线性变换。
答案:不是线性变换。
模型连接:激活函数引入非线性。没有非线性,神经网络再深也只是一个大矩阵。
49. 谱半径与稳定性
题目:设
A=[0.8000.5]
判断迭代
xt+1=Axt
是否会趋向零。
解答:
该矩阵特征值为:
0.8,0.5
谱半径是特征值绝对值的最大值:
ρ(A)=0.8
因为:
ρ(A)<1
反复迭代时每个特征方向都会衰减,所以 xt 会趋向零。
答案:会趋向零。
模型连接:递归网络、线性动力系统、梯度传播都关心谱半径。谱半径小于 1 容易衰减,大于 1 容易爆炸。
50. 中心化矩阵
题目:对三维向量
x=124
求去均值后的向量。
解答:
先求均值:
xˉ=31+2+4=37
每个分量减去均值:
xc=1−372−374−37=−34−3135
检查中心化后求和:
−34−31+35=0
答案:
−34−3135
模型连接:中心化是 PCA、协方差、LayerNorm 的基础动作之一。先把均值移走,才能更清楚地看变化方向。
两篇 50 题的模型学习主线
如果只按模型学习价值复盘,线性代数可以压成七句话:
- 矩阵乘法:神经网络前向计算。
- 点积和范数:相似度、注意力和归一化。
- 秩和子空间:信息维度、冗余和压缩。
- 最小二乘和投影:监督学习的几何原型。
- 特征值和谱半径:动态系统稳定性。
- 二次型和正定性:损失曲面的曲率。
- SVD/PCA/低秩:表示学习、降维、LoRA 和模型压缩。
线性代数不是一堆矩阵计算技巧,而是一套看模型内部表示的语言。
参考