线性代数到模型学习:从特征值到低秩压缩的25道题

承接线代上篇,围绕特征值、对角化、二次型、正交投影、PCA、SVD、线性变换和低秩更新设计第26到50题,服务大模型学习。

这是“线性代数到模型学习 50 题”的下篇,覆盖第 26 到 50 题。

上篇讲矩阵、方程组、秩、子空间和最小二乘。本文继续往模型学习最常见的线性代数工具走:特征值、对角化、二次型、正交投影、PCA、SVD、线性变换、低秩更新。

如果说上篇回答“模型怎么算”,这篇回答:

模型里的方向、曲率、压缩、稳定性、低秩结构到底怎么用线性代数看

flowchart LR
  A["特征值"] --> B["动力系统稳定性"]
  B --> C["二次型和正定性"]
  C --> D["投影和最小二乘"]
  D --> E["PCA/SVD"]
  E --> F["低秩压缩和 LoRA"]

排版约定:公式块里不放句号或逗号,避免标点被渲染进公式;每题固定为 题目 / 解答 / 答案 / 模型连接

一、特征值与特征向量:矩阵最偏爱的方向

26. 求二阶矩阵的特征值

题目:求矩阵

A=[2003]A= \begin{bmatrix} 2 & 0\\ 0 & 3 \end{bmatrix}

的特征值。

解答

特征值满足:

det(AλI)=0\det(A-\lambda I)=0

先写:

AλI=[2λ003λ]A-\lambda I= \begin{bmatrix} 2-\lambda & 0\\ 0 & 3-\lambda \end{bmatrix}

行列式为:

det(AλI)=(2λ)(3λ)\det(A-\lambda I)=(2-\lambda)(3-\lambda)

令其为 0:

(2λ)(3λ)=0(2-\lambda)(3-\lambda)=0

所以:

λ1=2,λ2=3\lambda_1=2,\quad \lambda_2=3

答案

2,32,\quad 3

模型连接:对角矩阵最容易看懂:它沿不同坐标轴分别缩放。特征值就是这些特殊方向上的缩放倍数。

27. 求特征向量

题目:对矩阵

A=[2103]A= \begin{bmatrix} 2 & 1\\ 0 & 3 \end{bmatrix}

求特征值 λ=2\lambda=2 对应的特征向量。

解答

特征向量满足:

(A2I)x=0(A-2I)\mathbf x=0

计算:

A2I=[0101]A-2I= \begin{bmatrix} 0 & 1\\ 0 & 1 \end{bmatrix}

设:

x=[xy]\mathbf x= \begin{bmatrix} x\\ y \end{bmatrix}

方程为:

y=0y=0

xx 可以任取非零数,所以特征向量为:

x=t[10],t0\mathbf x=t \begin{bmatrix} 1\\ 0 \end{bmatrix}, \quad t\ne 0

答案

span{[10]}\operatorname{span} \left\{ \begin{bmatrix} 1\\ 0 \end{bmatrix} \right\}

去掉零向量后都是对应特征向量。

模型连接:特征向量是经过矩阵变换后方向不变的向量。理解它,就能理解为什么 PCA 会找“最稳定、最重要”的方向。

28. 用特征值看反复迭代

题目:设

A=[0.5002],x0=[11]A= \begin{bmatrix} 0.5 & 0\\ 0 & 2 \end{bmatrix}, \quad \mathbf x_0= \begin{bmatrix} 1\\ 1 \end{bmatrix}

Anx0A^n\mathbf x_0

解答

对角矩阵的幂很简单:

An=[0.5n002n]A^n= \begin{bmatrix} 0.5^n & 0\\ 0 & 2^n \end{bmatrix}

所以:

Anx0=[0.5n002n][11]=[0.5n2n]A^n\mathbf x_0 = \begin{bmatrix} 0.5^n & 0\\ 0 & 2^n \end{bmatrix} \begin{bmatrix} 1\\ 1 \end{bmatrix} = \begin{bmatrix} 0.5^n\\ 2^n \end{bmatrix}

答案

Anx0=[0.5n2n]A^n\mathbf x_0= \begin{bmatrix} 0.5^n\\ 2^n \end{bmatrix}

模型连接:反复乘矩阵时,特征值大于 1 的方向会放大,小于 1 的方向会衰减。RNN 梯度爆炸和梯度消失可以先用这个模型理解。

29. 对角化的基本计算

题目:若

A=PDP1,D=[2003]A=PDP^{-1}, \quad D= \begin{bmatrix} 2 & 0\\ 0 & 3 \end{bmatrix}

A5A^5 的表达式。

解答

因为:

A=PDP1A=PDP^{-1}

所以:

A2=PDP1PDP1=PD2P1A^2=PDP^{-1}PDP^{-1}=PD^2P^{-1}

中间的 P1PP^{-1}P 抵消为 II。同理:

A5=PD5P1A^5=PD^5P^{-1}

而:

D5=[250035]=[3200243]D^5= \begin{bmatrix} 2^5 & 0\\ 0 & 3^5 \end{bmatrix} = \begin{bmatrix} 32 & 0\\ 0 & 243 \end{bmatrix}

所以:

A5=P[3200243]P1A^5= P \begin{bmatrix} 32 & 0\\ 0 & 243 \end{bmatrix} P^{-1}

答案

A5=P[3200243]P1A^5= P \begin{bmatrix} 32 & 0\\ 0 & 243 \end{bmatrix} P^{-1}

模型连接:对角化就是换到矩阵最容易理解的坐标系。很多复杂动态在特征向量坐标下会变成“各方向独立缩放”。

30. 对称矩阵的特征向量正交

题目:验证矩阵

A=[2003]A= \begin{bmatrix} 2 & 0\\ 0 & 3 \end{bmatrix}

的两个特征方向正交。

解答

该矩阵的两个特征方向分别是:

e1=[10],e2=[01]\mathbf e_1= \begin{bmatrix} 1\\ 0 \end{bmatrix}, \quad \mathbf e_2= \begin{bmatrix} 0\\ 1 \end{bmatrix}

计算点积:

e1e2=10+01=0\mathbf e_1^\top \mathbf e_2 = 1\cdot0+0\cdot1=0

点积为 0,说明它们正交。

答案:两个特征方向正交。

模型连接:实对称矩阵有一组正交特征向量。PCA、协方差矩阵、Hessian 分析都特别依赖这个性质。

二、二次型与正定性:损失曲面的形状

31. 计算二次型

题目:设

A=[2005],x=[34]A= \begin{bmatrix} 2 & 0\\ 0 & 5 \end{bmatrix}, \quad \mathbf x= \begin{bmatrix} 3\\ 4 \end{bmatrix}

xAx\mathbf x^\top A\mathbf x

解答

先算:

Ax=[2005][34]=[620]A\mathbf x = \begin{bmatrix} 2 & 0\\ 0 & 5 \end{bmatrix} \begin{bmatrix} 3\\ 4 \end{bmatrix} = \begin{bmatrix} 6\\ 20 \end{bmatrix}

再算:

xAx=[34][620]=18+80=98\mathbf x^\top A\mathbf x = \begin{bmatrix} 3 & 4 \end{bmatrix} \begin{bmatrix} 6\\ 20 \end{bmatrix} = 18+80=98

答案

9898

模型连接:二次型是局部损失曲面的标准形状。Taylor 二阶项常写成 ΔwHΔw\Delta w^\top H\Delta w

32. 判断二次型是否正定

题目:判断

A=[2005]A= \begin{bmatrix} 2 & 0\\ 0 & 5 \end{bmatrix}

是否正定。

解答

对任意非零向量:

x=[xy]\mathbf x= \begin{bmatrix} x\\ y \end{bmatrix}

有:

xAx=2x2+5y2\mathbf x^\top A\mathbf x = 2x^2+5y^2

只要 (x,y)(0,0)(x,y)\ne(0,0),则 x2x^2y2y^2 不会同时为 0,所以:

2x2+5y2>02x^2+5y^2>0

因此 AA 正定。

答案AA 正定。

模型连接:正定 Hessian 表示当前位置像一个向上开的碗,是局部极小点的典型条件。

33. 用主子式判断正定

题目:判断

A=[2112]A= \begin{bmatrix} 2 & 1\\ 1 & 2 \end{bmatrix}

是否正定。

解答

二阶实对称矩阵正定可用顺序主子式判断。

第一阶主子式:

Δ1=2>0\Delta_1=2>0

第二阶主子式,即行列式:

Δ2=det(A)=2211=3>0\Delta_2= \det(A)=2\cdot2-1\cdot1=3>0

两个顺序主子式都大于 0,所以 AA 正定。

答案AA 正定。

模型连接:正定矩阵定义了一种“合理的距离”或“能量”。协方差、Mahalanobis 距离、二阶优化都用到这类矩阵。

34. 二次型配方

题目:化简二次型

q(x,y)=x2+2xy+y2q(x,y)=x^2+2xy+y^2

并判断其是否正定。

解答

观察:

x2+2xy+y2=(x+y)2x^2+2xy+y^2=(x+y)^2

所以:

q(x,y)=(x+y)2q(x,y)=(x+y)^2

它总是非负:

q(x,y)0q(x,y)\ge 0

但当 x=1,y=1x=1,y=-1 时:

q(1,1)=0q(1,-1)=0

(1,1)(1,-1) 不是零向量。因此它不是正定,只是半正定。

答案q(x,y)q(x,y) 半正定,不是正定。

模型连接:半正定意味着有些非零方向上的曲率为 0。损失曲面里这类平坦方向很常见,尤其在过参数化模型中。

35. Hessian 的特征值与曲率

题目:设某损失在一点附近的 Hessian 为

H=[10000.1]H= \begin{bmatrix} 10 & 0\\ 0 & 0.1 \end{bmatrix}

哪个方向曲率更大?

解答

该矩阵已经是对角矩阵。两个坐标方向的曲率分别是:

1010

和:

0.10.1

第一个方向曲率更大,说明沿第一坐标方向损失变化更陡。

答案:第一坐标方向曲率更大。

模型连接:优化时如果不同方向曲率差距很大,梯度下降会很难调学习率。学习率太大可能在陡方向震荡,太小又会在平方向走得很慢。

三、正交、投影与最小二乘

36. 正交矩阵保持长度

题目:设

Q=[0110]Q= \begin{bmatrix} 0 & -1\\ 1 & 0 \end{bmatrix}

验证它保持向量长度。

解答

正交矩阵满足:

QQ=IQ^\top Q=I

先算:

Q=[0110]Q^\top= \begin{bmatrix} 0 & 1\\ -1 & 0 \end{bmatrix}

于是:

QQ=[0110][0110]=[1001]Q^\top Q= \begin{bmatrix} 0 & 1\\ -1 & 0 \end{bmatrix} \begin{bmatrix} 0 & -1\\ 1 & 0 \end{bmatrix} = \begin{bmatrix} 1 & 0\\ 0 & 1 \end{bmatrix}

所以 QQ 是正交矩阵。对任意 x\mathbf x

Qx2=(Qx)(Qx)=xQQx=xx=x2\|Q\mathbf x\|^2 =(Q\mathbf x)^\top(Q\mathbf x) =\mathbf x^\top Q^\top Q\mathbf x =\mathbf x^\top\mathbf x =\|\mathbf x\|^2

答案QQ 保持长度。

模型连接:正交变换不会放大或缩小向量长度。初始化、旋转位置编码、稳定训练都关心这种性质。

37. 投影到一条直线

题目:将

y=[34]\mathbf y= \begin{bmatrix} 3\\ 4 \end{bmatrix}

投影到

u=[10]\mathbf u= \begin{bmatrix} 1\\ 0 \end{bmatrix}

张成的直线上。

解答

投影公式:

projuy=uyuuu\operatorname{proj}_{\mathbf u}\mathbf y = \frac{\mathbf u^\top\mathbf y}{\mathbf u^\top\mathbf u}\mathbf u

计算:

uy=3,uu=1\mathbf u^\top\mathbf y=3,\quad \mathbf u^\top\mathbf u=1

所以:

projuy=3[10]=[30]\operatorname{proj}_{\mathbf u}\mathbf y = 3 \begin{bmatrix} 1\\ 0 \end{bmatrix} = \begin{bmatrix} 3\\ 0 \end{bmatrix}

答案

[30]\begin{bmatrix} 3\\ 0 \end{bmatrix}

模型连接:投影是把信息保留到某个子空间。PCA、低秩压缩、表示降维都可以看作找一个好子空间再投影。

38. Gram-Schmidt 正交化

题目:对

a1=(1,1),a2=(1,0)\mathbf a_1=(1,1), \quad \mathbf a_2=(1,0)

做 Gram-Schmidt,求一组正交向量。

解答

取:

u1=a1=(1,1)\mathbf u_1=\mathbf a_1=(1,1)

a2\mathbf a_2 减去它在 u1\mathbf u_1 上的投影:

u2=a2a2u1u1u1u1\mathbf u_2 = \mathbf a_2-\frac{\mathbf a_2\cdot\mathbf u_1}{\mathbf u_1\cdot\mathbf u_1}\mathbf u_1

计算:

a2u1=1,u1u1=2\mathbf a_2\cdot\mathbf u_1=1,\quad \mathbf u_1\cdot\mathbf u_1=2

所以:

u2=(1,0)12(1,1)=(12,12)\mathbf u_2=(1,0)-\frac{1}{2}(1,1) = \left(\frac{1}{2},-\frac{1}{2}\right)

验证正交:

(1,1)(12,12)=0(1,1)\cdot\left(\frac{1}{2},-\frac{1}{2}\right)=0

答案

u1=(1,1),u2=(12,12)\mathbf u_1=(1,1), \quad \mathbf u_2=\left(\frac{1}{2},-\frac{1}{2}\right)

模型连接:正交化能消除重复方向。很多数值算法会尽量保持向量正交,避免信息混在一起导致不稳定。

39. 最小二乘的投影解释

题目:求点

y=[123]\mathbf y= \begin{bmatrix} 1\\ 2\\ 3 \end{bmatrix}

到向量

a=[111]\mathbf a= \begin{bmatrix} 1\\ 1\\ 1 \end{bmatrix}

张成直线上的投影。

解答

投影为:

y^=ayaaa\hat{\mathbf y} = \frac{\mathbf a^\top\mathbf y}{\mathbf a^\top\mathbf a}\mathbf a

计算:

ay=1+2+3=6\mathbf a^\top\mathbf y=1+2+3=6 aa=1+1+1=3\mathbf a^\top\mathbf a=1+1+1=3

所以:

y^=2a=[222]\hat{\mathbf y}=2\mathbf a = \begin{bmatrix} 2\\ 2\\ 2 \end{bmatrix}

答案

[222]\begin{bmatrix} 2\\ 2\\ 2 \end{bmatrix}

模型连接:最小二乘就是把目标投影到模型能表达的子空间里。模型表达能力有限时,只能找最近的可表达输出。

40. 投影误差与正交性

题目:接上一题,求误差

e=yy^\mathbf e=\mathbf y-\hat{\mathbf y}

并验证它与 a\mathbf a 正交。

解答

由上一题:

y^=[222]\hat{\mathbf y}= \begin{bmatrix} 2\\ 2\\ 2 \end{bmatrix}

所以:

e=[123][222]=[101]\mathbf e= \begin{bmatrix} 1\\ 2\\ 3 \end{bmatrix} - \begin{bmatrix} 2\\ 2\\ 2 \end{bmatrix} = \begin{bmatrix} -1\\ 0\\ 1 \end{bmatrix}

验证:

ae=(1,1,1)(1,0,1)=0\mathbf a^\top\mathbf e = (1,1,1)\cdot(-1,0,1) =0

答案

e=[101],ae=0\mathbf e= \begin{bmatrix} -1\\ 0\\ 1 \end{bmatrix}, \quad \mathbf a^\top\mathbf e=0

模型连接:最小二乘解的残差与模型子空间正交。这是正规方程 A(Axb)=0A^\top(Ax-b)=0 的几何意义。

四、PCA、SVD 与低秩结构

41. 协方差矩阵的直觉

题目:两个中心化样本为

x1=[11],x2=[11]\mathbf x_1= \begin{bmatrix} 1\\ 1 \end{bmatrix}, \quad \mathbf x_2= \begin{bmatrix} -1\\ -1 \end{bmatrix}

计算未除以样本数的散布矩阵

S=x1x1+x2x2S=\mathbf x_1\mathbf x_1^\top+\mathbf x_2\mathbf x_2^\top

解答

先算:

x1x1=[11][11]=[1111]\mathbf x_1\mathbf x_1^\top = \begin{bmatrix} 1\\ 1 \end{bmatrix} \begin{bmatrix} 1 & 1 \end{bmatrix} = \begin{bmatrix} 1 & 1\\ 1 & 1 \end{bmatrix}

再算:

x2x2=[11][11]=[1111]\mathbf x_2\mathbf x_2^\top = \begin{bmatrix} -1\\ -1 \end{bmatrix} \begin{bmatrix} -1 & -1 \end{bmatrix} = \begin{bmatrix} 1 & 1\\ 1 & 1 \end{bmatrix}

相加:

S=[2222]S= \begin{bmatrix} 2 & 2\\ 2 & 2 \end{bmatrix}

答案

S=[2222]S= \begin{bmatrix} 2 & 2\\ 2 & 2 \end{bmatrix}

模型连接:协方差矩阵描述数据在哪些方向变化大。PCA 会找最大变化方向,这里数据主要沿 (1,1)(1,1) 方向变化。

42. PCA 第一主成分

题目:对矩阵

S=[2222]S= \begin{bmatrix} 2 & 2\\ 2 & 2 \end{bmatrix}

求最大特征值对应的方向。

解答

观察:

S[11]=[44]=4[11]S \begin{bmatrix} 1\\ 1 \end{bmatrix} = \begin{bmatrix} 4\\ 4 \end{bmatrix} = 4 \begin{bmatrix} 1\\ 1 \end{bmatrix}

所以 (1,1)(1,1) 是特征方向,特征值为 4。

再看:

S[11]=[00]S \begin{bmatrix} 1\\ -1 \end{bmatrix} = \begin{bmatrix} 0\\ 0 \end{bmatrix}

另一个方向特征值为 0。

最大特征值为 4,对应方向为 (1,1)(1,1)。单位化后:

12[11]\frac{1}{\sqrt2} \begin{bmatrix} 1\\ 1 \end{bmatrix}

答案

12[11]\frac{1}{\sqrt2} \begin{bmatrix} 1\\ 1 \end{bmatrix}

模型连接:PCA 第一主成分就是数据变化最大的方向。表示学习和降维都依赖“主要信息方向”的概念。

43. SVD 的最小例子

题目:写出

A=[3001]A= \begin{bmatrix} 3 & 0\\ 0 & 1 \end{bmatrix}

的一个 SVD。

解答

这个矩阵已经是对角且对角元素非负。SVD 形式为:

A=UΣVA=U\Sigma V^\top

可以取:

U=I,Σ=[3001],V=IU=I, \quad \Sigma= \begin{bmatrix} 3 & 0\\ 0 & 1 \end{bmatrix}, \quad V=I

于是:

UΣV=IΣI=Σ=AU\Sigma V^\top=I\Sigma I=\Sigma=A

答案

A=I[3001]IA=I \begin{bmatrix} 3 & 0\\ 0 & 1 \end{bmatrix} I^\top

模型连接:SVD 把矩阵拆成输入方向、缩放强度、输出方向。奇异值越大,表示该方向越重要。

44. 低秩近似

题目:对

A=[3001]A= \begin{bmatrix} 3 & 0\\ 0 & 1 \end{bmatrix}

给出保留最大奇异值的秩 1 近似。

解答

该矩阵奇异值为 3 和 1。保留最大奇异值 3,对应第一坐标方向。

秩 1 近似为:

A1=[3000]A_1= \begin{bmatrix} 3 & 0\\ 0 & 0 \end{bmatrix}

它只保留最重要的方向,丢掉第二个较小方向。

答案

A1=[3000]A_1= \begin{bmatrix} 3 & 0\\ 0 & 0 \end{bmatrix}

模型连接:低秩近似是模型压缩的核心思想之一。大矩阵里如果只有少数方向重要,就可以用更小的矩阵近似。

45. LoRA 参数量对比

题目:一个权重矩阵为

WR1000×1000W\in\mathbb R^{1000\times 1000}

若用秩 r=4r=4 的 LoRA 更新:

ΔW=BA,BR1000×4,AR4×1000\Delta W=BA, \quad B\in\mathbb R^{1000\times 4}, \quad A\in\mathbb R^{4\times 1000}

求原矩阵参数量和 LoRA 更新参数量。

解答

原矩阵参数量:

1000×1000=1,000,0001000\times1000=1,000,000

LoRA 中 BB 的参数量:

1000×4=4,0001000\times4=4,000

AA 的参数量:

4×1000=4,0004\times1000=4,000

合计:

4,000+4,000=8,0004,000+4,000=8,000

答案:原矩阵 1,000,000 个参数,LoRA 更新 8,000 个参数。

模型连接:LoRA 的关键就是低秩更新。它不直接训练完整大矩阵,而是训练两个小矩阵,显著减少可训练参数量。

五、线性空间、线性变换与稳定性

46. 判断集合是否为子空间

题目:判断集合

S={(x,y)R2x+y=1}S=\{(x,y)\in\mathbb R^2\mid x+y=1\}

是否为 R2\mathbb R^2 的子空间。

解答

子空间必须包含零向量。

零向量为:

(0,0)(0,0)

代入条件:

0+0=010+0=0\ne 1

所以零向量不在集合中。该集合不是子空间。

答案:不是子空间。

模型连接:子空间必须过原点。仿射空间可以不经过原点,线性层加 bias 后得到的就是仿射变换,不再是纯线性变换。

47. 判断映射是否线性

题目:判断

T(x,y)=(x+y, 2x)T(x,y)=(x+y,\ 2x)

是否为线性变换。

解答

TT 能写成矩阵乘法形式,就是线性的。这里:

T(x,y)=[1120][xy]T(x,y) = \begin{bmatrix} 1 & 1\\ 2 & 0 \end{bmatrix} \begin{bmatrix} x\\ y \end{bmatrix}

因此它是线性变换。

答案:是线性变换。

模型连接:没有激活函数时,神经网络层就是线性变换或仿射变换。多层线性层叠在一起仍然是线性层,所以非线性激活很关键。

48. 非线性映射的反例

题目:判断

T(x,y)=(x2,y)T(x,y)=(x^2,y)

是否为线性变换。

解答

线性变换必须满足齐次性:

T(cx)=cT(x)T(c\mathbf x)=cT(\mathbf x)

取:

x=(1,0),c=2\mathbf x=(1,0), \quad c=2

则:

T(2,0)=(4,0)T(2,0)=(4,0)

而:

2T(1,0)=2(1,0)=(2,0)2T(1,0)=2(1,0)=(2,0)

两者不相等,所以不是线性变换。

答案:不是线性变换。

模型连接:激活函数引入非线性。没有非线性,神经网络再深也只是一个大矩阵。

49. 谱半径与稳定性

题目:设

A=[0.8000.5]A= \begin{bmatrix} 0.8 & 0\\ 0 & 0.5 \end{bmatrix}

判断迭代

xt+1=Axt\mathbf x_{t+1}=A\mathbf x_t

是否会趋向零。

解答

该矩阵特征值为:

0.8,0.50.8,\quad 0.5

谱半径是特征值绝对值的最大值:

ρ(A)=0.8\rho(A)=0.8

因为:

ρ(A)<1\rho(A)<1

反复迭代时每个特征方向都会衰减,所以 xt\mathbf x_t 会趋向零。

答案:会趋向零。

模型连接:递归网络、线性动力系统、梯度传播都关心谱半径。谱半径小于 1 容易衰减,大于 1 容易爆炸。

50. 中心化矩阵

题目:对三维向量

x=[124]\mathbf x= \begin{bmatrix} 1\\ 2\\ 4 \end{bmatrix}

求去均值后的向量。

解答

先求均值:

xˉ=1+2+43=73\bar x=\frac{1+2+4}{3}=\frac{7}{3}

每个分量减去均值:

xc=[173273473]=[431353]\mathbf x_c= \begin{bmatrix} 1-\frac{7}{3}\\ 2-\frac{7}{3}\\ 4-\frac{7}{3} \end{bmatrix} = \begin{bmatrix} -\frac{4}{3}\\ -\frac{1}{3}\\ \frac{5}{3} \end{bmatrix}

检查中心化后求和:

4313+53=0-\frac{4}{3}-\frac{1}{3}+\frac{5}{3}=0

答案

[431353]\begin{bmatrix} -\frac{4}{3}\\ -\frac{1}{3}\\ \frac{5}{3} \end{bmatrix}

模型连接:中心化是 PCA、协方差、LayerNorm 的基础动作之一。先把均值移走,才能更清楚地看变化方向。

两篇 50 题的模型学习主线

如果只按模型学习价值复盘,线性代数可以压成七句话:

  1. 矩阵乘法:神经网络前向计算。
  2. 点积和范数:相似度、注意力和归一化。
  3. 秩和子空间:信息维度、冗余和压缩。
  4. 最小二乘和投影:监督学习的几何原型。
  5. 特征值和谱半径:动态系统稳定性。
  6. 二次型和正定性:损失曲面的曲率。
  7. SVD/PCA/低秩:表示学习、降维、LoRA 和模型压缩。

线性代数不是一堆矩阵计算技巧,而是一套看模型内部表示的语言。

参考