线性代数到模型学习:从矩阵到秩的25道核心题

按同济工程数学线性代数第七版的主干,围绕矩阵、行列式、线性方程组、向量组、秩和子空间设计25道原创题,服务模型学习。

这是“线性代数到模型学习 50 题”的上篇,覆盖第 1 到 25 题。

我按高等教育出版社官方产品页确认的同济大学数学科学学院《工程数学 线性代数》第七版范围来组织:行列式、矩阵及其运算、矩阵的初等变换与线性方程组、向量组的线性相关性、相似矩阵及二次型、线性空间与线性变换。本文只借用知识范围,不复刻教材原题。

这组题的目标不是替代教材,而是回答一个更具体的问题:

如果我要学大模型、深度学习、embedding、注意力、PCA、LoRA、低秩压缩,线性代数里哪些题最值得反复练

flowchart LR
  A["向量"] --> B["矩阵"]
  B --> C["线性方程组"]
  C --> D["秩与子空间"]
  D --> E["投影与最小二乘"]
  E --> F["模型中的线性层"]

排版约定:公式块里不放句号或逗号,避免 KaTeX 把标点渲染成公式的一部分;每题固定为 题目 / 解答 / 答案 / 模型连接

一、矩阵和向量:模型计算的基本形状

1. 矩阵乘向量就是线性层

题目:设

A=[1234],x=[56]A= \begin{bmatrix} 1 & 2\\ 3 & 4 \end{bmatrix}, \quad \mathbf x= \begin{bmatrix} 5\\ 6 \end{bmatrix}

AxA\mathbf x

解答

矩阵乘向量,就是每一行和向量做点积:

Ax=[15+2635+46]A\mathbf x = \begin{bmatrix} 1\cdot 5+2\cdot 6\\ 3\cdot 5+4\cdot 6 \end{bmatrix}

逐项计算:

Ax=[1739]A\mathbf x = \begin{bmatrix} 17\\ 39 \end{bmatrix}

答案

[1739]\begin{bmatrix} 17\\ 39 \end{bmatrix}

模型连接:神经网络里的线性层就是 Wx+bW\mathbf x+\mathbf b。矩阵 WW 存权重,向量 x\mathbf x 存输入特征。

2. 检查矩阵乘法的形状

题目:若

AR3×4,BR4×2A\in\mathbb R^{3\times 4}, \quad B\in\mathbb R^{4\times 2}

ABAB 的形状,并判断 BABA 是否有定义。

解答

矩阵乘法 ABAB 有定义的条件是:

A 的列数=B 的行数A\text{ 的列数}=B\text{ 的行数}

这里 AA 的列数为 4,BB 的行数为 4,所以 ABAB 有定义。

结果形状取外侧维度:

ABR3×2AB\in\mathbb R^{3\times 2}

再看 BABABB 的列数为 2,AA 的行数为 3,不相等,所以 BABA 无定义。

答案ABAB 的形状为 3×23\times 2BABA 无定义。

模型连接:大模型工程里 shape 错误非常常见。矩阵乘法的内侧维度必须对齐,是理解 batch、hidden size、attention head 的第一步。

3. 点积衡量方向相似

题目:设

a=(1,2,2),b=(2,0,1)\mathbf a=(1,2,2), \quad \mathbf b=(2,0,1)

ab\mathbf a\cdot\mathbf b

解答

点积等于对应分量相乘后相加:

ab=12+20+21\mathbf a\cdot\mathbf b = 1\cdot 2+2\cdot 0+2\cdot 1

所以:

ab=4\mathbf a\cdot\mathbf b=4

答案

44

模型连接:注意力机制里的 query 和 key 会做点积。点积越大,通常表示两个向量方向越接近,相关性越强。

4. 转置让行向量和列向量对齐

题目:设

x=[123],y=[456]\mathbf x= \begin{bmatrix} 1\\ 2\\ 3 \end{bmatrix}, \quad \mathbf y= \begin{bmatrix} 4\\ 5\\ 6 \end{bmatrix}

xy\mathbf x^\top\mathbf yxy\mathbf x\mathbf y^\top 的形状。

解答

x\mathbf x^\top1×31\times 3y\mathbf y3×13\times 1,所以:

xyR1×1\mathbf x^\top\mathbf y \in \mathbb R^{1\times 1}

它是一个数:

xy=14+25+36=32\mathbf x^\top\mathbf y = 1\cdot4+2\cdot5+3\cdot6 = 32

x\mathbf x3×13\times 1y\mathbf y^\top1×31\times 3,所以:

xyR3×3\mathbf x\mathbf y^\top \in \mathbb R^{3\times 3}

具体为:

xy=[45681012121518]\mathbf x\mathbf y^\top = \begin{bmatrix} 4 & 5 & 6\\ 8 & 10 & 12\\ 12 & 15 & 18 \end{bmatrix}

答案xy=32\mathbf x^\top\mathbf y=32xy\mathbf x\mathbf y^\top3×33\times 3 矩阵。

模型连接:内积得到相似度,外积得到一个矩阵更新。低秩适配 LoRA 可以理解成用两个小矩阵的乘积生成一个低秩更新。

5. 矩阵乘法不满足交换律

题目:设

A=[1101],B=[1011]A= \begin{bmatrix} 1 & 1\\ 0 & 1 \end{bmatrix}, \quad B= \begin{bmatrix} 1 & 0\\ 1 & 1 \end{bmatrix}

分别计算 ABABBABA

解答

先算 ABAB

AB=[11+1110+1101+1100+11]=[2111]AB= \begin{bmatrix} 1\cdot1+1\cdot1 & 1\cdot0+1\cdot1\\ 0\cdot1+1\cdot1 & 0\cdot0+1\cdot1 \end{bmatrix} = \begin{bmatrix} 2 & 1\\ 1 & 1 \end{bmatrix}

再算 BABA

BA=[11+0011+0111+1011+11]=[1112]BA= \begin{bmatrix} 1\cdot1+0\cdot0 & 1\cdot1+0\cdot1\\ 1\cdot1+1\cdot0 & 1\cdot1+1\cdot1 \end{bmatrix} = \begin{bmatrix} 1 & 1\\ 1 & 2 \end{bmatrix}

显然:

ABBAAB\ne BA

答案

AB=[2111],BA=[1112]AB= \begin{bmatrix} 2 & 1\\ 1 & 1 \end{bmatrix}, \quad BA= \begin{bmatrix} 1 & 1\\ 1 & 2 \end{bmatrix}

模型连接:神经网络层的顺序不能随便交换。先做投影再做归一化,和先归一化再投影,通常不是一回事。

二、行列式和逆矩阵:可逆、面积和信息是否丢失

6. 二阶行列式

题目:计算

det[2314]\det \begin{bmatrix} 2 & 3\\ 1 & 4 \end{bmatrix}

解答

二阶行列式公式为:

det[abcd]=adbc\det \begin{bmatrix} a & b\\ c & d \end{bmatrix} =ad-bc

代入:

2431=52\cdot 4-3\cdot 1=5

答案

55

模型连接:行列式可以理解为线性变换对面积或体积的缩放倍数。行列式为 0 表示某个方向被压没,信息不可逆丢失。

7. 行列式为 0 的几何意义

题目:判断矩阵

A=[1224]A= \begin{bmatrix} 1 & 2\\ 2 & 4 \end{bmatrix}

是否可逆。

解答

计算行列式:

det(A)=1422=0\det(A)=1\cdot4-2\cdot2=0

二阶矩阵可逆当且仅当行列式不为 0。这里行列式为 0,所以矩阵不可逆。

答案AA 不可逆。

模型连接:第二行是第一行的 2 倍,说明信息重复。模型表示里如果很多特征线性相关,就会造成冗余和低秩结构。

8. 求二阶逆矩阵

题目:求

A=[2111]A= \begin{bmatrix} 2 & 1\\ 1 & 1 \end{bmatrix}

的逆矩阵。

解答

二阶逆矩阵公式:

[abcd]1=1adbc[dbca]\begin{bmatrix} a & b\\ c & d \end{bmatrix}^{-1} = \frac{1}{ad-bc} \begin{bmatrix} d & -b\\ -c & a \end{bmatrix}

这里:

adbc=2111=1ad-bc=2\cdot1-1\cdot1=1

所以:

A1=[1112]A^{-1} = \begin{bmatrix} 1 & -1\\ -1 & 2 \end{bmatrix}

答案

A1=[1112]A^{-1} = \begin{bmatrix} 1 & -1\\ -1 & 2 \end{bmatrix}

模型连接:逆矩阵表示“撤销一个线性变换”。但大模型里通常不显式求逆,因为维度太大、数值也可能不稳定。

9. 用逆矩阵解方程组

题目:解

{2x+y=5x+y=3\begin{cases} 2x+y=5\\ x+y=3 \end{cases}

解答

写成矩阵形式:

[2111][xy]=[53]\begin{bmatrix} 2 & 1\\ 1 & 1 \end{bmatrix} \begin{bmatrix} x\\ y \end{bmatrix} = \begin{bmatrix} 5\\ 3 \end{bmatrix}

由上一题可知:

A1=[1112]A^{-1} = \begin{bmatrix} 1 & -1\\ -1 & 2 \end{bmatrix}

所以:

[xy]=A1[53]=[1112][53]\begin{bmatrix} x\\ y \end{bmatrix} = A^{-1} \begin{bmatrix} 5\\ 3 \end{bmatrix} = \begin{bmatrix} 1 & -1\\ -1 & 2 \end{bmatrix} \begin{bmatrix} 5\\ 3 \end{bmatrix}

计算:

[xy]=[21]\begin{bmatrix} x\\ y \end{bmatrix} = \begin{bmatrix} 2\\ 1 \end{bmatrix}

答案

x=2,y=1x=2,\quad y=1

模型连接:线性方程组是最小版的“拟合参数”。训练线性模型,本质上就是找一组参数让方程尽量成立。

10. 对角矩阵的逆

题目:设

D=[2000500010]D= \begin{bmatrix} 2 & 0 & 0\\ 0 & 5 & 0\\ 0 & 0 & 10 \end{bmatrix}

D1D^{-1}

解答

对角矩阵只在主对角线上缩放各坐标。要撤销它,只需把每个对角元素取倒数:

D1=[1200015000110]D^{-1} = \begin{bmatrix} \frac{1}{2} & 0 & 0\\ 0 & \frac{1}{5} & 0\\ 0 & 0 & \frac{1}{10} \end{bmatrix}

答案

D1=[1200015000110]D^{-1} = \begin{bmatrix} \frac{1}{2} & 0 & 0\\ 0 & \frac{1}{5} & 0\\ 0 & 0 & \frac{1}{10} \end{bmatrix}

模型连接:归一化、缩放、逐通道 rescale 都可以先看成对角矩阵操作。每个维度独立缩放,计算简单。

三、初等变换和线性方程组:训练求解的原型

11. 高斯消元解二元方程组

题目:解

{x+2y=73x+4y=17\begin{cases} x+2y=7\\ 3x+4y=17 \end{cases}

解答

写增广矩阵:

[1273417]\left[ \begin{array}{cc|c} 1 & 2 & 7\\ 3 & 4 & 17 \end{array} \right]

用第二行减去第一行的 3 倍:

R2R23R1R_2\leftarrow R_2-3R_1

得到:

[127024]\left[ \begin{array}{cc|c} 1 & 2 & 7\\ 0 & -2 & -4 \end{array} \right]

第二行给出:

2y=4-2y=-4

所以:

y=2y=2

代回第一行:

x+22=7x+2\cdot2=7

得到:

x=3x=3

答案

x=3,y=2x=3,\quad y=2

模型连接:高斯消元是系统性消去变量。很多数值线性代数算法都在做更大规模、更稳定的“消元”。

12. 用秩判断方程组是否有解

题目:判断方程组

{x+y=12x+2y=3\begin{cases} x+y=1\\ 2x+2y=3 \end{cases}

是否有解。

解答

第二个方程左边是第一个方程左边的 2 倍。如果第一个方程成立,那么左边乘 2 应该得到:

2x+2y=22x+2y=2

但第二个方程要求:

2x+2y=32x+2y=3

矛盾。

也可看增广矩阵:

[111223]\left[ \begin{array}{cc|c} 1 & 1 & 1\\ 2 & 2 & 3 \end{array} \right]

第二行减去第一行的 2 倍:

[111001]\left[ \begin{array}{cc|c} 1 & 1 & 1\\ 0 & 0 & 1 \end{array} \right]

这表示 0=10=1,所以无解。

答案:无解。

模型连接:不是所有数据都能被一个简单线性模型完全拟合。无解时,我们通常转向最小二乘,找“误差最小”的近似解。

13. 欠定方程组有无穷多解

题目:解方程

x+2y+z=4x+2y+z=4

写出通解。

解答

一个方程有三个未知数,通常会有自由变量。令:

y=s,z=ty=s,\quad z=t

其中 s,ts,t 为任意实数。

则:

x=42stx=4-2s-t

所以通解为:

(x,y,z)=(42st, s, t)(x,y,z)=(4-2s-t,\ s,\ t)

也可写成:

[xyz]=[400]s[210]t[101]\begin{bmatrix} x\\ y\\ z \end{bmatrix} = \begin{bmatrix} 4\\ 0\\ 0 \end{bmatrix} s \begin{bmatrix} -2\\ 1\\ 0 \end{bmatrix} t \begin{bmatrix} -1\\ 0\\ 1 \end{bmatrix}

答案

(x,y,z)=(42st, s, t),s,tR(x,y,z)=(4-2s-t,\ s,\ t),\quad s,t\in\mathbb R

模型连接:参数多于约束时,会出现很多解。过参数化神经网络也是这样:能拟合训练集的参数组合很多,优化和正则化决定最后落在哪个解。

14. 计算矩阵的秩

题目:求矩阵

A=[123246111]A= \begin{bmatrix} 1 & 2 & 3\\ 2 & 4 & 6\\ 1 & 1 & 1 \end{bmatrix}

的秩。

解答

第二行是第一行的 2 倍,所以第二行不提供新的独立信息。

比较第一行和第三行:

(1,2,3)(1,2,3)

(1,1,1)(1,1,1)

不是倍数关系,所以它们线性无关。

因此独立行有 2 行,矩阵的秩为 2。

也可通过行变换:

R2R22R1R_2\leftarrow R_2-2R_1

得到一行全 0,剩余两行独立。

答案

rank(A)=2\operatorname{rank}(A)=2

模型连接:秩表示矩阵真正保留了多少独立方向。低秩压缩、LoRA、PCA 都是在利用“有效信息维度低于表面维度”。

15. 判断列向量是否张成目标向量

题目:判断

b=[35]\mathbf b= \begin{bmatrix} 3\\ 5 \end{bmatrix}

是否能由

v1=[11],v2=[12]\mathbf v_1= \begin{bmatrix} 1\\ 1 \end{bmatrix}, \quad \mathbf v_2= \begin{bmatrix} 1\\ 2 \end{bmatrix}

线性表示。

解答

要求存在 c1,c2c_1,c_2,使:

c1v1+c2v2=bc_1\mathbf v_1+c_2\mathbf v_2=\mathbf b

即:

c1[11]c2[12]=[35]c_1 \begin{bmatrix} 1\\ 1 \end{bmatrix} c_2 \begin{bmatrix} 1\\ 2 \end{bmatrix} = \begin{bmatrix} 3\\ 5 \end{bmatrix}

得到方程组:

{c1+c2=3c1+2c2=5\begin{cases} c_1+c_2=3\\ c_1+2c_2=5 \end{cases}

第二式减第一式:

c2=2c_2=2

代回:

c1=1c_1=1

所以可以线性表示。

答案

b=1v1+2v2\mathbf b=1\cdot\mathbf v_1+2\cdot\mathbf v_2

模型连接:embedding 空间里的一个表示,常常可以看成若干基础方向的线性组合。理解“张成”就是理解表示空间能覆盖哪些方向。

四、向量组、基、坐标和子空间

16. 判断两个向量是否线性无关

题目:判断

v1=(1,2),v2=(3,6)\mathbf v_1=(1,2), \quad \mathbf v_2=(3,6)

是否线性无关。

解答

如果一个向量是另一个向量的倍数,则线性相关。

这里:

v2=3v1\mathbf v_2=3\mathbf v_1

所以两向量线性相关,不是线性无关。

答案:线性相关。

模型连接:相关特征会提供重复信息。模型训练中,冗余特征可能导致参数不稳定,也会让有效维度下降。

17. 三维标准基下的坐标

题目:设标准基为

e1=(1,0,0),e2=(0,1,0),e3=(0,0,1)\mathbf e_1=(1,0,0), \quad \mathbf e_2=(0,1,0), \quad \mathbf e_3=(0,0,1)

写出 x=(4,1,2)\mathbf x=(4,-1,2) 在该基下的坐标。

解答

标准基下:

x=4e11e2+2e3\mathbf x = 4\mathbf e_1-1\mathbf e_2+2\mathbf e_3

所以坐标就是:

[412]\begin{bmatrix} 4\\ -1\\ 2 \end{bmatrix}

答案

(4,1,2)(4,-1,2)

模型连接:向量坐标依赖基。embedding 的每个维度可以看作在某组基方向上的坐标,但这些方向通常不是人类可直接解释的。

18. 非标准基下的坐标

题目:设

b1=(1,1),b2=(1,1)\mathbf b_1=(1,1), \quad \mathbf b_2=(1,-1)

x=(3,1)\mathbf x=(3,1) 在基 {b1,b2}\{\mathbf b_1,\mathbf b_2\} 下的坐标。

解答

要求:

x=c1b1+c2b2\mathbf x=c_1\mathbf b_1+c_2\mathbf b_2

即:

c1(1,1)+c2(1,1)=(3,1)c_1(1,1)+c_2(1,-1)=(3,1)

得到:

{c1+c2=3c1c2=1\begin{cases} c_1+c_2=3\\ c_1-c_2=1 \end{cases}

两式相加:

2c1=42c_1=4

所以:

c1=2c_1=2

再代回:

c2=1c_2=1

答案

[x]B=[21][\mathbf x]_{\mathcal B} = \begin{bmatrix} 2\\ 1 \end{bmatrix}

模型连接:换基就是换一种坐标系统看同一个对象。PCA 本质上就是找一组更适合描述数据的基。

19. 求零空间

题目:求矩阵

A=[121]A= \begin{bmatrix} 1 & 2 & 1 \end{bmatrix}

的零空间,即所有满足 Ax=0A\mathbf x=0 的向量。

解答

设:

x=[xyz]\mathbf x= \begin{bmatrix} x\\ y\\ z \end{bmatrix}

方程 Ax=0A\mathbf x=0 即:

x+2y+z=0x+2y+z=0

令:

y=s,z=ty=s,\quad z=t

则:

x=2stx=-2s-t

所以:

x=[2stst]=s[210]t[101]\mathbf x= \begin{bmatrix} -2s-t\\ s\\ t \end{bmatrix} = s \begin{bmatrix} -2\\ 1\\ 0 \end{bmatrix} t \begin{bmatrix} -1\\ 0\\ 1 \end{bmatrix}

答案

N(A)=span{[210],[101]}\mathcal N(A) = \operatorname{span} \left\{ \begin{bmatrix} -2\\ 1\\ 0 \end{bmatrix}, \begin{bmatrix} -1\\ 0\\ 1 \end{bmatrix} \right\}

模型连接:零空间表示“输入变化了,但输出不变”的方向。模型压缩、不可辨识参数、过参数化解空间都和零空间有关。

20. 求列空间

题目:求矩阵

A=[120012]A= \begin{bmatrix} 1 & 2\\ 0 & 0\\ 1 & 2 \end{bmatrix}

的列空间。

解答

两列分别为:

c1=[101],c2=[202]\mathbf c_1= \begin{bmatrix} 1\\ 0\\ 1 \end{bmatrix}, \quad \mathbf c_2= \begin{bmatrix} 2\\ 0\\ 2 \end{bmatrix}

显然:

c2=2c1\mathbf c_2=2\mathbf c_1

所以列空间只需要 c1\mathbf c_1 张成:

Col(A)=span{[101]}\operatorname{Col}(A) = \operatorname{span} \left\{ \begin{bmatrix} 1\\ 0\\ 1 \end{bmatrix} \right\}

答案

Col(A)=span{[101]}\operatorname{Col}(A) = \operatorname{span} \left\{ \begin{bmatrix} 1\\ 0\\ 1 \end{bmatrix} \right\}

模型连接:列空间是矩阵所有可能输出组成的空间。线性层能输出什么,取决于权重矩阵的列空间。

21. 秩-零度关系

题目:矩阵 AR2×3A\in\mathbb R^{2\times 3} 的秩为 2。求它的零空间维数。

解答

秩-零度定理:

rank(A)+nullity(A)=n\operatorname{rank}(A)+\operatorname{nullity}(A)=n

其中 nn 是矩阵的列数。这里 n=3n=3,且:

rank(A)=2\operatorname{rank}(A)=2

所以:

nullity(A)=32=1\operatorname{nullity}(A)=3-2=1

答案

11

模型连接:如果输入维度是 3,但线性层秩只有 2,就至少有 1 个方向会被压到零空间里,信息不可恢复。

五、最小二乘和模型线性层

22. 最小二乘的法方程

题目:给定

A=[11],b=[13]A= \begin{bmatrix} 1\\ 1 \end{bmatrix}, \quad \mathbf b= \begin{bmatrix} 1\\ 3 \end{bmatrix}

求最小二乘问题

minxAxb2\min_x\|Ax-\mathbf b\|^2

的解。

解答

AxAx 表示:

Ax=[xx]Ax= \begin{bmatrix} x\\ x \end{bmatrix}

要让它尽量接近 (1,3)(1,3),直觉上 xx 应该取平均值 2。用法方程验证:

AAx=AbA^\top A x=A^\top \mathbf b

先算:

AA=[11][11]=2A^\top A= \begin{bmatrix} 1 & 1 \end{bmatrix} \begin{bmatrix} 1\\ 1 \end{bmatrix} =2

再算:

Ab=[11][13]=4A^\top\mathbf b= \begin{bmatrix} 1 & 1 \end{bmatrix} \begin{bmatrix} 1\\ 3 \end{bmatrix} =4

所以:

2x=42x=4

得到:

x=2x=2

答案

x=2x=2

模型连接:最小二乘是监督学习的祖先。不能完全拟合时,就找平方误差最小的解。

23. 线性变换的矩阵表示

题目:线性变换 T ⁣:R2R2T\colon \mathbb R^2\to\mathbb R^2 满足:

T(1,0)=(2,1),T(0,1)=(3,4)T(1,0)=(2,1), \quad T(0,1)=(3,4)

TT 的标准矩阵。

解答

线性变换的标准矩阵由基向量的像作为列组成:

A=[T(1,0)T(0,1)]A= \begin{bmatrix} | & |\\ T(1,0) & T(0,1)\\ | & | \end{bmatrix}

所以:

A=[2314]A= \begin{bmatrix} 2 & 3\\ 1 & 4 \end{bmatrix}

答案

A=[2314]A= \begin{bmatrix} 2 & 3\\ 1 & 4 \end{bmatrix}

模型连接:一个线性层由它对基方向的作用完全决定。权重矩阵就是线性变换在标准基下的表示。

24. embedding 查表可以看成矩阵乘法

题目:设 embedding 矩阵为

E=[100123]E= \begin{bmatrix} 1 & 0\\ 0 & 1\\ 2 & 3 \end{bmatrix}

第 3 个 token 的 one-hot 向量为

e3=[001]\mathbf e_3= \begin{bmatrix} 0\\ 0\\ 1 \end{bmatrix}

计算 Ee3E^\top\mathbf e_3

解答

先写出:

E=[102013]E^\top= \begin{bmatrix} 1 & 0 & 2\\ 0 & 1 & 3 \end{bmatrix}

于是:

Ee3=[102013][001]=[23]E^\top\mathbf e_3 = \begin{bmatrix} 1 & 0 & 2\\ 0 & 1 & 3 \end{bmatrix} \begin{bmatrix} 0\\ 0\\ 1 \end{bmatrix} = \begin{bmatrix} 2\\ 3 \end{bmatrix}

答案

[23]\begin{bmatrix} 2\\ 3 \end{bmatrix}

模型连接:embedding 查表可以理解成 one-hot 向量和 embedding 矩阵相乘。实际工程不会真的构造巨大 one-hot,但数学上等价。

25. 注意力分数矩阵的形状

题目:设

QR4×8,KR4×8Q\in\mathbb R^{4\times 8}, \quad K\in\mathbb R^{4\times 8}

其中 4 是 token 数,8 是每个 head 的维度。求注意力分数矩阵

S=QKS=QK^\top

的形状。

解答

QQ 的形状为 4×84\times 8KK^\top 的形状为 8×48\times 4

所以:

S=QKR4×4S=QK^\top\in\mathbb R^{4\times 4}

这个矩阵中,第 ii 行第 jj 列表示第 ii 个 token 的 query 和第 jj 个 token 的 key 的相似度。

答案

SR4×4S\in\mathbb R^{4\times 4}

模型连接:注意力分数矩阵是 token 对 token 的关系表。序列长度为 nn 时,注意力矩阵通常是 n×nn\times n,这也是长上下文成本高的原因之一。

上篇总结

这 25 题打的是线性代数的底盘:

  • 矩阵乘法:模型前向计算。
  • 行列式和可逆性:线性变换是否丢信息。
  • 初等变换和方程组:参数求解的原型。
  • 秩、列空间、零空间:信息维度和冗余。
  • 最小二乘:监督学习的经典雏形。
  • embedding 和 attention 形状:线代进入大模型的第一现场。

下篇会继续第 26 到 50 题,进入特征值、对角化、二次型、正交投影、PCA、SVD 和线性变换。

参考