📘 第 4 章:向量空间
Note
本篇是《Linear Algebra and its Applications》(David C. Lay, 第 5 版) 第 4 章 Vector Spaces(向量空间) 的中文初学者精讲笔记。前两章里我们一直在和 里的向量打交道;这一章要把眼界打开:箭头、数列、多项式、函数、矩阵、信号……只要它们能”相加”和”数乘”,就都是向量。围绕这条主线,本章依次讲:向量空间与子空间(4.1)、矩阵的零空间与列空间(4.2)、线性无关与基(4.3)、坐标系(4.4)、维数(4.5)、秩(4.6)、基变换(4.7),以及两个大应用——差分方程(4.8)和马尔可夫链(4.9)。书中全部例题都保留了题目和逐步解答。
章前导引:航天飞行与控制系统
1981 年 4 月,美国第一架航天飞机”哥伦比亚号”(12 层楼高、重 75 吨)成功升空。它是控制系统工程设计的结晶,涉及航空、化学、电气、液压、机械等多个工程分支。
航天飞机的机身是不稳定的,因此在大气层内飞行时必须由计算机持续监控。飞控系统不断向气动控制面和 44 个小型推进喷管发送指令。下图就是一个典型的闭环反馈系统,用来控制航天飞机飞行时的俯仰角(机头仰角)。
图 4-1:闭环反馈控制系统示意图(各传感器的信号在汇合点处与计算机信号相加)
图中的汇合点表示:来自各种传感器的信号要加到沿图上方流动的计算机信号上。数学上,工程系统的输入、输出信号都是函数,而关键在于:这些函数可以像向量一样相加、数乘,并且满足与 中向量运算完全类似的代数性质。因此,“所有可能输入(函数)的集合”就被称为一个向量空间——系统工程(如下图的航天飞机俯仰控制系统)的数学基础正建立在函数向量空间之上。
图 4-2:航天飞机的俯仰控制系统(改绘自 Space Shuttle GN&C Operations Manual, Rockwell International, ©1988)
这就是本章要做的事:把第 1、2 章在 中种下的理论种子,推广到包括函数空间在内的各种向量空间。你在 、 里积累的几何直觉,几乎全部可以搬过去用。
4.1 向量空间与子空间
4.1.1 什么是向量空间
第 1、2 章的许多理论都建立在 的一组简单代数性质上。事实上,很多别的数学系统也有同样的性质。把这些性质提炼出来,就得到:
定义:向量空间
一个向量空间是一个非空集合 ,其中的元素称为向量,其上定义了两种运算——加法与标量乘法(用实数乘),且满足下面十条公理(对所有 中的 和所有标量 成立):
- 仍在 中(加法封闭);
- (交换律);
- (结合律);
- 中存在零向量 ,使 ;
- 对每个 ,存在 使 ;
- 仍在 中(数乘封闭);
- ;
- ;
- ;
- 。
**为什么这样定义?**因为这十条恰好是 中向量运算”好用”的全部理由。凡满足这十条的集合, 里成立的所有线性代数定理都自动适用于它——这就是抽象化的威力:证一次,处处可用。
仅凭这十条公理即可证明:零向量是唯一的;每个 的负向量 也是唯一的。还可以推出三个常用恒等式(对任意 和标量 ):
常见坑
这三个式子不是公理,而是可由公理推出的定理。初学者常把""与""混为一谈:前者是定理,后者是公理 10,二者缺一不可。
例 1:()是向量空间中最首要的例子。你在 中培养的几何直觉,将帮助你在整章中理解并可视化许多抽象概念。
图 4-3: 中的向量与平行四边形加法法则
例 2:设 是三维空间中所有箭头(有向线段)的集合,两个箭头长度相同、方向相同就算相等。加法按平行四边形法则定义;对 中每个 , 定义为长度是 的 倍的箭头: 时与 同向,否则反向。证明 是向量空间。(这是物理问题中描述各种力的常用模型。)
解: 的定义是纯几何的,不涉及坐标系。长度为零的箭头是一个点,充当零向量; 即 。于是公理 1、4、5、6、10 显然成立,其余公理由几何验证——例如交换律和结合律分别见下图。
图 4-4:(箭头的加法交换律)
图 4-5:(箭头的加法结合律)
例 3:设 是所有双侧无穷数列的集合(通常写成一行而非一列):
若 也是 中的元素,则定义 为逐项相加得到的数列 ; 定义为 。公理的验证方式与 完全一样,所以 是向量空间。
中的元素在工程里随处可见:凡是在离散时刻对信号(电信号、机械信号、光信号……)进行测量或采样的场合都会出现。航天飞机的主控系统用的正是离散(数字)信号。我们称 为**(离散时间)信号空间**。一个信号可以像下图那样画成图象。
图 4-6:一个离散时间信号
例 4:对 ,记 为次数不超过 的多项式全体:
其中系数 与变量 都是实数。多项式的次数是系数非零的最高次幂;全零系数的多项式叫零多项式,它也属于 (出于技术原因它的次数不定义)。
若 ,则定义
以及
由于 与 的次数仍不超过 ,公理 1、6 成立;公理 2、3、7–10 由实数性质保证;零多项式充当零向量, 充当负向量。故 是向量空间。( 在数据的统计趋势分析等场合会用到。)
例 5:设 是定义在集合 上的全体实值函数( 通常为实数轴或其上的一个区间)。函数按通常方式相加: 是在每点 取值 的函数;数乘 在每点取值 。例如 ,,,则
图 4-7:两个向量(函数)的相加
中两个函数相等,当且仅当它们在 的每一点取值相等。于是 的零向量是恒为零的函数( 对一切 ), 即 。公理 1、6 显然成立,其余由实数性质保证,故 是向量空间。
常见坑
学例 5 时最重要的观念转变是:把每个函数整体看作一个”点”——向量空间中的一个向量。两个函数相加、一个函数被数乘,都可以像下图那样直观想象。带着这幅图景去学一般向量空间, 的几何直觉就能迁移过来。
4.1.2 子空间
很多问题中,向量空间其实是某个更大向量空间的一个合适的子集。这时十条公理只需要验证三条。
定义:子空间
向量空间 的一个子空间是 的一个满足以下三条性质的子集 :
a. 的零向量在 中; b. 对加法封闭: 中任意 , 也在 中; c. 对数乘封闭: 中任意 和任意标量 , 也在 中。
这三条恰好是公理 1、4、6。其余公理为什么自动成立?公理 2、3、7–10 对 的所有元素成立,自然也对 中元素成立;公理 5 也成立,因为若 ,由 (c) 知 ,而前面已证 。
所以:每个子空间本身就是一个向量空间;反过来,任何向量空间都是它自身(以及可能的更大空间)的子空间。当至少涉及两个空间、一个套在另一个里面时才用”子空间”这个词,” 的子空间”表明 是更大的那个。
图 4-8: 的一个子空间
例 6:仅由 的零向量组成的集合是 的子空间,称为零子空间,记作 。
图 4-9:零子空间
例 7:设 是全体实系数多项式(运算方式与函数相同),则 是”全体实值函数”空间的子空间;而且对每个 , 是 的子空间——因为 ,含零多项式,且两个次数 的多项式之和、其数乘仍在 中。
例 8: 不是 的子空间,因为 根本不是 的子集( 的向量有三个分量, 的只有两个)。但是集合
是 的子集,它”看起来”和”运行起来”都像 (尽管逻辑上与 是不同的集合)。证明 是 的子空间。
解:零向量在 中; 中向量相加、数乘后第三个分量仍是 0,故结果仍在 中。三条性质都满足, 是 的子空间。
例 9: 中不经过原点的平面不是 的子空间,因为它不含 的零向量。同理, 中不过原点的直线(如下图)也不是 的子空间。
图 4-10:一条不是向量空间的直线(不过原点,加法/数乘会跑出去)
常见坑
检验子空间最快的一招:先看零向量在不在里面。不过原点的平面、直线、不包含 的任何集合,直接一票否决。零向量在之后,再逐条验证对加法和数乘的封闭性。
4.1.3 由一组向量张成的子空间
描述子空间最常见的方式是”取若干向量的全部线性组合”。回忆第 1 章: 表示由 的所有线性组合构成的集合。
例 10:设 是向量空间 中的向量,。证明 是 的子空间。
解:零向量在 中,因为 。为验证对加法封闭,取 中任意两个向量
利用 的公理 2、3、8:
所以 。再由公理 7、9,对任意标量 :
对数乘也封闭。故 是 的子空间。
图 4-11:子空间的一个例子(由两个向量张成的过原点平面)
例 10 的论证很容易推广,得到:
定理 1
若 在向量空间 中,则 是 的子空间。
我们称 为由 张成(生成)的子空间;若子空间 满足 且 ,则 叫 的一个张成集。
后面(4.5 节)会看到: 的每个非零真子空间,要么是 ( 线性无关,子空间是过原点的平面),要么是 (,子空间是过原点的直线)。即使是抽象向量空间,也值得在脑中保留这幅几何图象。
例 11:设 是所有形如 的向量的集合( 为任意标量),即
证明 是 的子空间。
解:把 中的向量写成列向量,则任一向量可分解为
这说明 ,其中 ,。由定理 1, 是 的子空间。
例 11 展示了一个非常有用的技巧:把子空间 表示成少量向量的线性组合之集。若 ,可以把张成集里的向量看作握住整个子空间的”把手”——对 中无穷多向量的计算,常常可以化为对有限个向量的运算。
例 12:当 取何值时, 属于由 张成的 的子空间?其中
解:这个问题就是第 1.3 节练习题 2,只是把 换成了”子空间”这个说法。那里的解答表明: 当且仅当 。值得把那道题的解法(以及 1.3 节习题 11–16、19–21)回顾一遍。
4.1 节练习题(PRACTICE PROBLEMS)
练习 1:证明 中所有形如 的点组成的集合 不是向量空间:请找出 中一个具体的向量 和一个标量 ,使得 (即 对数乘不封闭)。
解:取 中任一向量,比如 (对应 ),再取 。则 。假如它在 中,就应存在某个 使得
即 且 ,矛盾。所以 , 不是向量空间。
练习 2:设 ,其中 在向量空间 中。证明每个 ()都在 中。
解:,这就是 作为 的线性组合,故 。一般地,
所以每个 。
练习 3:若 矩阵满足 ,则称 对称。设 是所有 对称矩阵的集合。证明 是 (全体 矩阵构成的向量空间)的子空间。
解:按子空间定义逐条验证:
- (a) 的零向量是 零矩阵,而 ,零矩阵对称,故 ;
- (b) 设 ,即 ,。由转置性质,,故 对称,;
- (c) 设 , 为标量。,故 对称,。
三条全满足, 是 的子空间。
通关标准
能独立做到三件事:① 给一个新集合,按子空间三条件(零向量在内、加法封闭、数乘封闭)判断并证明它是不是子空间;② 给一个带参数的表达式(如例 11),把它改写成 ,从而立刻判定它是子空间;③ 能构造反例否定封闭性(如练习 1)。
4.1 节的习题(共 38 题,含”第一象限为何不是向量空间""对称矩阵空间""由公理证明 “等经典题目)见原书;其中习题 19 的质量–弹簧系统与习题 32 的子空间交/和问题背景如下图所示。
图 4-12:挂在弹簧上的质量块(习题 19:函数集 构成向量空间)
图 4-13:两个子空间 与 的交集 (习题 32:交是子空间,但并一般不是)
4.2 零空间、列空间与线性变换
线性代数的应用中, 的子空间通常以两种方式出现:(1) 作为齐次线性方程组的全体解;(2) 作为若干指定向量的全体线性组合。本节比较这两种描述,并讨论线性变换的核与值域。其实从 1.3 节起你就一直在和子空间打交道——本节的新东西主要是术语。
4.2.1 矩阵的零空间
考虑齐次方程组
写成矩阵形式即 ,其中
满足 的全体 有个专门的名字:
定义:零空间
矩阵 的零空间(null space),记作 ,是齐次方程 的全体解之集:
它还有一个更”动态”的描述: 是在变换 之下被映到 中零向量的全体 。
图 4-14: 是被 映到零向量的所有
例 1:设 就是上面的矩阵,。判断 是否属于 的零空间。
解:直接验证 是否满足 :
所以 。
“零空间”里的”空间”二字名副其实——零空间确实是向量空间:
定理 2
矩阵 的零空间是 的子空间。等价地说: 个方程、 个未知数的齐次线性方程组 的解集是 的子空间。
证明: 有 列,故 。下面验证子空间三条件。首先 。其次设 ,即 ,。利用矩阵乘法性质:
故 。最后对任意标量 :
故 。三条全满足, 是 的子空间。
例 2:设 是 中坐标 满足 且 的全体向量。证明 是 的子空间。
解:把描述 的方程整理为齐次形式:
恰是这个齐次线性方程组的解集,由定理 2, 是 的子空间。
常见坑
定义 的方程必须是齐次的(右端为 0)。非齐次方程组的解集一定不是子空间——因为零向量不是非齐次方程组的解;有时非齐次方程组甚至无解,解集为空。
4.2.2 Nul A 的显式描述
中的向量与 的元素之间没有明显关系——我们说 是隐式定义的:只给了向量必须满足的条件(),并没有给出其中元素的具体列表。而求解 恰恰就是在生成 的显式描述。
例 3:求下列矩阵零空间的一组张成集:
解:第一步,用自由变量求出 的通解。把增广矩阵 行约化为简化阶梯形,用自由变量表示主变量:
即
通解为 ,,其中 为自由变量。第二步,把通解向量按自由变量分解成线性组合:
的每个线性组合都在 中,反之亦然。所以 是 的一组张成集。
关于这个解法有两点值得记住(以后会反复用到):
- 这样得到的张成集自动线性无关:自由变量正是张成向量的权重。看解向量第 2、4、5 个分量即知, 只能推出权重 全为零。
- 当 含非零向量时,张成集中向量的个数等于 中自由变量的个数。
4.2.3 矩阵的列空间
与零空间不同,列空间是显式定义的——直接用线性组合给出。
定义:列空间
矩阵 的列空间(column space),记作 ,是 的各列的全体线性组合之集。若 ,则
由于 是子空间(定理 1),且 的列都是 中的向量,立得:
定理 3
矩阵 的列空间是 的子空间。
注意 中的典型向量可以写成 (),因为 就是 的列的线性组合:
这也说明 就是线性变换 的值域(本节末尾会回到这个视角)。
图 4-15: 是 的列的所有线性组合之集( 的值域)
例 4:求一个矩阵 ,使下列集合 恰为 :
解:第一步,把 写成线性组合之集:
第二步,把张成集中的向量作为列拼成矩阵:
则 。
回忆 1.4 节定理 4: 的列张成 当且仅当 对每个 都有解。用列空间的语言重述:
Note
矩阵 的列空间等于整个 ,当且仅当方程 对每个 都有解。
4.2.4 Nul A 与 Col A 的对比
零空间和列空间有什么关系?例 5–7 会说明:这两个空间差别很大。(不过 4.6 节学完更多理论后,会浮现出二者之间一个出人意料的联系。)
例 5:设
(a) 若 是 的子空间, 是多少?(b) 若 是 的子空间, 是多少?
解: (a) 的每列有 3 个分量,所以 是 的子空间,。 (b) 使 有定义的 必须有 4 个分量,所以 是 的子空间,。
当矩阵不是方阵时(如例 5), 与 中的向量住在完全不同的”宇宙”里—— 中向量的任何线性组合都不可能得到 中的向量。当 是方阵时, 与 至少共享零向量,某些特殊情况下也可能有公共的非零向量。
例 6: 同例 5。在 中找一个非零向量,在 中找一个非零向量。
解:在 中找向量很容易—— 的任何一列都行,比如 。要在 中找非零向量,就行约化增广矩阵 :
于是若 ,则 ,,, 为自由变量。给 赋一个非零值,比如 ,就得到 中的向量 。
例 7: 同例 5。设 ,。 (a) 判断 是否在 中; 有可能在 中吗? (b) 判断 是否在 中; 有可能在 中吗?
解: (a) 这里不需要 的显式描述,直接算乘积 :
显然不是 的解,故 。另外 有 4 个分量,而 是 的子空间,所以 根本不可能是 的元素。
(b) 把 行约化为阶梯形:
至此已能看出方程 相容,故 。而 只有 3 个分量, 是 的子空间,所以 不可能在 中。
下面的表格总结了 与 的对比(其中第 8 条是 1.9 节定理 11 与定理 12(a) 的重述):
| 1. 是 的子空间 | 1. 是 的子空间 |
| 2. 隐式定义:只给出条件 | 2. 显式定义:直接告诉你怎样构造其中的向量 |
| 3. 找向量费时:要对 做行变换 | 3. 找向量容易: 的列就是现成的,其余由它们组合 |
| 4. 与 的元素没有明显关系 | 4. 与 的元素关系明显: 的每列都在其中 |
| 5. 典型向量 满足 | 5. 典型向量 满足: 相容 |
| 6. 判断给定的 在不在其中很容易:算 即可 | 6. 判断给定的 在不在其中可能费时:要对 做行变换 |
| 7. 当且仅当 只有平凡解 | 7. 当且仅当 对每个 都有解 |
| 8. 当且仅当变换 是单射 | 8. 当且仅当变换 把 映满 |
4.2.5 线性变换的核与值域
之外的向量空间的子空间,常常借助线性变换来描述。把 1.8 节的定义推广:
定义:线性变换
从向量空间 到向量空间 的线性变换 是一个规则:它给 中每个向量 指定 中唯一的向量 ,且满足 (i) ,对所有 ; (ii) ,对所有 和标量 。
的核(kernel,或称零空间)是 中所有使 ( 中的零向量)的 之集; 的值域(range)是 中形如 ()的全体向量之集。若 恰好来自矩阵变换,即 ,则 的核与值域正是前面定义的 与 。
不难证明 的核是 的子空间(证明与定理 2 基本相同), 的值域是 的子空间。
图 4-16:与线性变换相伴的两个子空间:核( 中)与值域( 中)
应用中,子空间通常以某个线性变换的核或值域的面貌出现。例如,齐次线性微分方程的全体解恰好是某个线性变换的核。这类线性变换通常用函数的导数来描述,细节超出本课范围,这里只看两个例子。第一个解释为什么求导是线性变换。
例 8(需要微积分):设 是定义在区间 上、可微且导数连续的全体实值函数构成的空间; 是 上全体连续函数构成的空间 。令 把 中的 变成它的导数 。微积分里两条基本求导法则
恰好说明 是线性变换。可以证明: 的核是 上的全体常函数, 的值域是整个 ( 上的全体连续函数)。
例 9(需要微积分):微分方程
( 为常数)用于描述多种物理系统:加重的弹簧的振动、单摆的运动、电感–电容电路中的电压等。方程的解集恰好是把函数 映为函数 的那个线性变换的核。求这个向量空间的显式描述是微分方程课的问题;解集正是 4.1 节习题 19 所描述的空间( 的全体)。
4.2 节练习题(PRACTICE PROBLEMS)
练习 1:设 。用两种不同方法证明 是 的子空间(用两个不同的定理)。
解: 方法一: 是齐次线性方程组(只有一条方程)的解集,由定理 2, 是 的子空间。等价地说, 是 矩阵 的零空间。
方法二:用主变量 解出 ( 为自由变量),任何解都形如
这说明 ,由定理 1, 是 的子空间。(把 或 当主变量解,还能得到 的其他张成描述。)
练习 2:设 ,,。已知 与 都相容。问 会怎样?
解: 与 都在 中。因为 是向量空间(对加法封闭), 必在 中,也就是说方程 相容(有解)。
练习 3:设 为 矩阵。若 ,证明 。
解:任取 。 是 的列的线性组合,故 。又因为 ,所以 ,即
这说明 中每个向量都属于 ,故 。
通关标准
能做到四件事:① 判断一个向量在不在 (算 )或在不在 (行约化 );② 通过解 写出 的张成集,并明白它自动线性无关;③ 给一个参数化集合,立刻写出以它为列空间的矩阵 ;④ 说出 与 至少三条区别,以及二者分别住在 还是 。
4.2 节的习题(共 40 题,包括判断向量属于 还是 、为参数化集合找矩阵、线性变换 的核与值域等)见原书。
4.3 线性无关集与基
本节研究如何用”尽可能高效”的集合去张成向量空间 或其子空间 。核心思想仍是线性无关,定义与 中一致。
定义:线性无关 / 线性相关
中指标集 称为线性无关的,如果向量方程
只有平凡解 。若方程有非平凡解(存在不全为零的权重 使等式成立),则称该集合线性相关,这个等式称为 的一个线性相关关系。
和 中一样:单个向量 线性无关当且仅当 ;两个向量线性相关当且仅当其中一个是另一个的倍数;任何含零向量的集合都线性相关。下面定理的证明与 1.7 节定理 7 相同。
定理 4
含两个及以上向量、且 的指标集 线性相关,当且仅当某个 ()是它前面那些向量 的线性组合。
一般向量空间与 的主要差别在于:当向量不是 元组时,方程 (1) 通常不能写成 个线性方程的方程组——没法把向量摆成矩阵 的列去研究 。只能依靠定义和定理 4。
例 1:设 ,,。因为 ,所以 在 中线性相关。
例 2:集合 在 ( 上全体连续函数的空间)中线性无关,因为 与 互不为倍数——不存在标量 使 对 中所有 成立(看看两个函数的图象就明白)。但是 线性相关,因为恒等式 对一切 成立。
4.3.1 基
定义:基
设 是向量空间 的子空间。 中指标集 称为 的基(basis),如果 (i) 是线性无关集; (ii) 张成的子空间恰好是 ,即 。
因为任何向量空间都是自身的子空间,这个定义也适用于 : 的基就是线性无关且张成 的集合。当 时,条件 (ii) 自动要求每个 (因为张成集包含其成员,见 4.1 节)。
例 3:设 是可逆的 矩阵,比如 。由可逆矩阵定理, 的列线性无关且张成 ,所以它们构成 的一组基。
图 4-17:可逆矩阵的列构成 的一组基
例 4:设 是 单位矩阵 的列:
集合 称为 的标准基。
例 5:设 ,,。判断 是否为 的基。
解: 中恰好有三个向量,可以用好几种方法判断矩阵 是否可逆。例如做两次行替换即可发现 有 3 个主元位置,故 可逆。由例 3 的道理, 的列构成 的一组基。
例 6:设 。验证 是 的基(称为 的标准基)。
解: 显然张成 。为证线性无关,设 满足
这意味着左边的多项式与右边的零多项式处处取值相同。代数基本定理告诉我们: 中有多于 个零点的多项式只能是零多项式。所以上式对一切 成立仅当 ,即 线性无关,故是 的基。
图 4-18: 的标准基
常见坑
中涉及线性无关和张成的问题,最省力的做法不是直接抠定义,而是 4.4 节要讲的坐标向量技巧:把多项式对应到它的系数向量,转成 里的行约化问题。
4.3.2 张成集定理
基是一个”高效”的张成集——不含多余向量。事实上,从张成集中删去多余的向量就能造出基。
例 7:设
注意 。证明 ,并求子空间 的一组基。
解: 中每个向量都属于 ,因为
反过来,设 是 中任一向量,比如 。把 代入:
所以 ,即 中每个向量都已在 里。两个集合相等。由于 显然线性无关,它是 的一组基。
把例 7 一般化:
定理 5:张成集定理(The Spanning Set Theorem)
设 是 中的集合,。 a. 若 中某个向量(比如 )是 中其余向量的线性组合,则从 中删去 后得到的集合仍张成 。 b. 若 ,则 的某个子集是 的基。
证明: (a) 必要时重排 中向量的顺序,不妨设 是 的线性组合:。任取 ,写成
把 的表达式代入,立见 是 的线性组合。因 是 的任意元素,故 张成 。
(b) 若 本身线性无关,它已是基。否则按 (a) 不断删去”依赖于其他向量”的向量,只要集合里还有两个或以上的向量就可继续,直到剩下线性无关的张成集即基。若最终只剩一个向量,由于 ,这个向量非零(从而线性无关)。
图 4-19:从张成集中删去多余向量,得到基
4.3.3 Nul A 与 Col A 的基
4.2 节求 张成集的方法,在 含非零向量时自动产生线性无关集,所以那时得到的就是 的基。下面两个例子给出求列空间基的简单算法。
例 8:求 的基,其中
解: 的每个非主元列都是主元列的线性组合:,。由张成集定理,删去 和 后 仍张成 。令
由于 且 中没有任何向量是它前面向量的线性组合, 线性无关(定理 4)。故 是 的基。
那如果 不在简化阶梯形呢?关键事实: 的列之间的任何线性相关关系都可写成 (不参与该关系的列权重为 0)。 行约化成 后, 与 的解集完全相同;若 ,,则
同解。也就是说: 的列与 的列有完全相同的线性相关关系。
例 9:可以验证
与例 8 的矩阵 行等价。求 的基。
解:例 8 中有 ,,于是可预期 ,——代入验证确实如此!所以选最小张成集时可以删去 和 。而 必线性无关:若它们之间有线性相关关系,就会对应 之间的线性相关关系,与后者的线性无关性矛盾。故 是 的基——它们正是 的主元列。
例 8、9 揭示了如下重要结论:
定理 6
矩阵 的主元列构成 的基。
证明:设 是 的简化阶梯形。 的主元列线性无关(没有哪列是前面各列的线性组合)。由于 与 行等价, 的主元列也线性无关;同理, 的每个非主元列都是 的主元列的线性组合。由张成集定理,删去非主元列后剩下的主元列就是 的基。
常见坑(极其重要!)
基要用 本身的主元列,而不是行约化后的阶梯形 的主元列!行变换会改变列空间。例如例 8 中 的各列最后一个分量都是 0,它们不可能张成例 9 中 的列空间。正确流程:在 (或任何阶梯形)里定位主元列的位置 → 回到 里取对应位置的列。
4.3.4 基的两种视角
- 基是尽可能小的张成集:用张成集定理删向量,一旦删到线性无关就必须停——再多删一个就不张成 了。
- 基也是尽可能大的线性无关集:若 是 的基,再从 里添一个向量 ,新集必线性相关——因为 张成 , 是 中元素的线性组合。
例 10: 中的下面三个集合,展示了”扩大到基”与”再扩大就垮”(反之”缩小到基”与”再缩小就垮”)的过程:
4.3 节练习题(PRACTICE PROBLEMS)
练习 1:设 ,。判断 是不是 的基?是不是 的基?
解:令 ,行约化:
的行并非每行都有主元位置,所以 的列不张成 (1.4 节定理 4), 不是 的基。又因为 是 3 维向量,根本不在 里,也不可能是 的基。不过它们显然线性无关,所以是 的某个子空间(即 )的基。
练习 2:设 ,,,。求由 张成的子空间 的基。
解:以这四个向量为列构造矩阵 (其列空间就是 ),行约化找主元列:
的前两列是主元列,构成 的基。所以 是 的基。(定位主元列不需要约到简化阶梯形,阶梯形即可。)
练习 3:设 ,,。 中每个向量都能写成 的线性组合:
问 是 的基吗?
解:不是。基的定义要求张成集的成员在 里,而 和 都不在 中!事实上 是平面 的基,而 只是其中一条直线( 的基是 )。
常见坑
练习 3 揭示了基定义里最容易被忽略的一点: 的基必须既是线性无关集、又张成 、而且每个成员都属于 。“能表示出 的向量”不等于”是 的基”。
练习 4:设 是向量空间, 与 都是线性变换, 是 的基。若对每个 都有 ,证明对所有 有 。
解:因 是 的基,任一 可写为 。由 的线性性:
通关标准
能做到四件事:① 对 中的向量组,判断它们是否构成 (或某个子空间)的基;② 用”行约化找主元列、回原矩阵取列”求 的基,并牢记基来自原矩阵;③ 用张成集定理把一个张成集”瘦身”成基;④ 知道基是”最小的张成集”也是”最大的线性无关集”这两个等价说法。
4.3 节的习题(共 38 题,包括判断 中哪些集合是基、求 与 的基、RLC 电路(下图)解空间的基等)见原书。
图 4-20:RLC 电路(习题 28:解空间 中函数形如 )
4.4 坐标系
给向量空间 指定一组基的一个重要理由,是在 上建立坐标系。本节将证明:若 含 个向量,这个坐标系会让 “表现得像” 。若 本来就是 ,这组基则给出观察 的一个新视角。坐标系之所以存在,靠的是下面这条基本定理。
定理 7:唯一表示定理
设 是向量空间 的一组基。则对 中每个 ,存在唯一一组标量 使得
证明:因 张成 ,这样的标量存在。假设另有表示 。两式相减:
由 线性无关,权重必须全为零,即 ()。
定义:坐标
设 是 的基,。使 的权重 称为 相对于基 的坐标(-坐标)。
若 是 的 -坐标,则 中的向量
称为 的坐标向量(相对于 )。映射 称为(由 确定的)坐标映射。
例 1:设 是 的基,,。若 的坐标向量是 ,求 。
解:-坐标告诉我们怎样用 中的向量搭出 :
例 2:向量 的分量其实就是 相对于标准基 的坐标:
即 。
4.4.1 坐标的图形解释
集合上的坐标系就是一个把集合中的点一一映射到 的映射。例如:在平面上选好垂直的坐标轴和每根轴上的单位长度,普通坐标纸就为平面提供了坐标系。
图 4-21:标准坐标纸上的 、 与
图 4-22:换上按基 定制的”-坐标纸”
图 4-21 是标准坐标纸:坐标 和 给出 相对标准基的位置——沿 方向 1 个单位、沿 方向 6 个单位。图 4-22 抹掉标准网格、换上一张专门适配基 (例 1)的网格:坐标向量 给出 在新坐标系中的位置——沿 方向 个单位、沿 方向 3 个单位。
例 3:在晶体学中,晶体点阵的描述依靠给 选一组基 ,对应晶体某个”晶胞”的三条相邻棱。整个点阵由许多晶胞叠成。晶胞有 14 种基本类型,下图展示了其中 3 种。
图 4-23:几种晶胞的例子
晶体中原子的坐标就是相对于这个点阵基给出的。例如坐标 标识了图 4-23(c) 中晶胞顶面面心的原子。
4.4.2 中的坐标
给定 的基 后,求指定 的 -坐标向量很容易。
例 4:设 ,,,。求 相对于 的坐标向量 。
解: 的 -坐标 满足
即
这个方程可用增广矩阵行约化求解,也可用左端矩阵的逆求解。解得 ,,即 ,故
图 4-24: 的几何图象
上面方程 (3) 左端的矩阵把 的 -坐标转换成 的标准坐标。对 中一般的基 可做同样的坐标变换。令
则向量方程 等价于
称为从 到 标准基的坐标变换矩阵:左乘 把坐标向量 变成 。这个坐标变换方程非常重要,第 5 章和第 7 章还会多次用到。
由于 的列构成 的基, 可逆(可逆矩阵定理)。左乘 把 变回它的 -坐标向量:
由 实现的对应 就是前面说的坐标映射。因为 可逆,由可逆矩阵定理,坐标映射是从 到 的单射、满射线性变换。
4.4.3 坐标映射
选好 的基 ,就在 上建立了一个坐标系。坐标映射 把可能陌生空间 与熟悉的 连接起来(下图): 中的点现在可以用它们的”新名字”来指认了。
图 4-25:从 到 的坐标映射
定理 8
设 是向量空间 的基。则坐标映射 是从 到 的单、满线性变换。
证明:取 中两个典型向量 ,。利用向量运算:
于是
坐标映射保持加法。又若 是任意标量,
故 ,坐标映射也保持数乘。所以它是线性变换(单射与满射的验证见原书习题 23、24)。
坐标映射的线性性可以推广到线性组合:若 , 为标量,则
用一句话说:线性组合的 -坐标向量,等于坐标向量的同一线性组合。
定理 8 的坐标映射是同构(isomorphism)的重要例子:从一个向量空间 到另一个向量空间 的单、满线性变换称为从 到 的同构(iso 源自希腊语”相同”,morph 源自”形式/结构”)。 与 的记号与术语可以不同,但作为向量空间二者不可区分: 中任何向量空间运算都在 中被精确复现,反之亦然。特别地,任何拥有 个向量基的实向量空间都与 不可区分。
例 5:设 是空间 的标准基,即 。 的典型元素形如
由于 本来就是标准基向量的线性组合,立得
所以坐标映射 是从 到 的同构: 中的所有向量空间运算都对应 中的运算。
打个比方:把 和 想成两块由坐标映射连接起来的计算机屏幕, 屏幕上的每个向量空间运算都被 屏幕上对应的向量运算精确复制。两块屏幕上的向量长得不一样,但作为向量的”行为”完全相同。
图 4-26:空间 同构于
例 6:用坐标向量验证多项式 ,, 在 中线性相关。
解:例 5 式的坐标映射给出坐标向量 ,,。把它们写成矩阵 的列,通过行约化增广矩阵判断 :
的列线性相关,所以对应的多项式线性相关。事实上容易看出 的第 3 列等于第 2 列的 2 倍减去第 1 列的 5 倍,对应关系为
最后一个例子涉及 中一个同构于 的平面。
例 7:设
且 。则 是 的基。判断 是否在 中;若是,求 相对于 的坐标向量。
解:若 ,则下面的向量方程相容:
标量 (若存在)就是 的 -坐标。行约化:
于是 ,,。由 在 上建立的坐标系如下图所示。
图 4-27: 中平面 上的坐标系
如果给 另选一组基,对应的坐标系是否同样使 同构于 ?答案当然是肯定的——下一节会证明。
4.4 节练习题(PRACTICE PROBLEMS)
练习 1:设 ,,,。 (a) 证明 是 的基; (b) 求从 到标准基的坐标变换矩阵; (c) 写出联系 与 的方程; (d) 求所给 的 。
解: (a) 矩阵 显然行等价于单位矩阵。由可逆矩阵定理, 可逆,其列构成 的基。 (b) 坐标变换矩阵就是 。 (c) 。 (d) 解 (c) 中的方程,行约化增广矩阵比算 更省事:
所以 。
练习 2:集合 是 的基。求 相对于 的坐标向量。
解:坐标 满足
比较 的同次幂系数:
解得 ,,,故 。
通关标准
能做到五件事:① 已知基和 反求 ,或已知基和 求 ;② 写出坐标变换矩阵 并使用 ;③ 用坐标映射把 的线性无关/张成问题化归为 的行约化问题;④ 说出同构的定义;⑤ 解释为什么任何 维向量空间都”像” 。
4.4 节的习题(共 38 题,包括求坐标向量、用逆矩阵求坐标、用坐标向量检验多项式组的线性无关性,以及钛合金六角密堆积晶格的坐标计算——其晶胞与八面体/四面体位如下两图所示)见原书。
图 4-28:钛的六角密堆积点阵与晶胞(习题 37、38)
图 4-29:晶胞中的八面体位与四面体位
4.5 向量空间的维数
4.4 节定理 8 表明:基含 个向量的向量空间 同构于 。本节要证明:这个数 是空间 的内在属性,与具体选哪组基无关——它就是 的维数。对维数的讨论还会加深我们对基的理解。
第一条定理推广了 的一个著名结论。
定理 9
若向量空间 有一组基 ,则 中任何含有多于 个向量的集合必线性相关。
证明:设 是 中多于 个向量的集合。坐标向量 在 中线性相关,因为向量个数 超过了每个向量的分量个数 。于是存在不全为零的标量 使
由于坐标映射是线性变换,
右边的零向量给出了用基向量搭出 所需的 个权重——全都是 0,即 。而 不全为零,所以 线性相关。
定理 9 说明:若 有基 ,则 中每个线性无关集至多含 个向量。
定理 10
若向量空间 有一组含 个向量的基,则 的每组基都恰好含 个向量。
证明:设 是含 个向量的基, 是 的任一组其他基。因为 是基而 线性无关,由定理 9 知 至多 个向量;又因为 是基而 线性无关, 至少 个向量。故 恰有 个向量。
图 4-30:同一空间的任何两组基所含向量个数相同
定义:维数
若非零向量空间 能被某个有限集合张成,则由张成集定理,该集合的某个子集是 的基;此时称 是有限维的,并把 的维数(记作 )定义为 的基所含向量的个数。零向量空间 的维数规定为 0。若 不能被任何有限集合张成,则称 是无限维的。
例 1: 的标准基含 个向量,所以 。标准多项式基 表明 ;一般地 。全体多项式构成的空间 是无限维的(见原书习题 27)。
例 2:设 ,其中 ,(这就是 4.4 节例 7 研究过的平面)。 互不成倍数因而线性无关,故 是 的基,。
例 3:求子空间
的维数。
解:容易看出 是下列向量的全体线性组合:
显然 ; 不是 的倍数;但 是 的倍数。由张成集定理可删去 ,剩下的仍张成 。最后, 不是 的线性组合,所以 线性无关(4.3 节定理 4),是 的基。故 。
例 4: 的子空间可按维数分类(下图):
- 0 维子空间:只有零子空间;
- 1 维子空间:由单个非零向量张成——过原点的直线;
- 2 维子空间:由两个线性无关向量张成——过原点的平面;
- 3 维子空间:只有 本身( 中任意三个线性无关的向量张成整个 ,由可逆矩阵定理)。
图 4-31: 中的一维子空间:过原点的直线
图 4-32: 中的二维子空间:过原点的平面
图 4-33: 子空间一览(点、直线、平面、全空间)
4.5.1 有限维空间的子空间
下一条定理是张成集定理的天然对偶。
定理 11
设 是有限维向量空间 的子空间。 中任何线性无关集都可以(必要时)扩充成 的一组基;且 是有限维的,并满足
证明:若 ,显然 。否则设 是 中任一线性无关集。若 张成 , 已是基;否则 中存在 ,而 仍线性无关(因为集合中没有任何向量是它前面向量的线性组合,由定理 4)。只要新集合还不张成 就继续扩充。由定理 9,线性无关集的规模不能超过 ,所以扩充终将停止——得到张成 的基,且 。
当空间或子空间的维数已知时,找基会大大简化,这要靠下一条定理。它说:只要一个集合的元素个数”对了”,就只需验证线性无关或张成二者之一。这一定理在大量应用问题(如微分方程、差分方程)中至关重要,因为那些场合验证线性无关远比验证张成容易。
定理 12:基定理(The Basis Theorem)
设 是 维向量空间()。则: 中任何恰好含 个元素的线性无关集自动是 的基;任何恰好含 个元素且张成 的集合自动是 的基。
证明:由定理 11, 个元素的线性无关集 可扩充为 的基;但该基必恰含 个元素(因 ),所以 本身已是基。再设 含 个元素且张成 :由张成集定理, 的某个子集 是 的基;由于 , 必含 个向量,故 。
4.5.2 Nul A 与 Col A 的维数
由于 的主元列构成 的基,确定了主元列就知道 的维数。 的维数似乎要费些功夫——但有一条捷径!
设 是 矩阵, 有 个自由变量。由 4.2 节,求 张成集的标准方法恰好产生 个线性无关的向量 (每个自由变量对应一个),所以 就是 的基。总结:
Note
的维数等于方程 中自由变量的个数; 的维数等于 中主元列的个数。
例 5:求下列矩阵零空间与列空间的维数:
解:把增广矩阵 行约化为阶梯形:
有 3 个自由变量 ,故 ; 有两个主元列,故 。
4.5 节练习题(PRACTICE PROBLEMS)
练习 1:判断下列命题的真假并说明理由( 是非零有限维向量空间)。 (a) 若 且 是 的线性相关子集,则 含多于 个向量。 (b) 若 张成 ,且 是 中比 含更多向量的子集,则 线性相关。
解: (a) 假。反例: 线性相关,但它只含 1 个向量,不必多于 个。 (b) 真。由张成集定理, 含有 的一组基,记为 ;则 含的向量比基 多。由定理 9, 线性相关。
练习 2:设 是向量空间 的子空间(4.1 节习题 32 已证 也是 的子空间)。证明 。
解:设 是 的一组基。注意它是 中的线性无关集,由定理 11 可(必要时)扩充成 的基。由于子空间的维数就是基所含向量个数,故 。
通关标准
能做到四件事:① 熟练说出并使用维数的核心事实:基的大小唯一、、基定理(个数对了只需验证一件事);② 给参数化子空间求基与维数(例 3 的套路);③ 直接读出行约化结果里的 (主元列数)与 (自由变量数);④ 会用维数反推: 维空间中 个线性无关向量必是基。
4.5 节的习题(共 34 题,包括求子空间的基与维数、Hermite 多项式与 Laguerre 多项式构成 的基等)见原书。
4.6 秩
借助向量空间的概念,本节深入矩阵内部,揭示隐藏在矩阵行与列之间的若干有趣而有用的关系。
例如,往一个 矩阵 里填 2000 个随机数,然后分别求 中线性无关列的最大数目、 中线性无关列(即 的行)的最大数目。令人惊讶的是:这两个数相等。这个公共值就是矩阵的秩。要解释为什么,得先研究由 的行张成的子空间。
4.6.1 行空间
若 是 矩阵, 的每行有 个分量,可以看作 中的向量。行向量的全体线性组合之集称为 的行空间(row space),记作 。每行有 个分量,故 是 的子空间。由于 的行可以等同于 的列,也可把 写成 。
例 1:设
的行空间是由 张成的 的子空间,即 。行向量习惯上横着写,但需要时也可以竖着写成列向量。
如果我们知道 各行之间的线性相关关系,就能用张成集定理把张成集缩成基。可惜对 做行变换并不能提供这些信息——行变换会改变行之间的相关关系。但行约化 确实大有用处:
定理 13
若两个矩阵 与 行等价,则它们的行空间相同。若 是阶梯形,则 的非零行构成 (以及 )的行空间的基。
证明: 由 经行变换得到,故 的行都是 的行的线性组合,从而 的行的任何线性组合也自动是 的行的线性组合——即 。由于行变换可逆,同样的论证给出 。两个行空间相同。若 是阶梯形,它的非零行线性无关(任何非零行都不是它下方非零行的线性组合;把定理 4 用于倒序排列的非零行即可),故它们构成这个公共行空间的基。
本节的主结果涉及三个空间:、、。下面的例子为它做铺垫,并展示一次行约化如何同时给出三个空间的基。
例 2:求下列矩阵行空间、列空间、零空间的基:
解:先约成阶梯形以求行空间与列空间的基:
由定理 13, 的前三行构成 的基:
对列空间:由 看出主元在第 1、2、4 列,所以 (不是 !)的第 1、2、4 列构成 的基:
注意: 的任何阶梯形都能(用非零行)给出 的基、并定位 的主元列;但求 的基需要简化阶梯形。对 继续行变换:
等价于 ,即
所以 ,,, 为自由变量。按 4.2 节的常规计算得
与 的基不同, 与 的基跟 本身的元素没有这样简单的直接联系。
常见坑
例 2 中 的前三行线性无关,但不能据此断言 的前三行线性无关!(事实上 的第 3 行 第 1 行 第 2 行。)行变换会改变矩阵行之间的线性相关关系。
4.6.2 秩定理
定义:秩
的秩(rank)是 的列空间的维数。
由于 , 的行空间的维数就是 的秩。零空间的维数有时称为 的零度(nullity),本书不使用这个术语。
定理 14:秩定理(The Rank Theorem)
矩阵 的列空间与行空间维数相等。这个公共维数就是 的秩,等于 的主元位置的个数,并满足
证明:由 4.3 节定理 6, 等于 的主元列数,即 的阶梯形 中主元位置的个数。又 的每个主元对应一个非零行,而这些非零行构成 的基,所以 的秩也等于行空间的维数。由 4.5 节, 等于 中自由变量的个数,也就是 的非主元列的个数。显然
定理得证。
定理 14 背后的思想在例 2 的计算里清晰可见:阶梯形 的 3 个主元位置确定了主变量,同时给出了 和 的基向量。
例 3: (a) 若 是 矩阵,零空间为 2 维, 的秩是多少? (b) 矩阵可能有 2 维零空间吗?
解: (a) 有 9 列,,故 。 (b) 不能。设 矩阵 有 2 维零空间,则由秩定理它必须秩为 7;但 的列是 中的向量, 的维数不能超过 6,即 ,矛盾。
下面的例子提供了一个可视化这些子空间的好方法。第 6 章将证明: 与 仅共享零向量,且二者相互”垂直”; 与 亦然。因此下图对一般情形建立了很好的心智图象。
例 4:设 。容易验证: 是 轴, 是 平面, 是方程为 的平面, 是 的全部倍数之集。下图在 的定义域中画出了 与 ;这个映射的值域 与 画在另一份 中。
图 4-34:由矩阵 确定的各个子空间
4.6.3 在方程组中的应用
秩定理是处理线性方程组信息的利器。下一例模拟了真实问题被提出的方式——不出现”矩阵""子空间""维数”这类字眼。
例 5:一位科学家在 40 个方程、42 个未知数的齐次方程组中找到了两个解。这两个解不成倍数,且其他所有解都能由这两个解的适当倍数相加构造出来。这位科学家能确定:具有相同系数的非齐次方程组必有解吗?
解:能。设 是 系数矩阵。题设说明那两个解线性无关且张成 ,所以 。由秩定理,。而 是 中唯一的 40 维子空间,故 。这意味着每个非齐次方程 都有解。
4.6.4 秩与可逆矩阵定理
与矩阵相关的各向量空间概念,为可逆矩阵定理补充了更多等价命题(接在 2.3 节原定理之后):
可逆矩阵定理(续)
设 是 矩阵。下列命题都与” 可逆”等价: m. 的列构成 的基; n. ; o. ; p. ; q. ; r. 。
证明:(m) 逻辑上等价于原定理中关于线性无关与张成的 (e)、(h)。其余五条通过一条几乎显然的推理链与之前的命题相连:
(g) 说 对每个 有解,而 恰是使 相容的那些 的集合,故 (g)⟹(n)。(n)⟹(o)⟹(p) 由维数与秩的定义。若 ( 的列数),由秩定理 ,故 ,即 (p)⟹(r)⟹(q)。(q) 意味着 只有平凡解,即 (d)。而 (d) 与 (g) 已知等价于” 可逆”。
我们没有把 的行空间相关的”显然命题”加进定理,因为行空间就是 的列空间。回忆原定理 (l): 可逆当且仅当 可逆,所以可逆矩阵定理的每条都可用 重述一遍——那会让定理翻倍、超过 30 条!
数值注记:计算机上的秩
“约成阶梯形数主元”看似简单,但除非对精确给定的元素做精确运算,行变换可能改变矩阵的”表观秩”。例如矩阵 ,若 未被精确存为 7,则计算机对 是否为零的处理会让秩显示为 1 或 2。实际应用中,矩阵的有效秩通常由奇异值分解(7.4 节)确定;奇异值分解还能可靠地给出 、、、 的基。
4.6 节练习题(PRACTICE PROBLEMS)
下列两矩阵行等价:
练习 1:求 与 。
解: 有两个主元列,故 ; 共 5 列,故 。
练习 2:求 与 的基。
解: 的主元列是前两列,故 的基为
的非零行构成 的基:。(碰巧本题中 的任何两行也能当基——行空间是 2 维且各行互不成倍数;但一般情形必须用阶梯形的非零行,不能用 自己的行。)
练习 3:求 的基,下一步该做什么?
解:对 继续行变换,把 化为简化阶梯形,然后按 4.2 节的方法用自由变量写出解向量。
练习 4: 的行阶梯形有多少个主元列?
解:由秩定理,(因为 ),所以 有 2 个主元位置。
通关标准
能做到四件事:① 一次行约化同时写出 (阶梯形非零行)、( 的主元列)、(简化阶梯形 + 自由变量)的基;② 熟用秩定理 做推理(例 3、例 5 的套路);③ 说出 以及 ;④ 记住可逆矩阵定理新增的 (m)–(r) 六条等价命题。
4.6 节的习题(共 38 题,包括”由行等价矩阵直接读秩”、基本子空间 的归属、秩 1 矩阵与外积 等)见原书。
4.7 基变换
选好 维向量空间 的基 ,相应的坐标映射 就为 建立了坐标系, 中每个 由它的坐标向量 唯一标识。
有些应用问题最初用基 描述,但改用新基 更利于求解(第 5、7 章有实例)。此时每个向量要改用新的 -坐标向量。本节研究:对每个 , 与 有何关系。
为直观起见,考虑下图中的两个坐标系。图 (a) 中 ;图 (b) 中同一个 表示为 ,即
问题就是:求这两个坐标向量之间的联系。
图 4-35:同一向量空间的两套坐标系( 系中的 )
图 4-36:同一向量空间的两套坐标系( 系中的同一个 )
例 1:设 与 是向量空间 的两组基,且
又设 ,即 。求 。
解:对 施加由 确定的坐标映射。由于坐标映射是线性变换:
把向量方程写成矩阵方程(线性组合的向量作为矩阵的列):
由 (1) 知 ,,代入即得
正是图中 的 -坐标。
把例 1 的论证一般化:
定理 15
设 与 是向量空间 的两组基。则存在唯一的 矩阵 使得
的列是 中各向量的 -坐标向量:
矩阵 称为从 到 的坐标变换矩阵:左乘它把 -坐标变成 -坐标。下图画出了这个坐标变换方程。
图 4-37: 的两套坐标系之间的变换
的列线性无关(它们是线性无关集 的坐标向量,见 4.4 节习题 25)。由于 是方阵,由可逆矩阵定理它可逆。对 两边左乘 得
即 的逆是把 -坐标变回 -坐标的矩阵:
4.7.1 中的基变换
若 而 是 的标准基 ,则 ,于是 就是 4.4 节的坐标变换矩阵
要在 的两个非标准基之间换坐标,就需要定理 15:必须求出旧基相对于新基的坐标向量。
例 2:设 ,,,, 与 是 的两组基。求从 到 的坐标变换矩阵。
解:矩阵 需要 的 -坐标向量。设 ,。按定义:
为同时解两个方程组,把 同时增广到系数矩阵上,行约化:
于是
所以
注意: 正是 (7) 行约化结果的右半块。这不是巧合——它的第一列就来自把 约化成 ,第二列同理。一般地:
对 中任意两组基之间的坐标变换矩阵,都有类似算法。
例 3:设 ,,,,, 是 的两组基。 (a) 求从 到 的坐标变换矩阵;(b) 求从 到 的坐标变换矩阵。
解: (a) 注意这里需要的是 (把 -坐标变成 -坐标),计算
所以 。
(b) 由 (a) 与 (6) 式( 与 互换):
还有另一种描述,用 4.4 节那两个分别把 -坐标、-坐标换成标准坐标的矩阵 、 表出。回忆对每个 :
于是
所以在 中, 可由 算出。不过对大于 的矩阵,例 3 那样的算法(行约化 )比先算 再算 更快。
4.7 节练习题(PRACTICE PROBLEMS)
练习 1:设 与 是向量空间 的两组基, 是以 、 为列的矩阵。下列哪个方程对所有 成立? (i) ;(ii) 。
解: 的列是 -坐标向量,所以形如 的向量( 为坐标向量)必是 -坐标向量。取 : 是某个向量的 -坐标向量,而这个向量正是 (按 展开再换算到 )。所以 (ii) 成立:。
练习 2:利用例 1 的结果,求从 到 的坐标变换矩阵。
解:例 1 的坐标向量表明
所以
通关标准
能做到三件事:① 记住并会用核心公式: 的列是旧基 中向量的新基 -坐标向量,且 ,;② 用”两向量组并排行约化到 “一步求出变换矩阵;③ 弄清箭头方向——下标 读作”从 到 “,写错方向是最常见的失分点。
4.7 节的习题(共 22 题,包括在 与标准基之间换基、用 化简三角函数积分等)见原书。
4.8 差分方程的应用
如今强大的计算机无处不在,越来越多的科学与工程问题改用离散(数字)数据而非连续数据来处理。分析这类数据的合适工具往往是差分方程。即使对连续过程建立了微分方程模型,其数值解也常常来自相关的差分方程。本节用线性代数阐释线性差分方程的一些基本性质。
4.8.1 离散时间信号
4.1 节例 3 引入的信号空间 中的信号是只定义在整数上的函数,可形象化为一个数列 。下图展示了三个典型信号,通项分别为 、 和 。
图 4-38: 中的三个信号:、、
数字信号当然出现在电气与控制系统工程中,但离散数据序列也产生于生物、物理、经济、人口学等许多领域——凡是在离散时间间隔上对过程进行测量或采样的场合。当过程从某个特定时刻开始时,常把信号写成 的形式, 的项视为零或干脆省略。
例 1:CD 唱机清晰的声音,来自以每秒 44,100 次的频率对音乐采样的结果。每次测量时,音乐信号的振幅被记录为一个数 。原始音乐由许多不同频率的声音混合而成,但数列 包含了足以重现全部频率(高达约每秒 20,000 周期,超出人耳分辨范围)的信息。
图 4-39:音乐信号的采样数据
4.8.2 信号空间 中的线性无关
为简化记号,只考虑 中三个信号 。它们线性无关,当且仅当方程
蕴含 。(“对所有 “指所有整数——正、负、零;也可只考虑从 开始的信号。)
设 满足 (1)。则 (1) 对任意三个相邻的 值()都成立,于是
(准确地说第二行应为 。)这个方程组的系数矩阵称为这些信号的卡索拉蒂矩阵(Casorati matrix),其行列式称为 的卡索拉蒂行列式(Casoratian)。
图 4-40:卡索拉蒂矩阵检验(Casorati Test)
结论:若卡索拉蒂矩阵对至少一个 值可逆,则 (2) 强制 ,三个信号线性无关。
例 2:验证 是线性无关的信号。
解:卡索拉蒂矩阵为
行变换可以证明它总可逆,但更快的是代一个具体的 ——比如 ——再行约化数值矩阵:
卡索拉蒂矩阵在 时可逆,所以 线性无关。
若卡索拉蒂矩阵不可逆,被检验的信号可能线性相关、也可能不相关(见原书习题 33)。但可以证明:若这些信号都是同一个齐次差分方程的解,则要么卡索拉蒂矩阵对所有 可逆(信号线性无关),要么对所有 不可逆(信号线性相关)。
4.8.3 线性差分方程
给定标量 ( 非零)和信号 ,方程
称为 阶线性差分方程(或线性递推关系)。通常取 。若 是零信号,方程是齐次的;否则是非齐次的。
例 3:在数字信号处理中,形如 (3) 的差分方程描述一个线性滤波器, 称为滤波器系数。把 当输入、 当输出,则相应齐次方程的解就是那些被滤掉、变成零信号的信号。向滤波器
(其中 是 的简写)输入两个不同信号试试。第一个信号来自对连续信号 按整数 采样:
( 是 的简写。)代入滤波器计算输出 ,结果发现输出恰好是输入 向前移一位。
图 4-41:低频离散信号 的采样
图 4-42:高频离散信号 的采样
第二个输入信号来自更高频的信号 ,按同样频率采样得
把 输入滤波器,输出是零信号。这个滤波器称为低通滤波器:让 通过,挡住高频的 。
例 4:齐次差分方程的解常常形如 。求方程
的一些解。
解:把 代入方程并对左边因式分解:
所以 满足 (4) 当且仅当 满足 (6)。于是 都是 (4) 的解。比如验证 :
一般地,非零信号 满足齐次差分方程
当且仅当 是辅助方程
的根。(本书不考虑重根情形;辅助方程有复根时,差分方程有形如 、 的解——例 3 正是这种情况。)
4.8.4 线性差分方程的解集
给定 ,考虑把信号 变为信号 的映射 :
容易验证 是线性变换。这说明齐次方程
的解集是 的核(被映成零信号的信号之集),从而是 的子空间——解的任意线性组合仍是解。
下面两条定理简单但极其基本。
定理 16
若 且 已知,则只要指定了 ,方程
就有唯一解。
证明:指定 后,用 (7) 定义
于是 都确定,再用 (7) 定义 。一般地,用递推关系
定义 时的 ;对 ,用递推关系
反向定义 。这样产生的信号满足 (7);反过来,任何满足 (7) 的信号必满足 (8)(9),故解唯一。
定理 17
阶齐次线性差分方程
的全体解之集 是一个 维向量空间。
证明:如前所述, 是线性变换的核,故是 的子空间。对 中的 ,令 。易验证 是线性变换。给定 中任意向量 ,由定理 16 存在唯一的 使 。所以 是从 到 的单、满线性变换,即同构。故 。
例 5:求差分方程
解空间的一组基。
解:线性代数在这里真正发挥作用!例 2 和例 4 表明 是线性无关的解。直接验证一组信号张成解空间通常很难,但这里毫无困难:定理 17 说解空间恰好是 3 维的,而 4.5 节基定理说 维空间中 个线性无关向量自动成为基。所以 是解空间的基。
描述差分方程”通解”的标准方式,就是给出解空间的一组基;这组基通常称为 (10) 的基本解组。实践中,只要找到 个线性无关的解信号,它们就自动张成 维解空间(如例 5 所示)。
4.8.5 非齐次方程
非齐次差分方程
的通解可以写成:(11) 的一个特解加上相应齐次方程 (10) 的基本解组的任意线性组合。这与 1.5 节” 的解集与 的解集平行”是同一个道理:两个映射都是线性的。
例 6:验证信号 满足差分方程
并求该方程所有解的描述。
解:把 代入 (12) 左端:
所以 确实是 (12) 的解。下一步解齐次方程
辅助方程为
根为 ,所以齐次方程的两个解是 和 。它们显然互不成倍数,故线性无关。由定理 17,解空间是 2 维的,所以 是 (13) 的解空间的基。用 (12) 的特解平移这个基,得 (12) 的通解:
下图给出两个解集的几何直观:图中每个点对应 中的一个信号。
图 4-43:差分方程 (12) 与 (13) 的解集(平行的两个”平面”)
4.8.6 化为一阶方程组
研究 阶齐次线性差分方程的现代方法,是把它换成等价的一阶差分方程组
其中 , 是 矩阵。(这种向量值差分方程的简单例子在 1.10 节已见过;更多例子见 4.9 节和 5.6 节。)
例 7:把差分方程
写成一阶方程组。
解:对每个 ,令
差分方程即 ,于是
即 ,其中 。
一般地,方程
可改写为 ,其中
常见坑
解齐次差分方程的完整流程:① 设 代入,得辅助方程;② 解出 个根 ;③ 由例 4 的结论, 都是解;④ 若它们线性无关(常用卡索拉蒂矩阵检验),由定理 17(解空间恰为 维)+ 基定理,它们自动构成基本解组。非齐次方程再加一个特解即可。
4.8 节练习题
可以证明信号 ,, 是
的解。证明它们构成该差分方程解空间的基。
解:考察卡索拉蒂矩阵
取 并行约化,验证它有 3 个主元位置,故可逆:
卡索拉蒂矩阵在 可逆,所以三个信号线性无关。而该方程解空间 的维数是 3(定理 17),由基定理,这三个信号构成 的基。
通关标准
能做到四件事:① 用 求齐次差分方程的基本解组,并明白”解空间是 维 + 基定理”为什么让”3 个线性无关解就是全部解”成立;② 用卡索拉蒂矩阵(代一个 )检验信号组的线性无关性;③ 非齐次方程通解 = 特解 + 齐次通解;④ 会把 阶方程写成 的一阶系统。
4.8 节的习题(共 37 题,包括国民收入的乘数–加速模型、悬臂梁的三弯矩方程(下图)、银行贷款与储蓄的递推、移动平均滤波等)见原书。
图 4-44:悬臂梁各支点处的弯矩(习题 19–20:三弯矩方程 )
4.9 马尔可夫链的应用
本节介绍的马尔可夫链是生物、商业、化学、工程、物理等众多领域的数学模型。共同点是:描述一个以相同方式重复多次的实验或测量,每次试验的结果是若干种指定可能结果之一,且一次试验的结果只依赖紧邻的上一次试验。
例如,每年统计某城市及其郊区的人口,向量
可以表示 60% 的人口住在城里、40% 住在郊区。各小数之和为 1,因为它们覆盖了全地区人口。这里用百分比比用人口总数更方便。
定义:概率向量、随机矩阵、马尔可夫链
分量非负且总和为 1 的向量称为概率向量。列都是概率向量的方阵称为随机矩阵(stochastic matrix)。马尔可夫链是一列概率向量 连同一个随机矩阵 ,满足
即由一阶差分方程 ()描述。
当 中的马尔可夫链描述一个系统或一系列实验时, 的各分量分别是系统处于 种可能状态的(或实验出现 种可能结果的)概率,因此 常被称为状态向量。
例 1:1.10 节研究过城市与郊区人口迁移的模型(下图)。两地区之间的年度迁移由迁移矩阵 决定:
即每年 5% 的城市人口搬到郊区,3% 的郊区人口搬进城里。 的列都是概率向量,故 是随机矩阵。设 2014 年该地区有 600,000 人住城里、400,000 人住郊区,初始分布即上面的 。求 2015 年与 2016 年的人口分布。
图 4-45:城市与郊区之间的年度迁移百分比
解:1.10 节例 3 中已算过:一年后人口向量从 变为
两边同除以总人口 100 万,并利用 :
向量 给出 2015 年的分布:58.2% 住城里,41.8% 住郊区。同理 2016 年的分布为
例 2:某选区国会选举的投票结果用 中的向量 表示(三个分量分别是投民主党 D、共和党 R、自由党 L 的百分比)。假设每两年记录一次选举结果,且一次选举的结果只依赖前一次选举的结果,那么这一列向量可能是马尔可夫链。取随机矩阵
第一列描述本次投 D 的人下次怎么投:70% 仍投 D,20% 改投 R,10% 改投 L。其余各列类似解释(见下图)。
图 4-46:相邻两次选举之间的投票流向图
若这些”转移”百分比多年不变,投票结果向量序列就构成马尔可夫链。设某次选举结果为
求下一次选举以及再下一次选举的可能结果。
解:下一次选举的状态向量是 ,再下次是 :
下次:44% 投 D,44.5% 投 R,11.5% 投 L。
再下次:38.7% 投 D,47.8% 投 R,13.5% 投 L。
为什么 确实给出下次选举的结果?设”首次”选举 1000 人投票:D 550、R 400、L 50。下次选举中,550 的 70% 仍投 D,400 的 10% 从 R 转投 D,50 的 30% 从 L 转投 D,故 D 的总票数为
即下次 44% 的票投 D。这个计算与算 第一个分量的过程本质相同;其余分量及 的分量同理。
4.9.1 预测遥远的未来
马尔可夫链最有趣的方面是长期行为。比如例 2 中,许多次选举之后(假设随机矩阵不变)投票情况会怎样?例 1 中的人口分布”从长远看”会怎样?先看一个数值例子。
例 3:设 ,。考虑由 ()描述的系统。随着时间推移系统会怎样?计算 一探究竟。
解:
继续算下去(保留四到五位有效数字):
这些向量似乎在逼近 ——从一个 到下一个 ,概率几乎不再变化。而且下述计算精确成立(无舍入误差):
系统处于状态 时,相邻两次测量之间不再发生任何变化。
4.9.2 稳态向量
定义:稳态向量
若 是随机矩阵,则满足
的概率向量 称为 的稳态向量(steady-state vector,或平衡向量)。
可以证明:每个随机矩阵都有稳态向量。例 3 的 就是 的稳态向量。
例 4:概率向量 是例 1 人口迁移矩阵 的稳态向量,因为
若例 1 中该地区总人口为 100 万, 对应 375,000 人住城里、625,000 人住郊区。一年之内:搬出城的人 ,搬进城的人 ——恰好抵消,城内人口不变;郊区人口同理保持稳定。
例 5:求 的稳态向量。
解:先解方程 :
(回忆 1.4 节 。)对本例的 :
行约化增广矩阵求 的全部解:
于是 , 为自由变量,通解为 。解空间的一组基可以取 ,但取不含分数的 (对应 )更好。最后,在解集中找出那个概率向量:把 除以分量之和:
验证:。
常见坑
求稳态向量的完整三步:① 解 (注意 不能直接当齐次方程组解,必须先写成 );② 解集的非零倍数都是解,挑一个分量简单的;③ 归一化:除以分量之和变成概率向量,得到的才是稳态向量。
4.9.3 正则随机矩阵与定理 18
若随机矩阵的某个矩阵幂 只含严格正的元素,则称 是正则(regular)的。例如对例 3 的 :
每个元素都严格为正,所以 是正则随机矩阵。
若向量序列 的各分量当 充分大时能任意接近向量 的对应分量,则称 当 时收敛到 。
定理 18
若 是 正则随机矩阵,则 有唯一的稳态向量 。而且,若 是任意初始状态且 (),则马尔可夫链 当 时收敛到 。
这条定理(证明见标准马尔可夫链教材)最惊人的地方是:初始状态对马尔可夫链的长期行为没有任何影响。为什么如此,5.2 节会用特征值理论解释。
例 6:例 2 中,假定历次选举构成马尔可夫链,那么很多年以后的某次选举中,会有百分之多少的选民投共和党?
解:手算时错误的做法是:随便取一个初始向量 ,算 ( 很大)——你既不知道该算多少个,也不能确定极限值。
正确做法是计算稳态向量,然后引用定理 18。对例 2 的 ,把对角元素各减 1 得 ,行约化增广矩阵:
把每行乘以 10 简化算术:
通解为 ,, 自由。取 得整数基向量,再归一化:
的分量描述了多年后选举的得票分布(假设随机矩阵保持不变)。所以最终大约 54% 的票将投给共和党候选人。
数值注记
若 ,则 ,一般地 。要算某个具体的 ,逐步算 比 更省算术;但 不大时(如 ),机器时间无所谓,直接算 只需更少的键击。
4.9 节练习题(PRACTICE PROBLEMS)
练习 1:设居民按例 1 的迁移矩阵 迁移,随机选一位居民,状态向量给出他此刻是城里人/郊区人的概率。 (a) 若他现在是城里人(),他明年住郊区的可能性多大? (b) 他两年后住郊区的可能性多大?
解: (a) 由于 5% 的城里人一年内会搬到郊区,且没有更多信息,可说有 5% 的概率他搬到郊区。这包含在状态向量 的第二个分量里:
(b) 两年后住郊区的可能性是 9.6%,因为
练习 2:设 ,。 是 的稳态向量吗?
解:稳态向量必须满足 。但
所以 不是 的稳态向量。
练习 3:例 1 中,许多年后将有多大的百分比人口住在郊区?
解:例 1 的 各元素严格为正,是正则随机矩阵,可引用定理 18;稳态向量已由例 4 求得:。所以人口分布向量 收敛到 ——最终 62.5% 的人口将住在郊区。
通关标准
能做到四件事:① 从文字描述写出随机矩阵(列 = “从某状态出发”的转移概率)和初始状态向量;② 熟练求稳态向量:解 → 取整数值基向量 → 归一化;③ 会判断正则性( 是否全正)并用定理 18 断言长期行为与初始状态无关;④ 明白 以及稳态向量的守恒含义(进出每个状态的人流恰好抵消)。
4.9 节的习题(共 22 题,包括电台听众转换(习题 1)、实验动物选食(下图)、学生健康/天气模型、加州人口迁移与底特律租车车队等)见原书;其中习题 22 的采样信号背景如下图。
图 4-47:信号 的采样数据(习题 22)
图 4-48:实验动物在三种食物之间的选择(习题 2)
自测一下
1. 为什么"不过原点的直线/平面"不可能是 或 的子空间?
子空间必须包含大空间的零向量(定义第一条)。 或 的零向量就是原点,不过原点的直线或平面根本不含原点,所以直接被否决。此外它们对数乘也不封闭:把里面的向量乘以 会沿着不过原点的方向”滑出”集合。
2. 与 分别是哪个 的子空间?判断一个向量 是否属于它们,各用什么方法?
对 矩阵 : 是 的子空间( 有 个分量才能算 ), 是 的子空间( 的列有 个分量)。判断 很容易:直接算 看是否为零向量。判断 则要对增广矩阵 做行变换,看 是否相容。
3. 求 的基时,为什么必须用 本身的主元列,而不能用行约化后阶梯形 的主元列?
因为行变换会改变列空间: 的列一般不在 中。 的作用只是定位主元列在哪些位置——由于 与 同解, 的列与 的列有完全相同的线性相关关系,所以 的主元列线性无关且张成 ,构成基; 的列自己却可能张成另一个空间。
4. 说出秩定理的公式,并用它回答: 矩阵 若有 4 个主元列, 是多少? 能等于 吗?
秩定理:( 为列数)。4 个主元列说明 ,故 。 是 的子空间且维数为 4,不可能等于 —— 中 4 个向量最多张成一个 4 维真子空间。
5. 为什么一个 3 阶齐次线性差分方程只要找到 3 个线性无关解,就能断言它们是全部解?求稳态向量时为什么必须解 而不是 ?
定理 17 说 阶齐次差分方程的解空间恰好是 维向量空间;再由基定理, 维空间中恰好 个线性无关的向量自动构成基,所以 3 个线性无关解就是基本解组,任何解都是它们的线性组合。稳态向量要求 ( 被映回自己),这等价于 ;而 解的是被映成零向量的向量,两者完全是不同的方程—— 是随机矩阵时 ,解 只会得到零向量。