本篇导读

本篇是 David C. Lay《Linear Algebra and its Applications》(5th Edition) 第 6 章 Orthogonality and Least Squares(正交性与最小二乘) 的中文初学者精讲笔记。前五章解决的问题是”方程组有没有解”;本章更进一步:当方程组根本无解时,怎样找出’最接近解’的近似解。这条路要经过五个台阶:内积与长度(6.1)→ 正交集(6.2)→ 正交投影(6.3)→ 格拉姆–施密特过程(6.4)→ 最小二乘(6.5),最后 6.6~6.8 把这些工具用到线性回归、内积空间、傅里叶级数等实际问题中。全书所有例题与练习题(Practice Problems)均已保留并逐步讲解,各节习题清单请见原书。

开篇故事:北美大地基准与 GPS 导航

想象一个需要十年时间、由几十位科学家共同完成的项目:求解一个 的线性方程组。这正是 1974 年美国国家大地测量局(National Geodetic Survey)更新**北美大地基准(North American Datum, NAD)**时做的事。NAD 是覆盖整个北美大陆的 268000 个精确定位参考点构成的网络,是所有测绘、地图、法定地界与土木工程放样的基础。由于 1927 年后新增了 20 多万个点、误差常年累积,必须整体重新平差。

这个庞大的方程组在普通意义下没有解——它只有最小二乘解:一种”最能与 180 万个观测数据相吻合”的方式给每个参考点分配经纬度。1986 年,人们通过求解一个 928735 个方程、928735 个未知量的”法方程”得到了这个最小二乘解。

图 6-1

图 6-1:北美大地基准与 GPS——地面参考点、卫星与用户定位相互依存

今天,地面参考点位置的精度直接决定 GPS 卫星定位的精度:GPS 接收机测量来自至少三颗卫星的信号到达时间,结合卫星位置数据推算自己的位置;有第四颗卫星时还能估计海拔。NAD 与 GPS 这两个问题本质上都归结为找一个”近似满足”无解方程组的向量——这正是本章前六节要讲清楚的事情。

要”近似”就得先定义什么叫”近”。6.1 节引入向量空间中的距离与正交;6.2、6.3 节说明如何用正交性找出子空间 中离外部点 最近的点;把 取成矩阵的列空间,6.5 节就自然导出了无解线性方程组的最小二乘解法;6.4 节顺路给出数值线性代数中广泛使用的矩阵分解;最后几节把最小二乘推广到更一般的向量空间。

6.1 内积、长度与正交

平面与立体几何中”长度、距离、垂直”这些概念,如何在 中定义?答案出人意料地简洁:全部用”内积”这一个工具定义。这三个概念是后面所有最小二乘问题的地基。

内积(Inner Product)

看成 列矩阵,则 行矩阵,乘积 矩阵——即一个数。这个数就是 内积(inner product),也叫点积(dot product),记作 。若

它是什么:对应分量相乘再求和,得到一个标量。为什么重要:它是”长度”和”角度”的代数化,后面判断两个向量是否垂直,只要看内积是否为零。

例 1,计算

两者相等不是巧合:把每个乘积项 换序成 ,结果显然一样。这直接引出下面的一般性质。

定理 1 为标量,则

  • a. (交换律)
  • b. (对加法的分配律)
  • c.
  • d. ,且 当且仅当

把 (b) 与 (c) 反复使用,得到一个后面常用的规则:

向量的长度

定义长度(length,或称范数 norm)是非负标量

图 6-2

图 6-2:把 解释为长度

为什么这样定义合理:若 ,把 看成平面上的点, 恰好就是原点到该点线段的标准长度——对直角三角形用勾股定理即可验证。对 用长方体的对角线做类似计算,结论同样成立。

对任意标量 ,有 (计算 再开方即得)。

长度为 1 的向量叫单位向量(unit vector)。把非零向量 除以自己的长度(即乘 ),得到与 同方向的单位向量 ——这一操作叫归一化(normalizing)。

图 6-3

图 6-3:归一化示意(a)——沿原方向把向量缩放至长度 1

图 6-4

图 6-4:归一化示意(b)——归一化只改变长度,不改变方向

例 2,求与 同方向的单位向量

先算长度:

再用 缩放:

验证:

例 3 中由 张成的子空间,求一个构成 的基的单位向量

的所有倍数构成,任何非零元素都是基。为简化计算,先”缩放”消去分数:乘 3 得 。计算 ,归一化得

另一个单位向量是 (反方向)。

实用技巧

向量里出现分数时,先乘一个适当的整数把分量变干净再算长度——缩放不改变方向,最后归一化一次即可。例 3 正是这样把 变成 的。

中的距离

数轴上 两点的距离是 。把它推广到

图 6-5

图 6-5:实数轴上的距离

定义距离(distance)记作 ,是向量 的长度:

中,这与通常的两点欧氏距离公式完全一致。

例 4 计算 的距离。

图 6-6

图 6-6: 的距离就是 的长度

观察平行四边形(图 6-6): 加到 上得到 ,所以 的距离与 的距离相等。

例 5,则

这就是立体解析几何中的标准两点距离公式。

正交向量

本章其余全部内容都建立在”垂直”的 版本上。考虑 (或 )中过原点、分别由 确定的两条直线:几何上这两条直线垂直,当且仅当 的距离等于 的距离(平方相等)。计算第一个距离的平方:

同理(把 换成 ):

两个平方距离相等当且仅当 。于是得到核心定义。

图 6-7

图 6-7:两条过原点的直线垂直,等价于

定义 中两个向量 正交(orthogonal,即垂直的线性代数叫法),如果

注意零向量与任何向量都正交()。上面的推导顺带证明了下面这个定理。

定理 2(勾股定理) 正交当且仅当

图 6-8

图 6-8:勾股定理的可视化——直角三角形两直角边对应正交向量

正交补(Orthogonal Complements)

如果向量 与子空间 中的每一个向量都正交,就说 正交。所有这些 组成的集合叫 正交补(orthogonal complement),记作 (读作”W perpendicular”或”W perp”)。

图 6-9

图 6-9:过原点的平面与直线互为正交补

例 6 中过原点的一个平面, 是过原点且垂直于 的直线。若 且都非零,则线段 垂直于线段 ,即 。所以 上每个向量都与 中一切向量正交,并且反过来也成立:

两个以后要用的事实(证明见原书 6.1 节习题 29、30):

  1. 向量 当且仅当 张成 的某个集合中的每个向量都正交——只需检查生成元,不必检查 中所有向量。例如 都正交,就意味着 中一切向量正交。
  2. 本身是 的子空间。

图 6-10

图 6-10:与 都正交的向量,垂直于它们张成的整个平面

下面的定理揭示了矩阵四大基本子空间之间的正交关系。

定理 3 矩阵,则 的行空间的正交补是零空间,列空间的正交补是 的零空间:

图 6-11

图 6-11: 矩阵 确定的四个基本子空间及正交关系

证明思路:按行–列法则计算 时, 的每一行做点积。若 ,说明 与每一行都正交,从而与行空间正交;反之亦然。第二式对 用第一式,并注意

常见坑

定理 3 中是”行空间 ⊥ 零空间”,而列空间与零空间一般不垂直。判断哪两个子空间正交时,看清楚矩阵是谁:,不是

证明两个集合相等(如 )的标准套路是双向包含:任取左边一个元素证明它在右边,再反向做一遍。

中的夹角(选学)

对非零向量 ,内积与夹角 之间有漂亮的关系:

图 6-12

图 6-12:两个向量之间的夹角

中用余弦定理验证:三角形三边长为 ,由余弦定理

整理后展开平方项,得

时,公式 (2) 可用来定义 中两向量的夹角。例如统计学中的相关系数(correlation coefficient),就是用公式 (2) 定义的

6.1 练习题

本节习题见原书(习题 1–34),其中 1–8 题用给定向量练习内积与长度计算,19–20 题为判断题,27–31 题专门练习正交补性质,是很好的内积运用训练。

6.1 练习问题(Practice Problems)

1.,计算

,故 ,且

这正是把 投影到 方向上的”雏形”——6.2 节会正式定义这个操作。

2.

(a) 求 方向上的单位向量 ;(b) 证明 正交;(c) 用 (a)(b) 解释为什么 必与单位向量 正交。

(a) 先缩放: 乘 3 得 。于是

(b) ,故正交。

(c) 的某个倍数 ,于是 正交性在缩放下保持不变——这是内积线性性质(定理 1(c))的直接推论。

3. 的子空间,已知 也是子空间。证明

,取 的基 ),令 是以 为行的 矩阵,则 。由定理 3,,故 。由秩定理(第 4 章):

,则 ,结论同样成立。

6.2 正交集

正交集与正交基

若向量集 任意两个不同向量都正交(即 ),则称之为正交集(orthogonal set)。

例 1 证明 是正交集,其中

图 6-13

图 6-13:三条线段两两垂直——正交集的几何形象

检查全部三对不同的向量:

每一对都正交,故 是正交集( 个向量要检查 对)。

定理 4非零向量组成的正交集,则 线性无关,从而是其张成子空间的基。

证明。两边与 做内积,由线性性质与正交性:

,故 。同理 ,即线性无关。∎

的一个基同时是正交集,就叫 正交基(orthogonal basis)。正交基好用在哪?看定理 5。

定理 5 是子空间 的正交基。对每个 ,线性组合 中的权重为

证明 做内积:,除以 解出 。对每个 同理。∎

为什么重要:有了正交基,求权重不需要解线性方程组——每个权重一次内积除法搞定;普通基则要像第 1 章那样行化简求解。

例 2 例 1 的集合 的正交基,把 表示成 中向量的线性组合。

计算

由定理 5:

通关标准

给一个正交基和向量 ,你要能不列方程组、直接用 写出分解,并代入验证结果等于

正交投影(到一条直线上)

现在做一个将成为本章核心的构造:给定非零向量 ,把 分解成”沿 方向的一部分”加”与 垂直的一部分”:

其中 正交。对任意 ,令 则 (1) 自动成立;而 正交当且仅当

。由此得唯一解。

图 6-14

图 6-14:选择 ,使 恰好与 正交

称为 上的正交投影(orthogonal projection), 称为 正交的分量。用 )代替 得到同一个 ,所以投影实际由 张成的直线 决定,也记作

例 3。求 的正交投影,并把 写成”一个在 中、一个与 正交”的两个向量之和。

计算 ,故

正交的分量为

两向量之和确实等于

图 6-15

图 6-15: 到过原点直线 的正交投影

验算习惯:若计算无误, 应是正交集。这里

例 4 求图 6-15 中 到直线 的距离。

的距离就是从 垂直落到投影点 的那条垂线段的长度,即

定理 5 的几何解释

公式 (2) 的形状与定理 5 中每一项完全一样——定理 5 是把 分解成”到一串一维子空间的正交投影之和”。以 )为例,任意 可写成

第一项是 所在直线上的投影,第二项是在 所在直线上的投影——(3) 把 表示为它在两条正交”坐标轴”上投影之和。

图 6-16

图 6-16:把一个向量分解成两个投影之和

力的分量分解

图 6-16 的分解在物理中很常见:力用向量 表示,若关心的只是某个方向(比如物体的运动方向 ),关键一步就是把力分解为沿 的分量垂直于 的分量——计算与例 3 完全相同。

图 6-17

图 6-17:把力分解为沿运动方向的分量与垂直分量

标准正交集(Orthonormal Sets)

若一个集合既是正交集、又全由单位向量组成,就叫标准正交集(orthonormal set);它张成的子空间的基叫标准正交基。由定理 4,它自动线性无关。最简单的例子是 的标准基

例 5 证明 的标准正交基,其中

图 6-18

图 6-18: 中一组标准正交基(例 5 的向量恰是例 1 向量的归一化版本)

两两正交:

再验证都是单位向量:

故为标准正交集;三个向量线性无关,构成 的基。

把非零正交集的每个向量归一化,得到的新集合仍是正交集(因此是标准正交集)——正交性在缩放下不变。

列标准正交的矩阵

定理 6 矩阵 的列构成标准正交集,当且仅当

证明(一般情形同理),则

这些元素都是(转置记号下的)内积:列两两正交 ⟺ 所有 ;列都是单位向量 ⟺ 对角元全为 1。两者合起来恰是 。∎

定理 7 是列标准正交的 矩阵,,则:

  • a. (保持长度)
  • b. (保持内积)
  • c. 当且仅当 (保持正交)

性质 (a)(c) 说明映射 保持长度与正交性——这是许多计算机算法(如 QR 算法)依赖的关键性质。

例 6 的列标准正交(),验证

正交矩阵(orthogonal matrix):可逆方阵 满足 。由定理 6,这样的矩阵列标准正交;反过来,列标准正交的方阵必是正交矩阵。正交矩阵在第 7 章会反复出现。

例 7 矩阵

是正交矩阵——它是方阵,且由例 5 知其列标准正交。请验证它的也标准正交。

三行恰是例 5 中 的转置。逐对计算行的内积与长度:

同理可算 (分母通分后分子恰好相消);各行长度满足 ,其余两行同样为 1。故行也标准正交。

另一个更快的角度: 的列标准正交 ⟺ ,即 ,而这正是”行两两正交且为单位长度”的矩阵表述——正交矩阵的行必然标准正交(一般证明见原书习题 27、28)。

到直线的反射(拓展)

正交投影还能定义反射:给定过原点的直线 关于 的反射定义为

即”镜像点”=投影点再加上一份”超出量” 。可以证明 是线性变换(原书 6.2 节习题 34)。由这类反射构造的初等反射矩阵(Householder 矩阵)是数值计算中生成 QR 分解的重要工具(见本章末补充题 7)。

图 6-19

图 6-19: 关于过原点直线的反射

6.2 练习题

本节习题见原书(习题 1–36):1–6 判断正交集,7–10 练习正交基分解,17–22 判断/构造标准正交集,23–24 为判断题。

6.2 练习问题(Practice Problems)

1.,证明 的标准正交基。

正交:。单位长度:

由定理 4 线性无关;两个线性无关向量在 中构成基,且是标准正交基。

2. 取例 3 中的 与直线 ,改用 (与例 3 不同的直线方向向量)计算

与例 3 的结果完全相同!这说明正交投影与在直线上选取哪个非零向量 无关(原书习题 31 给出代数证明:把 换成 ,分子分母同乘 ,结果不变)。

3. 用例 6 的 ,取 ,验证

由例 6 知 ,故 ;而 ✓。这正是定理 7(b)。

4. 列标准正交矩阵,证明

由定理 6,。两边取行列式并用第 3 章 3.2 节定理 5、6:

6.3 正交投影

6.2 节解决了”投影到一条直线”;本节推广到”投影到任意子空间 “——这是通往最小二乘的最后一站。

中给定 与子空间 ,存在唯一的 满足:(1) 正交;(2) 中离 最近的点。

图 6-20

图 6-20: 中点到直线的投影,在 中有直接类比

这两个性质是求解最小二乘问题的关键(6.5 节完整展开)。

正交分解定理

先把 的正交基”切开”。若 的正交基, 的展开式总可分成两段之和。

例 1 的正交基,。把 写成 中的 中的 之和。

按基向量”分组”:

。为证 ,只需验证它与 的基向量正交(6.1 节事实 1):

同理 ,故

例 1 依赖 的完整正交基。下面的定理说明:只要 自己有正交基就够了

定理 8(正交分解定理) 的子空间,则每个 都可唯一写成

其中 。事实上,若 的任意正交基,则

称为 正交投影,记作 。当 是一维子空间时,公式退化为 6.2 节的 (2) 式。

图 6-21

图 6-21: 到子空间 的正交投影

证明要点:公式 (2) 定义的 ;令 ,对 的每个基向量 计算 ,正交性使交叉项全部消失,剩下 ,故 。唯一性:若另有 ,两式相减得 ,左边在 中、右边在 中,故该向量自身与其内积为零,必为零向量。∎

唯一性的重要推论 只依赖子空间 ,与用哪个正交基计算无关。

例 2 的正交基。把 写成 中向量与垂直于 的向量之和。

由公式 (2)():

于是

分解为

验算习惯:定理 8 已保证 ,但手算时最好验证 的内积都为零。

正交投影的几何解释

时,公式 (2) 中的每一项本身就是 到一条直线( 张成的一维子空间)的投影。所以: 的正交投影,等于它到 的正交基各条”正交轴”上投影之和

图 6-22

图 6-22: 到互相正交的一维子空间投影之和

投影的性质与最佳逼近定理

本来就在 中,则分解式 (2) 恰是定理 5 的展开式,故

定理 9(最佳逼近定理) 的子空间, 的正交投影。则 中离 最近的点:

对所有属于 且不等于 成立。

图 6-23

图 6-23:正交投影 中离 最近的点

称为 的元素对 最佳逼近(best approximation)。当实际问题需要用固定子空间 中的向量 近似给定的 时, 就是”误差”,定理 9 说误差在 时最小

证明。则 ,而由正交分解定理 ,特别地它垂直于 。把 用勾股定理(定理 2):

,第二项严格为正,故 (3) 成立。∎

附带收获

这个证明还再次说明 与所选正交基无关:用别的正交基算出的投影同样是最优点,而最优点唯一。

例 3 在例 2 的条件下, 中离 最近的点就是

例 4 中点 到子空间 距离定义为 中最近点的距离。求 的距离,其中

由最佳逼近定理,距离为 。因 是正交基():

距离为

标准正交基下的简洁公式

定理 10 是子空间 的标准正交基,则

,则

证明 单位长度使 (2) 中的分母 ,得 (4)。权重 恰是 的分量,故 (4) 即 。∎

补充两个有用的恒等式( 列标准正交矩阵,):

正交矩阵,则 对一切 成立。

常见坑

公式 (4) 理论上很漂亮,但分量含平方根,手算反而麻烦;手算请用公式 (2)(定理 8),计算机算法才偏爱标准正交形式 (5)。

6.3 练习题

本节习题见原书(习题 1–26):3–6 练习投影计算,7–10 练习正交分解,11–14 练习最近点与最佳逼近,15–16 练习求距离,21–22 为判断题。

6.3 练习问题(Practice Problems)

1.。利用 计算

投影竟然等于 自身!原因: 恰好是 的线性组合(),此时 中离 最近的点就是 本身。

2. 的子空间,。若 ,证明

用定理 10 的矩阵形式:取列标准正交的 (列构成 的标准正交基),则

即正交投影是线性运算(对加法与数乘均保持)。

6.4 格拉姆–施密特过程

前面三节不断用到”正交基”——但正交基从哪来?**格拉姆–施密特过程(Gram–Schmidt process)**是一个简单算法:从任意基出发,为 的任何非零子空间制造正交(或标准正交)基。

图 6-24

图 6-24:构造正交基 ——从 中减去它在 上的投影

算法的思想

核心动作只有一个:从新向量中减去它在”已正交化的部分”上的投影,剩下的就是垂直分量。

例 1。构造 的正交基

上的投影为 ,其正交补分量为

(其中 。) 中非零正交组;因 ,它就是 的正交基。

完整算法

定理 11(格拉姆–施密特过程) 给定非零子空间 的基 ,定义

的正交基,并且对每个

证明思路(归纳):设已构造出 的正交基 ,定义 。由正交分解定理,;由子空间对减法封闭且 ;又 保证 。于是在 维空间 中得到 个非零正交向量,由基定理它是正交基。∎

(1) 式说明第 步的向量只”替换”了原来前 个向量的张成范围,不越界。

例 2,它们线性无关,构成子空间 的基。构造 的正交基。

第 1 步

第 2 步 中减去它在 上的投影:

第 2′ 步(可选缩放) 有分数,乘 4 换成 仍是正交基。

第 3 步 中减去它在 上的投影:

于是

图 6-25

图 6-25:由 与子空间 构造

与投影都在 中), 是非零正交组。 由三个向量张成、是三维的,故由基定理它就是 的正交基。

实用技巧

中间向量出现分数时随时缩放(乘一个整数)——缩放不破坏正交性,却让后续计算清爽得多。例 2 的第 2′ 步、例 4 的 都是如此。

构造标准正交基

从正交基 得到标准正交基只需归一化每个 。手算时”先全部正交化、最后统一归一化”比”每步立刻归一化”更省事(避免反复出现根号)。

例 3 例 1 得到正交基 。对应的标准正交基为

QR 分解

定理 12(QR 分解) 矩阵 的列线性无关,则 可分解为 ,其中 是列构成 标准正交基的 矩阵, 是对角元为正的上三角可逆 矩阵。

证明思路 的列 跑格拉姆–施密特(加归一化),得 的标准正交基 ,令 。由性质 (1),每个 ,即 ,其中 只有前 个分量可能非零(适当调整符号可设 )。令 ,则 上三角;列无关保证 可逆。∎

例 4 的 QR 分解。

的三列恰是例 2 的 ,正交基已求出:

缩放 ,归一化后作 的列:

(列标准正交)得

数值注记(原书):

  1. 计算机上跑格拉姆–施密特时舍入误差会累积,向量多了之后正交性可能”丢失”;改进的格拉姆–施密特(调整计算顺序)能显著缓解,但实用中更常用另一种约需两倍运算量的 QR 算法,它能给出更精确的标准正交基。
  2. 实际程序通常用一系列正交矩阵左乘 把它变成上三角阵来做 QR 分解——与用初等矩阵左乘得到 LU 分解的思路类似。

6.4 练习题

本节习题见原书(习题 1–26):1–6 练习格拉姆–施密特,9–12 求列空间正交基,13–16 求/用 QR 分解,17–18 为判断题。

6.4 练习问题(Practice Problems)

1.。构造 的标准正交基。

,则 ,故 —— 已经是正交的,只需归一化:

(第二个向量先乘 3 化为 再归一化,避开分数。)

2. 列正交, 矩阵)。证明:若 的列线性相关,则 必不可逆。

列相关 ⟺ 存在非零 使 ,即 。由 6.2 节定理 7(a)( 列标准正交时保持长度):

存在非零 使 ,由可逆矩阵定理, 不可逆。∎

6.5 最小二乘问题

本章开头的大地测量方程组无解。现实中无解方程组比比皆是(测量有误差、数据有噪声),但又必须给出一个”解”。能做的最好事情是:找 使 尽可能接近

什么是最小二乘解

看作 的近似,距离 越小近似越好。一般最小二乘问题:求 使 达到最小(“最小二乘”得名于这个距离是平方和的平方根)。

定义最小二乘解,使得

关键观察:无论 取什么, 都落在列空间 里。所以问题等价于: 中找离 最近的点

图 6-26

图 6-26: 比到其他任何 都近

(若 本来就在 中,方程组相容,普通解就是”最小二乘解”。)

法方程(Normal Equations)

由最佳逼近定理,取 ,方程 必相容,其解就是最小二乘解(有自由变量时解不唯一——但 本身唯一)。

图 6-27

图 6-27:最小二乘解 中的权重列表

再由正交分解定理, 垂直于 的每个列向量 。把所有列拼起来:

(这正是 6.1 节定理 3:。)展开:

定理 13 的最小二乘解集合,与法方程(normal equations) 的(非空)解集合完全相同。

证明要点:上面已证最小二乘解满足法方程;反之,若 满足法方程,则 的所有列正交、从而垂直于整个 ,于是 是正交分解,由唯一性 。∎

常见坑

法方程是 不要写成 的、以未知数个数为准; 的、以方程个数为准——写错维度整个方向就错了。

例 1 求不相容方程组 的最小二乘解,其中

计算法方程各部分:

法方程为 可逆(),用逆矩阵解:

例 2 的最小二乘解,其中

这类矩阵出现在统计学方差分析(analysis of variance)问题中。

计算得

对法方程的增广矩阵行化简:

通解为 自由。最小二乘解的通式:

有无穷多个,但它们都对应同一个投影

何时最小二乘解唯一

定理 14 矩阵,下列命题等价:

  • a. 对每个 有唯一最小二乘解;
  • b. 的列线性无关;
  • c. 矩阵 可逆。

此时唯一的最小二乘解为

公式 (4) 主要用于理论推导,以及 可逆矩阵时的手算。

最小二乘误差

得到近似 后,距离 称为这次近似的最小二乘误差(least-squares error)。

例 3 用例 1 的 求最小二乘误差。

由例 1,,故

最小二乘误差为 :对任何 的距离至少是 (注意图 6-28 里画的是列空间中的 ,不是 本身)。

图 6-28

图 6-28:最小二乘误差 的几何意义

列正交时的快捷算法

例 4 的最小二乘解,其中

的列 正交),可直接对 做投影:

而权重已经现成地写在上式里,故

(这类列正交矩阵常见于下一节的线性回归问题。)

用 QR 分解求最小二乘解

有时法方程是病态的(ill-conditioned): 元素的微小计算误差会放大成 的大误差。若 的列线性无关,更可靠的做法是用 QR 分解。

定理 15 矩阵 列线性无关, 是 QR 分解,则对每个 ,方程 有唯一最小二乘解

证明 。由定理 12, 的列是 的标准正交基,由定理 10,,故 是最小二乘解;唯一性由定理 14。∎

数值注记 是上三角阵,实际计算应解三角方程组 (回代或行化简),不要先算 再乘——快且更稳定。

例 5 用 QR 分解求 的最小二乘解,其中

按 6.4 节方法可得

计算

解上三角方程组

回代:。故

6.5 练习题

本节习题见原书(习题 1–26):1–4 练习构造法方程,5–6 求全部最小二乘解,7–8 求最小二乘误差,9–12 求投影与最小二乘解,15–16 用给定 QR 分解求解,17–18 为判断题。

6.5 练习问题(Practice Problems)

1.。求 的最小二乘解及最小二乘误差。

先算

对法方程增广矩阵行化简:

通解为 自由。取 得一个特解

求误差:!误差 。这是因为 恰好落在 里——方程组实际相容,且 不可逆(列相关),最小二乘解有无穷多个,误差均为零。

2. 的列都正交时,最小二乘解有什么特点?

的每个生成元正交 ⟹ ,于是最小二乘解 满足 ,即最小二乘解恰好是齐次方程 的解; 总是一个最小二乘解。

6.6 线性模型中的应用

科学与工程的常见任务:用数据建立公式,预测一个变量随其他变量变化的规律。本节展示多种这样的场景——每一步最终都化归为解一个最小二乘问题。为了贴近统计学惯例,把 改写成 设计矩阵(design matrix),参数向量观测向量

最小二乘直线

两个变量最简单的关系是 。实验数据给出点 ,看起来大致落在一条直线附近,问题是确定 使直线”最贴近”数据。

图 6-29

图 6-29:用直线拟合实验数据

对每个数据点 观测值,直线在同横坐标处给出的 预测值,两者之差叫残差(residual)。衡量”贴近”的标准做法(因为计算简单)是取残差平方和:使残差平方和最小的直线 称为最小二乘直线(也叫 的回归直线,系数 叫回归系数)。

若数据点严格在直线上,则 ,写成矩阵形式:

数据点不共线时此方程组无解——这正是最小二乘问题 换了记号而已!向量 之距离的平方恰是残差平方和,所以求最小二乘直线 ⟺ 求 的最小二乘解

例 1 求拟合数据点 的最小二乘直线

用数据的 坐标造设计矩阵、 坐标造观测向量:

法方程

最小二乘直线为

图 6-30

图 6-30:例 1 的最小二乘直线

实用技巧:先算 坐标的平均值 ,用新变量 平均偏差形式,mean-deviation form)代替 ,设计矩阵的两列就正交了,法方程的求解立刻简化(原理同 6.5 节例 4;参见原书习题 17、18)。

一般线性模型

有时需要用直线以外的曲线拟合。统计学家引入残差向量 ,把模型写成

任何这种形式的方程叫线性模型(linear model)。 确定后,目标是使 最小——即求 的最小二乘解 ,它满足法方程

用其他曲线拟合

当散点图不接近任何直线,可假设形如

的关系,其中 是已知函数、 是待定参数。它对未知参数 是线性的,所以仍是线性模型。(“线性”指参数线性,不指 线性!)

图 6-31

图 6-31:植物养分净初级生产量随叶面积的变化——开口向下的抛物线模型

图 6-32

图 6-32:典型平均成本曲线——开口向上的抛物线

例 2 设数据点大致沿抛物线分布(如上两图的场景: 为公司日产量、 为平均成本;或 为叶面积、 为养分生产量),用形如

的方程逼近。描述产生”最小二乘拟合”的线性模型。

每个数据点给出一个带残差的方程:

其中 是观测值 与预测值 之差。写成矩阵形式 (看前几行找规律即可写出 ):

例 3 若数据沿三次曲线分布(比如公司总成本随产量变化),用 拟合,描述其线性模型。

图 6-33

图 6-33:沿三次曲线分布的数据点

与例 2 同法,设计矩阵每行多一列

多元回归

实验若有两个自变量 与一个因变量 ,预测方程可以是

或更一般的

(地质学中用它建模侵蚀面、冰斗、土壤 pH 等量的空间分布,最小二乘拟合称为趋势面,trend surface。)只要 由形如 的方程预测( 已知、 未知权重),就得到线性模型。

例 4(最小二乘平面) 地理学中用数据 建立局部地形模型,其中 分别是纬度、经度与海拔。描述基于 (4) 的线性模型,其解称为最小二乘平面

图 6-34

图 6-34:最小二乘平面

预期数据满足:

,其中

例 4 说明:多元回归的线性模型与前面简单回归的模型抽象形式完全相同。线性代数让我们看清所有线性模型背后的统一原理——只要把 定义对,法方程永远是同一个矩阵形式,与变量个数无关。因此对任何 可逆的线性模型,最小二乘解都是

应用一瞥(原书习题背景):按开普勒第一定律,彗星轨道是椭圆、抛物线或双曲线。在合适的极坐标下,彗星位置 满足 ,其中 为常数、 为轨道离心率( 椭圆、 抛物线、 双曲线)。把观测数据 代入并用最小二乘估计 ,就能判断轨道类型并预测彗星未来的位置——哈雷彗星正是用这类方法被算出回归日期的。

图 6-35

图 6-35:哈雷彗星——用最小二乘从观测数据估计轨道参数的经典案例

6.6 练习题

本节习题见原书(习题 1–20):1–4 求最小二乘直线,7–8 建立收入/成本曲线模型,13–14 求最小二乘曲线,15–16 涉及飞机起飞数据的拟合与速度估计,19–20 涉及统计学中的平方和分解 SS(R)、SS(E)、SS(T)。

6.6 练习问题(Practice Problem)

问题:某产品月销量受季节波动影响,近似销量的曲线可取形式

其中 是月份。 给出基本销售趋势,正弦项反映季节变化。给出使上式对数据 做最小二乘拟合的线性模型(设计矩阵与参数向量)。

图 6-36

图 6-36:带季节波动的销售趋势

构造 ,使 的第 行是数据点 对应的预测值 。显然

三列分别是”常数项、线性趋势、季节正弦项”,模型仍是 的标准形式。

6.7 内积空间

到目前为止,“长度、距离、正交”都只在 中定义,靠的是定理 1 的四条内积性质。但应用中经常要在别的向量空间(多项式空间、连续函数空间……)里谈这些概念。办法是:把定理 1 的结论升级为公理,凡满足这四条公理的运算都称为内积。

内积公理

定义 向量空间 上的内积是一个函数:给每对向量 赋一个实数 ,满足对所有 及标量

  1. (对称)
  2. (第一变元线性)
  3. ,且 当且仅当 (正定)

装备了内积的向量空间叫内积空间(inner product space)。 带标准内积就是一个内积空间,本章对 讲的几乎所有内容都能搬到一般的内积空间中。

例 1 取定两个正数,比如 4 和 5。对 ,定义

证明 (1) 是内积。

逐条验证四条公理:

  • 公理 1:
  • 公理 2:设 ,则
  • 公理 3:
  • 公理 4:,且等于零仅当 ,即 ;又

所以 (1) 是 上的内积。∎

这类”加权内积”在加权最小二乘问题中自然出现:给更可靠的测量分配更大权重(详见 6.8 节)。

例 2 是互不相同的实数。对 中的多项式 ,定义

证明 (2) 是 上的内积。

公理 1–3 直接由乘法与加法性质得到。公理 4:;若 ,则 个点 处全为零。但 的次数小于 ,一个非零多项式至多有 个根,故 必是零多项式。∎

(从现在起,当内积空间的对象是多项式或函数时,我们按通常方式书写它们而不用粗体——但记住:作为向量空间的元素,每个函数都是”向量”。)

例 3,用例 2 的内积,取 。设 。计算

长度、距离与正交

是内积空间。完全照搬 的模式定义:

(注意 有意义是因为公理 4 保证非负,但它不一定是”平方和”,因为 未必是 中的向量。)长度为 1 的向量是单位向量; 的距离是 正交当且仅当

例 4 用例 3 的内积(在 三点求值),计算 的长度。

由例 3,,故

格拉姆–施密特过程

内积空间有限维子空间的正交基同样可用格拉姆–施密特过程构造;正交投影到有正交基的子空间照常定义,且投影与正交基的选取无关,正交分解定理与最佳逼近定理照样成立。许多应用中常见的正交基正是用这个过程造出来的。

例 5,内积是例 2 型的求值内积,求值点取 。把 视为 的子空间,对多项式 应用格拉姆–施密特,产生 的正交基。

内积只依赖多项式在 处的值,所以把每个多项式用它在这些点的取值向量( 中)表示:

观察: 与常数 1 已经正交(取值向量内积为 ),取 。对 ,用取值向量计算 的投影:

投影为 ,于是

的正交基为 ,其取值向量为

例 5、6 中的多项式 属于统计学中所谓的正交多项式(orthogonal polynomials)——“正交”指的就是例 2 型内积下的正交。

内积空间中的最佳逼近

应用数学的常见问题:用某个子空间 中的函数 去逼近内积空间 中的函数 。当”接近程度”由内积定义()时,最佳逼近就是 到子空间 的正交投影

例 6(内积同例 5), 是例 5 为子空间 找到的正交基。求 中的多项式对 的最佳逼近。

的取值向量已列在 (3) 中。 处的值为 。计算:

最佳逼近为

当”距离”只在 这五个点度量时,这个多项式是 中离 最近的。

图 6-37

图 6-37: 中的多项式对 的最佳逼近

两个重要不等式

是内积空间 中的向量, 是有限维子空间。把勾股定理用于正交分解

特别地,投影的范数不超过原向量的范数(斜边最长):

图 6-38

图 6-38:斜边是最长的边

定理 16(柯西–施瓦茨不等式) 对内积空间 中所有

证明,两边都是零,成立。若 ,取 ,则

,即 (4)。∎

柯西–施瓦茨不等式在数学许多分支都有用(原书习题给出几个简单应用,如比较几何平均与算术平均)。这里主要用它证明另一个基本不等式。

图 6-39

图 6-39:三角形边长——两边之和不小于第三边

定理 17(三角不等式) 中所有

证明

其中第二步用对称性,第三步用柯西–施瓦茨。两边开方即得。∎

的内积(需要微积分)

应用中最常用的内积空间,大概是区间 上全体连续函数构成的空间

怎么想到它的内积?先用多项式 试探: 时,可用例 2 型的求值内积算”长度”,但这只反映 个点上的行为。取越来越多的求值点:

图 6-40

图 6-40:在 上取不同个数的求值点计算

分成 个长为 的小区间,取点 ,并把求值和除以 (相当于取平均):

图 6-41

图 6-41:把 分成 个等长小区间

:由于 连续,方括号内是黎曼和,趋于定积分——我们被引向 上的平均值。这个量对任意次数的多项式(乃至一切连续函数)都有定义,且满足内积公理。因子 无关紧要,常省略。

例 7,定义

证明 (5) 是 上的内积。

公理 1–3 由定积分的初等性质直接得到。公理 4:。若该积分为零,由 连续且非负,其在 上必恒为零(微积分中的定理),故 是零函数。∎

例 8(例 7 的内积), 是由 张成的子空间。用格拉姆–施密特求 的正交基。

,计算

已经与 正交,取 。为求 上的投影,计算:

于是

作为函数: 的正交基为

6.7 练习题

本节习题见原书(习题 1–28):1–2 练习例 1 型加权内积,3–12 练习求值内积下的计算与正交多项式,13–14 由可逆矩阵/单射变换构造内积,15–18 用内积公理验证恒等式,19–20 用柯西–施瓦茨证不等式,21–26 练习 的积分内积(25 题构造勒让德多项式),27–28 为计算机练习。

6.7 练习问题(Practice Problems)

用内积公理验证以下两条。

1.

由公理 1,;再由公理 3,

2.

由公理 1(对称)、公理 2、再对称一次:

注意:公理 2 只对第一变元线性,第二变元的线性要靠对称性补出来——这是初学者最容易漏掉的一步。

6.8 内积空间的应用

本节展示 6.7 节的内积空间如何出现在实际问题中。第一个应用正与本章开篇的北美大地基准那次大规模最小二乘计算有关。

加权最小二乘(Weighted Least-Squares)

个观测值,想用某子空间中的向量 (分量为 )来逼近它。误差平方和(sum of squares for error,SS(E))为

这就是 的标准长度)。

但如果各观测值可靠性不同呢?(北美大地基准正是如此——数据来自跨越 140 年的测量;或者各观测值来自样本量不同的抽样。)这时应当加权:给更可靠的测量更大的话语权。取权重 ,定义加权误差平方和

它正是内积

(6.7 节例 1 的推广)诱导的长度平方。把加权问题化成普通问题只需一个对角矩阵:设 是对角元为 的对角矩阵,则 (2) 的第

所以加权 SS(E) (普通长度!)。若近似向量由矩阵 的列构造,要找 使 尽量贴近 ,即最小化

于是 就是普通(不加权)方程组

的最小二乘解,其法方程为

例 1 求拟合数据 的最小二乘直线 。设最后两个数据点的 测量误差较大,给它们一半权重

按 6.6 节记号( 对应 对应 ):

权重减半即取权重 ,等价于给其余点权重 、后两点权重 。取加权矩阵 的对角元为 (整体缩放不改变结果)。 左乘

法方程:

):

所求直线为

对比:不加权的普通最小二乘直线是 ——权重不同,直线斜率都变号了,可见加权的影响之大。

图 6-42

图 6-42:加权最小二乘直线与普通最小二乘直线的比较

数据的趋势分析(Trend Analysis)

设未知函数 处的值已知(也许近似)。数据呈”线性趋势”时可用 逼近;呈”二次趋势”时用 。6.6 节从另一个角度讨论过这一点。

有些统计问题需要把线性趋势与二次(乃至更高次)趋势分离开。例如工程师分析新车的行驶性能: 表示车在时刻 离参考点的距离。匀速行驶时 是直线(斜率即速度);猛踩油门后曲线会出现二次项甚至三次项(加速度)。分析超车能力时,可能需要把二次、三次成分从线性项中分离出来。

问题在于:若直接用 拟合,系数 未必给出关于二次趋势的独立信息(它可能与其它 统计上纠缠在一起)。趋势分析的做法是:在 上引入求值内积(6.7 节例 2 型)

用格拉姆–施密特造出 的正交基 。设 的正交投影,则 称为三次趋势函数,系数 称为数据的趋势系数 度量线性趋势、 度量二次趋势、 度量三次趋势。

关键优势:由于 正交,各趋势系数 可以逐个独立计算、互不干扰。只要二次趋势就忽略 ;要四次趋势也只需再对 造一个正交于 并算 。实践中统计学家很少需要超过三次或四次的趋势。

图 6-43

图 6-43:用二次趋势函数逼近数据

例 2 趋势分析最简单常用的情形:点 可调整为等距且之和为零。对数据 拟合二次趋势函数。

坐标已适当缩放为 ,可直接使用 6.7 节例 5 找到的正交多项式:

计算只需这些向量,不需要正交多项式的具体公式。数据在 中的最佳逼近是正交投影:

的系数 并不小,可以认为数据至少有二次趋势——图 6-43 的图形证实了这一点。

傅里叶级数(需要微积分)

连续函数常用正弦与余弦函数的线性组合来逼近——声波、电信号、机械振动都是典型对象。

为简单起见考虑 上的函数。事实证明: 中任何函数都能被

形式的函数逼近到任意精度( 充分大即可)。(4) 称为三角多项式(trigonometric polynomial);若 不全为零,称它是 阶的。三角多项式与其他函数的联系源于:对任意 ,集合

在内积

下是正交的

例 3 有内积 (6), 是不等的正整数。证明 正交。

用积化和差恒等式。当

(正弦在 处均为零。)

是 (5) 中函数张成的子空间。给定 中的函数对 的最佳逼近称为 上的 阶傅里叶逼近(Fourier approximation)。因为 (5) 中函数正交,最佳逼近就是正交投影,系数 称为 傅里叶系数

可算出 ;原书习题 7),于是

常数项 按 (7) 取 )——这解释了 (4) 中常数项为什么写成

例 4 上的 阶傅里叶逼近。

先算常数项:

,用分部积分:

使第一项相消; 全为零,剩下 。)故 阶傅里叶逼近为

图 6-44

图 6-44: 的三阶傅里叶逼近

图 6-45

图 6-45: 的四阶傅里叶逼近——阶数越高越贴近

与傅里叶逼近之差的范数称为逼近的均方误差(mean square error,“均方”指范数由积分定义)。可以证明:当逼近阶数增大时,均方误差趋于零。因此习惯写成

这就是 上的傅里叶级数(Fourier series)。比如 这一项,就是 到由 张成的一维子空间上的投影。

6.8 练习题

本节习题见原书(习题 1–16):1–2 练习加权最小二乘,3–4 练习三次/二次趋势分析,5–14 涉及 内积与傅里叶逼近(10 题为方波函数),15–16 为计算机练习。

6.8 练习问题(Practice Problems)

1.。验证 (例 7 型积分内积,从 积到 )中是正交集。

逐对计算:

(后两个被积函数是奇函数,在对称区间上积分为零——一眼看出。)三对内积全为零,故是正交集。

2. 的一阶与三阶傅里叶逼近。

三阶傅里叶逼近是 中的最佳逼近。但 本身就在这个子空间里,所以 就是它自己的最佳逼近):

一阶逼近是 中的最佳逼近。 两项与 中所有函数正交(不同频率的正交性,例 3 及习题 5、6),对计算一阶系数的积分没有任何贡献,所以一阶逼近就是

图 6-46

图 6-46: 的一阶与三阶逼近——三阶逼近与 重合

全章脉络回顾

把整章串成一条线:内积(6.1)定义了长度、距离与正交 → 正交集让坐标计算变成”一次内积除法”(6.2)→ 正交投影给出子空间中离任意点最近的点(6.3)→ 格拉姆–施密特从任意基造出正交基并产生 QR 分解(6.4)→ 把投影用到的子空间取成 最小二乘解就是法方程 的解(6.5)→ 一切统计拟合模型(直线、抛物线、多元回归)都是同一套机器(6.6)→ 换掉标准内积,同样的故事在一般内积空间重演(6.7)→ 加权最小二乘、趋势分析、傅里叶级数都是它的应用(6.8)。各节习题均见原书,建议至少完成每节前 10 题以巩固计算。

自测一下