Kriging 代理模型
Kriging 代理模型
在昂贵优化中,只知道候选点的预测目标值还不够:当两个点的预测值接近时,哪一个更值得花一次真实评估?Kriging 为每个候选点建立预测分布,使算法能同时利用预测均值和模型不确定性。在确定性计算机实验中,它常以高斯过程(Gaussian Process,GP)回归的形式实现。
用均值和协方差描述未知函数
设真实目标函数为 ,Kriging 用一个带均值函数和协方差函数的高斯过程描述我们对未知函数的认识:
表示先验均值或趋势, 描述两点的函数值如何相关。常数趋势是常见选择,但并非唯一选择。核函数的长度尺度控制相关性随输入距离衰减的速度;各维变量的长度尺度可以不同。
“高斯过程”表示:任选有限个输入点,它们对应的函数值在模型中服从联合高斯分布。真实仿真若是确定性的,并不意味着仿真本身在随机变化;随机过程表达的是观测有限时对未知函数的建模不确定性。新数据加入后,预测分布随之更新。
核函数把“相近输入”变成相关性假设
一个常见例子是平方指数核:
是变量维数, 是过程方差, 是第 维的长度尺度。两点在某维相距越远,该维对相关性的削弱通常越大; 较大意味着模型允许函数沿该维变化得较慢。输入缩放很重要,否则长度尺度的解释会被单位影响。
核函数决定模型愿意相信什么样的函数变化。平方指数核隐含较强的平滑性;若真实响应有突变、尖锐边界或不同区域差异很大,它可能给出过于自信的预测。可以考虑其他核或分区建模,但需要用实际数据检查假设,不能仅靠改一个核名解决问题。
记真实样本为 、。若观测满足 ,其中独立高斯噪声的方差为 ,则令 、。对新点 ,再令 。在均值函数和核参数已给定的条件下,潜在函数值的预测均值与方差为:
其中 。 预测潜在函数值, 衡量给定模型与已有数据后的预测方差;若预测的是一次新观测,还要计入观测噪声方差。无噪声插值模型通常在已有样本点的预测方差为零。
这两个公式来自联合高斯分布的条件分布。给定训练数据之前,模型知道的只是 与 ;训练点真实值出现后,相关性向量 决定它们对新点均值的修正程度,也决定该点方差能降低多少。离已有样本较远的地方常有较大的预测方差,但实际大小还受核参数和采样布局影响。
式中用 是为了清楚表达数学关系。数值实现时一般通过 Cholesky 等矩阵分解求解线性方程,不显式计算逆矩阵。若观测无噪声,可令 ;加入很小的数值稳定项与假定真实观测有噪声是两个不同的建模决定,应在实现和报告中区分。
核参数从哪里来
、 和噪声方差通常未知。一种常用做法是选择能提高观测数据边际似然的参数。若均值函数已固定,记 ,其对数边际似然为:
其中 包含核及噪声参数。第一项衡量模型与数据的符合程度,第二项与协方差矩阵有关,限制模型任意调整参数来追逐样本。实际拟合还应约束参数范围并考虑多个初始值,因为似然优化本身可能有局部最优。边际似然高也不保证模型在未采样区域可靠,仍需结合预测检查与领域知识。
从预测分布选择下一次评估
模型本身不会自动告诉我们下一步评估哪个点,还需要采集函数(acquisition function)。在无噪声、单目标最小化情形,可用期望改进(Expected Improvement,EI) 举例。设 是已真实评估点中的最小值,候选点的预测服从均值为 、标准差为 的正态分布,则:
这里 和 分别是标准正态分布的累积分布函数与密度函数,公式适用于 ;当 时直接按改进量的非负部分处理。预测值低的点可能带来直接改进,预测不确定性较大的点也可能值得探索。Jones、Schonlau 与 Welch 的高效全局优化(EGO)采用 Kriging 与 EI,反复选择新点进行真实评估。
举一个示意数值:假设当前真实最小值为 ,候选点 A 的预测均值为 、标准差为 ;候选点 B 的预测均值为 、标准差为 。代入上式,A 的 EI 约为 ,B 的 EI 约为 。A 的预测值更好且更确定;B 虽然均值没有改进,但仍有机会得到明显更低的真实值,因此 EI 可能先选 B。这是根据假设预测分布计算的教学例子,并非实测结果。
EI 不是唯一的选点规则。也可以用置信界、改进概率或其他采集函数;不同准则对探索与利用的取舍不同。采集函数本身可能有多个局部极值,因此“求下一点评估位置”通常也是一个需要求解的优化子问题,只是它查询的是便宜的代理模型。
一次典型迭代包括:拟合核函数参数、计算候选点的 和 、优化采集函数、真实评估所选点,再更新模型。拟合核参数与优化采集函数自身也要耗时,但在真实评估尤其昂贵时,这部分计算可能值得付出。
从初始样本到最终解
在一个有界、连续、单目标最小化任务中,可按以下顺序使用 Kriging:
- 先确定真实评估预算、变量范围和约束;初始样本及最终核验都应占用预算。
- 选择覆盖搜索范围的初始设计,真实评估目标值,并检查失败点、重复点与噪声。
- 缩放输入和必要时缩放输出,选择均值函数、核函数以及噪声处理方式,拟合核参数。
- 检查已拟合模型的数值稳定性与预测表现;例如用留一预测观察已知样本是否被严重误判。
- 在可行域内优化 EI 等采集函数,真实评估所选点,再加入数据并重新拟合。
- 在预算耗尽或达到明确的停止条件时,返回真实评估过且可行的最佳点。
留一预测不需要增加真实评估,但也不能证明模型在远离全部样本的区域准确。优化算法的最终表现应按真实评估次数、墙钟时间和真正得到的目标值报告;代理预测最低的点,只有经过真实评估后才能作为已验证结果。
使用时的边界
- 方差依赖模型假设: 反映所选核、均值和噪声模型下的不确定性,不是对真实误差的无条件保证。核参数估计不准时,采样决策也会受影响。
- 数据规模与数值稳定性:标准密集核矩阵的分解随样本数增长可能成为开销;样本点过近或核参数不合适时还可能产生病态矩阵。实现中应使用稳定的矩阵分解,并检查数值问题。
- 维数与核选择:变量增多时,每一维长度尺度都可能需要从有限样本中估计;如果大量变量几乎没有影响,可利用领域知识做变量筛选或结构化建模。
- 噪声、约束和多目标:上面的 EI 公式对应无噪声单目标示例。面对噪声观测、昂贵约束或多个目标,需要相应调整观测模型及采集准则。
- 真实评估仍是依据:最终解的目标值与可行性应由真实评估确认,而非直接引用代理预测。
与 RBF 代理模型相比,Kriging 的突出特点是能在模型假设下同时给出预测均值和方差;两者的效果仍取决于数据、变量维度、核选择与采样策略。
参考资料
- Sacks, J., Welch, W. J., Mitchell, T. J., & Wynn, H. P. (1989). Design and Analysis of Computer Experiments. Statistical Science, 4(4), 409–423.
- Rasmussen, C. E., & Williams, C. K. I. (2006). Gaussian Processes for Machine Learning, Chapter 2: Regression. MIT Press.
- Rasmussen, C. E., & Williams, C. K. I. (2006). Gaussian Processes for Machine Learning, Chapter 4: Covariance Functions. MIT Press.
- Jones, D. R., Schonlau, M., & Welch, W. J. (1998). Efficient Global Optimization of Expensive Black-Box Functions. Journal of Global Optimization, 13, 455–492.