残差分析是回归分析中至关重要的一环,它帮助我们评估模型的假设是否成立,识别数据中的异常值,以及判断模型是否能够充分解释数据的变异,Minitab作为一款强大的统计分析软件,提供了便捷的残差分析工具,本文将详细介绍如何在Minitab中进行残差分析,从数据准备到结果解读,为您提供一套完整的操作指南。

数据准备与回归模型建立
在进行残差分析之前,首先需要建立一个回归模型,以简单线性回归为例,假设我们研究的是广告投入(自变量X)与销售额(因变量Y)之间的关系。
数据输入:打开Minitab,将数据输入到工作表中,一列存放自变量数据,另一列存放因变量数据,C1列命名为“广告投入”,C2列命名为“销售额”,并对应输入相关数据。
拟合回归模型:
- 点击菜单栏中的“统计”(Stat)> “回归”(Regression)> “拟合线图”(Fitted Line Plot)。
- 在弹出的对话框中,将“销售额”选入“响应”(Response)变量框,将“广告投入”选入“预测变量”(Predictors)变量框。
- 在“选项”(Options)标签页中,确保已勾选“拟合线图”(Fitted Line Plot)和“置信区间”(Confidence interval),以及“预测区间”(Prediction interval)等需要的图形输出。
- 点击“确定”(OK),Minitab会输出回归方程、R方值、方差分析表以及拟合线图,这一步是获取残差的基础,因为残差是观测值与模型预测值之间的差异。
生成残差图
Minitab提供了多种残差图,从不同角度检验模型假设,最常用的方法是通过回归对话框直接生成。
打开回归对话框:
- 点击“统计”(Stat)> “回归”(Regression)> “回归”(Regression)...(注意:这里选择“回归”而非“拟合线图”,以获得更详细的残差选项)。
- 将“销售额”选入“响应”(Response)变量框,“广告投入”选入“预测变量”(Predictors)变量框。
指定残差图类型:
- 点击“图形”(Graphs)按钮,进入图形设置对话框。
- 在“残差图”(Residual plots)部分,Minitab提供了多种预设组合:
- 四合一残差图(Four in one):这是最常用、最推荐的选项,它包含四张图:残差 versus 拟合值(Residuals versus Fits)、残差 versus 顺序(Residuals versus Order)、残差 versus 观测值(Residuals versus Observation order,通常与顺序图类似)以及正态概率图(Normal Probability Plot),这四张图能综合检验线性、独立性、方差齐性和正态性假设。
- 单个残差图:您也可以选择只生成特定的图形,残差 versus 拟合值”或“正态概率图”。
- 勾选“四合一残差图(Four in one)”,然后点击“确定”(OK)返回主对话框。
- 在主对话框中点击“确定”(OK),Minitab将在会话窗口输出回归模型的详细结果,并生成一张包含四个子图的残差分析图。
残差图的解读与分析
生成的残差图是判断模型优劣的关键,我们需要逐一解读这些图形。
残差 versus 拟合值图(检验线性与方差齐性)

- 理想形态: points应随机、无规律地散布在水平线y=0的两侧,形成一个无明显趋势的“云团”状。
- 问题识别:
- 非线性:如果点呈现出明显的曲线模式(如U型或倒U型),则表明变量间可能存在非线性关系,需要考虑在模型中加入多项式项(如二次项)或对变量进行转换。
- 方差非齐性(异方差性):如果随着拟合值的增加,残差的波动范围呈现系统性变化(如喇叭形,即两端大中间小或反之),则表明方差不相等,这可能需要对方差较大的数据进行转换(如对数转换)或使用加权最小二乘法。
残差 versus 顺序图(检验独立性)
- 理想形态: points应随机分布在y=0上下,没有明显的上升、下降或周期性模式。
- 问题识别:
- 自相关:如果点显示出明显的趋势(如连续多个正值或负值)或周期性波动,则表明残差之间存在自相关,违背了独立性假设,这在时间序列数据中尤为常见,可能需要引入时间序列模型或使用自相关函数(ACF)和偏自相关函数(PACF)图进行进一步诊断。
正态概率图(PP图)(检验正态性)
- 理想形态: points应大致沿着一条直线分布。
- 问题识别:
- 非正态:points严重偏离直线,特别是在两端出现明显的S型或反S型弯曲,则表明残差可能不服从正态分布,这会影响假设检验和区间估计的准确性,可以考虑对数据进行转换,或使用不依赖于正态性假设的非参数方法,也可以在会话窗口查看残差的描述性统计量和直方图(可在“图形”选项中勾选“残差直方图”)来辅助判断。
利用Minitab进行进一步的残差诊断
除了图形化分析,Minitab还提供了一些数值统计量来辅助诊断。
异常值识别:
- 在“回归”对话框中,点击“存储”(Storage)按钮。
- 勾选“残差”(Residuals)、“标准化残差”(Standardized residuals)和“剔除残差”(Deleted residuals)等。
- 标准化残差(通常指学生化残差)的绝对值大于2或3的观测值可能被视为异常值,您可以在工作表中查看这些值,并结合残差图上的点进行定位,分析其产生的原因(数据录入错误、特殊实验条件等),决定是否需要剔除或进行特殊处理。
强影响点识别:
- 在“存储”对话框中,还可以勾选“Cook距离”(Cook's distance)、“杠杆率”(Leverage)等。
- Cook距离:衡量某个观测值对整个回归模型参数估计的影响程度,Cook距离大于1或4/n(n为样本量)的观测值被认为是强影响点,需要重点关注。
- 杠杆率(帽子矩阵Hii):衡量观测值的自变量取值远离中心点的程度,高杠杆点不一定有问题,但如果同时伴有大的残差,则可能是强影响点。
通过以上步骤,我们便可以在Mintab中系统地进行残差分析,从建立模型、生成图形到解读结果和识别异常值,这一系列操作能够帮助我们全面评估回归模型的有效性和可靠性,确保基于该模型得出的上文归纳是科学和稳健的。
相关问答FAQs
问题1:在Minitab残差分析中,残差 versus 拟合值图”呈现出明显的喇叭形,表明什么问题?应如何处理?
解答:残差 versus 拟合值图”呈现出明显的喇叭形(即随着拟合值的增加,残差的波动范围逐渐增大或减小),这表明数据存在异方差性(Heteroscedasticity),即方差不齐性,这意味着模型的误差项的方差不是一个常数,而是随着自变量的变化而变化,这违反了线性回归的基本假设之一,会导致回归系数的标准误估计不准确,从而影响假设检验(如t检验)和区间估计的可靠性。

处理方法:
- 数据转换:对因变量Y进行转换是常用的方法,如果方差与均值成正比,可以尝试对Y取对数(log(Y));如果方差与均值的平方成正比,可以尝试取平方根(√Y),转换后需要重新拟合模型并检查残差图是否改善。
- 加权最小二乘法(WLS):如果能够确定方差与某个变量之间的关系,可以使用加权最小二乘法,给方差较小的观测值赋予较大的权重,给方差较大的观测值赋予较小的权重,从而消除异方差性,在Minitab中,可以通过“统计”> “回归”> “广义回归”(Generalized Regression)来实现加权回归。
- 使用稳健标准误:在某些情况下,如果主要关注的是回归系数的估计值而非其精确的统计推断,可以报告使用稳健标准误(也称为异方差稳健标准误)的结果,这可以在不改变模型拟合的情况下调整标准误。
问题2:如何通过Minitab中的“正态概率图”判断残差是否服从正态分布?除了图形方法,还有哪些数值检验方法可以使用?
解答:通过Minitab中的“正态概率图”(也称为PP图或QQ图)判断残差正态性的方法如下:
- 理想情况:如果残差严格服从正态分布,图中的数据点应紧密地排列在一条直线上。
- 判断偏离:如果数据点显著偏离直线,尤其是在图的尾部(两端)出现系统性的弯曲(如S型或反S型),则表明残差可能不服从正态分布,尾部在下方翘起,表明存在左偏(负偏);尾部在上方翘起,表明存在右偏(正偏)。
除了图形方法,Minitab还提供了一些数值检验方法来更客观地评估正态性:
- AndersonDarling检验:这是在Minitab中最常用的正态性检验方法之一,它对分布尾部的差异非常敏感,在“回归”对话框的“图形”选项中,生成残差图时,Minitab会自动为残差进行AndersonDarling正态性检验,并在会话窗口输出检验结果(A统计量和对应的p值)。
- 判断规则:如果p值小于显著性水平(通常取0.05),则拒绝原假设(残差服从正态分布),认为残差显著偏离正态分布;反之,则不能拒绝原假设,认为残差服从正态分布。
- ShapiroWilk检验:这也是一个常用的正态性检验,尤其适用于小样本量(n<50),在Minitab中,可以通过“统计”> “基本统计量”> “正态性检验”(Normality Test)来对存储的残差数据进行此检验。
- 描述性统计与直方图:查看残差的偏度(Skewness)和峰度(Kurtosis),偏度应接近0,峰度应接近3,直方图的形状应接近钟形曲线,这些可以在“统计”> “基本统计量”> “显示描述性统计量”(Display Descriptive Statistics)中获得。
需要注意的是,对于大样本量,正态性检验可能会过于敏感,即使残差与正态分布有微小差异也可能导致p值显著,图形方法与数值检验应结合使用,综合判断。

