在 KNN 算法中,K 值的大小通常怎样选定才对分类结果影响较小?
考察说明
考查对 KNN 算法中超参数 K 选取方法的理解。
回答思路
- 【回答框架 1】K 值选取常用交叉验证法,将训练集划分为多份,对不同 K 值计算验证集准确率,选择平均准确率最高的 K。
- 【回答框架 2】K 值过小会导致模型对噪声和异常点敏感,容易过拟合;K 值过大则会使模型过于平滑,忽略局部信息,可能导致欠拟合。
- 【回答框架 3】实际中通常设置 K 为奇数以在二分类时避免平票,并考虑类别的样本量均衡性,若类别不均衡可结合加权投票改进。
- 【回答框架 4】选取 K 值时还需结合数据规模和特征维度,可用网格搜索结合交叉验证确定最优 K,同时关注计算成本。
- 【回答框架 5】最终 K 的确定属于超参数调优,应依据验证集或测试集表现权衡偏差与方差。
- 【关键点 1】K 值常用交叉验证法确定,以验证准确率为标准。
- 【关键点 2】K 过小易过拟合,K 过大易欠拟合。
- 【关键点 3】可用网格搜索或启发式规则(如 sqrt(N))初步设定再调优。
- 【关键点 4】类别不均衡时可考虑加权投票或调整 K。
- 【易错点 1】不能简单固定 K 为某常数,需结合数据分布和验证结果。
- 【易错点 2】不能将训练集准确率作为 K 选取依据,会过拟合。
- 【易错点 3】忽略类别不均衡时,大 K 可能使多数类主导预测结果。