人工智能面试题更新 2026-08-05

请阐述监督学习、半监督学习和无监督学习各自的定义,并比较它们之间的核心差异。

人工智能技术原理

考察说明

考查对机器学习三大学习范式基本概念及差异的理解。

回答思路

  1. 【回答框架 1】监督学习利用有标签样本训练模型,目标是学习输入到输出的映射,常见任务包括分类和回归,代表算法有线性回归、逻辑回归、支持向量机、神经网络等。
  2. 【回答框架 2】无监督学习使用无标签数据,旨在发现数据内在结构或分布,常见任务包括聚类、降维和关联规则挖掘,代表算法有K均值聚类、主成分分析、自编码器等。
  3. 【回答框架 3】半监督学习同时利用少量有标签数据和大量无标签数据训练,通常假设数据分布具有连续性或聚类结构,通过传播标签或生成伪标签提升性能,适用于标注成本高的场景。
  4. 【回答框架 4】三者的核心区别在于训练数据中标签信息的可用性:监督学习完全依赖标签,无监督学习无标签,半监督学习介于两者之间。此外,目标不同:监督学习重在预测,无监督学习重在发现结构,半监督学习旨在结合两者优势提升泛化能力。
  5. 【回答框架 5】在实际应用中,选择哪种范式取决于数据标签的获取成本和任务目标。例如,图像分类常用监督学习,客户分群可用无监督学习,而医疗影像诊断中标注昂贵,适合半监督学习。
  6. 【关键点 1】监督学习使用有标签数据,任务是分类和回归。
  7. 【关键点 2】无监督学习使用无标签数据,任务是聚类、降维和关联分析。
  8. 【关键点 3】半监督学习结合少量标签与大量无标签数据,假设数据分布连续性或聚类结构。
  9. 【关键点 4】三者核心差异在于标签可用性和学习目标。
  10. 【关键点 5】选择范式需权衡标签成本和任务需求。
  11. 【易错点 1】混淆半监督学习与弱监督学习,后者可能使用噪声或不完整标签。
  12. 【易错点 2】误以为无监督学习无需任何标签信息,但评估仍可能需要部分标签。
  13. 【易错点 3】认为半监督学习必然优于仅用有标签数据训练的模型,实际效果取决于数据分布假设是否成立。