基础模型配合提示和 RAG 已经能用,但某类工单分类仍不稳定。你会怎样判断是否值得做监督微调?
考察说明
考查微调适用性、训练数据质量和基线比较能力。
回答思路
- 先确认失败来自稳定行为模式而不是资料缺失、标签定义冲突或工具错误,知识更新问题不应靠微调解决。
- 建立提示基线和分层评测,明确希望改善的类别、格式与边界,同时检查是否已有更简单规则方案。
- 训练样本需来自真实任务并由一致标准标注,清理重复、错误和数据泄漏,保留独立时间段作为测试集。
- 训练后比较目标类别、长尾、安全、拒答、延迟和成本,不能因总体分数上升就忽略关键能力退化。
- 把数据、参数和基础模型版本纳入治理,并评估持续补数、重新训练与回滚成本后再决定生产使用。