视觉编码器和 LLM 连接时,使用BLIP2中 Q-Former 那种复杂的 Adaptor 好还是 LLaVA 中简单的 MLP 好,说说各自的优缺点
考察说明
考察多模态模型架构中视觉-语言连接器的设计权衡与选型能力
回答思路
- 准确描述Q-Former的作用机制(可学习查询通过交叉注意力压缩视觉特征)
- 准确描述MLP连接器的直接映射方式
- 能从参数量、计算开销、训练数据需求、性能表现等维度对比
- 能结合具体场景(数据量、任务复杂度)给出选择理由
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。