作业帮面试题更新 2026-08-05

请描述LLaVA模型的训练细节,以及Qwen语言模型与CLIP视觉编码器在架构上是如何拼接的。

作业帮人工智能互联网/IT系统设计技术原理

考察说明

考察对多模态大模型LLaVA训练流程与视觉-语言特征拼接机制的理解

回答思路

  1. 能说明LLaVA两阶段训练流程(预训练对齐与指令微调)
  2. 能解释CLIP视觉编码器输出与Qwen词嵌入的投影对齐方式
  3. 能指出训练时视觉编码器与语言模型的冻结/微调策略
  4. 能阐述拼接后特征的维度匹配与输入格式