AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
互联网/IT行业面试题
多模态大模型的Vision Encoder一般使…
互联网/IT行业面试题
更新 2026-08-05
多模态大模型的Vision Encoder一般使用ViT的第几层输出?
美团
人工智能
互联网/IT
技术原理
技术选型
考察说明
考察对多模态模型中视觉编码器具体实现细节的掌握
回答思路
能明确指出常用做法是使用ViT的倒数第二层(如第23层)输出
解释为何不用最后一层(如CLS token或与文本对齐不足)
说明不同模型(如LLaVA、Qwen-VL)可能采用不同层,需根据训练经验选择
提及层输出对语义对齐和细粒度特征的影响
换一题
上一题
请介绍 Webpack 的核心工作原理,以及它如何完成模块打包?
下一题
在热点 key 保护中,你会选择 Redis 分布式锁还是本地锁?为什么?
本题还出现在
美团面试题
人工智能面试题