数据岗位面试题 · 技术原理
题库中标记为“数据”的结构化面试题。
共 3928 道真题 · 当前筛选命中 2406 道 · 更新 2026-08-05
筛选题目已选:技术原理
考察点
技术栈
第 61 题HashMap是如何保证key不重复的?当插入重复key时会如何处理? 考察对HashMap去重逻辑和覆盖写入机制的理解第 62 题如何用 SQL 找出连续三天下单的用户? 考察 SQL 窗口函数应用与连续性问题建模能力第 63 题SQL中UNION和UNION ALL的区别是什么? 考察对SQL集合操作语义的理解及实际应用差异第 64 题请介绍DWD层的设计理念和常见构建方式。 考察对数据仓库分层建模的理解及DWD层实践第 65 题请介绍一下 Spark 作业从提交到执行的整体流程? 考察对 Spark 运行架构和任务调度机制的理解第 66 题你对AB实验这一块有多大了解? 考察对AB实验基础概念、流程、统计原理及实际应用的理解深度第 67 题task、application和job有什么区别? 考察对调度系统核心概念的理解与边界区分第 68 题平时工作中数仓有几层,每层怎么建表的? 考察数仓分层设计思路及各层建表规范第 69 题Hadoop如何实现高可用 考察对Hadoop高可用架构原理和实现机制的理解第 70 题请介绍你对 Java 语言及其核心 API 的熟悉程度,并举例说明 Java 中常用数据结构及其实现原理。 考察 Java 基础掌握广度及对常用数据结构底层实现的理解第 71 题解释什么是YOLO,以及它是什么类型的模型。 考察对YOLO算法核心思想和模型类型的基本理解第 72 题风控建模中,如何将连续性指标转换为离散指标?常用的转换方法有哪些? 考察连续变量分箱与WOE转换能力第 73 题快速排序的时间复杂度是多少?它稳定吗? 考察快速排序的复杂度分析、稳定性和边界条件理解第 74 题介绍一个你在使用Spark时遇到的技术难点,并说明如果Spark版本升级,相关函数或API可能失效,你如何应对? 考察对Spark版本兼容性风险的认知以及解决实际任务中方案选型的能力第 75 题请实现一个SQL,统计连续登录7天及以上的用户,要求至少给出两种方法,其中一种不能使用开窗函数。 考察SQL连续问题解法,包括开窗函数与自连接/日期差分组等非开窗方案第 76 题窗口函数 Sliding Time Window 为什么不设置很长的窗口时间? 考察对滑动时间窗口机制的理解及参数权衡意识第 77 题SQL中左连接、右连接、内连接,各自返回的表结果形式有什么区别?请举例说明结果集中行与列的组成。 考察对连接结果集结构的具体理解,能否用实例说清行数变化第 78 题XGBoost使用损失函数二阶泰勒展开相比只用一阶有什么优势? 考察对XGBoost损失函数近似和优化算法本质的理解第 79 题你是否了解ROS系统?如果了解,请说明它的核心组成和应用场景。 考察对ROS系统的认知广度和深度第 80 题请解释 Layer Normalization(LN)与 Batch Normalization(BN)的区别,并说明在 NLP 任务中为何更常用 LN。 考察对归一化技术及其适用场景的理解