数据岗位面试题 · 技术原理
题库中标记为“数据”的结构化面试题。
共 3928 道真题 · 当前筛选命中 2406 道 · 更新 2026-08-05
筛选题目已选:技术原理
考察点
技术栈
第 621 题请解释什么是线程安全问题,并举例说明在什么场景下会出现。 考察对线程安全概念的理解和典型场景识别能力第 622 题操作系统如何调度线程和进程的运行? 考察对CPU调度时机、策略和底层机制的理解第 623 题请解释Transformer模型中的位置编码(Positional Encoding)的作用和实现方式,并说明它与嵌入(Embedding)的关系。 考察对Transformer位置编码机制的理解及其在序列建模中的作用第 624 题请介绍数据仓库分层设计的思路,并结合你的实习经历说明分层带来的实际价值。 考察对数据仓库分层原理的理解及结合真实项目经验的应用能力第 625 题如何计算用户连续登录的最大天数? 考察对连续性问题建模和算法实现能力第 626 题请描述决策树剪枝的完整流程,并说明预剪枝与后剪枝的区别。 考察对决策树剪枝方法、流程及两种策略差异的理解第 627 题样本量计算的具体逻辑是什么? 考察对样本量计算方法的掌握和实际应用能力第 628 题数仓建模了解哪些?星形模型和雪花模型的区别和适用场景是什么? 考察数仓建模基础、模型比较与场景判断能力第 629 题给定Faster R-CNN网络和一堆数据,你会如何调参? 考察对目标检测模型Faster R-CNN调参的具体理解和实践第 630 题请编写SQL查询,找出连续登录至少两天的用户,并说明你的解题思路。 考察SQL中连续问题的时间窗口处理与去重聚合能力第 631 题Python模块和包的区别是什么? 考察Python基础概念区分能力第 632 题请解释 RAG 的作用机制,它如何结合检索与生成来提升大模型回答质量? 考察对检索增强生成技术原理和应用价值的理解第 633 题Flink 和 Spark 在实时处理方面哪个更好? 考察对两类流式计算引擎原理差异的理解及选型依据第 634 题训练模型的时候 Loss 不下降怎么解决? 考察对模型训练中 Loss 停滞问题的排查与解决能力第 635 题HDFS小文件会造成什么问题? 考察对HDFS元数据模型和存储性能瓶颈的理解第 636 题请介绍你对Apache Spark核心架构的理解。 考察对Spark核心组件的掌握程度第 637 题请介绍你对仿真领域的了解,包括常见方法、工具或应用场景。 考察对仿真技术的知识广度与实际理解第 638 题Spark和MapReduce最大的区别是什么? 考察对两大分布式计算框架核心差异的理解与概括能力第 639 题在特征工程中,处理异常值和缺失值有哪些常用方法? 考察特征工程中数据清洗的基础方法掌握第 640 题如何定义和计算内容审核机审有效性的核心指标,如召回率、精准率和误伤率? 考察对机审有效性指标的定义、计算和权衡理解