数据岗位面试题 · 技术原理
题库中标记为“数据”的结构化面试题。
共 3928 道真题 · 当前筛选命中 2406 道 · 更新 2026-08-05
筛选题目已选:技术原理
考察点
技术栈
第 701 题请用SQL查询出每个科目的平均分。 考察SQL聚合函数与分组查询的基础能力第 702 题Spark为什么能处理大规模数据集(高并发)? 考察对Spark分布式计算架构、内存计算与并行调度机制的理解第 703 题请简述 Spark 的执行原理。 考察对 Spark 执行模型、任务调度与内存管理的理解第 704 题请解释Hive数据倾斜的常见原因及相应的调优策略。 考察对Hive数据倾斜的理解及实际调优能力第 705 题从袋中随机抽取3个球,已知白球与黑球数量相等,求抽到白球数的期望。 考察基础概率计算能力第 706 题请说明使用CTE(公共表表达式)计算模型召回率和准确率的具体方法。 考察对CTE语法和分类模型评估指标计算方式的理解第 707 题为什么维度表通常要在 DWS 层进行统一管理和加工? 考察对数据仓库分层架构和维度建模思想的理解第 708 题当风电机组载荷数据分析结果与预期不符时,你会采取哪些措施进行排查? 考察载荷数据异常排查的逻辑性、系统性以及工程实践能力第 709 题请说明TensorFlow中concat函数和multiply函数的区别及典型使用场景,并举例说明各自的输入输出形状要求。 考察对TensorFlow常用张量操作API的理解与应用能力第 710 题请介绍几种常见的 SQL JOIN 及其用法,以及你在项目中更常用哪种。 考察关系型数据库连接的基本原理、语法掌握与实际选型第 711 题MR的思想来源是什么?你是否研读过相关论文? 考察对MapReduce分布式计算模型理论渊源的理解深度第 712 题在做实验或抽样设计时,最小样本量通常与哪些指标相关? 考察对样本量计算影响因素的理解第 713 题请解释 RAG(检索增强生成)的原理,并说明其解决了什么问题。 考察对 RAG 架构的理解、组件作用和业务价值第 714 题请讲解维度建模的核心概念,并说明其与关系建模的主要区别。 考察对维度建模原理、核心概念及其适用场景的理解第 715 题在特征工程中,常用的特征筛选方法有哪些?请至少列举三种并说明其原理。 考察特征筛选的方法体系与适用场景第 716 题请具体介绍你负责的项目中,召回率和准确率这两个指标是如何定义、计算和优化的? 考察对评估指标的理解、计算能力以及优化思路第 717 题请简要介绍你参与过的一个互联网项目,包括项目目标、你的职责、技术选型和最终成果。 考察候选人的项目梳理能力、技术深度和成果呈现第 718 题请描述MapReduce的整体执行流程,包括从作业提交到输出结果的各个阶段。 考察对MapReduce分布式计算框架执行机制的理解第 719 题请实现一个函数,找出给定整数数组中所有和为0的三元组,并要求结果不包含重复三元组。 考察算法设计、去重思维与双指针优化能力第 720 题请介绍一下你对大数据的兴趣,并说明 Hadoop 生态中 HDFS、MapReduce 和 YARN 这三个核心组件各自的职责。 考察对大数据基础组件的理解及个人兴趣的自我表达