数据岗位面试题 · 编码实现
题库中标记为“数据”的结构化面试题。
共 3928 道真题 · 当前筛选命中 156 道 · 更新 2026-08-05
筛选题目已选:编码实现
考察点
技术栈
第 101 题给定酒店表和评论表,每张评论包含酒店ID、评分、评论时间。找出评分至少为4分(视为好评)的评论中,连续好评(按评论时间排序,无需按序号)数量最长的五星酒店,且该连续好评数至少为3。请写出SQL或伪代码实现。 考察SQL窗口函数、连续序列分组及业务条件过滤能力第 102 题请实现二分查找并说明其时间复杂度。 考察二分查找的基本实现与复杂度分析第 103 题给定一张帖子表t,字段包括日期pdate、用户ID mid、帖子ID pid和帖子内容content,请编写SQL查询最近一周内每天发帖量排名前10的用户及其发帖数。 考察窗口函数与日期过滤的SQL编写能力第 104 题请用Python现场手写一个算法题解题方案。 考察现场编码能力与算法思维第 105 题请编写SQL计算次日留存率。 考察对留存率定义的理解和SQL自连接或窗口函数的使用能力。第 106 题请写出实现分组 Top N 的 SQL 思路:按作者分区统计发布量,取出每个分区发布量前三名的作者。 考察分组聚合与窗口函数的使用第 107 题请实现一个函数,反转单链表。 考察链表基础操作、指针/引用处理和边界条件第 108 题熟练掌握Python语言,用Python写一个函数,实现对游戏玩家评分数据的归一化处理。 考察Python编程基础与数据归一化处理能力第 109 题请说明如何实现SQL行转列,并比较不同实现方式的适用场景。 考察SQL行转列的实现能力与方案权衡第 110 题给定用户购买记录表(字段包含用户ID、订单号、订单创建时间),请用 SQL 计算用户的复购率。复购率定义为在统计周期内下单次数大于等于 2 的用户数占同期下单用户总数的比例。 考察 SQL 聚合、条件统计和业务指标定义能力第 111 题请用SQL查询出每个部门近30天的日均销售额,并说明你如何处理缺失或异常数据。 考察SQL基础能力及数据异常处理意识第 112 题如何用SQL找出购买过指定三个类目商品、且只购买过这三个类目商品的用户? 考察SQL中集合操作与条件组合的掌握第 113 题请写出 SQL 查询:对于给定的课程,找出每位任教老师所带学生中的最高分。 考察 SQL 分组聚合与多表关联的编写能力第 114 题请阐述 MapReduce 框架中 Partitioner 的功能,并说明实现自定义 Partitioner 的步骤。 考查对 MapReduce 分区机制的理解及自定义 Partitioner 的实践能力。第 115 题请解释在 MapReduce 框架内自定义排序规则的实现方式,并列举其实际应用场景。 考查对 MapReduce 中排序机制的理解及自定义排序的应用能力。第 116 题请说明在 Hive 中编写并使用自定义函数(UDF)的具体方法,并列举 UDF 的典型应用场景。 考查对 Hive UDF 开发流程和应用场景的理解。第 117 题请说明在 Hive 环境下进行数据清洗与预处理的具体实践方式,并列举常用工具或方法。 考查对 Hive 数据清洗与预处理常用手段的掌握程度。第 118 题请解释 Hive 中的 UDTF(User-Defined Table-Generating Functions)的概念,并说明实现一个 UDTF 的具体步骤和方法。 考查对 Hive 自定义函数体系中 UDTF 概念的理解和实现能力。第 119 题请说明在 Apache Flink 中实现基于时间窗口的聚合计算的具体做法,并列举常用的聚合函数类型。 考查对 Flink 时间窗口聚合机制及常用聚合算子的掌握程度。第 120 题请说明在 Apache Flink 中实现自定义状态后端的步骤和关键考虑点。 考查对 Flink 状态后端抽象机制及扩展方式的理解。