数据岗位面试题更新 2026-08-05

请描述在 Apache Druid 中实现数据备份与恢复的具体方法和步骤。

数据技术原理问题排查Apache Druid

考察说明

考察对 Apache Druid 数据持久化机制及备份恢复实践的理解。

回答思路

  1. 【回答框架 1】Apache Druid 的数据备份主要围绕其存储层设计:元数据存储在 MySQL 或 PostgreSQL 中,通过定期导出数据库即可备份;段数据存储在深度存储(如 HDFS、S3)中,直接复制对应目录即可。
  2. 【回答框架 2】恢复时先恢复元数据库,再确保深度存储中的段数据可访问,Druid 服务会自动从元数据加载段信息并加载数据。可通过重新导入元数据或启动服务时指定存储路径完成恢复。
  3. 【回答框架 3】对于更精细的备份,可使用 Druid 的索引任务或导出工具将段数据转换为其他格式存储,但标准做法仍是上述两部分的组合备份。
  4. 【回答框架 4】需注意备份一致性:应先停止写入或在低峰期操作,避免元数据与段数据时间点不一致导致恢复后数据缺失。
  5. 【关键点 1】元数据数据库备份是核心,确保元数据与深度存储的段数据匹配。
  6. 【关键点 2】深度存储中的段文件需完整复制,且保留目录结构。
  7. 【关键点 3】恢复时按元数据优先、数据其次的顺序进行。