在 DolphinScheduler 中,任务执行失败后系统会如何触发重试?重试策略的配置入口和关键参数有哪些?
考察说明
考查对 DolphinScheduler 任务失败处理与重试配置的理解。
回答思路
- 【回答框架 1】DolphinScheduler 的任务重试是基于工作流实例和任务实例的重试机制,当任务执行失败后,系统会按照配置的失败重试次数和失败重试间隔重新提交执行。重试的触发条件通常是任务执行失败且未超过最大重试次数。
- 【回答框架 2】重试策略主要在任务定义或工作流定义中进行配置,关键参数包括失败重试次数和失败重试间隔(单位为分钟)。配置入口在创建或编辑任务节点时的高级设置或相关配置项中。
- 【回答框架 3】任务实例在达到最大重试次数后仍然失败,则会进入失败状态,并可能触发工作流的失败策略,如结束流程或继续执行后续任务。重试会为任务生成新的任务实例,但可能共享或保留原执行记录。
- 【回答框架 4】重试机制适用于可重试的失败场景,但需注意重试可能重复执行副作用,建议保证任务幂等性,或根据实际业务设置合理的重试次数和间隔。
- 【关键点 1】任务失败后按配置的次数和间隔自动重试。
- 【关键点 2】配置参数主要是失败重试次数和失败重试间隔,配置入口在任务定义或工作流定义中。
- 【关键点 3】重试不保证业务幂等,需任务自身支持幂等。
- 【关键点 4】达到最大重试次数后任务失败,可能触发工作流失败策略。
- 【易错点 1】重试间隔配置过大可能导致任务延迟,过小可能造成频繁重试。
- 【易错点 2】重试可能产生重复执行,需确保任务幂等,尤其涉及外部资源或数据写入。
- 【易错点 3】不同失败类型(如资源不足、业务异常)应统一重试,可能导致资源浪费。