news 2026/10/1 21:19:37

Hadoop-日志清理

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Hadoop-日志清理

查YARN 日志聚合目录 /tmp/logs 占用大小

执行查看大小:hdfs dfs -du -h /tmp/logs

(1)日志聚合日志目录由 yarn-site.xml
yarn.nodemanager.remote-app-log-dir 配置的目录存放

(2)在yarn-default.xml查看目前配置:
yarn.log-aggregation.retain-seconds=604800(在HDFS上聚集的日志最多保存多长时间,单位秒,7天)
yarn.log-aggregation.retain-check-interval-seconds=86400(检查聚合日志保留情况任务执行间隔时间,1天)

修改参数后,需要重启nodemanager

官网解释:https://hadoop.apache.org/docs/current/hadoop-yarn/hadoop-yarn-common/yarn-default.xml

补充:
yarn.nodemanager.remote-app-log-dir 和yarn.nodemanager.log-dirs 的区别?

yarn.nodemanager.log-dirs : 存储在每个 NM 节点本地磁盘,存储的是应用运行时的容器日志(stdout/stderr/syslog),是临时的,作业跑完即清理,可配多个目录(提升本地 I/O 吞吐)
yarn.nodemanager.remote-app-log-dir : 存储在远端文件系统(HDFS / 其余云存储),存储的是应用结束后聚合上传的集中日志,可长期保留(靠 yarn.log-aggregation.retain-seconds 管保留),只能配置一个远端根目录

HDFS 回收站 .Trash

查看命令
hdfs dfs -du -h /user/*/.Trash

清理规则调整(core-site.xml):
fs.trash.interval=1440 保留 1 天 (检查点删除前的分钟数,单位是分钟,0=禁用回收站)

fs.trash.checkpoint.interval (检查点间隔分钟数,需 ≤ fs.trash.interval)

NameNode 上的 Trash Emptier 线程定期创建检查点并清理超期文件,客户端 hdfs dfs -rm 删除时读取它来决定是否移入 .Trash,修改参数后需要重启Namenode

官网解释: https://hadoop.apache.org/docs/current/hadoop-project-dist/hadoop-common/core-default.xml

Spark History EventLog(spark-defaults.conf)

spark.history.fs.cleaner.enabled(默认 false,true开启自动清理)
spark.history.fs.cleaner.interval(默认 1d):How often the cleaner checks for files to delete.
spark.history.fs.cleaner.maxAge(默认 7d):Job history files older than this will be deleted.

JobHistoryServer 不参与日志删除,无需重启

spark Monitoring 文档
https://spark.apache.org/docs/latest/monitoring.html

服务日志清理

守护进程(NameNode/DataNode/ResourceManager/NodeManager 等)自己的运行日志,清理机制是 log4j 的滚动+保留份数,而不是 Hadoop 配置项
最好的办法是编写脚本,使用命令周期删除

(1)存储地址
这些日志写在本地磁盘(目录由 hadoop-env.sh 的 HADOOP_LOG_DIR 决定)
(2)删除参数

Hadoop 2.x(log4j 1.x)— set MaxBackupIndex:保留 N 个、超出删最旧
MaxBackupIndex 决定在删除最旧备份前保留的备份文件最大数量(正整数)。默认值为 1
https://logging.apache.org/log4j/1.x/apidocs/org/apache/log4j/RollingFileAppender.html

Hadoop 3.x(log4j2)— DefaultRolloverStrategy 与 Delete
DefaultRolloverStrategy 的 max 属性,默认值N= 7,达到 N 个删最旧
Delete action + IfLastModified
https://logging.apache.org/log4j/2.x/manual/appenders/rolling-file.html

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 21:19:00

2026 AI 论文辅助工具综合排行榜|毕业党实测,按全流程能力打分

前言 本次排行榜纯粹按照综合实力进行排名,评估维度包含:功能完整度、本土化适配、学术准确性、文档安全、性价比。不看网络热度,不单独放大某一项单点能力,综合衡量一款工具能否支撑国内学生完成毕业论文全流程。 学术提示&…

作者头像 李华
网站建设 2026/10/1 21:17:06

AI生成内容样式冲突?用iframe隔离方案一次解决

这个坑是从一个AI病历生成项目里踩出来的。诊所管理后台要接入大模型,医生输入主诉和现病史,AI自动生成结构化病历草稿,前端需要把AI返回的HTML片段渲染出来,给医生预览、修改、确认。第一天联调就把我整懵了——主站用的是Vue3加…

作者头像 李华
网站建设 2026/10/1 21:16:43

Python3综合扫描工具源码解析:从端口扫描到漏洞检测的自动化实践

简介:一份基于 Python3 的多功能网络安全扫描工具源码,面向企业安全自检、授权渗透测试与安全开发学习者。项目集敏感文件探测、WAF/CDN 识别、端口扫描、服务指纹识别、操作系统检测、弱口令检测、漏洞利用扫描、SQL 注入检测、CDN 绕过与旁站查询于一体…

作者头像 李华
网站建设 2026/10/1 21:16:39

【9月终章】大厂架构师到商业领袖的三十天蜕变手记与心力总结

【9月终章】大厂架构师到商业领袖的三十天蜕变手记与心力总结在 2026 年 9 月的整整三十天中,我们用三十篇高密度的真实手记,完整记录了一个前大厂资深架构师在创立 YueJoy 并带领团队冲刺商业化的心智进化与认知突围。 作为创业心法专栏的终局收官之作&…

作者头像 李华
网站建设 2026/10/1 21:15:36

杭州9610出口免税财务公司原来竟有3个隐藏坑?

出口免税申报背后的成本隐忧近年来,杭州跨境电商企业数量持续攀升,9610出口模式作为小额跨境电商包裹出口的重要通道,吸引了大量中小卖家入场。然而,数据表明,约有六成首次尝试9610申报的企业在首年遭遇过不同程度的财…

作者头像 李华