故障排查
约 875 字大约 3 分钟
2026-05-14
阅读导览
故障排查
把文件、权限、进程、服务、网络和资源知识串成可复用的排查流程。
- 学习路径
- 关键概念
- 排查入口
把文件、权限、进程、服务、网络和资源知识串成可复用的排查流程。这个模块不追求一次列完所有命令,而是帮助你建立判断路径:遇到问题时知道先看哪里、用什么命令收集证据,以及哪些操作需要谨慎。
模块学习路线
| 文章 | 解决的问题 |
|---|---|
| CPU 飙高怎么查 | 定位高 CPU 进程、线程和可能的业务原因。 |
| 定时任务不执行怎么查 | 围绕路径、环境变量、权限、日志和时间表达式排查。 |
| 磁盘满了怎么查 | 定位满的分区、大目录、被删除但占用的文件。 |
| 内存不够怎么查 | 排查内存、swap、OOM 和进程占用。 |
| Permission denied 怎么查 | 从用户、文件权限、目录权限、服务运行用户逐步定位。 |
| 端口访问不了怎么查 | 从 DNS、网络、监听地址、防火墙到应用日志逐层排查。 |
| 服务起不来怎么查 | 围绕 systemctl、journalctl、配置检查和端口验证排查。 |
| SSH 连不上怎么查 | 区分超时、拒绝连接、认证失败和主机指纹变化。 |
| Linux 问题排查总流程 | 建立从现象、范围、证据到修复的排查框架。 |
怎么学习这个模块
这个模块是前面所有模块的“总应用”。前面学的是文件、权限、进程、服务、网络、资源各自的知识,这里把它们串成“遇到具体问题怎么查”的实战流程。
先读 Linux 问题排查总流程 建立通用框架——现象、范围、证据、假设、验证、修复——再按你遇到的现象对症查:
| 你遇到的现象 | 对症文章 |
|---|---|
| 不知道从哪下手、越查越乱 | Linux 问题排查总流程 |
| 磁盘满了、写不进文件 | 磁盘满了怎么查 |
| 内存告警、服务被 OOM | 内存不够怎么查 |
| CPU 飙高、机器发卡 | CPU 飙高怎么查 |
| 某个端口连不上 | 端口访问不了怎么查 |
| 服务 start 之后起不来 | 服务起不来怎么查 |
| SSH 登录不上去 | SSH 连不上怎么查 |
| Permission denied | Permission denied 怎么查 |
| 定时任务没按时跑 | 定时任务不执行怎么查 |
每一篇的共同套路都是“先用只读命令看懂,再动手改”。这个模块的反面教材只有一个:在没看清问题之前就“先重启 / 先 chmod 777 / 先 kill 试试”。
实践清单
模块练习
- 1先读本模块入口,理解 故障排查 解决什么问题。
- 2挑一篇和当前工作最相关的文章,照着命令跑一遍。
- 3把遇到的错误记录成“现象、假设、证据、结论”。
重点总结
要点回收
- 故障排查模块关注的是:把文件、权限、进程、服务、网络和资源知识串成可复用的排查流程。
- 学习顺序应该从理解概念开始,再补命令细节。
- 每篇文章都要落实到真实命令和排查判断。
版权所有
版权归属:Shuo Liu
