ログ監視は、システムが出すログの中から異常の兆候を拾い、検知・通知につなげる監視です。 「ログを保存しておくこと」と「ログを監視すること」は別物で、残っているだけのログは障害が起きてから読む資料にしかなりません。監視は「起きたときに向こうから知らせてくる」状態を作ることです。
何から拾うか(優先順位)
全部を見ようとすると破綻します。実害に直結するものから絞るのが定石です。
- エラーの急増 … 500エラー・例外ログが平常時の数倍になったら通知
- 認証まわり … 失敗ログインの急増(ブルートフォースの兆候)、深夜の管理者ログイン
- ジョブ・バックアップの失敗 … 「失敗のログが出た」だけでなく「成功のログが出ていない」も検知する(ジョブごと止まると失敗ログすら出ない)
- ディスク容量・リソースの警告
仕組みの基本形
各サーバーのログ(syslog、journalctl、アプリログ)を1箇所に集約し、そこで条件マッチと通知を行うのが基本形です。集約しておくと、サーバーに入れない障害時でもログが読め、複数台の突き合わせもできます。 保存期間はログローテーションとセットで設計します(詳しくはログローテーションとlogrotate)。
通知疲れを防ぐ
ログ監視が失敗する典型は「何でも通知した結果、誰も見なくなる」です。 通知が来たら必ず何か行動するものだけをアラートにし、残りはダッシュボードや日次サマリーへ落とす——この仕分けが監視を長生きさせます。