تقریباً هر خرابی جدی که به آن رسیدگی کردهایم، هفتهها قبل نشانه داده بود: دیسکی که آرامآرام پر میشد، حافظهای که نشت داشت، یا خطایی که هر شب در لاگ تکرار میشد. مسئله نبودِ نشانه نیست — کسی نگاه نمیکرد.
چهار لایهای که باید دیده شوند
۱. منابع
پردازنده، حافظه، فضای دیسک و شبکه. سادهترین لایه و همانکه بیشترین خرابیهای قابل پیشگیری را جلوگیری میکند. پرشدن دیسک، رایجترین علت خرابی سرورهایی است که «ناگهان» از کار میافتند.
۲. سرویس
اینکه سرور روشن است یعنی سرویس کار میکند؟ نه. باید خودِ سرویس را بررسی کنید: آیا پاسخ میدهد، در چه زمانی، و پاسخش درست است.
۳. تجربهٔ کاربر
مؤثرترین پایش، شبیهسازی کاری است که کاربر واقعاً انجام میدهد: ورود به سامانه، باز کردن یک صفحهٔ کلیدی. اگر این کار هر چند دقیقه خودکار انجام شود، معمولاً زودتر از تماس کاربران متوجه مشکل میشوید.
۴. پشتیبانگیری و امنیت
موفقیت آخرین پشتیبانگیری، انقضای گواهیها، و تلاشهای ناموفق ورود. اینها معمولاً از پایش جا میمانند و دقیقاً همانهایی هستند که روز حادثه اهمیت پیدا میکنند.
مشکل اصلی: هشدار بیش از حد
سامانهای که روزی صد هشدار میفرستد، عملاً هیچ هشداری نمیفرستد — چون بعد از یک هفته کسی نگاهشان نمیکند. این پدیده، شایعترین علت شکست پروژههای پایش است.
قاعدهای که به مشتریان پیشنهاد میکنیم: هر هشدار باید یک کار مشخص را لازم داشته باشد. اگر هشداری میآید و کار درستش «نادیده گرفتن» است، آن هشدار باید حذف یا آستانهاش اصلاح شود.
خلاصه: پنج هشدار که همیشه خوانده میشوند، از صد هشداری که هیچوقت خوانده نمیشوند ارزشمندترند.
روند مهمتر از لحظه است
«فضای دیسک ۸۵٪ است» یک عدد است. «فضای دیسک در سه هفته از ۶۰٪ به ۸۵٪ رسیده» یک هشدار واقعی است که به شما زمان میدهد. نگهداری تاریخچه و دیدن روند، تفاوت بین واکنش و پیشگیری است.