نگهداری پیشگیرانه شبکه؛ چکلیست ماهانه، فصلی و سالانه

تقریباً هیچ تجهیزی بدون مقدمه خراب نمیشود. دیسکی که میسوزد، هفتهها قبل خطای خواندن داده است. منبع تغذیهای که از کار میافتد، مدتها داغتر از حد معمول کار کرده. سوئیچی که یک روز بالا نمیآید، بارها خودش را ریاستارت کرده و کسی لاگ را نخوانده است.
نگهداری پیشگیرانه شبکه یعنی همین نشانهها را پیدا کردن، پیش از آنکه به توقف تبدیل شوند. این مقاله یک چکلیست عملی میدهد: چه چیزی را ماهانه، چه چیزی را فصلی و چه چیزی را سالانه باید بررسی کرد — و چرا هر مورد اهمیت دارد.
چرا پیشگیری از تعمیر ارزانتر است
سه دلیل ساده دارد و هر سه قابل اندازهگیریاند.
اول، زمان. تعویض برنامهریزیشده یک دیسک در ساعت غیرکاری، صفر ساعت توقف دارد. تعویض همان دیسک بعد از سوختن، ساعتها توقف بهعلاوه زمان بازیابی اطلاعات دارد.
دوم، قیمت. قطعهای که با فرصت خریداری میشود، با قیمت بازار خریده میشود. قطعهای که فوری لازم است، با هر قیمتی که موجود باشد خریده میشود — و گاهی اصلاً موجود نیست.
سوم، دامنه. خرابی برنامهریزینشده معمولاً تنها نمیآید. سروری که ناگهان خاموش میشود، ممکن است پایگاه داده را هم خراب کند. توقف کنترلشده این ریسک را ندارد.
وقتی این سه را در کنار هزینه هر ساعت توقف بگذارید، معمولاً معلوم میشود بازدید دورهای ارزانترین بخش قرارداد است.
چکلیست ماهانه
اینها کارهایی است که هر ماه باید انجام شود. بیشترشان کوتاهاند و مجموعاً چند ساعت وقت میگیرند.
بکاپها
مهمترین بند فهرست، و بیشترین بندی که نادیده گرفته میشود. سه سؤال:
- آیا بکاپهای ماه گذشته همه با موفقیت اجرا شدهاند؟ (نه فقط «سیستم بکاپ روشن است»)
- حجم بکاپها منطقی است یا ناگهان کم شده؟ کاهش ناگهانی حجم معمولاً یعنی چیزی از دامنه بکاپ خارج شده.
- آیا یک بازیابی آزمایشی انجام شده؟ بکاپی که بازیابیاش تست نشده، بکاپ نیست؛ یک فرض است.
بند سوم را جدی بگیرید. رایجترین فاجعهای که میبینیم این نیست که شرکت بکاپ نداشته باشد؛ این است که بکاپ داشته و در روز نیاز معلوم شده قابل بازیابی نیست.
فضای دیسک و منابع
فضای خالی سرورها، رشد پایگاه داده، مصرف حافظه و پردازنده در ساعات اوج. روند مهمتر از عدد لحظهای است: سروری که ماه پیش ۴۰ درصد فضا داشت و امروز ۲۰ درصد دارد، دو ماه دیگر متوقف میشود.
لاگ خطاها
لاگ سیستم سرورها و تجهیزات شبکه. دنبال الگو بگردید، نه تکخطا: تجهیزی که هفتهای یک بار ریاستارت میشود، دارد چیزی میگوید.
وضعیت آنتیویروس و بهروزرسانیها
آیا همه ایستگاهها بهروزند؟ سیستمهایی که مدتهاست بهروزرسانی نگرفتهاند معمولاً همانهایی هستند که خاموش بودهاند یا از دامنه مدیریت خارج شدهاند — و همانها بیشترین ریسک را دارند.
حسابهای کاربری
حساب کارکنانی که رفتهاند غیرفعال شده است؟ حسابهای دسترسی از راه دور همه هنوز لازماند؟ این بررسی ساده، یکی از بالاترین نسبتهای فایده به زحمت را دارد.
چکلیست فصلی
کارهایی که هر سه ماه یکبار، معمولاً در قالب یک بازدید حضوری انجام میشوند.
بازرسی فیزیکی رک و اتاق سرور
- دما و تهویه: فنها کار میکنند؟ هوا مسیر درستی دارد؟ رک بسته است یا هوای گرم برمیگردد؟
- گرد و غبار: انباشت گرد روی فنها و ورودی هوا، شایعترین علت داغ شدن است.
- مرتب بودن کابلها: نه برای زیبایی — کابل درهم، هم جریان هوا را میبندد هم عیبیابی را کند میکند.
- برچسبها: هنوز خوانا و درستاند؟ برچسبی که با واقعیت نمیخواند، بدتر از نبودن است.
- وضعیت UPS: باتریها سالماند؟ آخرین تست تخلیه کی بوده؟
سلامت سختافزار
وضعیت آرایه دیسکها، شمارنده خطای دیسکها، سلامت منابع تغذیه افزونه، و دمای قطعات. اینجا دنبال چیزی میگردید که هنوز خراب نشده اما دارد میشود.
بازبینی پیکربندی
قوانین فایروال هنوز همه لازماند؟ قوانینی که برای یک پروژه موقت اضافه شده بودند و پروژه تمام شده، هنوز باز ماندهاند؟ این بررسی در شبکههای میکروتیک اهمیت بیشتری دارد؛ در مقاله پشتیبانی شبکه میکروتیک توضیح دادهایم چرا.
بررسی ظرفیت
پورتهای خالی سوئیچ چقدر مانده؟ پهنای باند اینترنت در ساعت اوج چقدر اشغال است؟ اینها ورودی برنامهریزی سال بعدند و اگر بهموقع دیده شوند، خرید اضطراری اتفاق نمیافتد.
چکلیست سالانه
تست کامل بازیابی
نه فقط بازیابی یک فایل — شبیهسازی از دست رفتن یک سرور و بازگرداندن کامل آن در محیط آزمایشی. زمانی که این کار میبرد، همان زمانی است که در روز حادثه خواهید داشت. اگر این عدد را ندانید، هیچ برنامه بازیابی واقعی ندارید.
بازبینی چرخه عمر تجهیزات
کدام تجهیزات به پایان پشتیبانی سازنده نزدیک میشوند؟ برای کدامها هنوز قطعه یدکی پیدا میشود؟ خروجی این بررسی، برنامه تعویض تدریجی است — بهجای تعویض اضطراری همهچیز با هم در سالی که یکیشان میسوزد.
بازبینی مستندات
نقشه شبکه با واقعیت میخواند؟ فهرست تجهیزات بهروز است؟ دسترسیهای مدیریتی همه ثبت شدهاند؟ مستنداتی که سالی یکبار هم بازبینی نشود، ظرف دو سال بیارزش میشود.
بازبینی قرارداد و SLA
آیا سطح خدماتی که خریدهاید هنوز با نیاز امروز شما میخواند؟ شرکتی که سه سال پیش سی نفر بود و حالا هشتاد نفر است، احتمالاً به سطح متفاوتی نیاز دارد. معیارهای این بازبینی را در مقاله SLA آوردهایم.
جدول خلاصه
| مورد | ماهانه | فصلی | سالانه |
|---|---|---|---|
| موفقیت بکاپها | ✓ | ||
| بازیابی آزمایشی نمونه | ✓ | ||
| تست کامل بازیابی | ✓ | ||
| فضای دیسک و منابع | ✓ | ||
| لاگ خطاها | ✓ | ||
| بهروزرسانیها و آنتیویروس | ✓ | ||
| بازبینی حسابهای کاربری | ✓ | ||
| بازرسی فیزیکی رک و تهویه | ✓ | ||
| سلامت دیسک و منبع تغذیه | ✓ | ||
| بازبینی قوانین فایروال | ✓ | ||
| تست UPS | ✓ | ||
| بررسی ظرفیت | ✓ | ||
| چرخه عمر تجهیزات | ✓ | ||
| بازبینی مستندات | ✓ | ||
| بازبینی قرارداد و SLA | ✓ |
اشتباه رایج: بازدید بدون چکلیست
«ماهی یک بار میآییم سر میزنیم» تعهد نیست. بازدیدی که خروجی مکتوب ندارد، قابل ارزیابی هم نیست — نه برای شما، نه برای پیمانکار.
یک بازدید سالم سه خروجی دارد: چکلیست پرشده با وضعیت هر بند، فهرست کارهایی که همانجا انجام شد، و فهرست مواردی که نیاز به اقدام دارند با اولویت و برآورد. اگر گزارش بازدید این سه را ندارد، عملاً فقط یک حضور فیزیکی بوده است.
به همین دلیل در بندهای قرارداد پشتیبانی تأکید کردهایم که چکلیست بازدید باید پیوست قرارداد باشد، نه چیزی که در لحظه تصمیم گرفته میشود.
از کجا شروع کنیم اگر هیچکدام را انجام نمیدهیم
اگر این فهرست طولانی به نظر میرسد، با سه مورد شروع کنید که بیشترین بازده را دارند:
- تست بازیابی بکاپ. همین هفته. اگر جواب نداد، بقیه فهرست اهمیتی ندارد.
- بازرسی فیزیکی رک. نیم ساعت وقت میبرد و معمولاً دو سه مشکل در حال شکلگیری را نشان میدهد.
- فهرست تجهیزات با مدل و سن. پایه هر برنامهریزی بعدی است.
بقیه فهرست را میشود طی چند ماه اضافه کرد. مهم این است که شروع شود و ثبت شود — نگهداریای که مستند نمیشود، بعد از تغییر یک نفر فراموش میشود.
پنج نشانهای که نباید نادیده گرفت
بعضی علائم آنقدر رایجاند که عادی به نظر میرسند. هر کدام از اینها را دیدید، بدانید که یک خرابی در حال شکل گرفتن است و وقت دارید جلویش را بگیرید.
کندی که «هر از گاهی» پیش میآید
کاربران میگویند اینترنت گاهی کند میشود و بعد خودش درست میشود. این تقریباً هیچوقت تصادفی نیست. معمولاً یا مصرف در ساعت خاصی به سقف میرسد، یا تجهیزی زیر بار داغ میکند و خودش را محدود میکند، یا یک لینک مشکلدار مدام بالا و پایین میشود. بدون تاریخچه پایش، این مسئله سالها میتواند ادامه پیدا کند بدون اینکه کسی علتش را بفهمد.
تجهیزی که خودش ریاستارت میشود
یک بار ممکن است اتفاقی باشد. دو بار در ماه یعنی مشکل. علت معمولاً یکی از اینهاست: منبع تغذیه در حال از بین رفتن، گرمای بیش از حد، یا مشکل برق ورودی. هر سه قابل تشخیصاند و هر سه اگر رها شوند به خرابی کامل ختم میشوند.
فنهایی که صدایشان تغییر کرده
صدای بلندتر یعنی فن دارد سریعتر میچرخد، یعنی دستگاه گرمتر از قبل است. صدای غیرعادی یعنی خود فن دارد از بین میرود. هیچکدام بیاهمیت نیستند و هر دو با یک بازدید ساده قابل تشخیصاند.
بکاپی که مدت زمان اجرایش تغییر کرده
اگر بکاپی که همیشه دو ساعت طول میکشید حالا شش ساعت طول میکشد، یا برعکس ناگهان بیست دقیقهای تمام میشود، چیزی تغییر کرده است. کوتاه شدن ناگهانی معمولاً بدتر است: یعنی چیزی از دامنه بکاپ خارج شده و کسی متوجه نشده.
خطاهایی که کاربران دیگر گزارش نمیکنند
وقتی کاربران به مشکلی عادت میکنند، دیگر گزارشش نمیکنند و به راهحلهای دور زدن روی میآورند. کاهش تعداد تیکتها همیشه خبر خوبی نیست؛ گاهی یعنی کاربران از سیستم ناامید شدهاند. در گزارش ماهانه، به روند نوع درخواستها هم نگاه کنید، نه فقط تعدادشان.
چطور نگهداری را از حالت آتشنشانی دربیاوریم
بیشتر تیمهای IT در وضعیت واکنشی گیر میکنند: تمام وقتشان صرف حل مشکلات فوری میشود و هیچوقت فرصت پیشگیری پیش نمیآید. این چرخه خودش را تقویت میکند، چون هرچه پیشگیری کمتر، خرابی بیشتر و فرصت کمتر.
شکستن این چرخه به یک تصمیم مدیریتی نیاز دارد، نه به تلاش بیشتر تیم فنی. سه اقدام عملی:
- زمان محافظتشده. یک بازه ثابت ماهانه که فقط برای کارهای پیشگیرانه است و برای کارهای فوری برداشته نمیشود، مگر در موارد بحرانی واقعی.
- ثبت اجباری. هر خرابی با علت ریشهای ثبت شود، نه فقط با «حل شد». بدون علت ریشهای، همان مشکل ماه بعد برمیگردد.
- بازبینی ماهانه علتها. پانزده دقیقه نگاه کردن به فهرست خرابیهای ماه، معمولاً یک الگوی تکرارشونده را نشان میدهد که با یک اقدام ریشهای حذف میشود.
این سه کار هزینهای ندارند جز انضباط. و اثرشان معمولاً ظرف دو سه ماه در تعداد خرابیها دیده میشود.
نگهداری در زیرساخت پسیو
بخشی که تقریباً همیشه از قلم میافتد، چون «کابل که خراب نمیشود». این درست نیست. کابلکشی در طول زمان تحت تأثیر جابهجایی میزها، اضافه شدن پریزها، تعمیرات ساختمان و کشیده شدنهای مکرر قرار میگیرد.
آنچه باید سالانه بررسی شود: صحت برچسبها در دو سر هر مسیر، وضعیت فیزیکی پچکوردها که بیشترین فرسودگی را دارند، مسیرهایی که بعد از جابهجایی رها شدهاند و هیچکس نمیداند به کجا میروند، و مستندات نقشه که معمولاً بعد از دو سه تغییر با واقعیت فاصله میگیرد.
یک مسیر بیبرچسب امروز، نیم ساعت عیبیابی اضافه در روز خرابی است. ده مسیر بیبرچسب، یعنی هر عیبیابی به حدس و آزمونوخطا تبدیل میشود.
آستانههای فنی: چه عددی یعنی وقت اقدام
چکلیست بدون آستانه، به قضاوت لحظهای بازدیدکننده وابسته است. این جدول، نقطه شروع آستانههاست؛ آنها را با خط مبنای شبکه خودتان تنظیم کنید:
| مورد | نشانه | معنای احتمالی | اقدام |
|---|---|---|---|
| خطای CRC/FCS روی پورت | شمارنده در حال افزایش، حتی کم | کابل، پچکورد یا ماژول معیوب | تست کابل، تعویض پچکورد یا ماژول |
| Late Collision یا Half-Duplex | هر مقدار روی لینک گیگابیتی | عدم تطابق Duplex | بررسی تنظیم Auto-negotiation دو طرف |
| توان دریافتی ماژول فیبر | روند نزولی یا نزدیک به آستانه هشدار ماژول | کانکتور کثیف، خم زیاد، فرسودگی | تمیزکاری کانکتور با ابزار مخصوص، تست افت |
| مصرف لینک | صدک ۹۵ بالای حدود ۷۰٪ ظرفیت | نزدیک شدن به اشباع در اوج | برنامه ارتقا یا توزیع بار |
| پردازنده روتر یا فایروال | بالا بهطور پایدار در ساعات کاری | ظرفیت ناکافی یا قانون ناکارآمد | بازبینی قوانین، ارزیابی ظرفیت |
| بودجه PoE سوئیچ | مصرف بالای حدود ۸۰٪ بودجه | حاشیه کم برای دستگاه جدید | توزیع دستگاهها یا سوئیچ با بودجه بیشتر |
| دمای ورودی رک | خارج از بازه ۱۸ تا ۲۷ درجه ASHRAE | مشکل سرمایش یا جریان هوا | بررسی کولر، پنلهای خالی، کابلهای مانع |
| باتری UPS | زمان پشتیبانی کمتر از نیاز خاموشی منظم، یا عمر نزدیک به پایان | فرسودگی باتری | تعویض برنامهریزیشده |
پایش نوری با DOM
بیشتر ماژولهای فیبر نوری SFP و SFP+ قابلیت DOM (پایش دیجیتال نوری، طبق مشخصه SFF-8472) دارند: توان ارسال و دریافت، دما، ولتاژ و جریان لیزر را گزارش میدهند و آستانههای هشدار و خطر خودشان را دارند. ثبت ماهانه توان دریافتی هر لینک فیبر و مقایسه با مقدار روز نصب، افت تدریجی را ماهها پیش از قطعی نشان میدهد. محاسبه بودجه افت را در فیبر نوری در شبکه سازمانی آوردهایم.
چرا شمارندهها را باید روند دید
مقدار مطلق شمارنده خطا به تنهایی معنای کمی دارد — ممکن است مربوط به ماهها پیش باشد. آنچه مهم است نرخ افزایش است. به همین دلیل این آستانهها بهتر است در سیستم مانیتورینگ بهصورت نرخ تعریف شوند و بازدید دورهای، روندها را مرور کند. برای بخش سرورها، چکلیست تکمیلی در سرویس دورهای سرور است.
پرسشهای متداول
نگهداری پیشگیرانه چقدر زمان میبرد؟
برای یک شبکه متوسط، چند ساعت در ماه برای موارد ماهانه و نیم روز برای بازدید فصلی. تست کامل بازیابی سالانه معمولاً یک روز کاری است.
آیا این کارها را خودمان میتوانیم انجام دهیم؟
بخش زیادیاش بله، بهویژه موارد ماهانه. مواردی که تخصص یا ابزار خاص میخواهند — مثل تست UPS یا بازبینی پیکربندی — معمولاً بهتر است با کسی انجام شود که مرجع مقایسه دارد.
اگر همهچیز سالم بود، یعنی پول بازدید هدر رفت؟
نه، دقیقاً برعکس. این همان سوءتفاهمی است که باعث میشود شرکتها بعد از یک سال آرام، بازدید را قطع کنند. هزینه نگهداری را باید با هزینه توقفی که اتفاق نیفتاد مقایسه کرد، نه با صفر.
هر چند وقت باید تجهیزات را تعویض کرد؟
عدد ثابتی ندارد و به شرایط کاری بستگی دارد. معیار عملی این است: وقتی سازنده پشتیبانی را قطع کرد، وقتی قطعه یدکی کمیاب شد، یا وقتی ظرفیتش کم آورد. بازبینی سالانه چرخه عمر برای همین است.
قدم بعدی
اگر میخواهید بدانید شبکه شما امروز در کدام بندهای این فهرست ضعف دارد، بازدید فنی نقطه شروع است: چکلیست را پر میکنیم و گزارش مکتوب با اولویتبندی تحویل میدهیم.
مشاهده خدمات پشتیبانی شبکه و درخواست بازدید · تلفن: 021-74903
نگهداری شبکه مشتریان را انجام میدهید؟
اگر پیمانکار یا کارشناس مستقل شبکه هستید و مشتریانی دارید که به نگهداری منظم با گزارش مکتوب نیاز دارند، از طریق برنامه همکاری در فروش نصیر ارتباط همکار یا معرف شوید.