پشتیبانی و نگهداری

نگهداری پیشگیرانه شبکه؛ چک‌لیست ماهانه، فصلی و سالانه

نگهداری پیشگیرانه شبکه سازمانی

تقریباً هیچ تجهیزی بدون مقدمه خراب نمی‌شود. دیسکی که می‌سوزد، هفته‌ها قبل خطای خواندن داده است. منبع تغذیه‌ای که از کار می‌افتد، مدت‌ها داغ‌تر از حد معمول کار کرده. سوئیچی که یک روز بالا نمی‌آید، بارها خودش را ری‌استارت کرده و کسی لاگ را نخوانده است.

نگهداری پیشگیرانه شبکه یعنی همین نشانه‌ها را پیدا کردن، پیش از آنکه به توقف تبدیل شوند. این مقاله یک چک‌لیست عملی می‌دهد: چه چیزی را ماهانه، چه چیزی را فصلی و چه چیزی را سالانه باید بررسی کرد — و چرا هر مورد اهمیت دارد.

چرا پیشگیری از تعمیر ارزان‌تر است

سه دلیل ساده دارد و هر سه قابل اندازه‌گیری‌اند.

اول، زمان. تعویض برنامه‌ریزی‌شده یک دیسک در ساعت غیرکاری، صفر ساعت توقف دارد. تعویض همان دیسک بعد از سوختن، ساعت‌ها توقف به‌علاوه زمان بازیابی اطلاعات دارد.

دوم، قیمت. قطعه‌ای که با فرصت خریداری می‌شود، با قیمت بازار خریده می‌شود. قطعه‌ای که فوری لازم است، با هر قیمتی که موجود باشد خریده می‌شود — و گاهی اصلاً موجود نیست.

سوم، دامنه. خرابی برنامه‌ریزی‌نشده معمولاً تنها نمی‌آید. سروری که ناگهان خاموش می‌شود، ممکن است پایگاه داده را هم خراب کند. توقف کنترل‌شده این ریسک را ندارد.

وقتی این سه را در کنار هزینه هر ساعت توقف بگذارید، معمولاً معلوم می‌شود بازدید دوره‌ای ارزان‌ترین بخش قرارداد است.

چک‌لیست ماهانه

این‌ها کارهایی است که هر ماه باید انجام شود. بیشترشان کوتاه‌اند و مجموعاً چند ساعت وقت می‌گیرند.

بکاپ‌ها

مهم‌ترین بند فهرست، و بیشترین بندی که نادیده گرفته می‌شود. سه سؤال:

  • آیا بکاپ‌های ماه گذشته همه با موفقیت اجرا شده‌اند؟ (نه فقط «سیستم بکاپ روشن است»)
  • حجم بکاپ‌ها منطقی است یا ناگهان کم شده؟ کاهش ناگهانی حجم معمولاً یعنی چیزی از دامنه بکاپ خارج شده.
  • آیا یک بازیابی آزمایشی انجام شده؟ بکاپی که بازیابی‌اش تست نشده، بکاپ نیست؛ یک فرض است.

بند سوم را جدی بگیرید. رایج‌ترین فاجعه‌ای که می‌بینیم این نیست که شرکت بکاپ نداشته باشد؛ این است که بکاپ داشته و در روز نیاز معلوم شده قابل بازیابی نیست.

فضای دیسک و منابع

فضای خالی سرورها، رشد پایگاه داده، مصرف حافظه و پردازنده در ساعات اوج. روند مهم‌تر از عدد لحظه‌ای است: سروری که ماه پیش ۴۰ درصد فضا داشت و امروز ۲۰ درصد دارد، دو ماه دیگر متوقف می‌شود.

لاگ خطاها

لاگ سیستم سرورها و تجهیزات شبکه. دنبال الگو بگردید، نه تک‌خطا: تجهیزی که هفته‌ای یک بار ری‌استارت می‌شود، دارد چیزی می‌گوید.

وضعیت آنتی‌ویروس و به‌روزرسانی‌ها

آیا همه ایستگاه‌ها به‌روزند؟ سیستم‌هایی که مدت‌هاست به‌روزرسانی نگرفته‌اند معمولاً همان‌هایی هستند که خاموش بوده‌اند یا از دامنه مدیریت خارج شده‌اند — و همان‌ها بیشترین ریسک را دارند.

حساب‌های کاربری

حساب کارکنانی که رفته‌اند غیرفعال شده است؟ حساب‌های دسترسی از راه دور همه هنوز لازم‌اند؟ این بررسی ساده، یکی از بالاترین نسبت‌های فایده به زحمت را دارد.

چک‌لیست فصلی

کارهایی که هر سه ماه یک‌بار، معمولاً در قالب یک بازدید حضوری انجام می‌شوند.

بازرسی فیزیکی رک و اتاق سرور

  • دما و تهویه: فن‌ها کار می‌کنند؟ هوا مسیر درستی دارد؟ رک بسته است یا هوای گرم برمی‌گردد؟
  • گرد و غبار: انباشت گرد روی فن‌ها و ورودی هوا، شایع‌ترین علت داغ شدن است.
  • مرتب بودن کابل‌ها: نه برای زیبایی — کابل درهم، هم جریان هوا را می‌بندد هم عیب‌یابی را کند می‌کند.
  • برچسب‌ها: هنوز خوانا و درست‌اند؟ برچسبی که با واقعیت نمی‌خواند، بدتر از نبودن است.
  • وضعیت UPS: باتری‌ها سالم‌اند؟ آخرین تست تخلیه کی بوده؟

سلامت سخت‌افزار

وضعیت آرایه دیسک‌ها، شمارنده خطای دیسک‌ها، سلامت منابع تغذیه افزونه، و دمای قطعات. اینجا دنبال چیزی می‌گردید که هنوز خراب نشده اما دارد می‌شود.

بازبینی پیکربندی

قوانین فایروال هنوز همه لازم‌اند؟ قوانینی که برای یک پروژه موقت اضافه شده بودند و پروژه تمام شده، هنوز باز مانده‌اند؟ این بررسی در شبکه‌های میکروتیک اهمیت بیشتری دارد؛ در مقاله پشتیبانی شبکه میکروتیک توضیح داده‌ایم چرا.

بررسی ظرفیت

پورت‌های خالی سوئیچ چقدر مانده؟ پهنای باند اینترنت در ساعت اوج چقدر اشغال است؟ این‌ها ورودی برنامه‌ریزی سال بعدند و اگر به‌موقع دیده شوند، خرید اضطراری اتفاق نمی‌افتد.

چک‌لیست سالانه

تست کامل بازیابی

نه فقط بازیابی یک فایل — شبیه‌سازی از دست رفتن یک سرور و بازگرداندن کامل آن در محیط آزمایشی. زمانی که این کار می‌برد، همان زمانی است که در روز حادثه خواهید داشت. اگر این عدد را ندانید، هیچ برنامه بازیابی واقعی ندارید.

بازبینی چرخه عمر تجهیزات

کدام تجهیزات به پایان پشتیبانی سازنده نزدیک می‌شوند؟ برای کدام‌ها هنوز قطعه یدکی پیدا می‌شود؟ خروجی این بررسی، برنامه تعویض تدریجی است — به‌جای تعویض اضطراری همه‌چیز با هم در سالی که یکی‌شان می‌سوزد.

بازبینی مستندات

نقشه شبکه با واقعیت می‌خواند؟ فهرست تجهیزات به‌روز است؟ دسترسی‌های مدیریتی همه ثبت شده‌اند؟ مستنداتی که سالی یک‌بار هم بازبینی نشود، ظرف دو سال بی‌ارزش می‌شود.

بازبینی قرارداد و SLA

آیا سطح خدماتی که خریده‌اید هنوز با نیاز امروز شما می‌خواند؟ شرکتی که سه سال پیش سی نفر بود و حالا هشتاد نفر است، احتمالاً به سطح متفاوتی نیاز دارد. معیارهای این بازبینی را در مقاله SLA آورده‌ایم.

جدول خلاصه

موردماهانهفصلیسالانه
موفقیت بکاپ‌ها
بازیابی آزمایشی نمونه
تست کامل بازیابی
فضای دیسک و منابع
لاگ خطاها
به‌روزرسانی‌ها و آنتی‌ویروس
بازبینی حساب‌های کاربری
بازرسی فیزیکی رک و تهویه
سلامت دیسک و منبع تغذیه
بازبینی قوانین فایروال
تست UPS
بررسی ظرفیت
چرخه عمر تجهیزات
بازبینی مستندات
بازبینی قرارداد و SLA

اشتباه رایج: بازدید بدون چک‌لیست

«ماهی یک بار می‌آییم سر می‌زنیم» تعهد نیست. بازدیدی که خروجی مکتوب ندارد، قابل ارزیابی هم نیست — نه برای شما، نه برای پیمانکار.

یک بازدید سالم سه خروجی دارد: چک‌لیست پرشده با وضعیت هر بند، فهرست کارهایی که همان‌جا انجام شد، و فهرست مواردی که نیاز به اقدام دارند با اولویت و برآورد. اگر گزارش بازدید این سه را ندارد، عملاً فقط یک حضور فیزیکی بوده است.

به همین دلیل در بندهای قرارداد پشتیبانی تأکید کرده‌ایم که چک‌لیست بازدید باید پیوست قرارداد باشد، نه چیزی که در لحظه تصمیم گرفته می‌شود.

از کجا شروع کنیم اگر هیچ‌کدام را انجام نمی‌دهیم

اگر این فهرست طولانی به نظر می‌رسد، با سه مورد شروع کنید که بیشترین بازده را دارند:

  1. تست بازیابی بکاپ. همین هفته. اگر جواب نداد، بقیه فهرست اهمیتی ندارد.
  2. بازرسی فیزیکی رک. نیم ساعت وقت می‌برد و معمولاً دو سه مشکل در حال شکل‌گیری را نشان می‌دهد.
  3. فهرست تجهیزات با مدل و سن. پایه هر برنامه‌ریزی بعدی است.

بقیه فهرست را می‌شود طی چند ماه اضافه کرد. مهم این است که شروع شود و ثبت شود — نگهداری‌ای که مستند نمی‌شود، بعد از تغییر یک نفر فراموش می‌شود.

پنج نشانه‌ای که نباید نادیده گرفت

بعضی علائم آن‌قدر رایج‌اند که عادی به نظر می‌رسند. هر کدام از این‌ها را دیدید، بدانید که یک خرابی در حال شکل گرفتن است و وقت دارید جلویش را بگیرید.

کندی که «هر از گاهی» پیش می‌آید

کاربران می‌گویند اینترنت گاهی کند می‌شود و بعد خودش درست می‌شود. این تقریباً هیچ‌وقت تصادفی نیست. معمولاً یا مصرف در ساعت خاصی به سقف می‌رسد، یا تجهیزی زیر بار داغ می‌کند و خودش را محدود می‌کند، یا یک لینک مشکل‌دار مدام بالا و پایین می‌شود. بدون تاریخچه پایش، این مسئله سال‌ها می‌تواند ادامه پیدا کند بدون اینکه کسی علتش را بفهمد.

تجهیزی که خودش ری‌استارت می‌شود

یک بار ممکن است اتفاقی باشد. دو بار در ماه یعنی مشکل. علت معمولاً یکی از این‌هاست: منبع تغذیه در حال از بین رفتن، گرمای بیش از حد، یا مشکل برق ورودی. هر سه قابل تشخیص‌اند و هر سه اگر رها شوند به خرابی کامل ختم می‌شوند.

فن‌هایی که صدایشان تغییر کرده

صدای بلندتر یعنی فن دارد سریع‌تر می‌چرخد، یعنی دستگاه گرم‌تر از قبل است. صدای غیرعادی یعنی خود فن دارد از بین می‌رود. هیچ‌کدام بی‌اهمیت نیستند و هر دو با یک بازدید ساده قابل تشخیص‌اند.

بکاپی که مدت زمان اجرایش تغییر کرده

اگر بکاپی که همیشه دو ساعت طول می‌کشید حالا شش ساعت طول می‌کشد، یا برعکس ناگهان بیست دقیقه‌ای تمام می‌شود، چیزی تغییر کرده است. کوتاه شدن ناگهانی معمولاً بدتر است: یعنی چیزی از دامنه بکاپ خارج شده و کسی متوجه نشده.

خطاهایی که کاربران دیگر گزارش نمی‌کنند

وقتی کاربران به مشکلی عادت می‌کنند، دیگر گزارشش نمی‌کنند و به راه‌حل‌های دور زدن روی می‌آورند. کاهش تعداد تیکت‌ها همیشه خبر خوبی نیست؛ گاهی یعنی کاربران از سیستم ناامید شده‌اند. در گزارش ماهانه، به روند نوع درخواست‌ها هم نگاه کنید، نه فقط تعدادشان.

چطور نگهداری را از حالت آتش‌نشانی دربیاوریم

بیشتر تیم‌های IT در وضعیت واکنشی گیر می‌کنند: تمام وقتشان صرف حل مشکلات فوری می‌شود و هیچ‌وقت فرصت پیشگیری پیش نمی‌آید. این چرخه خودش را تقویت می‌کند، چون هرچه پیشگیری کمتر، خرابی بیشتر و فرصت کمتر.

شکستن این چرخه به یک تصمیم مدیریتی نیاز دارد، نه به تلاش بیشتر تیم فنی. سه اقدام عملی:

  1. زمان محافظت‌شده. یک بازه ثابت ماهانه که فقط برای کارهای پیشگیرانه است و برای کارهای فوری برداشته نمی‌شود، مگر در موارد بحرانی واقعی.
  2. ثبت اجباری. هر خرابی با علت ریشه‌ای ثبت شود، نه فقط با «حل شد». بدون علت ریشه‌ای، همان مشکل ماه بعد برمی‌گردد.
  3. بازبینی ماهانه علت‌ها. پانزده دقیقه نگاه کردن به فهرست خرابی‌های ماه، معمولاً یک الگوی تکرارشونده را نشان می‌دهد که با یک اقدام ریشه‌ای حذف می‌شود.

این سه کار هزینه‌ای ندارند جز انضباط. و اثرشان معمولاً ظرف دو سه ماه در تعداد خرابی‌ها دیده می‌شود.

نگهداری در زیرساخت پسیو

بخشی که تقریباً همیشه از قلم می‌افتد، چون «کابل که خراب نمی‌شود». این درست نیست. کابل‌کشی در طول زمان تحت تأثیر جابه‌جایی میزها، اضافه شدن پریزها، تعمیرات ساختمان و کشیده شدن‌های مکرر قرار می‌گیرد.

آنچه باید سالانه بررسی شود: صحت برچسب‌ها در دو سر هر مسیر، وضعیت فیزیکی پچ‌کوردها که بیشترین فرسودگی را دارند، مسیرهایی که بعد از جابه‌جایی رها شده‌اند و هیچ‌کس نمی‌داند به کجا می‌روند، و مستندات نقشه که معمولاً بعد از دو سه تغییر با واقعیت فاصله می‌گیرد.

یک مسیر بی‌برچسب امروز، نیم ساعت عیب‌یابی اضافه در روز خرابی است. ده مسیر بی‌برچسب، یعنی هر عیب‌یابی به حدس و آزمون‌وخطا تبدیل می‌شود.

آستانه‌های فنی: چه عددی یعنی وقت اقدام

چک‌لیست بدون آستانه، به قضاوت لحظه‌ای بازدیدکننده وابسته است. این جدول، نقطه شروع آستانه‌هاست؛ آن‌ها را با خط مبنای شبکه خودتان تنظیم کنید:

موردنشانهمعنای احتمالیاقدام
خطای CRC/FCS روی پورتشمارنده در حال افزایش، حتی کمکابل، پچ‌کورد یا ماژول معیوبتست کابل، تعویض پچ‌کورد یا ماژول
Late Collision یا Half-Duplexهر مقدار روی لینک گیگابیتیعدم تطابق Duplexبررسی تنظیم Auto-negotiation دو طرف
توان دریافتی ماژول فیبرروند نزولی یا نزدیک به آستانه هشدار ماژولکانکتور کثیف، خم زیاد، فرسودگیتمیزکاری کانکتور با ابزار مخصوص، تست افت
مصرف لینکصدک ۹۵ بالای حدود ۷۰٪ ظرفیتنزدیک شدن به اشباع در اوجبرنامه ارتقا یا توزیع بار
پردازنده روتر یا فایروالبالا به‌طور پایدار در ساعات کاریظرفیت ناکافی یا قانون ناکارآمدبازبینی قوانین، ارزیابی ظرفیت
بودجه PoE سوئیچمصرف بالای حدود ۸۰٪ بودجهحاشیه کم برای دستگاه جدیدتوزیع دستگاه‌ها یا سوئیچ با بودجه بیشتر
دمای ورودی رکخارج از بازه ۱۸ تا ۲۷ درجه ASHRAEمشکل سرمایش یا جریان هوابررسی کولر، پنل‌های خالی، کابل‌های مانع
باتری UPSزمان پشتیبانی کمتر از نیاز خاموشی منظم، یا عمر نزدیک به پایانفرسودگی باتریتعویض برنامه‌ریزی‌شده

پایش نوری با DOM

بیشتر ماژول‌های فیبر نوری SFP و SFP+ قابلیت DOM (پایش دیجیتال نوری، طبق مشخصه SFF-8472) دارند: توان ارسال و دریافت، دما، ولتاژ و جریان لیزر را گزارش می‌دهند و آستانه‌های هشدار و خطر خودشان را دارند. ثبت ماهانه توان دریافتی هر لینک فیبر و مقایسه با مقدار روز نصب، افت تدریجی را ماه‌ها پیش از قطعی نشان می‌دهد. محاسبه بودجه افت را در فیبر نوری در شبکه سازمانی آورده‌ایم.

چرا شمارنده‌ها را باید روند دید

مقدار مطلق شمارنده خطا به تنهایی معنای کمی دارد — ممکن است مربوط به ماه‌ها پیش باشد. آنچه مهم است نرخ افزایش است. به همین دلیل این آستانه‌ها بهتر است در سیستم مانیتورینگ به‌صورت نرخ تعریف شوند و بازدید دوره‌ای، روندها را مرور کند. برای بخش سرورها، چک‌لیست تکمیلی در سرویس دوره‌ای سرور است.

پرسش‌های متداول

نگهداری پیشگیرانه چقدر زمان می‌برد؟

برای یک شبکه متوسط، چند ساعت در ماه برای موارد ماهانه و نیم روز برای بازدید فصلی. تست کامل بازیابی سالانه معمولاً یک روز کاری است.

آیا این کارها را خودمان می‌توانیم انجام دهیم؟

بخش زیادی‌اش بله، به‌ویژه موارد ماهانه. مواردی که تخصص یا ابزار خاص می‌خواهند — مثل تست UPS یا بازبینی پیکربندی — معمولاً بهتر است با کسی انجام شود که مرجع مقایسه دارد.

اگر همه‌چیز سالم بود، یعنی پول بازدید هدر رفت؟

نه، دقیقاً برعکس. این همان سوءتفاهمی است که باعث می‌شود شرکت‌ها بعد از یک سال آرام، بازدید را قطع کنند. هزینه نگهداری را باید با هزینه توقفی که اتفاق نیفتاد مقایسه کرد، نه با صفر.

هر چند وقت باید تجهیزات را تعویض کرد؟

عدد ثابتی ندارد و به شرایط کاری بستگی دارد. معیار عملی این است: وقتی سازنده پشتیبانی را قطع کرد، وقتی قطعه یدکی کمیاب شد، یا وقتی ظرفیتش کم آورد. بازبینی سالانه چرخه عمر برای همین است.

قدم بعدی

اگر می‌خواهید بدانید شبکه شما امروز در کدام بندهای این فهرست ضعف دارد، بازدید فنی نقطه شروع است: چک‌لیست را پر می‌کنیم و گزارش مکتوب با اولویت‌بندی تحویل می‌دهیم.

مشاهده خدمات پشتیبانی شبکه و درخواست بازدید · تلفن: 021-74903

نگهداری شبکه مشتریان را انجام می‌دهید؟

اگر پیمانکار یا کارشناس مستقل شبکه هستید و مشتریانی دارید که به نگهداری منظم با گزارش مکتوب نیاز دارند، از طریق برنامه همکاری در فروش نصیر ارتباط همکار یا معرف شوید.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *