سرویس دورهای سرور؛ چکلیست فنی روزانه تا سالانه برای جلوگیری از خرابی

بیشتر تماسهای اضطراری که درباره سرور میگیریم، یک الگوی مشترک دارند: مشکل یکشبه ایجاد نشده. دیسکی که هفتهها هشدار داده بود، گواهیای که تاریخش گذشته، دیسکی که آرامآرام پر شده، یا بکاپی که ماهها بیصدا شکست خورده بود. همه اینها با یک بازدید منظم قابل تشخیص بودند.
این مقاله چکلیست فنی سرویس دورهای سرور است، دستهبندیشده بر اساس بازه زمانی، با توضیح اینکه هر بند چه خرابیای را پیشگیری میکند. هدف این است که بدانید یک سرویس دورهای واقعی شامل چه چیزهایی است — و اگر پیمانکار دارید، از او چه گزارشی بخواهید.
چرا «کار میکند» کافی نیست
سرورهای سازمانی برای ادامه کار در شرایط خرابی جزئی طراحی شدهاند: RAID با یک دیسک خراب کار میکند، منبع تغذیه افزونه با یکی از کار افتاده کار میکند، فنها با خرابی یکی سرعت را بالا میبرند. این طراحی عالی است — به شرطی که کسی متوجه خرابی اول شود. بدون پایش، افزونگی فقط خرابی را به تأخیر میاندازد و کاربران اولین نشانه را روزی میبینند که خرابی دوم رخ داده و سرور خوابیده.
سرویس دورهای یعنی تبدیل «خرابی ناگهانی» به «کار برنامهریزیشده». همین منطق را برای تجهیزات شبکه در نگهداری پیشگیرانه شبکه توضیح دادهایم.
روزانه: خودکار، نه دستی
بررسیهای روزانه نباید به حضور کسی وابسته باشند. باید در سیستم مانیتورینگ تعریف شوند و فقط در صورت مشکل هشدار بدهند:
- وضعیت کارهای بکاپ شب گذشته: موفق، ناموفق یا با هشدار. بکاپ ناموفقی که کسی ندیده، بدترین نوع بکاپ است.
- هشدارهای سختافزاری: از پردازنده مدیریتی سرور (iLO در HPE، iDRAC در Dell) — دیسک، منبع تغذیه، فن، دما، خطای حافظه.
- وضعیت آرایه RAID: Optimal یا Degraded.
- فضای دیسک: هشدار در ۸۰٪ و وضعیت بحرانی در ۹۰٪. پر شدن دیسک سیستم یا فایلهای لاگ پایگاه داده، سرویس را متوقف میکند.
- دسترسپذیری سرویسها: نه فقط اینکه سرور به پینگ جواب میدهد، بلکه اینکه سرویس اصلی — پایگاه داده، سایت داخلی، سرور فایل — واقعاً پاسخ میدهد.
پیادهسازی این پایش با ابزارهای مانیتورینگ و هشدار خودکار، بخشی از خدمات DevOps و مانیتورینگ زیرساخت است.
هفتگی
- مرور لاگ رویدادهای سیستمعامل: خطاهای تکرارشونده دیسک، خطاهای سرویس، شکست ورود به سیستم با الگوی غیرعادی.
- لاگ رویدادهای یکپارچه سختافزار (در HPE به آن Integrated Management Log میگویند): رویدادهای اصلاحشده حافظه، هشدارهای موقت دما یا برق که به هشدار دائمی تبدیل نشدهاند ولی نشانهاند.
- روند مصرف منابع: پردازنده، حافظه و تأخیر دیسک در ساعات اوج. افزایش تدریجی تأخیر دیسک معمولاً پیش از شکایت کاربران دیده میشود.
- Snapshotهای فراموششده ماشینهای مجازی: Snapshot بکاپ نیست و ماندن طولانیاش کارایی دیسک را پایین میآورد و فضا را میبلعد.
ماهانه
وصلههای امنیتی
مایکروسافت وصلههای امنیتی ماهانه را در دومین سهشنبه هر ماه منتشر میکند. روش استاندارد: نصب ابتدا روی سرورهای کمحساسیت یا محیط آزمایشی، چند روز صبر، سپس سرورهای حیاتی در پنجره تغییر برنامهریزیشده — با Snapshot یا بکاپ تازه پیش از نصب و برنامه بازگشت. وصلههای هایپروایزر و نرمافزارهای کاربردی (پایگاه داده، نرمافزار بکاپ) هم در همین چرخه بررسی شوند.
سلامت اکتیو دایرکتوری
در شبکههایی که بیش از یک کنترلر دامنه دارند، تکثیر (Replication) بین آنها باید سالم باشد. ابزارهای داخلی ویندوز مثل dcdiag و repadmin /replsummary خطاهای تکثیر، DNS و سرویسها را گزارش میدهند. تکثیری که ماهها شکست خورده، وقتی کنترلر اصلی خراب شود، دایرکتوری ناقص تحویل میدهد.
همگامسازی زمان
احراز هویت Kerberos در ویندوز بهطور پیشفرض اختلاف زمان بیش از ۵ دقیقه بین کلاینت و کنترلر دامنه را نمیپذیرد. کنترلر دامنه اصلی باید از منبع زمان معتبر همگام شود و بقیه از آن. ماشینهای مجازی نباید همزمان از میزبان و از دامنه زمان بگیرند.
گواهیهای دیجیتال
فهرست گواهیها و تاریخ انقضایشان: وبسایت داخلی، سرور ایمیل، VPN، رابط مدیریتی تجهیزات. گواهی منقضیشده یعنی کاربرانی که صبح شنبه نمیتوانند وصل شوند. هشدار را سی روز پیش از انقضا تنظیم کنید.
حسابهای کاربری
حساب کارمندانی که رفتهاند، حسابهای سرویس با رمز بدون انقضا، اعضای گروههای مدیریتی. هر عضو گروه Domain Admins باید دلیل مکتوب داشته باشد.
فصلی
آزمون بازیابی بکاپ
مهمترین بند کل چکلیست. بکاپی که هرگز بازیابی نشده، فقط یک فرض است. هر فصل حداقل یک ماشین مجازی کامل و یک پایگاه داده را در محیط جدا بازیابی کنید، زمان بازیابی را اندازه بگیرید و با هدف زمان بازیابی (RTO) مقایسه کنید. جزئیات در قانون ۳-۲-۱ در پشتیبانگیری سازمانی.
Firmware و درایورها
سازندگان سرور بستههای بهروزرسانی یکپارچه منتشر میکنند — در HPE به آن Service Pack for ProLiant میگویند — که BIOS، پردازنده مدیریتی، کنترلر RAID، کارت شبکه و دیسکها را همخوان بهروز میکند. بعضی بهروزرسانیهای Firmware دیسک و کنترلر، مشکلات شناختهشده از دست رفتن داده را رفع میکنند. اما Firmware را کورکورانه نصب نکنید: یادداشت انتشار را بخوانید، سازگاری با نسخه هایپروایزر را بررسی کنید و در پنجره تغییر با برنامه بازگشت اجرا کنید.
بازبینی ظرفیت
روند سهماهه فضای دیسک، حافظه و پردازنده را نگاه کنید و پیشبینی کنید کی به سقف میرسید. خرید برنامهریزیشده ارزانتر از خرید اضطراری است.
بررسی فیزیکی و محیطی
- دمای هوای ورودی: توصیه ASHRAE برای تجهیزات فناوری اطلاعات، دمای ورودی بین ۱۸ تا ۲۷ درجه سانتیگراد است. دمای اتاق را کنار سرور و در جلوی رک اندازه بگیرید، نه کنار در.
- گرد و غبار: فیلترها و ورودیهای هوا. گرد و غبار انباشته، دمای قطعات را بالا و عمر فنها را کوتاه میکند.
- کابلها و برچسبها: کابل آویزان جلوی جریان هوا، پچکورد بدون برچسب.
- چراغهای وضعیت: گاهی هشداری که نرمافزار گزارش نکرده، روی بدنه دیده میشود.
ششماهه تا سالانه
UPS و باتری
باتریهای سربی-اسیدی دریچهدار (VRLA) که در بیشتر UPSها استفاده میشوند، عمر مفید محدودی دارند که با دمای بالا بهشدت کوتاه میشود. آزمون خودکار باتری UPS را فعال کنید، زمان پشتیبانی واقعی را با بار واقعی اندازه بگیرید و تاریخ نصب باتریها را روی بدنه ثبت کنید. مهمتر: آزمایش کنید که نرمافزار UPS واقعاً فرمان خاموشی منظم را به سرورها و میزبان مجازیسازی میفرستد. اگر UPS فعلی قدیمی است یا ظرفیتش با بار فعلی نمیخواند، UPS را در همین بازبینی ارزیابی کنید.
آزمون بازیابی از فاجعه
سالی یک بار سناریوی کامل: «سرور اصلی کلاً از دست رفته است». چه کسی چه کاری میکند، از کجا بازیابی میشود، چند ساعت طول میکشد، کدام رمزها و مستندات لازم است و آیا در دسترساند؟
بازبینی چرخه عمر
تاریخ پایان پشتیبانی سیستمعاملها، هایپروایزر و سختافزار. سروری که دیگر وصله امنیتی نمیگیرد، باید در برنامه جایگزینی باشد.
بازبینی مستندات
نقشه شبکه، فهرست سرورها و ماشینهای مجازی، آدرسها، رمزهای ذخیرهشده در مخزن امن، روالهای بازیابی. مستنداتی که یک سال بهروز نشده، احتمالاً غلط است.
جدول خلاصه
| بازه | موارد اصلی | پیشگیری از |
|---|---|---|
| روزانه (خودکار) | بکاپ، هشدار سختافزار، RAID، فضای دیسک، سرویسها | خرابی دوم، پر شدن دیسک، بکاپ ناموفق |
| هفتگی | لاگها، روند منابع، Snapshotها | مشکلات در حال شکلگیری |
| ماهانه | وصله امنیتی، AD، زمان، گواهی، حسابها | نفوذ، قطعی احراز هویت |
| فصلی | آزمون بازیابی، Firmware، ظرفیت، محیط | بکاپ غیرقابل بازیابی، خرابی ناشی از گرما |
| سالانه | UPS، آزمون فاجعه، چرخه عمر، مستندات | توقف طولانی، سختافزار بدون پشتیبانی |
پنجره تغییر و برنامه بازگشت
نیمی از خرابیها در سرویس دورهای، ناشی از خود سرویساند: وصلهای که سرویسی را از کار انداخته، Firmwareی که ناسازگار بوده، راهاندازی مجددی که سرویسی بعد از آن بالا نیامده. سه قاعده این ریسک را کم میکند:
- پنجره تغییر ثابت — مثلاً پنجشنبه عصر — که کاربران از آن خبر دارند.
- نقطه بازگشت پیش از هر تغییر — Snapshot یا بکاپ تازه — و روش مکتوب بازگشت.
- آزمون پس از تغییر — فهرست کوتاه سرویسهایی که باید بعد از هر راهاندازی مجدد بررسی شوند.
گزارش سرویس: از پیمانکار چه بخواهید
اگر سرویس دورهای را برونسپاری کردهاید، گزارش هر دوره باید حداقل اینها را داشته باشد:
- فهرست بررسیهای انجامشده با نتیجه هر کدام، نه فقط «سرویس انجام شد»
- هشدارها و خرابیهای کشفشده و اقدام انجامشده
- وصلهها و Firmwareهای نصبشده با نسخه
- نتیجه آزمون بازیابی بکاپ و زمان بازیابی اندازهگیریشده
- روند ظرفیت و پیشبینی نیاز
- ریسکهای باز و پیشنهاد اقدام با اولویت
بندهای قراردادی مرتبط را در چکلیست قرارداد پشتیبانی آوردهایم.
موارد اضافه در میزبان مجازیسازی
اگر سرورها مجازیاند، چند بند به چکلیست اضافه میشود:
- مصرف منابع میزبان در کنار مصرف هر ماشین؛ ماشینها ممکن است سالم به نظر برسند در حالی که میزبان زیر فشار حافظه یا صف پردازنده است.
- فضای خالی مخزن ذخیرهسازی که با دیسکهای مجازی پویا و Snapshotها بیصدا پر میشود؛ پر شدن آن همه ماشینها را همزمان متوقف میکند.
- نسخه ابزارهای یکپارچهسازی هایپروایزر در هر ماشین.
- ماشینهای بیصاحب: ماشینهایی که کسی نمیداند برای چیست؛ هر کدام یک سیستمعامل وصلهنشده بالقوه است.
پرسشهای متداول
سرویس دورهای سرور هر چند وقت یکبار لازم است؟
پایش روزانه باید دائمی و خودکار باشد. بازدید فنی کامل برای بیشتر سازمانهای کوچک و متوسط ماهانه، و بندهای سنگینتر مثل آزمون بازیابی فصلی. سرورهای حیاتیتر بازه کوتاهتر میخواهند.
سرویس دورهای باعث قطعی میشود؟
بیشتر بندها — بررسی لاگ، هشدار، ظرفیت، آزمون بازیابی در محیط جدا — هیچ قطعی ندارند. نصب وصله و Firmware معمولاً راهاندازی مجدد لازم دارد که در پنجره تغییر برنامهریزیشده انجام میشود.
تمیز کردن فیزیکی سرور لازم است؟
بله، بهخصوص در اتاقهایی که فیلتر هوای مناسب ندارند. گرد و غبار با بالا بردن دمای قطعات، عمر دیسکها و منابع تغذیه را کم میکند. تمیزکاری باید با روش درست و ترجیحاً در پنجره تغییر انجام شود.
قدم بعدی
اگر آخرین باری که کسی بکاپ را واقعاً بازیابی کرده یا لاگ سختافزار سرور را خوانده یادتان نمیآید، وقت یک بازدید فنی است. در سرویس دورهای، همین چکلیست را اجرا میکنیم و گزارش مکتوب با ریسکها و اولویتها تحویل میدهیم.
مشاهده خدمات سرویس دورهای سرور · تلفن: 021-74903
مشتری دارید که سرورش نگهداری نمیشود؟
اگر فروشنده سختافزار یا مشاور IT هستید و مشتریانتان به نگهداری منظم سرور نیاز دارند، از طریق برنامه همکاری در فروش نصیر ارتباط همکار یا معرف شوید.