سرور و مجازی‌سازی

سرویس دوره‌ای سرور؛ چک‌لیست فنی روزانه تا سالانه برای جلوگیری از خرابی

سرویس دوره‌ای سرور

بیشتر تماس‌های اضطراری که درباره سرور می‌گیریم، یک الگوی مشترک دارند: مشکل یک‌شبه ایجاد نشده. دیسکی که هفته‌ها هشدار داده بود، گواهی‌ای که تاریخش گذشته، دیسکی که آرام‌آرام پر شده، یا بکاپی که ماه‌ها بی‌صدا شکست خورده بود. همه این‌ها با یک بازدید منظم قابل تشخیص بودند.

این مقاله چک‌لیست فنی سرویس دوره‌ای سرور است، دسته‌بندی‌شده بر اساس بازه زمانی، با توضیح اینکه هر بند چه خرابی‌ای را پیشگیری می‌کند. هدف این است که بدانید یک سرویس دوره‌ای واقعی شامل چه چیزهایی است — و اگر پیمانکار دارید، از او چه گزارشی بخواهید.

چرا «کار می‌کند» کافی نیست

سرورهای سازمانی برای ادامه کار در شرایط خرابی جزئی طراحی شده‌اند: RAID با یک دیسک خراب کار می‌کند، منبع تغذیه افزونه با یکی از کار افتاده کار می‌کند، فن‌ها با خرابی یکی سرعت را بالا می‌برند. این طراحی عالی است — به شرطی که کسی متوجه خرابی اول شود. بدون پایش، افزونگی فقط خرابی را به تأخیر می‌اندازد و کاربران اولین نشانه را روزی می‌بینند که خرابی دوم رخ داده و سرور خوابیده.

سرویس دوره‌ای یعنی تبدیل «خرابی ناگهانی» به «کار برنامه‌ریزی‌شده». همین منطق را برای تجهیزات شبکه در نگهداری پیشگیرانه شبکه توضیح داده‌ایم.

روزانه: خودکار، نه دستی

بررسی‌های روزانه نباید به حضور کسی وابسته باشند. باید در سیستم مانیتورینگ تعریف شوند و فقط در صورت مشکل هشدار بدهند:

  • وضعیت کارهای بکاپ شب گذشته: موفق، ناموفق یا با هشدار. بکاپ ناموفقی که کسی ندیده، بدترین نوع بکاپ است.
  • هشدارهای سخت‌افزاری: از پردازنده مدیریتی سرور (iLO در HPE، iDRAC در Dell) — دیسک، منبع تغذیه، فن، دما، خطای حافظه.
  • وضعیت آرایه RAID: Optimal یا Degraded.
  • فضای دیسک: هشدار در ۸۰٪ و وضعیت بحرانی در ۹۰٪. پر شدن دیسک سیستم یا فایل‌های لاگ پایگاه داده، سرویس را متوقف می‌کند.
  • دسترس‌پذیری سرویس‌ها: نه فقط اینکه سرور به پینگ جواب می‌دهد، بلکه اینکه سرویس اصلی — پایگاه داده، سایت داخلی، سرور فایل — واقعاً پاسخ می‌دهد.

پیاده‌سازی این پایش با ابزارهای مانیتورینگ و هشدار خودکار، بخشی از خدمات DevOps و مانیتورینگ زیرساخت است.

هفتگی

  • مرور لاگ رویدادهای سیستم‌عامل: خطاهای تکرارشونده دیسک، خطاهای سرویس، شکست ورود به سیستم با الگوی غیرعادی.
  • لاگ رویدادهای یکپارچه سخت‌افزار (در HPE به آن Integrated Management Log می‌گویند): رویدادهای اصلاح‌شده حافظه، هشدارهای موقت دما یا برق که به هشدار دائمی تبدیل نشده‌اند ولی نشانه‌اند.
  • روند مصرف منابع: پردازنده، حافظه و تأخیر دیسک در ساعات اوج. افزایش تدریجی تأخیر دیسک معمولاً پیش از شکایت کاربران دیده می‌شود.
  • Snapshotهای فراموش‌شده ماشین‌های مجازی: Snapshot بکاپ نیست و ماندن طولانی‌اش کارایی دیسک را پایین می‌آورد و فضا را می‌بلعد.

ماهانه

وصله‌های امنیتی

مایکروسافت وصله‌های امنیتی ماهانه را در دومین سه‌شنبه هر ماه منتشر می‌کند. روش استاندارد: نصب ابتدا روی سرورهای کم‌حساسیت یا محیط آزمایشی، چند روز صبر، سپس سرورهای حیاتی در پنجره تغییر برنامه‌ریزی‌شده — با Snapshot یا بکاپ تازه پیش از نصب و برنامه بازگشت. وصله‌های هایپروایزر و نرم‌افزارهای کاربردی (پایگاه داده، نرم‌افزار بکاپ) هم در همین چرخه بررسی شوند.

سلامت اکتیو دایرکتوری

در شبکه‌هایی که بیش از یک کنترلر دامنه دارند، تکثیر (Replication) بین آن‌ها باید سالم باشد. ابزارهای داخلی ویندوز مثل dcdiag و repadmin /replsummary خطاهای تکثیر، DNS و سرویس‌ها را گزارش می‌دهند. تکثیری که ماه‌ها شکست خورده، وقتی کنترلر اصلی خراب شود، دایرکتوری ناقص تحویل می‌دهد.

همگام‌سازی زمان

احراز هویت Kerberos در ویندوز به‌طور پیش‌فرض اختلاف زمان بیش از ۵ دقیقه بین کلاینت و کنترلر دامنه را نمی‌پذیرد. کنترلر دامنه اصلی باید از منبع زمان معتبر همگام شود و بقیه از آن. ماشین‌های مجازی نباید هم‌زمان از میزبان و از دامنه زمان بگیرند.

گواهی‌های دیجیتال

فهرست گواهی‌ها و تاریخ انقضایشان: وب‌سایت داخلی، سرور ایمیل، VPN، رابط مدیریتی تجهیزات. گواهی منقضی‌شده یعنی کاربرانی که صبح شنبه نمی‌توانند وصل شوند. هشدار را سی روز پیش از انقضا تنظیم کنید.

حساب‌های کاربری

حساب کارمندانی که رفته‌اند، حساب‌های سرویس با رمز بدون انقضا، اعضای گروه‌های مدیریتی. هر عضو گروه Domain Admins باید دلیل مکتوب داشته باشد.

فصلی

آزمون بازیابی بکاپ

مهم‌ترین بند کل چک‌لیست. بکاپی که هرگز بازیابی نشده، فقط یک فرض است. هر فصل حداقل یک ماشین مجازی کامل و یک پایگاه داده را در محیط جدا بازیابی کنید، زمان بازیابی را اندازه بگیرید و با هدف زمان بازیابی (RTO) مقایسه کنید. جزئیات در قانون ۳-۲-۱ در پشتیبان‌گیری سازمانی.

Firmware و درایورها

سازندگان سرور بسته‌های به‌روزرسانی یکپارچه منتشر می‌کنند — در HPE به آن Service Pack for ProLiant می‌گویند — که BIOS، پردازنده مدیریتی، کنترلر RAID، کارت شبکه و دیسک‌ها را هم‌خوان به‌روز می‌کند. بعضی به‌روزرسانی‌های Firmware دیسک و کنترلر، مشکلات شناخته‌شده از دست رفتن داده را رفع می‌کنند. اما Firmware را کورکورانه نصب نکنید: یادداشت انتشار را بخوانید، سازگاری با نسخه هایپروایزر را بررسی کنید و در پنجره تغییر با برنامه بازگشت اجرا کنید.

بازبینی ظرفیت

روند سه‌ماهه فضای دیسک، حافظه و پردازنده را نگاه کنید و پیش‌بینی کنید کی به سقف می‌رسید. خرید برنامه‌ریزی‌شده ارزان‌تر از خرید اضطراری است.

بررسی فیزیکی و محیطی

  • دمای هوای ورودی: توصیه ASHRAE برای تجهیزات فناوری اطلاعات، دمای ورودی بین ۱۸ تا ۲۷ درجه سانتی‌گراد است. دمای اتاق را کنار سرور و در جلوی رک اندازه بگیرید، نه کنار در.
  • گرد و غبار: فیلترها و ورودی‌های هوا. گرد و غبار انباشته، دمای قطعات را بالا و عمر فن‌ها را کوتاه می‌کند.
  • کابل‌ها و برچسب‌ها: کابل آویزان جلوی جریان هوا، پچ‌کورد بدون برچسب.
  • چراغ‌های وضعیت: گاهی هشداری که نرم‌افزار گزارش نکرده، روی بدنه دیده می‌شود.

شش‌ماهه تا سالانه

UPS و باتری

باتری‌های سربی-اسیدی دریچه‌دار (VRLA) که در بیشتر UPSها استفاده می‌شوند، عمر مفید محدودی دارند که با دمای بالا به‌شدت کوتاه می‌شود. آزمون خودکار باتری UPS را فعال کنید، زمان پشتیبانی واقعی را با بار واقعی اندازه بگیرید و تاریخ نصب باتری‌ها را روی بدنه ثبت کنید. مهم‌تر: آزمایش کنید که نرم‌افزار UPS واقعاً فرمان خاموشی منظم را به سرورها و میزبان مجازی‌سازی می‌فرستد. اگر UPS فعلی قدیمی است یا ظرفیتش با بار فعلی نمی‌خواند، UPS را در همین بازبینی ارزیابی کنید.

آزمون بازیابی از فاجعه

سالی یک بار سناریوی کامل: «سرور اصلی کلاً از دست رفته است». چه کسی چه کاری می‌کند، از کجا بازیابی می‌شود، چند ساعت طول می‌کشد، کدام رمزها و مستندات لازم است و آیا در دسترس‌اند؟

بازبینی چرخه عمر

تاریخ پایان پشتیبانی سیستم‌عامل‌ها، هایپروایزر و سخت‌افزار. سروری که دیگر وصله امنیتی نمی‌گیرد، باید در برنامه جایگزینی باشد.

بازبینی مستندات

نقشه شبکه، فهرست سرورها و ماشین‌های مجازی، آدرس‌ها، رمزهای ذخیره‌شده در مخزن امن، روال‌های بازیابی. مستنداتی که یک سال به‌روز نشده، احتمالاً غلط است.

جدول خلاصه

بازهموارد اصلیپیشگیری از
روزانه (خودکار)بکاپ، هشدار سخت‌افزار، RAID، فضای دیسک، سرویس‌هاخرابی دوم، پر شدن دیسک، بکاپ ناموفق
هفتگیلاگ‌ها، روند منابع، Snapshotهامشکلات در حال شکل‌گیری
ماهانهوصله امنیتی، AD، زمان، گواهی، حساب‌هانفوذ، قطعی احراز هویت
فصلیآزمون بازیابی، Firmware، ظرفیت، محیطبکاپ غیرقابل بازیابی، خرابی ناشی از گرما
سالانهUPS، آزمون فاجعه، چرخه عمر، مستنداتتوقف طولانی، سخت‌افزار بدون پشتیبانی

پنجره تغییر و برنامه بازگشت

نیمی از خرابی‌ها در سرویس دوره‌ای، ناشی از خود سرویس‌اند: وصله‌ای که سرویسی را از کار انداخته، Firmwareی که ناسازگار بوده، راه‌اندازی مجددی که سرویسی بعد از آن بالا نیامده. سه قاعده این ریسک را کم می‌کند:

  1. پنجره تغییر ثابت — مثلاً پنجشنبه عصر — که کاربران از آن خبر دارند.
  2. نقطه بازگشت پیش از هر تغییر — Snapshot یا بکاپ تازه — و روش مکتوب بازگشت.
  3. آزمون پس از تغییر — فهرست کوتاه سرویس‌هایی که باید بعد از هر راه‌اندازی مجدد بررسی شوند.

گزارش سرویس: از پیمانکار چه بخواهید

اگر سرویس دوره‌ای را برون‌سپاری کرده‌اید، گزارش هر دوره باید حداقل این‌ها را داشته باشد:

  • فهرست بررسی‌های انجام‌شده با نتیجه هر کدام، نه فقط «سرویس انجام شد»
  • هشدارها و خرابی‌های کشف‌شده و اقدام انجام‌شده
  • وصله‌ها و Firmwareهای نصب‌شده با نسخه
  • نتیجه آزمون بازیابی بکاپ و زمان بازیابی اندازه‌گیری‌شده
  • روند ظرفیت و پیش‌بینی نیاز
  • ریسک‌های باز و پیشنهاد اقدام با اولویت

بندهای قراردادی مرتبط را در چک‌لیست قرارداد پشتیبانی آورده‌ایم.

موارد اضافه در میزبان مجازی‌سازی

اگر سرورها مجازی‌اند، چند بند به چک‌لیست اضافه می‌شود:

  • مصرف منابع میزبان در کنار مصرف هر ماشین؛ ماشین‌ها ممکن است سالم به نظر برسند در حالی که میزبان زیر فشار حافظه یا صف پردازنده است.
  • فضای خالی مخزن ذخیره‌سازی که با دیسک‌های مجازی پویا و Snapshotها بی‌صدا پر می‌شود؛ پر شدن آن همه ماشین‌ها را هم‌زمان متوقف می‌کند.
  • نسخه ابزارهای یکپارچه‌سازی هایپروایزر در هر ماشین.
  • ماشین‌های بی‌صاحب: ماشین‌هایی که کسی نمی‌داند برای چیست؛ هر کدام یک سیستم‌عامل وصله‌نشده بالقوه است.

پرسش‌های متداول

سرویس دوره‌ای سرور هر چند وقت یک‌بار لازم است؟

پایش روزانه باید دائمی و خودکار باشد. بازدید فنی کامل برای بیشتر سازمان‌های کوچک و متوسط ماهانه، و بندهای سنگین‌تر مثل آزمون بازیابی فصلی. سرورهای حیاتی‌تر بازه کوتاه‌تر می‌خواهند.

سرویس دوره‌ای باعث قطعی می‌شود؟

بیشتر بندها — بررسی لاگ، هشدار، ظرفیت، آزمون بازیابی در محیط جدا — هیچ قطعی ندارند. نصب وصله و Firmware معمولاً راه‌اندازی مجدد لازم دارد که در پنجره تغییر برنامه‌ریزی‌شده انجام می‌شود.

تمیز کردن فیزیکی سرور لازم است؟

بله، به‌خصوص در اتاق‌هایی که فیلتر هوای مناسب ندارند. گرد و غبار با بالا بردن دمای قطعات، عمر دیسک‌ها و منابع تغذیه را کم می‌کند. تمیزکاری باید با روش درست و ترجیحاً در پنجره تغییر انجام شود.

قدم بعدی

اگر آخرین باری که کسی بکاپ را واقعاً بازیابی کرده یا لاگ سخت‌افزار سرور را خوانده یادتان نمی‌آید، وقت یک بازدید فنی است. در سرویس دوره‌ای، همین چک‌لیست را اجرا می‌کنیم و گزارش مکتوب با ریسک‌ها و اولویت‌ها تحویل می‌دهیم.

مشاهده خدمات سرویس دوره‌ای سرور · تلفن: 021-74903

مشتری دارید که سرورش نگهداری نمی‌شود؟

اگر فروشنده سخت‌افزار یا مشاور IT هستید و مشتریان‌تان به نگهداری منظم سرور نیاز دارند، از طریق برنامه همکاری در فروش نصیر ارتباط همکار یا معرف شوید.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *