سرور و مجازی‌سازی

RAID چیست و کدام سطح برای سرور شما مناسب است؛ ظرفیت، سرعت و ریسک بازسازی

سطوح RAID سرور

در بیشتر سرورهایی که برای پشتیبانی تحویل می‌گیریم، سطح RAID را کسی انتخاب نکرده؛ پیش‌فرض کنترلر یا عادت نصاب بوده. نتیجه گاهی سروری است که با خرابی یک دیسک، روزها در حالت خطر کار می‌کند، یا پایگاه داده‌ای که بی‌دلیل کند است چون روی سطحی نشسته که برای نوشتن زیاد طراحی نشده.

این مقاله سطوح رایج RAID سرور را با عدد مقایسه می‌کند: ظرفیت قابل استفاده، کارایی خواندن و نوشتن، و مهم‌تر از همه، ریسک در زمان بازسازی — جایی که انتخاب اشتباه هزینه واقعی دارد.

RAID چه کاری می‌کند و چه کاری نمی‌کند

RAID (آرایه افزونه دیسک‌های مستقل) چند دیسک فیزیکی را به یک دیسک منطقی تبدیل می‌کند تا یکی یا ترکیبی از سه هدف برآورده شود: ظرفیت بیشتر، سرعت بیشتر، و تحمل خرابی دیسک.

آنچه RAID انجام نمی‌دهد، مهم‌تر است: RAID در برابر حذف اشتباه فایل، باج‌افزار، خرابی کنترلر، خرابی فایل‌سیستم، آتش‌سوزی یا سرقت هیچ محافظتی ندارد. اگر کاربری فایلی را حذف کند، RAID آن حذف را با وفاداری کامل روی همه دیسک‌ها تکرار می‌کند. RAID بکاپ نیست؛ فقط دسترس‌پذیری را در برابر خرابی دیسک بالا می‌برد. برای بکاپ، قانون ۳-۲-۱ در پشتیبان‌گیری را ببینید.

سه مفهوم پایه

  • نواربندی (Striping): داده به قطعه‌هایی تقسیم و روی چند دیسک پخش می‌شود تا خواندن و نوشتن موازی انجام شود.
  • آینه‌سازی (Mirroring): همان داده روی دو دیسک نوشته می‌شود.
  • توازن (Parity): از داده چند دیسک، یک مقدار محاسبه‌ای (در RAID 5 با XOR) ذخیره می‌شود که با آن می‌توان محتوای یک دیسک از دست رفته را بازسازی کرد.

سطوح رایج

RAID 0 — فقط نواربندی

بیشترین سرعت و همه ظرفیت، اما صفر تحمل خرابی: خرابی هر دیسک یعنی از دست رفتن کل آرایه. احتمال خرابی آرایه با تعداد دیسک بالا می‌رود. در سرور سازمانی جز برای داده موقت و قابل بازتولید جایی ندارد.

RAID 1 — آینه

دو دیسک با محتوای یکسان. نصف ظرفیت، تحمل خرابی یک دیسک، خواندن خوب و نوشتن هم‌اندازه یک دیسک. انتخاب استاندارد برای دیسک سیستم‌عامل یا هایپروایزر.

RAID 5 — نواربندی با یک توازن

حداقل سه دیسک؛ ظرفیت یک دیسک صرف توازن می‌شود. تحمل خرابی یک دیسک. کارایی خواندن خوب، اما نوشتن تصادفی کند به دلیل جریمه نوشتن (پایین‌تر توضیح داده شده). بیشترین بحث درباره همین سطح است.

RAID 6 — نواربندی با دو توازن

حداقل چهار دیسک؛ ظرفیت دو دیسک صرف توازن. تحمل خرابی هم‌زمان دو دیسک — یا خرابی یک دیسک به‌علاوه خطای خواندن در زمان بازسازی. نوشتن از RAID 5 هم کندتر.

RAID 10 — آینه‌های نواربندی‌شده

حداقل چهار دیسک؛ جفت‌های آینه که روی‌شان نواربندی شده. نصف ظرفیت. تحمل خرابی حداقل یک دیسک و حداکثر یک دیسک از هر جفت. بهترین کارایی نوشتن در میان سطوح افزونه و سریع‌ترین بازسازی، چون فقط از روی یک دیسک همتا کپی می‌شود.

ظرفیت قابل استفاده: فرمول‌ها

با n دیسک هم‌اندازه به ظرفیت C:

سطحظرفیت قابل استفادهمثال: ۶ دیسک ۴ ترابایتیتحمل خرابی
RAID 0n × C۲۴ ترابایتهیچ
RAID 1C (دو دیسک)۱ دیسک
RAID 5(n − ۱) × C۲۰ ترابایت۱ دیسک
RAID 6(n − ۲) × C۱۶ ترابایت۲ دیسک
RAID 10(n ÷ ۲) × C۱۲ ترابایت۱ دیسک تضمینی، تا ۳ اگر از جفت‌های جدا باشند

اگر دیسک‌ها هم‌اندازه نباشند، بیشتر کنترلرها کوچک‌ترین دیسک را مبنا می‌گیرند و بقیه ظرفیت هدر می‌رود.

جریمه نوشتن و محاسبه IOPS

در سطوح افزونه، هر نوشتن منطقی به چند عملیات فیزیکی تبدیل می‌شود. به این ضریب جریمه نوشتن (Write Penalty) می‌گویند:

  • RAID 1 و RAID 10: ضریب ۲ — هر نوشتن روی دو دیسک.
  • RAID 5: ضریب ۴ — برای نوشتن تصادفی کوچک: خواندن داده قدیم، خواندن توازن قدیم، نوشتن داده جدید، نوشتن توازن جدید.
  • RAID 6: ضریب ۶ — دو توازن باید خوانده و نوشته شود.

فرمول IOPS مؤثر آرایه:

IOPS مؤثر = IOPS خام × (درصد خواندن + درصد نوشتن ÷ جریمه نوشتن)

که در آن IOPS خام، مجموع IOPS همه دیسک‌هاست. مثال: هشت دیسک SAS با ۱۰ هزار دور، هر کدام حدود ۱۴۰ IOPS، یعنی ۱۱۲۰ IOPS خام.

سطحبار ۷۰٪ خواندن / ۳۰٪ نوشتنبار ۵۰٪ / ۵۰٪
RAID 10۷۸۴ + ۱۶۸ = ۹۵۲۵۶۰ + ۲۸۰ = ۸۴۰
RAID 5۷۸۴ + ۸۴ = ۸۶۸۵۶۰ + ۱۴۰ = ۷۰۰
RAID 6۷۸۴ + ۵۶ = ۸۴۰۵۶۰ + ۹۳ = ۶۵۳

هر چه سهم نوشتن بیشتر شود، فاصله بیشتر می‌شود. پایگاه داده‌های تراکنشی، ماشین‌های مجازی متعدد و سرورهای ایمیل بار نوشتن قابل توجهی دارند؛ سرور فایل و آرشیو عمدتاً خواندنی‌اند. این اعداد تقریبی‌اند — حافظه نهان کنترلر، نوشتن ترتیبی و SSD معادله را تغییر می‌دهند — اما جهت انتخاب را درست نشان می‌دهند.

ریسک بازسازی: جایی که RAID 5 شکست می‌خورد

وقتی یک دیسک در RAID 5 خراب می‌شود، آرایه در حالت Degraded کار می‌کند: هیچ افزونگی باقی نمانده. برای بازسازی روی دیسک جایگزین، کنترلر باید تمام داده همه دیسک‌های باقی‌مانده را بخواند. دو ریسک در این مرحله وجود دارد:

ریسک اول: خطای خواندن غیرقابل بازیابی (URE)

سازندگان دیسک نرخ خطای خواندن غیرقابل بازیابی را در برگه مشخصات اعلام می‌کنند. برای دیسک‌های رده مصرفی معمولاً یک خطا در هر ۱۰۱۴ بیت خوانده‌شده (حدود ۱۲٫۵ ترابایت)، و برای دیسک‌های سازمانی ۱۰۱۵ یا ۱۰۱۶.

محاسبه برای آرایه RAID 5 با چهار دیسک ۴ ترابایتی که یکی خراب شده: باید ۳ × ۴ = ۱۲ ترابایت خوانده شود، یعنی حدود ۹٫۶ × ۱۰۱۳ بیت.

  • با نرخ ۱۰۱۴: تعداد مورد انتظار خطا حدود ۰٫۹۶؛ احتمال عبور بدون حتی یک خطا حدود e−۰٫۹۶ ≈ ۳۸٪. یعنی در بدترین حالت برگه مشخصات، احتمال برخورد با خطا هنگام بازسازی بیش از ۶۰٪ است.
  • با نرخ ۱۰۱۵: تعداد مورد انتظار حدود ۰٫۰۹۶؛ احتمال خطا حدود ۹٪.

این عدد مشخصات، سقف بدبینانه است و نرخ واقعی در میدان معمولاً پایین‌تر گزارش می‌شود. اما جهتش روشن است: هر چه دیسک‌ها بزرگ‌تر و ارزان‌تر، ریسک بیشتر. در RAID 5، یک خطای خواندن در حالت Degraded یعنی بلوک‌هایی که دیگر قابل بازسازی نیستند — و بسته به کنترلر، ممکن است بازسازی کامل متوقف شود.

RAID 6 دقیقاً برای همین ساخته شد: با دو توازن، خرابی یک دیسک به‌علاوه یک خطای خواندن هنگام بازسازی، هنوز قابل تحمل است. در RAID 10، بازسازی فقط از روی یک دیسک همتا انجام می‌شود، پس حجم خواندن و در نتیجه ریسک بسیار کمتر است.

ریسک دوم: خرابی دیسک دوم در زمان بازسازی

بازسازی یک دیسک چندترابایتی مکانیکی، بسته به بار سرور، از چند ساعت تا بیش از یک روز طول می‌کشد و در این مدت همه دیسک‌ها زیر فشار خواندن مداوم‌اند. دیسک‌هایی که از یک سری تولید و هم‌زمان نصب شده‌اند، عمر و فرسودگی مشابهی دارند. احتمال خرابی دیسک دوم در همین پنجره، ناچیز نیست.

نتیجه عملی: برای دیسک‌های مکانیکی چندترابایتی، RAID 5 را کنار بگذارید. RAID 6 یا RAID 10 انتخاب‌های امروزی‌اند.

SSD معادله را چطور تغییر می‌دهد

SSDها نرخ URE بهتری دارند، بازسازی‌شان بسیار سریع‌تر است، و IOPS آن‌قدر بالاست که جریمه نوشتن RAID 5 اغلب گلوگاه نمی‌شود. به همین دلیل RAID 5 روی SSDهای سازمانی با ظرفیت متوسط، در بسیاری از موارد انتخاب قابل قبولی است. دو نکته: جریمه نوشتن روی SSD به معنی فرسایش بیشتر هم هست، پس کلاس دوام (DWPD) باید متناسب با بار نوشتن باشد؛ و SSDهای هم‌سری ممکن است در زمان‌های نزدیک به پایان عمر نوشتن برسند.

دیسک یدکی (Hot Spare)

دیسک یدکی داغ در آرایه نصب است اما استفاده نمی‌شود؛ به محض خرابی یک دیسک، کنترلر بازسازی را خودکار روی آن شروع می‌کند. مزیتش کوتاه کردن پنجره خطر است — به‌خصوص وقتی خرابی شب یا تعطیلات رخ می‌دهد و تا رسیدن دیسک جایگزین ممکن است روزها طول بکشد. در آرایه‌های RAID 5 و 6 با دیسک‌های بزرگ، ارزش یک دیسک یدکی معمولاً بیش از قیمت آن است.

RAID سخت‌افزاری یا نرم‌افزاری

نوعمزیتمحدودیت
کنترلر سخت‌افزاریحافظه نهان محافظت‌شده، مستقل از سیستم‌عامل، بوت آسانوابستگی به مدل کنترلر؛ در خرابی کنترلر، جایگزین هم‌خانواده لازم است
RAID نرم‌افزاری سیستم‌عاملبدون هزینه، قابل انتقالمصرف پردازنده، بدون حافظه نهان محافظت‌شده
فایل‌سیستم‌های مدیریت دیسک مثل ZFSتشخیص و ترمیم خرابی خاموش داده با Checksum، Snapshotنیاز به حافظه و تخصص؛ کنترلر باید در حالت عبور (HBA) باشد

در سرورهای سازمانی با هایپروایزر، کنترلر سخت‌افزاری با حافظه نهان محافظت‌شده رایج‌ترین انتخاب است. در ذخیره‌سازهای شبکه NAS، RAID نرم‌افزاری یا ZFS داخلی دستگاه استاندارد است.

جدول انتخاب بر اساس بار کاری

بار کاریسطح پیشنهادیدلیل
دیسک سیستم‌عامل یا هایپروایزرRAID 1ساده، بازسازی سریع
پایگاه داده تراکنشی، ماشین‌های مجازیRAID 10بهترین نوشتن و کمترین ریسک بازسازی
سرور فایل، داده حجیم با خواندن غالبRAID 6ظرفیت خوب با تحمل دو خرابی
آرشیو و مخزن بکاپRAID 6ظرفیت و ایمنی؛ سرعت نوشتن ترتیبی کافی
SSD سازمانی با ظرفیت متوسطRAID 5 یا RAID 10بسته به بار نوشتن و بودجه

مانیتورینگ: RAIDی که کسی نگاهش نمی‌کند

رایج‌ترین سناریوی از دست رفتن داده که می‌بینیم، این است: یک دیسک ماه‌ها پیش خراب شده، کنترلر هشدار داده، اما هیچ‌کس ندیده — چراغ نارنجی پشت سرور در اتاقی که کسی به آن سر نمی‌زند. آرایه ماه‌ها در حالت Degraded کار کرده تا دیسک دوم هم خراب شده.

برای جلوگیری:

  • هشدار کنترلر یا iLO/iDRAC را به ایمیل یا سیستم مانیتورینگ وصل کنید.
  • مقادیر SMART دیسک‌ها — به‌خصوص تعداد سکتورهای جایگزین‌شده و در انتظار — را پایش کنید؛ افزایش آن‌ها معمولاً پیش از خرابی کامل رخ می‌دهد.
  • Patrol Read یا Consistency Check دوره‌ای را در کنترلر فعال کنید تا خطاهای خواندن پنهان قبل از روز بازسازی کشف و ترمیم شوند.
  • Firmware کنترلر و دیسک‌ها را در برنامه سرویس دوره‌ای سرور به‌روز نگه دارید.

اشتباه‌های رایج

  1. RAID را جای بکاپ حساب کردن. بزرگ‌ترین و گران‌ترین اشتباه.
  2. RAID 5 با دیسک‌های مکانیکی بزرگ برای داده حیاتی.
  3. دیسک رده مصرفی در سرور. دیسک‌های دسکتاپ برای کار ۲۴ ساعته، لرزش چند دیسک کنار هم و رفتار مناسب در آرایه طراحی نشده‌اند.
  4. تعویض دیسک اشتباه. در آرایه Degraded، بیرون کشیدن دیسک سالم به‌جای دیسک خراب یعنی از دست رفتن آرایه. قبل از تعویض، دیسک را از رابط مدیریتی شناسایی و چراغش را روشن کنید.
  5. بدون هشدار. آرایه‌ای که خرابی‌اش را به کسی خبر نمی‌دهد.

پرسش‌های متداول

RAID را بعد از نصب می‌شود عوض کرد؟

بعضی کنترلرها مهاجرت سطح RAID را روی داده زنده پشتیبانی می‌کنند، اما این عملیات طولانی و پرریسک است. روش امن: بکاپ کامل و تأییدشده، ساخت آرایه جدید، بازگرداندن داده. بهتر است سطح درست از روز اول انتخاب شود.

کدام سطح RAID سریع‌تر است؟

برای خواندن، سطوح نواربندی‌شده با دیسک بیشتر. برای نوشتن تصادفی — که برای پایگاه داده و ماشین مجازی مهم است — RAID 10 در میان سطوح افزونه سریع‌ترین است.

با خرابی کنترلر RAID، داده از دست می‌رود؟

معمولاً نه، اگر کنترلر جایگزین هم‌خانواده باشد؛ پیکربندی آرایه روی خود دیسک‌ها ذخیره شده و کنترلر جدید آن را می‌خواند. اما این دقیقاً لحظه‌ای است که بکاپ جدا ارزش خودش را نشان می‌دهد.

قدم بعدی

اگر نمی‌دانید سرورهای فعلی‌تان روی چه سطح RAIDی هستند، هشدار دارند یا نه، و دیسک‌هایشان در چه وضعیتی‌اند، یک بررسی فنی کوتاه تصویر روشنی می‌دهد. در نصب سرور جدید هم سطح RAID را بر اساس بار کاری واقعی طراحی می‌کنیم — راهنمای کامل مشخصات را در انتخاب سرور برای شرکت کوچک و متوسط ببینید.

مشاهده خدمات نصب و راه‌اندازی سرور · تلفن: 021-74903

مشتری‌تان سرور یا ذخیره‌ساز می‌خواهد؟

اگر فروشنده سخت‌افزار، مشاور یا پیمانکار IT هستید، پروژه‌های نصب، پیکربندی و نگهداری سرور مشتریان‌تان را از طریق برنامه همکاری در فروش نصیر ارتباط به ما بسپارید.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *