RAID چیست و کدام سطح برای سرور شما مناسب است؛ ظرفیت، سرعت و ریسک بازسازی

در بیشتر سرورهایی که برای پشتیبانی تحویل میگیریم، سطح RAID را کسی انتخاب نکرده؛ پیشفرض کنترلر یا عادت نصاب بوده. نتیجه گاهی سروری است که با خرابی یک دیسک، روزها در حالت خطر کار میکند، یا پایگاه دادهای که بیدلیل کند است چون روی سطحی نشسته که برای نوشتن زیاد طراحی نشده.
این مقاله سطوح رایج RAID سرور را با عدد مقایسه میکند: ظرفیت قابل استفاده، کارایی خواندن و نوشتن، و مهمتر از همه، ریسک در زمان بازسازی — جایی که انتخاب اشتباه هزینه واقعی دارد.
RAID چه کاری میکند و چه کاری نمیکند
RAID (آرایه افزونه دیسکهای مستقل) چند دیسک فیزیکی را به یک دیسک منطقی تبدیل میکند تا یکی یا ترکیبی از سه هدف برآورده شود: ظرفیت بیشتر، سرعت بیشتر، و تحمل خرابی دیسک.
آنچه RAID انجام نمیدهد، مهمتر است: RAID در برابر حذف اشتباه فایل، باجافزار، خرابی کنترلر، خرابی فایلسیستم، آتشسوزی یا سرقت هیچ محافظتی ندارد. اگر کاربری فایلی را حذف کند، RAID آن حذف را با وفاداری کامل روی همه دیسکها تکرار میکند. RAID بکاپ نیست؛ فقط دسترسپذیری را در برابر خرابی دیسک بالا میبرد. برای بکاپ، قانون ۳-۲-۱ در پشتیبانگیری را ببینید.
سه مفهوم پایه
- نواربندی (Striping): داده به قطعههایی تقسیم و روی چند دیسک پخش میشود تا خواندن و نوشتن موازی انجام شود.
- آینهسازی (Mirroring): همان داده روی دو دیسک نوشته میشود.
- توازن (Parity): از داده چند دیسک، یک مقدار محاسبهای (در RAID 5 با XOR) ذخیره میشود که با آن میتوان محتوای یک دیسک از دست رفته را بازسازی کرد.
سطوح رایج
RAID 0 — فقط نواربندی
بیشترین سرعت و همه ظرفیت، اما صفر تحمل خرابی: خرابی هر دیسک یعنی از دست رفتن کل آرایه. احتمال خرابی آرایه با تعداد دیسک بالا میرود. در سرور سازمانی جز برای داده موقت و قابل بازتولید جایی ندارد.
RAID 1 — آینه
دو دیسک با محتوای یکسان. نصف ظرفیت، تحمل خرابی یک دیسک، خواندن خوب و نوشتن هماندازه یک دیسک. انتخاب استاندارد برای دیسک سیستمعامل یا هایپروایزر.
RAID 5 — نواربندی با یک توازن
حداقل سه دیسک؛ ظرفیت یک دیسک صرف توازن میشود. تحمل خرابی یک دیسک. کارایی خواندن خوب، اما نوشتن تصادفی کند به دلیل جریمه نوشتن (پایینتر توضیح داده شده). بیشترین بحث درباره همین سطح است.
RAID 6 — نواربندی با دو توازن
حداقل چهار دیسک؛ ظرفیت دو دیسک صرف توازن. تحمل خرابی همزمان دو دیسک — یا خرابی یک دیسک بهعلاوه خطای خواندن در زمان بازسازی. نوشتن از RAID 5 هم کندتر.
RAID 10 — آینههای نواربندیشده
حداقل چهار دیسک؛ جفتهای آینه که رویشان نواربندی شده. نصف ظرفیت. تحمل خرابی حداقل یک دیسک و حداکثر یک دیسک از هر جفت. بهترین کارایی نوشتن در میان سطوح افزونه و سریعترین بازسازی، چون فقط از روی یک دیسک همتا کپی میشود.
ظرفیت قابل استفاده: فرمولها
با n دیسک هماندازه به ظرفیت C:
| سطح | ظرفیت قابل استفاده | مثال: ۶ دیسک ۴ ترابایتی | تحمل خرابی |
|---|---|---|---|
| RAID 0 | n × C | ۲۴ ترابایت | هیچ |
| RAID 1 | C (دو دیسک) | — | ۱ دیسک |
| RAID 5 | (n − ۱) × C | ۲۰ ترابایت | ۱ دیسک |
| RAID 6 | (n − ۲) × C | ۱۶ ترابایت | ۲ دیسک |
| RAID 10 | (n ÷ ۲) × C | ۱۲ ترابایت | ۱ دیسک تضمینی، تا ۳ اگر از جفتهای جدا باشند |
اگر دیسکها هماندازه نباشند، بیشتر کنترلرها کوچکترین دیسک را مبنا میگیرند و بقیه ظرفیت هدر میرود.
جریمه نوشتن و محاسبه IOPS
در سطوح افزونه، هر نوشتن منطقی به چند عملیات فیزیکی تبدیل میشود. به این ضریب جریمه نوشتن (Write Penalty) میگویند:
- RAID 1 و RAID 10: ضریب ۲ — هر نوشتن روی دو دیسک.
- RAID 5: ضریب ۴ — برای نوشتن تصادفی کوچک: خواندن داده قدیم، خواندن توازن قدیم، نوشتن داده جدید، نوشتن توازن جدید.
- RAID 6: ضریب ۶ — دو توازن باید خوانده و نوشته شود.
فرمول IOPS مؤثر آرایه:
IOPS مؤثر = IOPS خام × (درصد خواندن + درصد نوشتن ÷ جریمه نوشتن)
که در آن IOPS خام، مجموع IOPS همه دیسکهاست. مثال: هشت دیسک SAS با ۱۰ هزار دور، هر کدام حدود ۱۴۰ IOPS، یعنی ۱۱۲۰ IOPS خام.
| سطح | بار ۷۰٪ خواندن / ۳۰٪ نوشتن | بار ۵۰٪ / ۵۰٪ |
|---|---|---|
| RAID 10 | ۷۸۴ + ۱۶۸ = ۹۵۲ | ۵۶۰ + ۲۸۰ = ۸۴۰ |
| RAID 5 | ۷۸۴ + ۸۴ = ۸۶۸ | ۵۶۰ + ۱۴۰ = ۷۰۰ |
| RAID 6 | ۷۸۴ + ۵۶ = ۸۴۰ | ۵۶۰ + ۹۳ = ۶۵۳ |
هر چه سهم نوشتن بیشتر شود، فاصله بیشتر میشود. پایگاه دادههای تراکنشی، ماشینهای مجازی متعدد و سرورهای ایمیل بار نوشتن قابل توجهی دارند؛ سرور فایل و آرشیو عمدتاً خواندنیاند. این اعداد تقریبیاند — حافظه نهان کنترلر، نوشتن ترتیبی و SSD معادله را تغییر میدهند — اما جهت انتخاب را درست نشان میدهند.
ریسک بازسازی: جایی که RAID 5 شکست میخورد
وقتی یک دیسک در RAID 5 خراب میشود، آرایه در حالت Degraded کار میکند: هیچ افزونگی باقی نمانده. برای بازسازی روی دیسک جایگزین، کنترلر باید تمام داده همه دیسکهای باقیمانده را بخواند. دو ریسک در این مرحله وجود دارد:
ریسک اول: خطای خواندن غیرقابل بازیابی (URE)
سازندگان دیسک نرخ خطای خواندن غیرقابل بازیابی را در برگه مشخصات اعلام میکنند. برای دیسکهای رده مصرفی معمولاً یک خطا در هر ۱۰۱۴ بیت خواندهشده (حدود ۱۲٫۵ ترابایت)، و برای دیسکهای سازمانی ۱۰۱۵ یا ۱۰۱۶.
محاسبه برای آرایه RAID 5 با چهار دیسک ۴ ترابایتی که یکی خراب شده: باید ۳ × ۴ = ۱۲ ترابایت خوانده شود، یعنی حدود ۹٫۶ × ۱۰۱۳ بیت.
- با نرخ ۱۰۱۴: تعداد مورد انتظار خطا حدود ۰٫۹۶؛ احتمال عبور بدون حتی یک خطا حدود e−۰٫۹۶ ≈ ۳۸٪. یعنی در بدترین حالت برگه مشخصات، احتمال برخورد با خطا هنگام بازسازی بیش از ۶۰٪ است.
- با نرخ ۱۰۱۵: تعداد مورد انتظار حدود ۰٫۰۹۶؛ احتمال خطا حدود ۹٪.
این عدد مشخصات، سقف بدبینانه است و نرخ واقعی در میدان معمولاً پایینتر گزارش میشود. اما جهتش روشن است: هر چه دیسکها بزرگتر و ارزانتر، ریسک بیشتر. در RAID 5، یک خطای خواندن در حالت Degraded یعنی بلوکهایی که دیگر قابل بازسازی نیستند — و بسته به کنترلر، ممکن است بازسازی کامل متوقف شود.
RAID 6 دقیقاً برای همین ساخته شد: با دو توازن، خرابی یک دیسک بهعلاوه یک خطای خواندن هنگام بازسازی، هنوز قابل تحمل است. در RAID 10، بازسازی فقط از روی یک دیسک همتا انجام میشود، پس حجم خواندن و در نتیجه ریسک بسیار کمتر است.
ریسک دوم: خرابی دیسک دوم در زمان بازسازی
بازسازی یک دیسک چندترابایتی مکانیکی، بسته به بار سرور، از چند ساعت تا بیش از یک روز طول میکشد و در این مدت همه دیسکها زیر فشار خواندن مداوماند. دیسکهایی که از یک سری تولید و همزمان نصب شدهاند، عمر و فرسودگی مشابهی دارند. احتمال خرابی دیسک دوم در همین پنجره، ناچیز نیست.
نتیجه عملی: برای دیسکهای مکانیکی چندترابایتی، RAID 5 را کنار بگذارید. RAID 6 یا RAID 10 انتخابهای امروزیاند.
SSD معادله را چطور تغییر میدهد
SSDها نرخ URE بهتری دارند، بازسازیشان بسیار سریعتر است، و IOPS آنقدر بالاست که جریمه نوشتن RAID 5 اغلب گلوگاه نمیشود. به همین دلیل RAID 5 روی SSDهای سازمانی با ظرفیت متوسط، در بسیاری از موارد انتخاب قابل قبولی است. دو نکته: جریمه نوشتن روی SSD به معنی فرسایش بیشتر هم هست، پس کلاس دوام (DWPD) باید متناسب با بار نوشتن باشد؛ و SSDهای همسری ممکن است در زمانهای نزدیک به پایان عمر نوشتن برسند.
دیسک یدکی (Hot Spare)
دیسک یدکی داغ در آرایه نصب است اما استفاده نمیشود؛ به محض خرابی یک دیسک، کنترلر بازسازی را خودکار روی آن شروع میکند. مزیتش کوتاه کردن پنجره خطر است — بهخصوص وقتی خرابی شب یا تعطیلات رخ میدهد و تا رسیدن دیسک جایگزین ممکن است روزها طول بکشد. در آرایههای RAID 5 و 6 با دیسکهای بزرگ، ارزش یک دیسک یدکی معمولاً بیش از قیمت آن است.
RAID سختافزاری یا نرمافزاری
| نوع | مزیت | محدودیت |
|---|---|---|
| کنترلر سختافزاری | حافظه نهان محافظتشده، مستقل از سیستمعامل، بوت آسان | وابستگی به مدل کنترلر؛ در خرابی کنترلر، جایگزین همخانواده لازم است |
| RAID نرمافزاری سیستمعامل | بدون هزینه، قابل انتقال | مصرف پردازنده، بدون حافظه نهان محافظتشده |
| فایلسیستمهای مدیریت دیسک مثل ZFS | تشخیص و ترمیم خرابی خاموش داده با Checksum، Snapshot | نیاز به حافظه و تخصص؛ کنترلر باید در حالت عبور (HBA) باشد |
در سرورهای سازمانی با هایپروایزر، کنترلر سختافزاری با حافظه نهان محافظتشده رایجترین انتخاب است. در ذخیرهسازهای شبکه NAS، RAID نرمافزاری یا ZFS داخلی دستگاه استاندارد است.
جدول انتخاب بر اساس بار کاری
| بار کاری | سطح پیشنهادی | دلیل |
|---|---|---|
| دیسک سیستمعامل یا هایپروایزر | RAID 1 | ساده، بازسازی سریع |
| پایگاه داده تراکنشی، ماشینهای مجازی | RAID 10 | بهترین نوشتن و کمترین ریسک بازسازی |
| سرور فایل، داده حجیم با خواندن غالب | RAID 6 | ظرفیت خوب با تحمل دو خرابی |
| آرشیو و مخزن بکاپ | RAID 6 | ظرفیت و ایمنی؛ سرعت نوشتن ترتیبی کافی |
| SSD سازمانی با ظرفیت متوسط | RAID 5 یا RAID 10 | بسته به بار نوشتن و بودجه |
مانیتورینگ: RAIDی که کسی نگاهش نمیکند
رایجترین سناریوی از دست رفتن داده که میبینیم، این است: یک دیسک ماهها پیش خراب شده، کنترلر هشدار داده، اما هیچکس ندیده — چراغ نارنجی پشت سرور در اتاقی که کسی به آن سر نمیزند. آرایه ماهها در حالت Degraded کار کرده تا دیسک دوم هم خراب شده.
برای جلوگیری:
- هشدار کنترلر یا iLO/iDRAC را به ایمیل یا سیستم مانیتورینگ وصل کنید.
- مقادیر SMART دیسکها — بهخصوص تعداد سکتورهای جایگزینشده و در انتظار — را پایش کنید؛ افزایش آنها معمولاً پیش از خرابی کامل رخ میدهد.
- Patrol Read یا Consistency Check دورهای را در کنترلر فعال کنید تا خطاهای خواندن پنهان قبل از روز بازسازی کشف و ترمیم شوند.
- Firmware کنترلر و دیسکها را در برنامه سرویس دورهای سرور بهروز نگه دارید.
اشتباههای رایج
- RAID را جای بکاپ حساب کردن. بزرگترین و گرانترین اشتباه.
- RAID 5 با دیسکهای مکانیکی بزرگ برای داده حیاتی.
- دیسک رده مصرفی در سرور. دیسکهای دسکتاپ برای کار ۲۴ ساعته، لرزش چند دیسک کنار هم و رفتار مناسب در آرایه طراحی نشدهاند.
- تعویض دیسک اشتباه. در آرایه Degraded، بیرون کشیدن دیسک سالم بهجای دیسک خراب یعنی از دست رفتن آرایه. قبل از تعویض، دیسک را از رابط مدیریتی شناسایی و چراغش را روشن کنید.
- بدون هشدار. آرایهای که خرابیاش را به کسی خبر نمیدهد.
پرسشهای متداول
RAID را بعد از نصب میشود عوض کرد؟
بعضی کنترلرها مهاجرت سطح RAID را روی داده زنده پشتیبانی میکنند، اما این عملیات طولانی و پرریسک است. روش امن: بکاپ کامل و تأییدشده، ساخت آرایه جدید، بازگرداندن داده. بهتر است سطح درست از روز اول انتخاب شود.
کدام سطح RAID سریعتر است؟
برای خواندن، سطوح نواربندیشده با دیسک بیشتر. برای نوشتن تصادفی — که برای پایگاه داده و ماشین مجازی مهم است — RAID 10 در میان سطوح افزونه سریعترین است.
با خرابی کنترلر RAID، داده از دست میرود؟
معمولاً نه، اگر کنترلر جایگزین همخانواده باشد؛ پیکربندی آرایه روی خود دیسکها ذخیره شده و کنترلر جدید آن را میخواند. اما این دقیقاً لحظهای است که بکاپ جدا ارزش خودش را نشان میدهد.
قدم بعدی
اگر نمیدانید سرورهای فعلیتان روی چه سطح RAIDی هستند، هشدار دارند یا نه، و دیسکهایشان در چه وضعیتیاند، یک بررسی فنی کوتاه تصویر روشنی میدهد. در نصب سرور جدید هم سطح RAID را بر اساس بار کاری واقعی طراحی میکنیم — راهنمای کامل مشخصات را در انتخاب سرور برای شرکت کوچک و متوسط ببینید.
مشاهده خدمات نصب و راهاندازی سرور · تلفن: 021-74903
مشتریتان سرور یا ذخیرهساز میخواهد؟
اگر فروشنده سختافزار، مشاور یا پیمانکار IT هستید، پروژههای نصب، پیکربندی و نگهداری سرور مشتریانتان را از طریق برنامه همکاری در فروش نصیر ارتباط به ما بسپارید.