معرفی نسل جدید پردازنده‌های انویدیا (NVIDIA) با نام تجاری “Vera Rubin”، نمایانگر یک تغییر پارادایم بنیادین در طراحی زیرساخت‌های محاسباتی هوش مصنوعی است. در سیر تکامل شتاب‌دهنده‌های دیتاسنتر، معماری Hopper که در سال ۲۰۲۲ عرضه شد، با معرفی موتور ترانسفورمر و دقت FP8، به عنوان سخت‌افزار پایه برای عصر پدیدار شدن مدل‌های زبانی بزرگ (LLM) نظیر ChatGPT شناخته شد.

پس از آن، معماری Blackwell در سال ۲۰۲۴ با هدف مقیاس‌پذیری عظیم و مدیریت مدل‌های تریلیون‌پارامتری مبتنی بر معماری ترکیبی از خبرگان (Mixture of Experts) پا به عرصه گذاشت. با این حال، نسل Rubin که به افتخار اخترشناس برجسته، ورا روبین (Vera Rubin) نام‌گذاری شده است، اساساً برای پاسخگویی به پیچیده‌ترین نیازهای پردازشی آینده، از جمله هوش مصنوعی عامل‌گرا (Agentic AI) و مدل‌های استدلالی (Reasoning Models) طراحی شده است.

در این مدل‌های نوین، فرآیند استنتاج دیگر یک سیستم ساده و یک‌مرحله‌ای پرسش‌وپاسخ نیست، بلکه به یک “فرآیند تفکر” تبدیل شده است. مدل‌های استدلالی با استفاده از مقیاس‌پذیری زمانِ آزمون (Test-time Scaling)، زنجیره‌های طولانی از افکار را تولید می‌کنند، رویکردهای مختلف را می‌آزمایند و پیش از ارائه پاسخ نهایی، خروجی‌های خود را اصلاح می‌کنند.

این سطح از تولید توکن‌های متوالی که نیازمند حفظ بافتارهای متنی بسیار طولانی (Long-Context) و پنجره‌های استنتاجی تا سطح میلیون‌ها توکن است، گلوگاه‌های سخت‌افزاری جدیدی را آشکار کرده است. در این شرایط، فرآیند تولید توکن (Decode) در فاز استنتاج، به شدت تحت تاثیر محدودیت‌های پهنای باند حافظه و سرعت ارتباطات درون‌شبکه‌ای قرار می‌گیرد. معماری پردازنده‌های Rubin با بهره‌گیری از فرآیند ساخت ۳ نانومتری، ادغام پردازنده مرکزی اختصاصی Vera، استفاده از حافظه‌های فوق‌سریع HBM4 و پیاده‌سازی نسل ششم ارتباطات NVLink، پاسخی همه‌جانبه و مهندسی‌شده به این چالش‌های محاسباتی ارائه می‌دهد.

بررسی معماری پردازنده‌های NVIDIA Rubin تفاوت‌های ساختاری با نسل Blackwell و تاثیر آن در AI

کالبدشکافی معماری Rubin و مقایسه آن با نسل قبل

برای درک وسعت جهش تکنولوژیک در معماری Rubin، کالبدشکافی ریزمعماری آن و مقایسه با نسل Blackwell امری گریزناپذیر است. برخلاف ارتقاهای معمول در صنعت نیمه‌هادی، معماری Rubin یک بازطراحی ساختاری عمیق بر پایه طراحی چیپلت (Chiplet) است که برای اولین بار در محصولات انویدیا با این گستردگی به کار گرفته می‌شود. پردازنده گرافیکی Rubin (با نام کد R100) از ۳۳۶ میلیارد ترانزیستور تشکیل شده است که نسبت به ۲۰۸ میلیارد ترانزیستور در تراشه Blackwell، رشدی معادل ۱.۶ برابر را نشان می‌دهد.

این تراشه با استفاده از فناوری ساخت N3 (گره ۳ نانومتری TSMC) و لیتوگرافی پیشرفته N3P تولید می‌گردد و از فناوری بسته‌بندی CoWoS-L بهره می‌برد. ساختار فیزیکی این پردازنده شامل دو دای (Die) محاسباتی در حد محدودیت رتیکل (Reticle-limited) است که به همراه دای‌های ورودی/خروجی (I/O) مبتنی بر لیتوگرافی ۵ نانومتری (N5B) بر روی یک اینترپوزر با اندازه چهار برابر رتیکل استاندارد مونتاژ شده‌اند. برای درک بهتر این تغییرات معماری و تحلیل جهش عملکردی نسبت به ورک‌استیشن‌ها و معماری‌های پیشین مراجعه کنید.

هسته اصلی قدرت پردازشی تراشه R100 در ۲۲۴ چندپردازنده جریانی (SM) و ۸۹۶ هسته تنسور نسل سوم (3rd-generation Tensor Cores) نهفته است. این هسته‌ها با پشتیبانی بومی از موتور ترانسفورمر نسل سوم، قابلیت پردازش در فرمت‌های متنوعی از جمله FP8 ،FP6 ،BF16 و فرمت انقلابی NVFP4 (ممیز شناور ۴ بیتی) را دارا هستند. بهره‌گیری از فشرده‌سازی تطبیقی و مقیاس‌دهی میکروبلوکی در قالب NVFP4، به تراشه Rubin اجازه می‌دهد تا به رکورد بی‌نظیر ۵۰ پتافلاپس (PFLOPS) قدرت محاسباتی در استنتاج دست یابد. در مقام مقایسه، تراشه B200 از معماری Blackwell قدرتی در حدود ۹ الی ۱۵ پتافلاپس در پردازش‌های مشابه ارائه می‌دهد که نشان‌دهنده جهشی ۵ برابری در توان استنتاجی و ۳.۵ برابری در توان آموزش (Training) نسل Rubin است.

دلیل این افزایش عملکرد، تنها به افزایش خام تعداد ترانزیستورها محدود نمی‌شود. مهندسان انویدیا تغییرات بنیادینی در نحوه مدیریت عملیات‌های ماتریسی ایجاد کرده‌اند. معماری Rubin توان عملیاتی هسته‌های تنسور در هر کلاک را با دو برابر کردن حجم داده‌های پردازش‌شده در بُعد K (بُعد کاهش یا Reduction در ضرب ماتریس‌ها) دو برابر کرده است. این بدان معناست که یک عملیات ضرب ماتریس که در معماری Blackwell نیازمند چهار حلقه تکرار در بُعد K است، در تراشه Rubin تنها در دو حلقه به پایان می‌رسد. این بهینه‌سازی تاثیر مستقیمی بر کاهش تاخیر در کرنل‌های محدود به حافظه و محدود به تاخیر دارد و سرعت پردازش را در فازهای پیش‌پر کردن (Prefill) و رمزگشایی (Decode) افزایش می‌دهد.

علاوه بر این، معماری Rubin در پردازش مکانیزم توجه (Attention)، از ترکیب پراکندگی فعال‌سازی (Activation Sparsity) با فشرده‌سازی تطبیقی پشتیبانی می‌کند. تراشه قادر است داده‌های میانیِ مکانیزم توجه را به شکل ساختاریافته فشرده ۲:۴ بارگذاری نماید که به شدت هزینه نوشتن نتایج موقت و نیاز به فضای ذخیره‌سازی را در مقایسه با Blackwell کاهش می‌دهد. تابع Softmax نیز که به دلیل محاسبات نمایی همواره به عنوان یک گلوگاه در مدل‌های زبانی شناخته می‌شود، در معماری Rubin تا ۴ برابر در دقت‌های BF16/FP16 سریع‌تر از خط پایه Blackwell عمل می‌کند.

اما پلتفرم Vera Rubin تنها به پردازنده گرافیکی محدود نیست؛ این پلتفرم از پردازنده مرکزی کاملاً سفارشی انویدیا با نام Vera نیز بهره می‌برد. پردازنده Vera که جانشین پردازنده‌های نسل Grace محسوب می‌شود، دارای ۲۲۷ میلیارد ترانزیستور است و از ۸۸ هسته پردازشی سفارشی مبتنی بر معماری ARM با نام Olympus استفاده می‌کند.

این پردازنده با بهره‌گیری از فناوری چندنخی مکانی (Spatial Multi-Threading)، تعداد رشته‌های پردازشی را به ۱۷۶ رشته می‌رساند، بدون آنکه همانند روش‌های سنتیِ تخصیص زمانی (Time-slicing)، توان عملیاتی هسته‌ها کاهش یابد. پردازنده Vera قادر است تا ۱.۵ ترابایت حافظه LPDDR5X را پشتیبانی کند و از طریق اتصال اختصاصی NVLink-C2C با سرعت ۱.۸ ترابایت بر ثانیه (۷ برابر سریع‌تر از گذرگاه PCIe Gen 6) به پردازنده‌های گرافیکی Rubin متصل می‌شود که هماهنگی کشویی و حافظه منسجمی را بین CPU و GPU فراهم می‌آورد.

جدول زیر مقایسه دقیقی از مشخصات کلیدی این دو معماری دیتاسنتر ارائه می‌دهد:

ویژگی‌های فنیمعماری Rubin (R100)معماری Blackwell (B200)Hopper (H100)
تعداد ترانزیستور (GPU)۳۳۶ میلیارد۲۰۸ میلیارد۸۰ میلیارد
گره پردازشی (لیتوگرافی)TSMC N3 (۳ نانومتری)TSMC 4NP (۴ نانومتری)TSMC 4N (۴ نانومتری)
پردازنده مرکزی میزبانVera CPU (۸۸ هسته آرم)Grace CPU (۷۲ هسته آرم)x86 یا Grace
قدرت استنتاج (NVFP4)۵۰ پتافلاپس~۹ تا ۱۵ پتافلاپسفاقد پشتیبانی
قدرت آموزش (NVFP4)۳۵ پتافلاپس~۱۰ پتافلاپسفاقد پشتیبانی
ظرفیت و نوع حافظه۲۸۸ گیگابایت HBM4۱۹۲/۲۸۸ گیگابایت HBM3e۸۰ گیگابایت HBM3
پهنای باند حافظه۲۲ ترابایت بر ثانیه۸ ترابایت بر ثانیه۳.۳۵ ترابایت بر ثانیه
پهنای باند شبکه NVLink۳.۶ ترابایت بر ثانیه۱.۸ ترابایت بر ثانیه۹۰۰ گیگابایت بر ثانیه

تاثیر حافظه‌های HBM4 در پهنای باند و پردازش AI

همزمان با بزرگتر شدن ابعاد مدل‌های زبانی و ورود به عصر بافتارهای میلیونی، دیتاسنترها با پدیده‌ای به نام “دیوار حافظه” (Memory Wall) مواجه شده‌اند. در استنتاج مدل‌های زبانی، به‌ویژه در مدل‌های عامل‌گرا که نیازمند مراجعه مکرر به تاریخچه مکالمات هستند، هسته‌های پردازشی غالباً منتظر رسیدن داده‌ها از حافظه می‌مانند. در این سناریو، حافظه پنهان مقادیر کلیدی (KV Cache) که توالی توکن‌های پیشین را ذخیره می‌کند، به سرعت حجم عظیمی از VRAM را اشغال کرده و گلوگاه اصلی سیستم می‌شود.

معماری Rubin با به‌کارگیری حافظه‌های نسل چهارم با پهنای باند بالا (HBM4)، پاسخی قطعی به این معضل ارائه می‌دهد. هر پردازنده R100 به هشت پشته حافظه HBM4 با پیکربندی ۱۲ لایه (12-Hi) مجهز شده است که مجموعاً ۲۸۸ گیگابایت ظرفیت را فراهم می‌آورند. اما مهم‌تر از ظرفیت، پهنای باند خارق‌العاده ۲۲ ترابایت بر ثانیه‌ای این حافظه‌هاست که حدود ۲.۷۵ برابر سریع‌تر از پهنای باند ۸ ترابایتی حافظه‌های HBM3e در پردازنده‌های نسل Blackwell Ultra است. این پهنای باند عظیم از طریق دو برابر شدن عرض گذرگاه رابط در هر پشته به ۲۰۴۸ بیت و دستیابی به سرعت ۱۰.۸ گیگاترانسفر بر ثانیه در هر پین محقق شده است.

اهمیت این معماری حافظه زمانی آشکارتر می‌شود که استراتژی‌های طراحی جایگزین انویدیا را بررسی کنیم. انویدیا در ابتدا قصد داشت تراشه‌ای تخصصی به نام Rubin CPX را برای پردازش فاز پیش‌پر کردن (Prefill) بافتارهای طولانی عرضه کند. این تراشه لغوشده، قرار بود به جای حافظه گران‌قیمت HBM، از ۱۲۸ گیگابایت حافظه GDDR7 با پهنای باند حدودی ۱.۵ تا ۲ ترابایت بر ثانیه استفاده نماید تا ظرفیت بالا را با هزینه کمتری ارائه دهد.

ایده اولیه این بود که فاز پیش‌پر کردن که محدود به توان محاسباتی است، روی حافظه‌های GDDR7 انجام شود و فاز تولید توکن (Decode) که تشنه پهنای باند است، به پردازنده‌های استاندارد مجهز به HBM سپرده شود. با این حال، انویدیا با ارتقای همه‌جانبه پردازنده R100 و ترکیب آن با شتاب‌دهنده‌های حافظه تنسور ارتقایافته (TMA)، نیاز به جداسازی سخت‌افزاری را مرتفع ساخت.

سیستم TMA ارتقایافته در معماری Rubin، سربار جابه‌جایی داده‌ها را به شکل قابل توجهی در مدل‌های دارای ساختار “ترکیبی از خبرگان” (Mixture-of-Experts) کاهش می‌دهد. در معماری‌های گذشته، سیستم مجبور بود برای دسترسی به هر “خبره” در شبکه عصبی، یک توصیف‌گر (Descriptor) مجزا در حافظه تعریف کند. اما TMA در معماری Rubin اجازه می‌دهد که یک توصیف‌گر واحد برای تمامی تنسورهایی که دارای ساختار داده‌ای مشترک هستند اما در نقاط مختلفی از حافظه فیزیکی HBM4 قرار دارند، به اشتراک گذاشته شود. ترکیب HBM4 با این مکانیزم‌های سخت‌افزاری تضمین می‌کند که تراشه Rubin می‌تواند مدل‌های استدلالی سنگین را بدون افت عملکردِ ناشی از تاخیر حافظه، پردازش کند.

بنچمارک و عملکرد Rubin در پردازش مدل‌های زبانی بزرگ (LLM)

ارزیابی توانمندی‌های واقعی معماری Rubin نیازمند بررسی عملکرد آن در شرایط بارهای کاری سنگین و مدل‌های مقیاس‌بزرگ است. بررسی توان محاسباتی مورد نیاز برای مدل‌های هوش مصنوعی منبع‌باز می‌تواند چشم‌انداز روشنی از این چالش‌ها ارائه دهد.

مدل زبانی Falcon 180B، توسعه یافته توسط موسسه TII، با ۱۸۰ میلیارد پارامتر و آموزش دیده بر روی ۳.۵ تریلیون توکن، یکی از قدرتمندترین و سنگین‌ترین مدل‌های منبع‌باز فعلی است که عملکردی نزدیک به GPT-4 دارد. معماری این مدل شامل توجه چندپرسشی (Multiquery Attention) و بلوک‌های رمزگشای موازی است. راه‌اندازی و اجرای استنتاج بر روی این مدل در حالت عادی (Unquantized)، نیازمند حدود ۶۴۰ گیگابایت حافظه VRAM است.

در زیرساخت‌های متکی بر معماری Hopper (مانند پردازنده‌های A100)، این میزان حافظه معادل استفاده از هشت پردازنده ۸۰ گیگابایتی است که هزینه‌های نگهداری آن به ده‌ها هزار دلار در ماه می‌رسد. حتی با استفاده از تکنیک‌های فشرده‌سازی و کاهش دقت به ۴ بیت (INT4) یا ۸ بیت، استقرار این مدل حداقل به ۳۲۰ تا ۴۰۰ گیگابایت VRAM و ۵ الی ۸ پردازنده فیزیکی نیاز دارد. مشکل اساسی در این معماری‌های قدیمی این است که توزیع یک مدل بر روی تعداد زیادی از کارت‌های فیزیکی، به دلیل تاخیر در ارتباطات بین‌تراشه‌ای، باعث افت شدید سرعت تولید توکن به زیر ۴ الی ۸ توکن بر ثانیه می‌شود.

در مقابل، معماری Rubin با فراهم آوردن ۲۸۸ گیگابایت حافظه HBM4 در هر پردازنده، معادلات زیرساختی را کاملاً دگرگون می‌سازد. مدل Falcon 180B در حالت کوانتایز شده، به جای نیاز به یک رک کامل از پردازنده‌های A100، می‌تواند به راحتی در پیکربندی یک “ابررسانای Vera Rubin” (Vera Rubin Superchip) که از یک پردازنده Vera CPU و دو پردازنده گرافیکی R100 (مجموعاً ۵۷۶ گیگابایت HBM4) تشکیل شده است، مستقر شود. این ادغام به معنای کاهش فاحش سربار ارتباطی و افزایش خیره‌کننده خروجی مدل است.

هنگامی که بحث مدل‌های مبتنی بر MoE در مقیاس تریلیون پارامتری مطرح می‌شود، برتری‌های Rubin محسوس‌تر است. داده‌های بنچمارک انویدیا نشان می‌دهند که در اجرای استنتاج مدل‌هایی نظیر Kimi-K2-Thinking که دارای فرآیندهای استدلالی عمیق و پنجره‌های ۳۲ هزار توکنی هستند، پلتفرم رَک مقیاس Vera Rubin NVL72 می‌تواند خروجی توکن‌ها را به ازای هر مگاوات انرژی مصرفی تا ۱۰ برابر نسبت به سیستم مشابه GB200 نسل Blackwell افزایش دهد. همچنین در بحث آموزش مدل‌های MoE ده تریلیون پارامتری، سیستم Vera Rubin NVL72 به لطف ارتباطات پرسرعت و موتورهای تنسور جدید، می‌تواند مدل را با استفاده از یک‌چهارم تعداد پردازنده‌هایی که در سیستم‌های Blackwell مورد نیاز است، در همان بازه زمانی استاندارد آموزش دهد.

در دیتاسنترهای مقیاس‌بزرگ و “کارخانه‌های هوش مصنوعی” (AI Factories)، قدرت پردازشی تراشه‌ها تنها زمانی قابل استفاده است که شبکه ارتباطی بتواند داده‌ها را بدون تاخیر بین آن‌ها جابه‌جا کند. پلتفرم Vera Rubin به همراه نسل ششم معماری ارتباطی NVLink (NVLink 6) معرفی شده است که استانداردهای شبکه‌سازی را در مقیاس رک بازنویسی کرده است.

فناوری NVLink 6 پهنای باند دوطرفه‌ای معادل ۳.۶ ترابایت بر ثانیه به ازای هر پردازنده گرافیکی فراهم می‌کند که دقیقاً دو برابر پهنای باند ۱.۸ ترابایتیِ NVLink 5 در نسل Blackwell است. این ارتباطات از طریق سوئیچ‌های اختصاصی NVLink مدیریت می‌شوند. در معماری یک رک کامل مانند Vera Rubin NVL72 (شامل ۷۲ پردازنده گرافیکی و ۳۶ پردازنده مرکزی)، سوئیچ‌های NVLink 6 با استفاده از شبکه‌ای متشکل از ۵۰۰۰ کابل نوری و مسی بدون کور در ساختار سینی‌های ماژولار (Switch Trays)، پهنای باند ارتباطی تجمیعی ۲۶۰ ترابایت بر ثانیه را برای تمام پردازنده‌ها در یک توپولوژی همه‌به‌همه (All-to-All) فراهم می‌آورند.

یکی از بزرگترین مزیت‌های NVLink 6 نسبت به شبکه‌های اترنت سنتی (Ethernet)، توانایی محاسبات درون‌شبکه‌ای (In-network Compute) است. سینی‌های سوئیچ NVLink 6 در مجموع قابلیت پردازش ۱۳۰ ترا-فلاپس (TFLOPS) عملیات تقلیلی (مانند All-Reduce) را در فرمت FP8 دارا هستند. این ویژگی باعث می‌شود تا عملیات‌های جمعی، بدون اشغال کردن چرخه‌های پردازشیِ تراشه‌های اصلی Rubin انجام شوند. نتایج شبیه‌سازی‌ها حاکی از آن است که در مدل‌های سنگینی مانند DeepSeek-R1 یا مدل‌های تریلیون پارامتری، NVLink 6 توان عملیاتی فاز رمزگشایی را نسبت به پیشرفته‌ترین راه‌حل‌های اترنت موجود تا ۲.۳ برابر، و نرخ انتقال بسته‌های داده را تا ۱۰ برابر افزایش داده و همزمان تاخیر را به یک‌سوم کاهش می‌دهد.

برای رفع چالش همگام‌سازی ارتباطات در شبکه‌های دیتاسنتر، مهندسان معماری Rubin از پروتکل “نوشتن‌های شمارش‌شده” (Counted Writes) رونمایی کرده‌اند. در معماری‌های سنتی، انتقال داده بین دو پردازنده نیازمند ارسال مداوم تاییدیه‌ها (Acknowledgments) و پرچم‌های اتمیک بود که منجر به توقف موقت پردازنده‌ها می‌شد. در معماری Rubin، ارتباطات توسط دستگاه ارسال‌کننده کنترل می‌شود (Device-initiated) و پردازنده دریافت‌کننده تنها با بررسی یک متغیر شمارنده، اتمام موفقیت‌آمیز انتقال را متوجه می‌شود. این کاهش چشمگیر در ترافیک کنترلی شبکه، موجب می‌شود تا پردازنده‌های متصل در شبکه‌های مقیاس‌بزرگ، زمان بیشتری را به محاسبه و زمان کمتری را به انتظار برای دست‌دهی (Handshake) شبکه اختصاص دهند.

علاوه بر شبکه درون‌رکی، پلتفرم Rubin برای ارتباطات برون‌رکی و مقیاس‌پذیری افقی (Scale-out) تا سطح صدها هزار پردازنده، از واحدهای پردازش داده BlueField-4 DPU (با پهنای باند ۱.۶ ترابیت بر ثانیه) و کارت‌های شبکه ConnectX-9 SuperNIC (با پهنای باند ۸۰۰ تا ۱۶۰۰ گیگابیت بر ثانیه) بر بستر فناوری‌های Spectrum-6 Ethernet و Quantum-X800 InfiniBand استفاده می‌کند که ترافیک ناهمگام و انفجاری بارهای کاری هوش مصنوعی را در سراسر دیتاسنتر مدیریت می‌نماید.

جایگاه Rubin در زیرساخت‌های مجازی‌سازی و کلاد

ارائه‌دهندگان خدمات ابری و سازمان‌های بزرگ تجاری همواره به دنبال بهینه‌سازی نرخ بهره‌وری از سخت‌افزارهای گران‌قیمت خود هستند. در این میان، مجازی‌سازی پردازنده‌های گرافیکی به ابزاری حیاتی برای تخصیص بهینه منابع به بارهای کاری متنوع تبدیل شده است. اهمیت تخصیص منابع گرافیکی در دیتاسنترهای مدرن این موضوع را به تفصیل مورد بررسی قرار داده است.

معماری پردازنده‌های انویدیا از زمان معرفی قابلیت “پردازنده گرافیکی چندنمونه‌ای” (MIG – Multi-Instance GPU) در مسیر تکامل مجازی‌سازی گام برداشته است و نسل Blackwell و Rubin اوج بلوغ این فناوری را به نمایش می‌گذارند. برخلاف روش‌های سنتیِ مجازی‌سازی که مبتنی بر تخصیص زمانی (Time-slicing) بودند و منابع مشترک به صورت نوبتی بین ماشین‌های مجازی به اشتراک گذاشته می‌شدند، فناوری MIG پردازنده فیزیکی را به صورت مکانی (Spatial Partitioning) در سطح سخت‌افزار به چندین نمونه کاملاً مجزا تقسیم می‌کند. هر نمونه مستقل، دارای هسته‌های محاسباتی، حافظه اختصاصی و پهنای باند کاملاً ایزوله است که تضمین‌کننده کیفیت خدمات (QoS) برای کاربران سازمانی خواهد بود.

انویدیا اخیراً با معرفی نرم‌افزار NVIDIA vGPU 20 و کارت گرافیک سازمانی RTX PRO 4500 Blackwell Server Edition، قدرت مجازی‌سازی در سطح رک‌ها را به شدت افزایش داده است. تراشه RTX PRO 4500 با مصرف برق تنها ۱۶۵ وات و استفاده از سیستم خنک‌کننده پسیو، مجهز به ۳۲ گیگابایت حافظه GDDR7 (با قابلیت تصحیح خطا یا ECC) و پهنای باند ۸۰۰ گیگابایت بر ثانیه است و می‌تواند از طریق فناوری MIG به دو نمونه کاملاً ایزوله ۱۶ گیگابایتی تقسیم شود.

در زیرساخت‌های دیتاسنتر که بعدها میزبان تراشه‌های قدرتمندتر Rubin نیز خواهند بود، یک سازمان می‌تواند به کمک پلتفرم‌های مدیریت مجازی‌سازی مانند VMware vSphere، تراشه‌های فیزیکی را بسته به نیاز به پروفایل‌های متنوع (مانند 3B برای کارمندان اداری، 4Q برای طراحان ایستگاه‌های کاری و 16Q برای پردازش داده) تخصیص دهد.

ترکیب قابلیت‌های MIG با پشتیبانی از PCIe Gen 5 در تراشه‌های جدید، سرعت انتقال داده از CPU را دو برابر کرده و باعث می‌شود تا بارهای کاری همزمان نظیر آموزش مدل‌های یادگیری ماشین، رندرینگ گرافیکی، استنتاج هوش مصنوعی و دسکتاپ‌های مجازی (VDI) بدون هیچ‌گونه افت کیفیت و رقابت بر سر منابع، به‌طور همزمان در یک دیتاسنتر واحد مدیریت شوند. این معماری ایزوله، به ویژه برای محیط‌های چندمستاجره (Multi-tenant) نظیر پلتفرم‌های MLOps و سرویس‌های ابری عمومی بسیار ایده‌آل است.

نتیجه‌گیری: آیا ارتقا از Blackwell به Rubin برای دیتاسنترها توجیه اقتصادی دارد؟

تصمیم‌گیری استراتژیک برای ارتقای زیرساخت‌های هوش مصنوعی از معماری Blackwell به Vera Rubin، نیازمند ارزیابی دقیقی از بارهای کاری، جدول‌های زمانی استقرار، و اقتصاد کلان دیتاسنترها است. از منظر شاخص‌های کلیدی عملکرد شامل هزینه کل مالکیت (TCO) و بازده عملیاتی (OPEX)، معماری Rubin یک جهش انقلابی محسوب می‌شود.

ارتقای ظرفیت و سرعت حافظه به ۲۸۸ گیگابایت HBM4 با پهنای باند ۲۲ ترابایت بر ثانیه در هر پردازنده، به دیتاسنترها این امکان را می‌دهد که سنگین‌ترین مدل‌های عامل‌گرا را با حافظه‌های پنهان KV عظیم، روی پردازنده‌های کمتری اجرا کنند. گزارش‌های فنی ثابت می‌کنند که پلتفرم Vera Rubin NVL72 می‌تواند استنتاج مدل‌های پیشرفته استدلالی را با هزینه‌ای معادل یک‌دهم هزینه سیستم‌های Blackwell (به ازای هر میلیون توکن) به انجام برساند و همچنین در آموزش مدل‌های پیچیده MoE، تعداد پردازنده‌های مورد نیاز را تا ۷۵ درصد (یک‌چهارم ظرفیت Blackwell) کاهش دهد.

این سطح از تراکم محاسباتی به این معناست که کارخانه‌های هوش مصنوعی می‌توانند با حفظ محدودیت‌های انرژی (Power Envelope) فعلی خود، تا ۱۰ برابر خروجی توکن بیشتری تولید کرده و سهم درآمدی خود را به شدت افزایش دهند.

با این وجود، واقعیت‌های زنجیره تامین و زمان عرضه به بازار (Time-to-Market) نقش تعیین‌کننده‌ای در تصمیمات مدیران دیتاسنترها ایفا می‌کند. پردازنده‌های سری Rubin، بر اساس نقشه‌راه انویدیا، در نیمه دوم سال ۲۰۲۶ میلادی برای ارائه‌دهندگان سرویس‌های کلان ابری (مانند AWS، Azure و CoreWeave) وارد مدار تولید می‌شوند. اما صف‌های طولانی تقاضا و محدودیت‌های تامین تراشه‌های حافظه HBM4 و فناوری بسته‌بندی CoWoS-L به این معناست که تخصیص گسترده این سرورها برای بازارهای عمومی و شرکت‌های کوچک‌تر تا اواسط سال ۲۰۲۷ و حتی اوایل ۲۰۲۸ به طول خواهد انجامید.

از این رو، ارتقا و انتظار برای دریافت پردازنده‌های Rubin تابعی از جدول زمان‌بندی کسب‌وکارهاست. برای سازمان‌ها، استارتاپ‌ها و آزمایشگاه‌هایی که برنامه‌های توسعه‌ای آن‌ها ایجاب می‌کند محصولات هوش مصنوعی خود را در سال‌های ۲۰۲۵ تا اواسط ۲۰۲۷ به بازار عرضه کنند، سرمایه‌گذاری بر روی پلتفرم‌های اثبات‌شده Blackwell (مانند پردازنده‌های B200، B300 یا نسخه‌های سرور RTX PRO) منطقی‌ترین گزینه از نظر اقتصادی است، زیرا تاخیر در زمان ورود به بازار، هزینه‌های عدم‌النفع بسیار بیشتری نسبت به مزایای فنی سخت‌افزار نسل بعد به همراه خواهد داشت.

در نقطه مقابل، برای سازندگان زیرساخت‌های ابری کلان و دیتاسنترهای سطح سازمانی که در حال برنامه‌ریزی استراتژیک برای میزبانی نسل بعدی مدل‌های تریلیون‌-پارامتری، دستیارهای برنامه‌نویسی با بافتارهای میلیونی و سیستم‌های هوش مصنوعی خودمختار در بازه زمانی سال‌های ۲۰۲۷ و بعد از آن هستند، پلتفرم Vera Rubin صرفاً یک ارتقای جذاب نیست؛ بلکه تنها معماری مقیاس‌پذیری است که از طریق رفع گلوگاه‌های حافظه، ارتباطات NVLink همه‌به‌همه و مصرف انرژی بهینه، بقا و رقابت‌پذیری اقتصادی آن‌ها را در عصر هوش مصنوعی عامل‌گرا تضمین می‌نماید.


منابع: 1، 2، 3، 5، 6، 7

One thought on “بررسی معماری پردازنده‌های NVIDIA Rubin: تفاوت‌های ساختاری با نسل Blackwell و تاثیر آن در AI

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *