معرفی نسل جدید پردازندههای انویدیا (NVIDIA) با نام تجاری “Vera Rubin”، نمایانگر یک تغییر پارادایم بنیادین در طراحی زیرساختهای محاسباتی هوش مصنوعی است. در سیر تکامل شتابدهندههای دیتاسنتر، معماری Hopper که در سال ۲۰۲۲ عرضه شد، با معرفی موتور ترانسفورمر و دقت FP8، به عنوان سختافزار پایه برای عصر پدیدار شدن مدلهای زبانی بزرگ (LLM) نظیر ChatGPT شناخته شد.
پس از آن، معماری Blackwell در سال ۲۰۲۴ با هدف مقیاسپذیری عظیم و مدیریت مدلهای تریلیونپارامتری مبتنی بر معماری ترکیبی از خبرگان (Mixture of Experts) پا به عرصه گذاشت. با این حال، نسل Rubin که به افتخار اخترشناس برجسته، ورا روبین (Vera Rubin) نامگذاری شده است، اساساً برای پاسخگویی به پیچیدهترین نیازهای پردازشی آینده، از جمله هوش مصنوعی عاملگرا (Agentic AI) و مدلهای استدلالی (Reasoning Models) طراحی شده است.
در این مدلهای نوین، فرآیند استنتاج دیگر یک سیستم ساده و یکمرحلهای پرسشوپاسخ نیست، بلکه به یک “فرآیند تفکر” تبدیل شده است. مدلهای استدلالی با استفاده از مقیاسپذیری زمانِ آزمون (Test-time Scaling)، زنجیرههای طولانی از افکار را تولید میکنند، رویکردهای مختلف را میآزمایند و پیش از ارائه پاسخ نهایی، خروجیهای خود را اصلاح میکنند.
این سطح از تولید توکنهای متوالی که نیازمند حفظ بافتارهای متنی بسیار طولانی (Long-Context) و پنجرههای استنتاجی تا سطح میلیونها توکن است، گلوگاههای سختافزاری جدیدی را آشکار کرده است. در این شرایط، فرآیند تولید توکن (Decode) در فاز استنتاج، به شدت تحت تاثیر محدودیتهای پهنای باند حافظه و سرعت ارتباطات درونشبکهای قرار میگیرد. معماری پردازندههای Rubin با بهرهگیری از فرآیند ساخت ۳ نانومتری، ادغام پردازنده مرکزی اختصاصی Vera، استفاده از حافظههای فوقسریع HBM4 و پیادهسازی نسل ششم ارتباطات NVLink، پاسخی همهجانبه و مهندسیشده به این چالشهای محاسباتی ارائه میدهد.
آنچه میخوانید:

کالبدشکافی معماری Rubin و مقایسه آن با نسل قبل
برای درک وسعت جهش تکنولوژیک در معماری Rubin، کالبدشکافی ریزمعماری آن و مقایسه با نسل Blackwell امری گریزناپذیر است. برخلاف ارتقاهای معمول در صنعت نیمههادی، معماری Rubin یک بازطراحی ساختاری عمیق بر پایه طراحی چیپلت (Chiplet) است که برای اولین بار در محصولات انویدیا با این گستردگی به کار گرفته میشود. پردازنده گرافیکی Rubin (با نام کد R100) از ۳۳۶ میلیارد ترانزیستور تشکیل شده است که نسبت به ۲۰۸ میلیارد ترانزیستور در تراشه Blackwell، رشدی معادل ۱.۶ برابر را نشان میدهد.
این تراشه با استفاده از فناوری ساخت N3 (گره ۳ نانومتری TSMC) و لیتوگرافی پیشرفته N3P تولید میگردد و از فناوری بستهبندی CoWoS-L بهره میبرد. ساختار فیزیکی این پردازنده شامل دو دای (Die) محاسباتی در حد محدودیت رتیکل (Reticle-limited) است که به همراه دایهای ورودی/خروجی (I/O) مبتنی بر لیتوگرافی ۵ نانومتری (N5B) بر روی یک اینترپوزر با اندازه چهار برابر رتیکل استاندارد مونتاژ شدهاند. برای درک بهتر این تغییرات معماری و تحلیل جهش عملکردی نسبت به ورکاستیشنها و معماریهای پیشین مراجعه کنید.
هسته اصلی قدرت پردازشی تراشه R100 در ۲۲۴ چندپردازنده جریانی (SM) و ۸۹۶ هسته تنسور نسل سوم (3rd-generation Tensor Cores) نهفته است. این هستهها با پشتیبانی بومی از موتور ترانسفورمر نسل سوم، قابلیت پردازش در فرمتهای متنوعی از جمله FP8 ،FP6 ،BF16 و فرمت انقلابی NVFP4 (ممیز شناور ۴ بیتی) را دارا هستند. بهرهگیری از فشردهسازی تطبیقی و مقیاسدهی میکروبلوکی در قالب NVFP4، به تراشه Rubin اجازه میدهد تا به رکورد بینظیر ۵۰ پتافلاپس (PFLOPS) قدرت محاسباتی در استنتاج دست یابد. در مقام مقایسه، تراشه B200 از معماری Blackwell قدرتی در حدود ۹ الی ۱۵ پتافلاپس در پردازشهای مشابه ارائه میدهد که نشاندهنده جهشی ۵ برابری در توان استنتاجی و ۳.۵ برابری در توان آموزش (Training) نسل Rubin است.
دلیل این افزایش عملکرد، تنها به افزایش خام تعداد ترانزیستورها محدود نمیشود. مهندسان انویدیا تغییرات بنیادینی در نحوه مدیریت عملیاتهای ماتریسی ایجاد کردهاند. معماری Rubin توان عملیاتی هستههای تنسور در هر کلاک را با دو برابر کردن حجم دادههای پردازششده در بُعد K (بُعد کاهش یا Reduction در ضرب ماتریسها) دو برابر کرده است. این بدان معناست که یک عملیات ضرب ماتریس که در معماری Blackwell نیازمند چهار حلقه تکرار در بُعد K است، در تراشه Rubin تنها در دو حلقه به پایان میرسد. این بهینهسازی تاثیر مستقیمی بر کاهش تاخیر در کرنلهای محدود به حافظه و محدود به تاخیر دارد و سرعت پردازش را در فازهای پیشپر کردن (Prefill) و رمزگشایی (Decode) افزایش میدهد.
علاوه بر این، معماری Rubin در پردازش مکانیزم توجه (Attention)، از ترکیب پراکندگی فعالسازی (Activation Sparsity) با فشردهسازی تطبیقی پشتیبانی میکند. تراشه قادر است دادههای میانیِ مکانیزم توجه را به شکل ساختاریافته فشرده ۲:۴ بارگذاری نماید که به شدت هزینه نوشتن نتایج موقت و نیاز به فضای ذخیرهسازی را در مقایسه با Blackwell کاهش میدهد. تابع Softmax نیز که به دلیل محاسبات نمایی همواره به عنوان یک گلوگاه در مدلهای زبانی شناخته میشود، در معماری Rubin تا ۴ برابر در دقتهای BF16/FP16 سریعتر از خط پایه Blackwell عمل میکند.
اما پلتفرم Vera Rubin تنها به پردازنده گرافیکی محدود نیست؛ این پلتفرم از پردازنده مرکزی کاملاً سفارشی انویدیا با نام Vera نیز بهره میبرد. پردازنده Vera که جانشین پردازندههای نسل Grace محسوب میشود، دارای ۲۲۷ میلیارد ترانزیستور است و از ۸۸ هسته پردازشی سفارشی مبتنی بر معماری ARM با نام Olympus استفاده میکند.
این پردازنده با بهرهگیری از فناوری چندنخی مکانی (Spatial Multi-Threading)، تعداد رشتههای پردازشی را به ۱۷۶ رشته میرساند، بدون آنکه همانند روشهای سنتیِ تخصیص زمانی (Time-slicing)، توان عملیاتی هستهها کاهش یابد. پردازنده Vera قادر است تا ۱.۵ ترابایت حافظه LPDDR5X را پشتیبانی کند و از طریق اتصال اختصاصی NVLink-C2C با سرعت ۱.۸ ترابایت بر ثانیه (۷ برابر سریعتر از گذرگاه PCIe Gen 6) به پردازندههای گرافیکی Rubin متصل میشود که هماهنگی کشویی و حافظه منسجمی را بین CPU و GPU فراهم میآورد.
جدول زیر مقایسه دقیقی از مشخصات کلیدی این دو معماری دیتاسنتر ارائه میدهد:
| ویژگیهای فنی | معماری Rubin (R100) | معماری Blackwell (B200) | Hopper (H100) |
| تعداد ترانزیستور (GPU) | ۳۳۶ میلیارد | ۲۰۸ میلیارد | ۸۰ میلیارد |
| گره پردازشی (لیتوگرافی) | TSMC N3 (۳ نانومتری) | TSMC 4NP (۴ نانومتری) | TSMC 4N (۴ نانومتری) |
| پردازنده مرکزی میزبان | Vera CPU (۸۸ هسته آرم) | Grace CPU (۷۲ هسته آرم) | x86 یا Grace |
| قدرت استنتاج (NVFP4) | ۵۰ پتافلاپس | ~۹ تا ۱۵ پتافلاپس | فاقد پشتیبانی |
| قدرت آموزش (NVFP4) | ۳۵ پتافلاپس | ~۱۰ پتافلاپس | فاقد پشتیبانی |
| ظرفیت و نوع حافظه | ۲۸۸ گیگابایت HBM4 | ۱۹۲/۲۸۸ گیگابایت HBM3e | ۸۰ گیگابایت HBM3 |
| پهنای باند حافظه | ۲۲ ترابایت بر ثانیه | ۸ ترابایت بر ثانیه | ۳.۳۵ ترابایت بر ثانیه |
| پهنای باند شبکه NVLink | ۳.۶ ترابایت بر ثانیه | ۱.۸ ترابایت بر ثانیه | ۹۰۰ گیگابایت بر ثانیه |
تاثیر حافظههای HBM4 در پهنای باند و پردازش AI
همزمان با بزرگتر شدن ابعاد مدلهای زبانی و ورود به عصر بافتارهای میلیونی، دیتاسنترها با پدیدهای به نام “دیوار حافظه” (Memory Wall) مواجه شدهاند. در استنتاج مدلهای زبانی، بهویژه در مدلهای عاملگرا که نیازمند مراجعه مکرر به تاریخچه مکالمات هستند، هستههای پردازشی غالباً منتظر رسیدن دادهها از حافظه میمانند. در این سناریو، حافظه پنهان مقادیر کلیدی (KV Cache) که توالی توکنهای پیشین را ذخیره میکند، به سرعت حجم عظیمی از VRAM را اشغال کرده و گلوگاه اصلی سیستم میشود.
معماری Rubin با بهکارگیری حافظههای نسل چهارم با پهنای باند بالا (HBM4)، پاسخی قطعی به این معضل ارائه میدهد. هر پردازنده R100 به هشت پشته حافظه HBM4 با پیکربندی ۱۲ لایه (12-Hi) مجهز شده است که مجموعاً ۲۸۸ گیگابایت ظرفیت را فراهم میآورند. اما مهمتر از ظرفیت، پهنای باند خارقالعاده ۲۲ ترابایت بر ثانیهای این حافظههاست که حدود ۲.۷۵ برابر سریعتر از پهنای باند ۸ ترابایتی حافظههای HBM3e در پردازندههای نسل Blackwell Ultra است. این پهنای باند عظیم از طریق دو برابر شدن عرض گذرگاه رابط در هر پشته به ۲۰۴۸ بیت و دستیابی به سرعت ۱۰.۸ گیگاترانسفر بر ثانیه در هر پین محقق شده است.
اهمیت این معماری حافظه زمانی آشکارتر میشود که استراتژیهای طراحی جایگزین انویدیا را بررسی کنیم. انویدیا در ابتدا قصد داشت تراشهای تخصصی به نام Rubin CPX را برای پردازش فاز پیشپر کردن (Prefill) بافتارهای طولانی عرضه کند. این تراشه لغوشده، قرار بود به جای حافظه گرانقیمت HBM، از ۱۲۸ گیگابایت حافظه GDDR7 با پهنای باند حدودی ۱.۵ تا ۲ ترابایت بر ثانیه استفاده نماید تا ظرفیت بالا را با هزینه کمتری ارائه دهد.
ایده اولیه این بود که فاز پیشپر کردن که محدود به توان محاسباتی است، روی حافظههای GDDR7 انجام شود و فاز تولید توکن (Decode) که تشنه پهنای باند است، به پردازندههای استاندارد مجهز به HBM سپرده شود. با این حال، انویدیا با ارتقای همهجانبه پردازنده R100 و ترکیب آن با شتابدهندههای حافظه تنسور ارتقایافته (TMA)، نیاز به جداسازی سختافزاری را مرتفع ساخت.
سیستم TMA ارتقایافته در معماری Rubin، سربار جابهجایی دادهها را به شکل قابل توجهی در مدلهای دارای ساختار “ترکیبی از خبرگان” (Mixture-of-Experts) کاهش میدهد. در معماریهای گذشته، سیستم مجبور بود برای دسترسی به هر “خبره” در شبکه عصبی، یک توصیفگر (Descriptor) مجزا در حافظه تعریف کند. اما TMA در معماری Rubin اجازه میدهد که یک توصیفگر واحد برای تمامی تنسورهایی که دارای ساختار دادهای مشترک هستند اما در نقاط مختلفی از حافظه فیزیکی HBM4 قرار دارند، به اشتراک گذاشته شود. ترکیب HBM4 با این مکانیزمهای سختافزاری تضمین میکند که تراشه Rubin میتواند مدلهای استدلالی سنگین را بدون افت عملکردِ ناشی از تاخیر حافظه، پردازش کند.
بنچمارک و عملکرد Rubin در پردازش مدلهای زبانی بزرگ (LLM)
ارزیابی توانمندیهای واقعی معماری Rubin نیازمند بررسی عملکرد آن در شرایط بارهای کاری سنگین و مدلهای مقیاسبزرگ است. بررسی توان محاسباتی مورد نیاز برای مدلهای هوش مصنوعی منبعباز میتواند چشمانداز روشنی از این چالشها ارائه دهد.
مدل زبانی Falcon 180B، توسعه یافته توسط موسسه TII، با ۱۸۰ میلیارد پارامتر و آموزش دیده بر روی ۳.۵ تریلیون توکن، یکی از قدرتمندترین و سنگینترین مدلهای منبعباز فعلی است که عملکردی نزدیک به GPT-4 دارد. معماری این مدل شامل توجه چندپرسشی (Multiquery Attention) و بلوکهای رمزگشای موازی است. راهاندازی و اجرای استنتاج بر روی این مدل در حالت عادی (Unquantized)، نیازمند حدود ۶۴۰ گیگابایت حافظه VRAM است.
در زیرساختهای متکی بر معماری Hopper (مانند پردازندههای A100)، این میزان حافظه معادل استفاده از هشت پردازنده ۸۰ گیگابایتی است که هزینههای نگهداری آن به دهها هزار دلار در ماه میرسد. حتی با استفاده از تکنیکهای فشردهسازی و کاهش دقت به ۴ بیت (INT4) یا ۸ بیت، استقرار این مدل حداقل به ۳۲۰ تا ۴۰۰ گیگابایت VRAM و ۵ الی ۸ پردازنده فیزیکی نیاز دارد. مشکل اساسی در این معماریهای قدیمی این است که توزیع یک مدل بر روی تعداد زیادی از کارتهای فیزیکی، به دلیل تاخیر در ارتباطات بینتراشهای، باعث افت شدید سرعت تولید توکن به زیر ۴ الی ۸ توکن بر ثانیه میشود.
در مقابل، معماری Rubin با فراهم آوردن ۲۸۸ گیگابایت حافظه HBM4 در هر پردازنده، معادلات زیرساختی را کاملاً دگرگون میسازد. مدل Falcon 180B در حالت کوانتایز شده، به جای نیاز به یک رک کامل از پردازندههای A100، میتواند به راحتی در پیکربندی یک “ابررسانای Vera Rubin” (Vera Rubin Superchip) که از یک پردازنده Vera CPU و دو پردازنده گرافیکی R100 (مجموعاً ۵۷۶ گیگابایت HBM4) تشکیل شده است، مستقر شود. این ادغام به معنای کاهش فاحش سربار ارتباطی و افزایش خیرهکننده خروجی مدل است.
هنگامی که بحث مدلهای مبتنی بر MoE در مقیاس تریلیون پارامتری مطرح میشود، برتریهای Rubin محسوستر است. دادههای بنچمارک انویدیا نشان میدهند که در اجرای استنتاج مدلهایی نظیر Kimi-K2-Thinking که دارای فرآیندهای استدلالی عمیق و پنجرههای ۳۲ هزار توکنی هستند، پلتفرم رَک مقیاس Vera Rubin NVL72 میتواند خروجی توکنها را به ازای هر مگاوات انرژی مصرفی تا ۱۰ برابر نسبت به سیستم مشابه GB200 نسل Blackwell افزایش دهد. همچنین در بحث آموزش مدلهای MoE ده تریلیون پارامتری، سیستم Vera Rubin NVL72 به لطف ارتباطات پرسرعت و موتورهای تنسور جدید، میتواند مدل را با استفاده از یکچهارم تعداد پردازندههایی که در سیستمهای Blackwell مورد نیاز است، در همان بازه زمانی استاندارد آموزش دهد.
معماری شبکه و ارتباطات پرسرعت (NVLink 6)
در دیتاسنترهای مقیاسبزرگ و “کارخانههای هوش مصنوعی” (AI Factories)، قدرت پردازشی تراشهها تنها زمانی قابل استفاده است که شبکه ارتباطی بتواند دادهها را بدون تاخیر بین آنها جابهجا کند. پلتفرم Vera Rubin به همراه نسل ششم معماری ارتباطی NVLink (NVLink 6) معرفی شده است که استانداردهای شبکهسازی را در مقیاس رک بازنویسی کرده است.
فناوری NVLink 6 پهنای باند دوطرفهای معادل ۳.۶ ترابایت بر ثانیه به ازای هر پردازنده گرافیکی فراهم میکند که دقیقاً دو برابر پهنای باند ۱.۸ ترابایتیِ NVLink 5 در نسل Blackwell است. این ارتباطات از طریق سوئیچهای اختصاصی NVLink مدیریت میشوند. در معماری یک رک کامل مانند Vera Rubin NVL72 (شامل ۷۲ پردازنده گرافیکی و ۳۶ پردازنده مرکزی)، سوئیچهای NVLink 6 با استفاده از شبکهای متشکل از ۵۰۰۰ کابل نوری و مسی بدون کور در ساختار سینیهای ماژولار (Switch Trays)، پهنای باند ارتباطی تجمیعی ۲۶۰ ترابایت بر ثانیه را برای تمام پردازندهها در یک توپولوژی همهبههمه (All-to-All) فراهم میآورند.
یکی از بزرگترین مزیتهای NVLink 6 نسبت به شبکههای اترنت سنتی (Ethernet)، توانایی محاسبات درونشبکهای (In-network Compute) است. سینیهای سوئیچ NVLink 6 در مجموع قابلیت پردازش ۱۳۰ ترا-فلاپس (TFLOPS) عملیات تقلیلی (مانند All-Reduce) را در فرمت FP8 دارا هستند. این ویژگی باعث میشود تا عملیاتهای جمعی، بدون اشغال کردن چرخههای پردازشیِ تراشههای اصلی Rubin انجام شوند. نتایج شبیهسازیها حاکی از آن است که در مدلهای سنگینی مانند DeepSeek-R1 یا مدلهای تریلیون پارامتری، NVLink 6 توان عملیاتی فاز رمزگشایی را نسبت به پیشرفتهترین راهحلهای اترنت موجود تا ۲.۳ برابر، و نرخ انتقال بستههای داده را تا ۱۰ برابر افزایش داده و همزمان تاخیر را به یکسوم کاهش میدهد.
برای رفع چالش همگامسازی ارتباطات در شبکههای دیتاسنتر، مهندسان معماری Rubin از پروتکل “نوشتنهای شمارششده” (Counted Writes) رونمایی کردهاند. در معماریهای سنتی، انتقال داده بین دو پردازنده نیازمند ارسال مداوم تاییدیهها (Acknowledgments) و پرچمهای اتمیک بود که منجر به توقف موقت پردازندهها میشد. در معماری Rubin، ارتباطات توسط دستگاه ارسالکننده کنترل میشود (Device-initiated) و پردازنده دریافتکننده تنها با بررسی یک متغیر شمارنده، اتمام موفقیتآمیز انتقال را متوجه میشود. این کاهش چشمگیر در ترافیک کنترلی شبکه، موجب میشود تا پردازندههای متصل در شبکههای مقیاسبزرگ، زمان بیشتری را به محاسبه و زمان کمتری را به انتظار برای دستدهی (Handshake) شبکه اختصاص دهند.
علاوه بر شبکه درونرکی، پلتفرم Rubin برای ارتباطات برونرکی و مقیاسپذیری افقی (Scale-out) تا سطح صدها هزار پردازنده، از واحدهای پردازش داده BlueField-4 DPU (با پهنای باند ۱.۶ ترابیت بر ثانیه) و کارتهای شبکه ConnectX-9 SuperNIC (با پهنای باند ۸۰۰ تا ۱۶۰۰ گیگابیت بر ثانیه) بر بستر فناوریهای Spectrum-6 Ethernet و Quantum-X800 InfiniBand استفاده میکند که ترافیک ناهمگام و انفجاری بارهای کاری هوش مصنوعی را در سراسر دیتاسنتر مدیریت مینماید.
جایگاه Rubin در زیرساختهای مجازیسازی و کلاد
ارائهدهندگان خدمات ابری و سازمانهای بزرگ تجاری همواره به دنبال بهینهسازی نرخ بهرهوری از سختافزارهای گرانقیمت خود هستند. در این میان، مجازیسازی پردازندههای گرافیکی به ابزاری حیاتی برای تخصیص بهینه منابع به بارهای کاری متنوع تبدیل شده است. اهمیت تخصیص منابع گرافیکی در دیتاسنترهای مدرن این موضوع را به تفصیل مورد بررسی قرار داده است.
معماری پردازندههای انویدیا از زمان معرفی قابلیت “پردازنده گرافیکی چندنمونهای” (MIG – Multi-Instance GPU) در مسیر تکامل مجازیسازی گام برداشته است و نسل Blackwell و Rubin اوج بلوغ این فناوری را به نمایش میگذارند. برخلاف روشهای سنتیِ مجازیسازی که مبتنی بر تخصیص زمانی (Time-slicing) بودند و منابع مشترک به صورت نوبتی بین ماشینهای مجازی به اشتراک گذاشته میشدند، فناوری MIG پردازنده فیزیکی را به صورت مکانی (Spatial Partitioning) در سطح سختافزار به چندین نمونه کاملاً مجزا تقسیم میکند. هر نمونه مستقل، دارای هستههای محاسباتی، حافظه اختصاصی و پهنای باند کاملاً ایزوله است که تضمینکننده کیفیت خدمات (QoS) برای کاربران سازمانی خواهد بود.
انویدیا اخیراً با معرفی نرمافزار NVIDIA vGPU 20 و کارت گرافیک سازمانی RTX PRO 4500 Blackwell Server Edition، قدرت مجازیسازی در سطح رکها را به شدت افزایش داده است. تراشه RTX PRO 4500 با مصرف برق تنها ۱۶۵ وات و استفاده از سیستم خنککننده پسیو، مجهز به ۳۲ گیگابایت حافظه GDDR7 (با قابلیت تصحیح خطا یا ECC) و پهنای باند ۸۰۰ گیگابایت بر ثانیه است و میتواند از طریق فناوری MIG به دو نمونه کاملاً ایزوله ۱۶ گیگابایتی تقسیم شود.
در زیرساختهای دیتاسنتر که بعدها میزبان تراشههای قدرتمندتر Rubin نیز خواهند بود، یک سازمان میتواند به کمک پلتفرمهای مدیریت مجازیسازی مانند VMware vSphere، تراشههای فیزیکی را بسته به نیاز به پروفایلهای متنوع (مانند 3B برای کارمندان اداری، 4Q برای طراحان ایستگاههای کاری و 16Q برای پردازش داده) تخصیص دهد.
ترکیب قابلیتهای MIG با پشتیبانی از PCIe Gen 5 در تراشههای جدید، سرعت انتقال داده از CPU را دو برابر کرده و باعث میشود تا بارهای کاری همزمان نظیر آموزش مدلهای یادگیری ماشین، رندرینگ گرافیکی، استنتاج هوش مصنوعی و دسکتاپهای مجازی (VDI) بدون هیچگونه افت کیفیت و رقابت بر سر منابع، بهطور همزمان در یک دیتاسنتر واحد مدیریت شوند. این معماری ایزوله، به ویژه برای محیطهای چندمستاجره (Multi-tenant) نظیر پلتفرمهای MLOps و سرویسهای ابری عمومی بسیار ایدهآل است.
نتیجهگیری: آیا ارتقا از Blackwell به Rubin برای دیتاسنترها توجیه اقتصادی دارد؟
تصمیمگیری استراتژیک برای ارتقای زیرساختهای هوش مصنوعی از معماری Blackwell به Vera Rubin، نیازمند ارزیابی دقیقی از بارهای کاری، جدولهای زمانی استقرار، و اقتصاد کلان دیتاسنترها است. از منظر شاخصهای کلیدی عملکرد شامل هزینه کل مالکیت (TCO) و بازده عملیاتی (OPEX)، معماری Rubin یک جهش انقلابی محسوب میشود.
ارتقای ظرفیت و سرعت حافظه به ۲۸۸ گیگابایت HBM4 با پهنای باند ۲۲ ترابایت بر ثانیه در هر پردازنده، به دیتاسنترها این امکان را میدهد که سنگینترین مدلهای عاملگرا را با حافظههای پنهان KV عظیم، روی پردازندههای کمتری اجرا کنند. گزارشهای فنی ثابت میکنند که پلتفرم Vera Rubin NVL72 میتواند استنتاج مدلهای پیشرفته استدلالی را با هزینهای معادل یکدهم هزینه سیستمهای Blackwell (به ازای هر میلیون توکن) به انجام برساند و همچنین در آموزش مدلهای پیچیده MoE، تعداد پردازندههای مورد نیاز را تا ۷۵ درصد (یکچهارم ظرفیت Blackwell) کاهش دهد.
این سطح از تراکم محاسباتی به این معناست که کارخانههای هوش مصنوعی میتوانند با حفظ محدودیتهای انرژی (Power Envelope) فعلی خود، تا ۱۰ برابر خروجی توکن بیشتری تولید کرده و سهم درآمدی خود را به شدت افزایش دهند.
با این وجود، واقعیتهای زنجیره تامین و زمان عرضه به بازار (Time-to-Market) نقش تعیینکنندهای در تصمیمات مدیران دیتاسنترها ایفا میکند. پردازندههای سری Rubin، بر اساس نقشهراه انویدیا، در نیمه دوم سال ۲۰۲۶ میلادی برای ارائهدهندگان سرویسهای کلان ابری (مانند AWS، Azure و CoreWeave) وارد مدار تولید میشوند. اما صفهای طولانی تقاضا و محدودیتهای تامین تراشههای حافظه HBM4 و فناوری بستهبندی CoWoS-L به این معناست که تخصیص گسترده این سرورها برای بازارهای عمومی و شرکتهای کوچکتر تا اواسط سال ۲۰۲۷ و حتی اوایل ۲۰۲۸ به طول خواهد انجامید.
از این رو، ارتقا و انتظار برای دریافت پردازندههای Rubin تابعی از جدول زمانبندی کسبوکارهاست. برای سازمانها، استارتاپها و آزمایشگاههایی که برنامههای توسعهای آنها ایجاب میکند محصولات هوش مصنوعی خود را در سالهای ۲۰۲۵ تا اواسط ۲۰۲۷ به بازار عرضه کنند، سرمایهگذاری بر روی پلتفرمهای اثباتشده Blackwell (مانند پردازندههای B200، B300 یا نسخههای سرور RTX PRO) منطقیترین گزینه از نظر اقتصادی است، زیرا تاخیر در زمان ورود به بازار، هزینههای عدمالنفع بسیار بیشتری نسبت به مزایای فنی سختافزار نسل بعد به همراه خواهد داشت.
در نقطه مقابل، برای سازندگان زیرساختهای ابری کلان و دیتاسنترهای سطح سازمانی که در حال برنامهریزی استراتژیک برای میزبانی نسل بعدی مدلهای تریلیون-پارامتری، دستیارهای برنامهنویسی با بافتارهای میلیونی و سیستمهای هوش مصنوعی خودمختار در بازه زمانی سالهای ۲۰۲۷ و بعد از آن هستند، پلتفرم Vera Rubin صرفاً یک ارتقای جذاب نیست؛ بلکه تنها معماری مقیاسپذیری است که از طریق رفع گلوگاههای حافظه، ارتباطات NVLink همهبههمه و مصرف انرژی بهینه، بقا و رقابتپذیری اقتصادی آنها را در عصر هوش مصنوعی عاملگرا تضمین مینماید.




دمتون گرم 🔥
به درد خورد ممنون!