۱۸ ترابایت حافظه از راه اترنت در سرور های هوش مصنوعی
استارتاپی با حمایت انویدیا، حافظه شبکه ای جدیدی برای هوش مصنوعی معرفی کرد
یک استارتاپ با پشتیبانی انویدیا سیستمی به نام Emfasys معرفی کرده که می تواند تا ۱۸ ترابایت حافظه DDR5 را از طریق شبکه اترنت به سرورها اضافه کند. این راهکار برای بارهای کاری پردازش خروجی هوش مصنوعی یا استنتاج است (Inference) در مقیاس بزرگ طراحی شده و هدف آن کاهش هزینه پردازش متن و تولید داده های هوش مصنوعی تا ۵۰ درصد است.
چرا حافظه به نقطه محدودکننده تبدیل شده است؟
بسیاری از کاربردهای هوش مصنوعی، مخصوصاً مدل های زبانی بزرگ (LLMها)، به مقدار بسیار زیادی حافظه نیاز دارند. اما افزودن رم بیشتر به سرور های میزبان همیشه امکان پذیر نیست؛ گاهی سخت افزار اجازه نمی دهد یا بسیار پرهزینه است. اینجاست که Emfasys وارد عمل می شود.
این سیستم به سرورها اجازه می دهد با استفاده از اتصال اترنت، به یک استخر حافظه (Memory Pool) عظیم دسترسی پیدا کنند؛ در واقع حافظه ای بیرون از خود سرور اما با سرعتی نزدیک به حافظه داخلی.
جزئیات فنی Emfasys
Emfasys یک سیستم رک مونت (Rack-Compatible) است که بر پایه کارت ACF-S SuperNIC ساخته شده. این کارت شبکه ویژه، توان انتقالی برابر با ۳.۲ ترابیت بر ثانیه (معادل ۴۰۰ گیگابایت بر ثانیه) دارد و تا ۱۸ ترابایت DDR5 را پشتیبانی می کند.
- سرورهای مجهز به ۴ یا ۸ پردازنده گرافیکی (GPU) می توانند از طریق پورت های استاندارد 400G یا 800G Ethernet به این استخر حافظه وصل شوند.
- انتقال داده با استفاده از فناوری RDMA (Remote Direct Memory Access) انجام می شود؛ یعنی پردازنده ها بدون دخالت CPU و بدون کپی اضافه می توانند به حافظه دسترسی مستقیم داشته باشند.
- پروتکل CXL.mem بستر اصلی این دسترسی است که زمان پاسخگویی را در حد چند میکروثانیه پایین می آورد.
به این ترتیب، اضافه کردن Emfasys به یک سرور هوش مصنوعی، تقریباً بی دردسر و بدون تغییر اساسی در معماری سیستم انجام می شود.
نرم افزار و سازگاری
برای استفاده از این استخر حافظه، سرورها به نرم افزار ویژه ای نیاز دارند که توسط Enfabrica ارائه می شود. این نرم افزار وظیفه مدیریت حافظه و پنهان کردن تأخیر انتقال داده را بر عهده دارد. خوشبختانه این ابزار روی سخت افزار و سیستم عامل های فعلی اجرا می شود و از همان رابط های RDMA مرسوم استفاده می کند؛ بنابراین نیازی به تغییرات گسترده یا بازطراحی زیرساخت نیست.
کاربردهای کلیدی
Emfasys دقیقاً برای شرایطی ساخته شده که مدل های هوش مصنوعی نیاز به:
- پرامپت های طولانی تر (ورودی های حجیم تر)،
- پنجره های زمینه ای بزرگ تر (Context Windows)،
- یا چند عامل همزمان (Multi-Agent Systems) دارند.
در این سناریوها، فشار زیادی روی حافظه HBM متصل به GPU وارد می شود؛ حافظه ای که هم ظرفیت محدودی دارد و هم بسیار گران است. استخر حافظه خارجی به دیتاسنترها امکان می دهد انعطاف پذیرتر عمل کنند: در صورت نیاز حافظه اضافه کنند، بدون اینکه مجبور باشند GPUهای گران تر بخرند.
مزایا برای سرور
- استفاده بهینه تر از GPUها: حافظه گران HBM کمتر هدر می رود.
- کاهش هزینه کلی: به جای خرید GPUهای جدید، حافظه خارجی به سرورها اضافه می شود.
- افزایش بهره وری: منابع محاسباتی بهتر استفاده می شوند.
- تقسیم متوازن بار: کارهای تولید توکن (Token Generation) روی چند سرور توزیع می شود و گلوگاه ها حذف می شوند.
به گفته Enfabrica، این رویکرد می تواند در سناریوهایی با متن طولانی یا پردازش های پرحجم، هزینه هر توکن تولیدی را تا ۵۰ درصد پایین بیاورد.
دیدگاه مدیرعامل Enfabrica
Rochan Sankar، مدیرعامل شرکت، می گوید:
«استنتاج هوش مصنوعی با دو مشکل بزرگ روبه رو است: یکی مقیاس پذیری پهنای باند حافظه و دیگری محدودیت ظرفیت حافظه. هرچه استنتاج بیشتر به سمت عامل محور و حافظه محور شدن حرکت کند، روش های فعلی پاسخگو نخواهند بود. ما Emfasys را ساختیم تا یک شبکه حافظه هوش مصنوعی در مقیاس رک ایجاد کنیم و این مشکلات را به شکلی نو حل کنیم. مشتریان ما مشتاق همکاری هستند تا معماری جدیدی برای جابه جایی حافظه بسازیم و اقتصاد توکن را بهبود دهیم.»
مطالب مفید :