چگونه بارهای کاری هوش مصنوعی را روی GPUهای مختلط با سرعت و صرفه اقتصادی اجرا کنیم؟
IBM Research AIUnited States3 دقیقه مطالعه۱۴۰۵/۰۵/۱۶ ساعت ۱۷:۱۵
تصویر مرتبط با خبر: Running AI on mixed hardware for speed and affordability
خلاصه سریع
اصل خبر در چند خط
پژوهشگران آیبیام، رد هت و نکسجن هند با استفاده از چارچوب llm-d توانستند سرعت استنتاج مدلهای هوش مصنوعی را ۳ تا ۵ برابر افزایش دهند.
این چارچوب منبعباز با هماهنگسازی موتورهای استنتاجی مانند vLLM و SGLang، محدودیتهای استنتاج با حجم بالا را مدیریت میکند.
llm-d از یک مسیریاب آگاه از کش KV بهره میبرد که درخواستها را به نمونههای دارای دادههای پیشمحاسبه هدایت میکند.
این رویکرد امکان استفاده از سختافزارهای ناهمگن را فراهم کرده و هزینهها را کاهش میدهد.
آزمایشها روی ابر نکسجن انجام شد و نتایج نشان داد که مدلهای IBM Granite و Sarvam AI با کارایی بیشتری اجرا میشوند.
این فناوری برای شرکتهایی که میخواهند کنترل کامل بر زیرساخت خود داشته باشند، مناسب است.
متن خبر
شرح خبر
پژوهشگران آیبیام، رد هت و نکسجن هند در آزمایشهای اخیر خود نشان دادند که استفاده از چارچوب منبعباز llm-d میتواند سرعت استنتاج مدلهای هوش مصنوعی را ۳ تا ۵ برابر افزایش داده و توان عملیاتی را دو برابر کند، حتی زمانی که از سختافزارهای مختلف ارائهدهندگان گوناگون استفاده میشود.
این رویکرد که برای اجرای مدلهای زبانی بزرگ (LLM) روی خوشههای GPU ناهمگن طراحی شده، با استفاده از یک مسیریاب آگاه از کش KV، درخواستها را به نمونههای vLLM هدایت میکند که احتمالاً دادههای پیشمحاسبه شده را در حافظه دارند.
این فناوری نه تنها هزینهها را کاهش میدهد، بلکه کنترل بیشتری بر عملکرد، امنیت دادهها و مقیاسپذیری زیرساختها به شرکتها میدهد.
آزمایشها روی ابر حاکمیت نکسجن انجام شد و نتایج نشان داد که مدلهای IBM Granite و Sarvam AI با سرعت بیشتری اجرا میشوند.
پژوهشگران آیبیام، رد هت و نکسجن هند با استفاده از چارچوب llm-d توانستند سرعت استنتاج مدلهای هوش مصنوعی را ۳ تا ۵ برابر افزایش دهند.
این چارچوب منبعباز با هماهنگسازی موتورهای استنتاجی مانند vLLM و SGLang، محدودیتهای استنتاج با حجم بالا را مدیریت میکند.
llm-d از یک مسیریاب آگاه از کش KV بهره میبرد که درخواستها را به نمونههای دارای دادههای پیشمحاسبه هدایت میکند.
این رویکرد امکان استفاده از سختافزارهای ناهمگن را فراهم کرده و هزینهها را کاهش میدهد.
آزمایشها روی ابر نکسجن انجام شد و نتایج نشان داد که مدلهای IBM Granite و Sarvam AI با کارایی بیشتری اجرا میشوند.
این فناوری برای شرکتهایی که میخواهند کنترل کامل بر زیرساخت خود داشته باشند، مناسب است.
این پیشرفت اهمیت زیادی دارد زیرا چالشهای اصلی هوش مصنوعی مولد، یعنی نیاز بالای حافظه و استفاده ناکارآمد از GPU، را با استفاده از سختافزارهای مختلط حل میکند.
این رویکرد نه تنها هزینهها را کاهش میدهد، بلکه امکان مقیاسپذیری و انعطافپذیری بیشتری را برای شرکتها فراهم میکند.
علاوه بر این، با کاهش خطر نشت دادهها و نقض امنیت، اعتماد شرکتها به استقرار محلی مدلها افزایش مییابد.
کاهش هزینههای زیرساختی، افزایش توان عملیاتی و بهبود کارایی استنتاج مدلهای هوش مصنوعی میتواند به شرکتها کمک کند تا خدمات بیشتری به مشتریان ارائه دهند.
این امر به ویژه برای شرکتهایی که در حال انتقال از مرحله آزمایش به مرحله ارائه خدمات به مشتریان هستند، حیاتی است.
این فناوری میتواند برای شرکتهای ایرانی که به دنبال کاهش هزینهها و بهبود کارایی زیرساختهای هوش مصنوعی خود هستند، مفید باشد.
با توجه به محدودیتهای دسترسی به سختافزارهای پیشرفته، استفاده از سختافزارهای ناهمگن میتواند راهحلی موثر باشد.
این رویکرد میتواند به شرکتها کمک کند تا با رعایت مقررات حاکمیت دیجیتال، کنترل بیشتری بر دادهها و مدلهای خود داشته باشند.
این امر به ویژه برای صنایعی که با دادههای حساس سروکار دارند، اهمیت دارد.
این همکاری بین آیبیام، رد هت و نکسجن هند نشاندهنده اهمیت روزافزون همکاریهای بینالمللی در زمینه فناوری است.
هند به عنوان یکی از بازارهای رو به رشد در حوزه ابر و هوش مصنوعی، نقش مهمی در توسعه این فناوریها ایفا میکند.
IBM Research Blog پژوهشگران آیبیام، رد هت و نکسجن با استفاده از چارچوب llm-d توانستند سرعت استنتاج مدلهای هوش مصنوعی را ۳ تا ۵ برابر افزایش دهند.
این فناوری هزینهها را کاهش میدهد و کارایی را بهبود میبخشد.
این صفحه خلاصه و تحلیل فارسی خبر را نمایش میدهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.
تحلیل تحریریه
ابعاد مهم خبر
چرا مهم است؟
این پیشرفت اهمیت زیادی دارد زیرا چالشهای اصلی هوش مصنوعی مولد، یعنی نیاز بالای حافظه و استفاده ناکارآمد از GPU، را با استفاده از سختافزارهای مختلط حل میکند.
این رویکرد نه تنها هزینهها را کاهش میدهد، بلکه امکان مقیاسپذیری و انعطافپذیری بیشتری را برای شرکتها فراهم میکند.
علاوه بر این، با کاهش خطر نشت دادهها و نقض امنیت، اعتماد شرکتها به استقرار محلی مدلها افزایش مییابد.
اثر کسبوکاری
کاهش هزینههای زیرساختی، افزایش توان عملیاتی و بهبود کارایی استنتاج مدلهای هوش مصنوعی میتواند به شرکتها کمک کند تا خدمات بیشتری به مشتریان ارائه دهند.
این امر به ویژه برای شرکتهایی که در حال انتقال از مرحله آزمایش به مرحله ارائه خدمات به مشتریان هستند، حیاتی است.
اثر احتمالی برای ایران
این فناوری میتواند برای شرکتهای ایرانی که به دنبال کاهش هزینهها و بهبود کارایی زیرساختهای هوش مصنوعی خود هستند، مفید باشد.
با توجه به محدودیتهای دسترسی به سختافزارهای پیشرفته، استفاده از سختافزارهای ناهمگن میتواند راهحلی موثر باشد.
ارتباط با LegalTech
این رویکرد میتواند به شرکتها کمک کند تا با رعایت مقررات حاکمیت دیجیتال، کنترل بیشتری بر دادهها و مدلهای خود داشته باشند.
این امر به ویژه برای صنایعی که با دادههای حساس سروکار دارند، اهمیت دارد.