چگونه بارهای کاری هوش مصنوعی را روی GPUهای مختلط با سرعت و صرفه اقتصادی اجرا کنیم؟

IBM Research AIUnited States3 دقیقه مطالعه۱۴۰۵/۰۵/۱۶ ساعت ۱۷:۱۵

تصویر مرتبط با خبر: Running AI on mixed hardware for speed and affordability
تصویر مرتبط با خبر: Running AI on mixed hardware for speed and affordability
خلاصه سریع

اصل خبر در چند خط

پژوهشگران آی‌بی‌ام، رد هت و نکسجن هند با استفاده از چارچوب llm-d توانستند سرعت استنتاج مدل‌های هوش مصنوعی را ۳ تا ۵ برابر افزایش دهند. این چارچوب منبع‌باز با هماهنگ‌سازی موتورهای استنتاجی مانند vLLM و SGLang، محدودیت‌های استنتاج با حجم بالا را مدیریت می‌کند. llm-d از یک مسیریاب آگاه از کش KV بهره می‌برد که درخواست‌ها را به نمونه‌های دارای داده‌های پیش‌محاسبه هدایت می‌کند. این رویکرد امکان استفاده از سخت‌افزارهای ناهمگن را فراهم کرده و هزینه‌ها را کاهش می‌دهد. آزمایش‌ها روی ابر نکسجن انجام شد و نتایج نشان داد که مدل‌های IBM Granite و Sarvam AI با کارایی بیشتری اجرا می‌شوند. این فناوری برای شرکتهایی که می‌خواهند کنترل کامل بر زیرساخت خود داشته باشند، مناسب است.

متن خبر

شرح خبر

پژوهشگران آی‌بی‌ام، رد هت و نکسجن هند در آزمایش‌های اخیر خود نشان دادند که استفاده از چارچوب منبع‌باز llm-d می‌تواند سرعت استنتاج مدل‌های هوش مصنوعی را ۳ تا ۵ برابر افزایش داده و توان عملیاتی را دو برابر کند، حتی زمانی که از سخت‌افزارهای مختلف ارائه‌دهندگان گوناگون استفاده می‌شود. این رویکرد که برای اجرای مدل‌های زبانی بزرگ (LLM) روی خوشه‌های GPU ناهمگن طراحی شده، با استفاده از یک مسیریاب آگاه از کش KV، درخواست‌ها را به نمونه‌های vLLM هدایت می‌کند که احتمالاً داده‌های پیش‌محاسبه شده را در حافظه دارند. این فناوری نه تنها هزینه‌ها را کاهش می‌دهد، بلکه کنترل بیشتری بر عملکرد، امنیت داده‌ها و مقیاس‌پذیری زیرساخت‌ها به شرکتها می‌دهد. آزمایش‌ها روی ابر حاکمیت نکسجن انجام شد و نتایج نشان داد که مدل‌های IBM Granite و Sarvam AI با سرعت بیشتری اجرا می‌شوند. پژوهشگران آی‌بی‌ام، رد هت و نکسجن هند با استفاده از چارچوب llm-d توانستند سرعت استنتاج مدل‌های هوش مصنوعی را ۳ تا ۵ برابر افزایش دهند. این چارچوب منبع‌باز با هماهنگ‌سازی موتورهای استنتاجی مانند vLLM و SGLang، محدودیت‌های استنتاج با حجم بالا را مدیریت می‌کند. llm-d از یک مسیریاب آگاه از کش KV بهره می‌برد که درخواست‌ها را به نمونه‌های دارای داده‌های پیش‌محاسبه هدایت می‌کند. این رویکرد امکان استفاده از سخت‌افزارهای ناهمگن را فراهم کرده و هزینه‌ها را کاهش می‌دهد. آزمایش‌ها روی ابر نکسجن انجام شد و نتایج نشان داد که مدل‌های IBM Granite و Sarvam AI با کارایی بیشتری اجرا می‌شوند. این فناوری برای شرکتهایی که می‌خواهند کنترل کامل بر زیرساخت خود داشته باشند، مناسب است. این پیشرفت اهمیت زیادی دارد زیرا چالش‌های اصلی هوش مصنوعی مولد، یعنی نیاز بالای حافظه و استفاده ناکارآمد از GPU، را با استفاده از سخت‌افزارهای مختلط حل می‌کند. این رویکرد نه تنها هزینه‌ها را کاهش می‌دهد، بلکه امکان مقیاس‌پذیری و انعطاف‌پذیری بیشتری را برای شرکتها فراهم می‌کند. علاوه بر این، با کاهش خطر نشت داده‌ها و نقض امنیت، اعتماد شرکتها به استقرار محلی مدل‌ها افزایش می‌یابد. کاهش هزینه‌های زیرساختی، افزایش توان عملیاتی و بهبود کارایی استنتاج مدل‌های هوش مصنوعی می‌تواند به شرکتها کمک کند تا خدمات بیشتری به مشتریان ارائه دهند. این امر به ویژه برای شرکتهایی که در حال انتقال از مرحله آزمایش به مرحله ارائه خدمات به مشتریان هستند، حیاتی است. این فناوری می‌تواند برای شرکتهای ایرانی که به دنبال کاهش هزینه‌ها و بهبود کارایی زیرساخت‌های هوش مصنوعی خود هستند، مفید باشد. با توجه به محدودیت‌های دسترسی به سخت‌افزارهای پیشرفته، استفاده از سخت‌افزارهای ناهمگن می‌تواند راه‌حلی موثر باشد. این رویکرد می‌تواند به شرکتها کمک کند تا با رعایت مقررات حاکمیت دیجیتال، کنترل بیشتری بر داده‌ها و مدل‌های خود داشته باشند. این امر به ویژه برای صنایعی که با داده‌های حساس سروکار دارند، اهمیت دارد. این همکاری بین آی‌بی‌ام، رد هت و نکسجن هند نشان‌دهنده اهمیت روزافزون همکاری‌های بین‌المللی در زمینه فناوری است. هند به عنوان یکی از بازارهای رو به رشد در حوزه ابر و هوش مصنوعی، نقش مهمی در توسعه این فناوری‌ها ایفا می‌کند. IBM Research Blog پژوهشگران آی‌بی‌ام، رد هت و نکسجن با استفاده از چارچوب llm-d توانستند سرعت استنتاج مدل‌های هوش مصنوعی را ۳ تا ۵ برابر افزایش دهند. این فناوری هزینه‌ها را کاهش می‌دهد و کارایی را بهبود می‌بخشد.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

این پیشرفت اهمیت زیادی دارد زیرا چالش‌های اصلی هوش مصنوعی مولد، یعنی نیاز بالای حافظه و استفاده ناکارآمد از GPU، را با استفاده از سخت‌افزارهای مختلط حل می‌کند. این رویکرد نه تنها هزینه‌ها را کاهش می‌دهد، بلکه امکان مقیاس‌پذیری و انعطاف‌پذیری بیشتری را برای شرکتها فراهم می‌کند. علاوه بر این، با کاهش خطر نشت داده‌ها و نقض امنیت، اعتماد شرکتها به استقرار محلی مدل‌ها افزایش می‌یابد.

اثر کسب‌وکاری

کاهش هزینه‌های زیرساختی، افزایش توان عملیاتی و بهبود کارایی استنتاج مدل‌های هوش مصنوعی می‌تواند به شرکتها کمک کند تا خدمات بیشتری به مشتریان ارائه دهند. این امر به ویژه برای شرکتهایی که در حال انتقال از مرحله آزمایش به مرحله ارائه خدمات به مشتریان هستند، حیاتی است.

اثر احتمالی برای ایران

این فناوری می‌تواند برای شرکتهای ایرانی که به دنبال کاهش هزینه‌ها و بهبود کارایی زیرساخت‌های هوش مصنوعی خود هستند، مفید باشد. با توجه به محدودیت‌های دسترسی به سخت‌افزارهای پیشرفته، استفاده از سخت‌افزارهای ناهمگن می‌تواند راه‌حلی موثر باشد.

ارتباط با LegalTech

این رویکرد می‌تواند به شرکتها کمک کند تا با رعایت مقررات حاکمیت دیجیتال، کنترل بیشتری بر داده‌ها و مدل‌های خود داشته باشند. این امر به ویژه برای صنایعی که با داده‌های حساس سروکار دارند، اهمیت دارد.

زاویه رسانه/کشور منبع

IBM Research Blog

برچسب‌ها