ارائه مدل‌های NVFP4 بر روی شتاب‌دهنده‌های AMD Instinct MI355: راه‌حلی برای استقرار مستقیم بدون تبدیل آفلاین

AMD ROCm BlogUS / Global3 دقیقه مطالعه۱۴۰۵/۰۵/۳۰ ساعت ۲۱:۰۰

تصویر مرتبط با خبر: Serving NVFP4 Models on AMD Instinct™ MI355 Accelerators
تصویر مرتبط با خبر: Serving NVFP4 Models on AMD Instinct™ MI355 Accelerators
خلاصه سریع

اصل خبر در چند خط

AMD خط لوله‌ای برای شبیه‌سازی مدل‌های NVFP4 بر روی شتاب‌دهنده‌های MI355 معرفی کرد که امکان استقرار مستقیم این مدل‌ها را بدون تبدیل آفلاین فراهم می‌کند. این خط لوله در vLLM یکپارچه شده و وزن‌ها را در حین محاسبات GEMM به BF16 تبدیل می‌کند. حافظه GPU به اندازه ردپای یک لایه محدود می‌شود و فعال‌سازی‌ها از طریق یک دور کامل کوانتیزه/دیکوانتیزه عبور می‌کنند. دو مسیر متراکم و MoE برای پیاده‌سازی این کار وجود دارد. AMD-Quark نیز برای تولید نقاط کنترل NVFP4 استفاده می‌شود. دقت مدل‌ها در معیارهای GSM8K و MMLU-Pro ارزیابی شده است.

متن خبر

شرح خبر

AMD با معرفی یک خط لوله شبیه‌سازی مبتنی بر vLLM، امکان استقرار مستقیم مدل‌های کوانتیزه‌شده NVFP4 را بر روی شتاب‌دهنده‌های Instinct MI355 فراهم کرده است. این شتاب‌دهنده‌ها که بر پایه معماری CDNA4 ساخته شده‌اند، پیش از این قادر به اجرای بومی تنسورهای NVFP4 نبودند و کاربران مجبور بودند مدل‌ها را به فرمت‌های دیگر تبدیل کنند. خط لوله جدید، وزن‌های NVFP4 را در حین محاسبات GEMM به BF16 تبدیل می‌کند و با مدیریت هوشمندانه حافظه، فشار حافظه GPU را به اندازه ردپای یک لایه محدود نگه می‌دارد. این رویکرد، دقت عددی فرمت اصلی را حفظ کرده و برای مدل‌های متراکم و MoE مانند Kimi-K2.6 و Qwen3-8B قابل استفاده است. AMD-Quark نیز به عنوان ابزاری برای تولید نقاط کنترل سازگار NVFP4 معرفی شده است. AMD خط لوله‌ای برای شبیه‌سازی مدل‌های NVFP4 بر روی شتاب‌دهنده‌های MI355 معرفی کرد که امکان استقرار مستقیم این مدل‌ها را بدون تبدیل آفلاین فراهم می‌کند. این خط لوله در vLLM یکپارچه شده و وزن‌ها را در حین محاسبات GEMM به BF16 تبدیل می‌کند. حافظه GPU به اندازه ردپای یک لایه محدود می‌شود و فعال‌سازی‌ها از طریق یک دور کامل کوانتیزه/دیکوانتیزه عبور می‌کنند. دو مسیر متراکم و MoE برای پیاده‌سازی این کار وجود دارد. AMD-Quark نیز برای تولید نقاط کنترل NVFP4 استفاده می‌شود. دقت مدل‌ها در معیارهای GSM8K و MMLU-Pro ارزیابی شده است. این پیشرفت اهمیت زیادی دارد زیرا امکان استفاده از مدل‌های پیشرو با فرمت NVFP4 را بر روی سخت‌افزار AMD فراهم می‌کند، بدون نیاز به تبدیل پرهزینه و زمان‌بر. این امر می‌تواند هزینه‌ها و زمان استقرار را به طور قابل توجهی کاهش دهد و انعطاف‌پذیری بیشتری برای کاربران فراهم کند. علاوه بر این، حفظ دقت عددی فرمت اصلی، اعتماد به نتایج را افزایش می‌دهد و امکان مقایسه عادلانه‌تر بین سخت‌افزارهای مختلف را فراهم می‌کند. این فناوری می‌تواند بازار شتاب‌دهنده‌های AMD را در برابر رقبا مانند NVIDIA تقویت کند و جذابیت این پلتفرم را برای شرکت‌ها و پژوهشگران افزایش دهد. کاهش هزینه‌های تبدیل و استقرار مدل‌ها می‌تواند منجر به صرفه‌جویی قابل توجهی در پروژه‌های بزرگ مقیاس شود و سرعت توسعه را افزایش دهد. در ایران، این فناوری می‌تواند برای پژوهشگران و شرکت‌های فعال در حوزه هوش مصنوعی مفید باشد، به ویژه آن‌هایی که به دنبال راه‌حل‌های اقتصادی‌تر برای استقرار مدل‌های بزرگ هستند. با توجه به محدودیت‌های دسترسی به سخت‌افزارهای پیشرفته، استفاده از شتاب‌دهنده‌های AMD می‌تواند گزینه‌ای قابل دسترس‌تر باشد. این پیشرفت می‌تواند تأثیراتی بر مالکیت فکری و استانداردهای فنی داشته باشد، به ویژه در زمینه فرمت‌های کوانتیزه‌سازی. همکاری بین AMD، NVIDIA و جامعه منبع‌باز می‌تواند به توسعه استانداردهای مشترک و بهبود سازگاری بین پلتفرم‌های مختلف منجر شود. این فناوری می‌تواند تأثیراتی بر رقابت‌های ژئوپلیتیکی در حوزه فناوری داشته باشد، به ویژه بین ایالات متحده و چین. توانایی استقرار مدل‌های پیشرو بر روی سخت‌افزارهای مختلف می‌تواند تعادل قدرت در بازار هوش مصنوعی را تغییر دهد. فنی و تخصصی AMD با معرفی خط لوله شبیه‌سازی، استقرار مستقیم مدل‌های NVFP4 را بر روی MI355 امکان‌پذیر کرد. این فناوری دقت را حفظ و هزینه‌ها را کاهش می‌دهد.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

این پیشرفت اهمیت زیادی دارد زیرا امکان استفاده از مدل‌های پیشرو با فرمت NVFP4 را بر روی سخت‌افزار AMD فراهم می‌کند، بدون نیاز به تبدیل پرهزینه و زمان‌بر. این امر می‌تواند هزینه‌ها و زمان استقرار را به طور قابل توجهی کاهش دهد و انعطاف‌پذیری بیشتری برای کاربران فراهم کند. علاوه بر این، حفظ دقت عددی فرمت اصلی، اعتماد به نتایج را افزایش می‌دهد و امکان مقایسه عادلانه‌تر بین سخت‌افزارهای مختلف را فراهم می‌کند.

اثر کسب‌وکاری

این فناوری می‌تواند بازار شتاب‌دهنده‌های AMD را در برابر رقبا مانند NVIDIA تقویت کند و جذابیت این پلتفرم را برای شرکت‌ها و پژوهشگران افزایش دهد. کاهش هزینه‌های تبدیل و استقرار مدل‌ها می‌تواند منجر به صرفه‌جویی قابل توجهی در پروژه‌های بزرگ مقیاس شود و سرعت توسعه را افزایش دهد.

اثر احتمالی برای ایران

در ایران، این فناوری می‌تواند برای پژوهشگران و شرکت‌های فعال در حوزه هوش مصنوعی مفید باشد، به ویژه آن‌هایی که به دنبال راه‌حل‌های اقتصادی‌تر برای استقرار مدل‌های بزرگ هستند. با توجه به محدودیت‌های دسترسی به سخت‌افزارهای پیشرفته، استفاده از شتاب‌دهنده‌های AMD می‌تواند گزینه‌ای قابل دسترس‌تر باشد.

ارتباط با LegalTech

این پیشرفت می‌تواند تأثیراتی بر مالکیت فکری و استانداردهای فنی داشته باشد، به ویژه در زمینه فرمت‌های کوانتیزه‌سازی. همکاری بین AMD، NVIDIA و جامعه منبع‌باز می‌تواند به توسعه استانداردهای مشترک و بهبود سازگاری بین پلتفرم‌های مختلف منجر شود.

زاویه رسانه/کشور منبع

فنی و تخصصی

برچسب‌ها