آوردن استنتاج پخش ۴-بیت Nunchaku به کتابخانه Diffusers: انقلاب در سرعت و کارایی مدل‌های انتشار

Hugging Face BlogUnited States3 دقیقه مطالعه۱۴۰۵/۰۵/۱۴ ساعت ۱۱:۴۵

تصویر مرتبط با خبر: Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
تصویر مرتبط با خبر: Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
خلاصه سریع

اصل خبر در چند خط

هاگینگ فیس پشتیبانی بومی از چکپوینت‌های Nunchaku را به کتابخانه Diffusers اضافه کرده است. این فناوری با استفاده از روش کوانتایز SVDQuant، لایه‌های اصلی ترنسفورمر را با وزنها و فعال‌سازی‌های ۴-بیت اجرا می‌کند. نتیجه، کاهش مصرف حافظه و افزایش سرعت استنتاج است. به عنوان مثال، یک مدل Nunchaku NVFP4 روی RTX 5090 می‌تواند تصویر ۱۰۲۴×۱۰۲۴ را در ۱.۷ ثانیه با مصرف ۱۲ گیگابایت حافظه تولید کند. این چکپوینت‌ها نیازمند GPUهای NVIDIA Blackwell هستند و برای نسل‌های قبلی، انواع INT4 در دسترس است. ابزار diffuse-compressor نیز به کاربران اجازه می‌دهد معماری‌های جدید را کوانتایز و منتشر کنند. این پیشرفت بدون نیاز به موتور استنتاج جداگانه یا کامپایل محلی CUDA انجام می‌شود.

متن خبر

شرح خبر

هاگینگ فیس با معرفی پشتیبانی بومی از چکپوینت‌های Nunchaku در کتابخانه Diffusers، گامی بزرگ در بهینه‌سازی مدل‌های انتشار (Diffusion) برداشته است. این فناوری جدید، با استفاده از روش کوانتایز SVDQuant، امکان اجرا کردن لایه‌های اصلی ترنسفورمر با وزنها و فعال‌سازی‌های ۴-بیت (W4A4) را فراهم می‌کند. نتیجه این کار، کاهش چشمگیر مصرف حافظه (VRAM) و افزایش سرعت حلقه نویززدایی است. به عنوان مثال، یک مدل Nunchaku NVFP4 می‌تواند تصویر ۱۰۲۴×۱۰۲۴ را در حدود ۱.۷ ثانیه روی کارت گرافیک RTX 5090 تولید کند، در حالی که مصرف حافظه اوج تنها ۱۲ گیگابایت است (در مقایسه با ۲۴ گیگابایت برای پایپلاین BF16). این پیشرفت نه تنها نیازمند کتابخانه استنتاج جداگانه‌ای نیست، بلکه با استفاده از بسته کرنل‌های Hugging Face، به سادگی و بدون کامپایل محلی CUDA قابل اجرا است. علاوه بر این، ابزار diffuse-compressor به کاربران امکان می‌دهد معماری‌های جدید را خود کوانتایز کرده و به عنوان مخازن استاندارد Diffusers منتشر کنند. این نوآوری برای توسعه‌دهندگان و پژوهشگران هوش مصنوعی در ایران نیز فرصت‌های جدیدی برای کار با مدل‌های سنگین در سخت‌افزارهای محدودتر فراهم می‌آورد. هاگینگ فیس پشتیبانی بومی از چکپوینت‌های Nunchaku را به کتابخانه Diffusers اضافه کرده است. این فناوری با استفاده از روش کوانتایز SVDQuant، لایه‌های اصلی ترنسفورمر را با وزنها و فعال‌سازی‌های ۴-بیت اجرا می‌کند. نتیجه، کاهش مصرف حافظه و افزایش سرعت استنتاج است. به عنوان مثال، یک مدل Nunchaku NVFP4 روی RTX 5090 می‌تواند تصویر ۱۰۲۴×۱۰۲۴ را در ۱.۷ ثانیه با مصرف ۱۲ گیگابایت حافظه تولید کند. این چکپوینت‌ها نیازمند GPUهای NVIDIA Blackwell هستند و برای نسل‌های قبلی، انواع INT4 در دسترس است. ابزار diffuse-compressor نیز به کاربران اجازه می‌دهد معماری‌های جدید را کوانتایز و منتشر کنند. این پیشرفت بدون نیاز به موتور استنتاج جداگانه یا کامپایل محلی CUDA انجام می‌شود. این خبر اهمیت زیادی دارد زیرا برای اولین بار، کوانتایز ۴-بیت با حفظ دقت و افزایش سرعت در مدل‌های انتشار امکان‌پذیر شده است. روش SVDQuant با انتقال مقادیر پراکنده فعال‌سازی به وزنها، مشکل اصلی کوانتایز در ترنسفورمرهای انتشار را حل می‌کند. این امر نه تنها مصرف حافظه را به نصف کاهش می‌دهد، بلکه سرعت استنتاج را نیز بهبود می‌بخشد. برای پژوهشگران و شرکت‌های ایرانی که با محدودیت‌های سخت‌افزاری مواجه هستند، این فناوری می‌تواند دسترسی به مدل‌های پیشرفته را آسان‌تر کند و هزینه‌های محاسباتی را به طور قابل توجهی کاهش دهد. این فناوری می‌تواند هزینه‌های زیرساخت ابری و محلی را برای شرکت‌های فعال در حوزه هوش مصنوعی کاهش دهد. استارت‌آپ‌ها و شرکت‌های کوچک‌تر می‌توانند با سخت‌افزارهای محدودتر، مدل‌های پیشرفته را اجرا کنند. همچنین، این پیشرفت می‌تواند بازار ابزارهای بهینه‌سازی مدل‌های هوش مصنوعی را دگرگون کند و فرصت‌های جدیدی برای ارائه خدمات پردازش ابری ارزان‌تر ایجاد نماید. برای ایران، این فناوری می‌تواند دسترسی پژوهشگران و شرکت‌ها به مدل‌های پیشرفته هوش مصنوعی را بدون نیاز به سخت‌افزارهای گران‌قیمت آسان‌تر کند. این امر می‌تواند منجر به رشد سریع‌تر پروژه‌های محلی در حوزه تولید محتوا، پردازش تصویر و سایر کاربردهای هوش مصنوعی شود. همچنین، کاهش مصرف حافظه می‌تواند برای مراکز داده‌ای که با محدودیت‌های سخت‌افزاری مواجه هستند، مفید باشد. این پیشرفت می‌تواند بر قوانین و مقررات مربوط به استفاده از مدل‌های هوش مصنوعی تأثیر بگذارد، به ویژه در زمینه‌های مالکیت فکری و استفاده از فناوری‌های کوانتایز شده. همچنین، ممکن است نیاز به استانداردهای جدیدی برای ارزیابی دقت و کارایی مدل‌های کوانتایز شده باشد. این فناوری می‌تواند تأثیراتی بر رقابت بین شرکت‌های آمریکایی و چینی در حوزه هوش مصنوعی داشته باشد. همچنین، دسترسی آسان‌تر به مدل‌های پیشرفته می‌تواند تعادل قدرت در حوزه فناوری را تغییر دهد. factual, technical, vendor_announcement هاگینگ فیس با معرفی پشتیبانی بومی از چکپوینت‌های Nunchaku، مصرف حافظه را نصف و سرعت استنتاج را افزایش داد. این فناوری برای پژوهشگران ایرانی نیز فرصت‌های جدیدی ایجاد می‌کند.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

این خبر اهمیت زیادی دارد زیرا برای اولین بار، کوانتایز ۴-بیت با حفظ دقت و افزایش سرعت در مدل‌های انتشار امکان‌پذیر شده است. روش SVDQuant با انتقال مقادیر پراکنده فعال‌سازی به وزنها، مشکل اصلی کوانتایز در ترنسفورمرهای انتشار را حل می‌کند. این امر نه تنها مصرف حافظه را به نصف کاهش می‌دهد، بلکه سرعت استنتاج را نیز بهبود می‌بخشد. برای پژوهشگران و شرکت‌های ایرانی که با محدودیت‌های سخت‌افزاری مواجه هستند، این فناوری می‌تواند دسترسی به مدل‌های پیشرفته را آسان‌تر کند و هزینه‌های محاسباتی را به طور قابل توجهی کاهش دهد.

اثر کسب‌وکاری

این فناوری می‌تواند هزینه‌های زیرساخت ابری و محلی را برای شرکت‌های فعال در حوزه هوش مصنوعی کاهش دهد. استارت‌آپ‌ها و شرکت‌های کوچک‌تر می‌توانند با سخت‌افزارهای محدودتر، مدل‌های پیشرفته را اجرا کنند. همچنین، این پیشرفت می‌تواند بازار ابزارهای بهینه‌سازی مدل‌های هوش مصنوعی را دگرگون کند و فرصت‌های جدیدی برای ارائه خدمات پردازش ابری ارزان‌تر ایجاد نماید.

اثر احتمالی برای ایران

برای ایران، این فناوری می‌تواند دسترسی پژوهشگران و شرکت‌ها به مدل‌های پیشرفته هوش مصنوعی را بدون نیاز به سخت‌افزارهای گران‌قیمت آسان‌تر کند. این امر می‌تواند منجر به رشد سریع‌تر پروژه‌های محلی در حوزه تولید محتوا، پردازش تصویر و سایر کاربردهای هوش مصنوعی شود. همچنین، کاهش مصرف حافظه می‌تواند برای مراکز داده‌ای که با محدودیت‌های سخت‌افزاری مواجه هستند، مفید باشد.

ارتباط با LegalTech

این پیشرفت می‌تواند بر قوانین و مقررات مربوط به استفاده از مدل‌های هوش مصنوعی تأثیر بگذارد، به ویژه در زمینه‌های مالکیت فکری و استفاده از فناوری‌های کوانتایز شده. همچنین، ممکن است نیاز به استانداردهای جدیدی برای ارزیابی دقت و کارایی مدل‌های کوانتایز شده باشد.

زاویه رسانه/کشور منبع

factual, technical, vendor_announcement

برچسب‌ها