بک‌اند مدلسازی ترنسفورمرز با سرعت بومی در vLLM: انقلابی در استنتاج مدل‌های هوش مصنوعی

Hugging Face BlogUnited States3 دقیقه مطالعه۱۴۰۵/۰۵/۱۵ ساعت ۲۲:۰۰

تصویر مرتبط با خبر: Native-speed vLLM transformers modeling backend
تصویر مرتبط با خبر: Native-speed vLLM transformers modeling backend
خلاصه سریع

اصل خبر در چند خط

کتابخانه ترنسفورمرز به عنوان استاندارد مدلسازی در یادگیری ماشین شناخته می‌شود و از بیش از ۴۵۰ معماری پشتیبانی می‌کند. ادغام آن به عنوان بک‌اند مدلسازی در vLLM امکان اجرا کردن مدل‌های ترنسفورمرز را درون این چارچوب فراهم کرد. آخرین نسخه این بک‌اند با استفاده از torch.fx و دستکاری کد منبع، سرعت استنتاج را به سطح پیاده‌سازی‌های بومی vLLM رسانده است. این امر با ادغام پویا لایه‌ها در زمان اجرا و بهینه‌سازی عملیات‌هایی مانند موازی‌سازی تنسوری و کارشناسان (MoE) حاصل شده است. مدل‌های دستکاری شده همچنان قابل کامپایل با torch هستند و می‌توانند در آموزش و ارزیابی نیز مورد استفاده قرار گیرند.

متن خبر

شرح خبر

کتابخانه ترنسفورمرز به عنوان کتابخانه مرجع مدلسازی برای یادگیری ماشین شناخته می‌شود که از بیش از ۴۵۰ معماری با استفاده از API‌های یکپارچه پشتیبانی می‌کند. این کتابخانه با هدف خودمحتوا و قابل فهم بودن پیاده‌سازی مدل‌ها طراحی شده است. ادغام ترنسفورمرز به عنوان بک‌اند مدلسازی در vLLM در سال گذشته، امکان اجرا کردن مدل‌های ترنسفورمرز (اعم از LLM و VLM) را درون vLLM و بدون نیاز به انتقال کد فراهم کرد. اکنون، این ادغام بهبود یافته و با پیاده‌سازی‌های بومی دست‌نویس vLLM در سه مدل متفاوت Qwen3 مقایسه شده است: مدل متراکم ۳۲ میلیارد پارامتری با موازی‌سازی تنسوری، مدل Mixture-of-Experts با ۲۳۵ میلیارد پارامتر و دقت FP8 بر روی موازی‌سازی داده‌ها و کارشناسان بر روی گره ۸×H100. این پیشرفت امکان دستیابی به سرعت استنتاج بومی vLLM را برای مدل‌های سازگار فراهم می‌کند، بدون نیاز به نوشتن حتی یک خط کد بهینه‌سازی. کتابخانه ترنسفورمرز به عنوان استاندارد مدلسازی در یادگیری ماشین شناخته می‌شود و از بیش از ۴۵۰ معماری پشتیبانی می‌کند. ادغام آن به عنوان بک‌اند مدلسازی در vLLM امکان اجرا کردن مدل‌های ترنسفورمرز را درون این چارچوب فراهم کرد. آخرین نسخه این بک‌اند با استفاده از torch.fx و دستکاری کد منبع، سرعت استنتاج را به سطح پیاده‌سازی‌های بومی vLLM رسانده است. این امر با ادغام پویا لایه‌ها در زمان اجرا و بهینه‌سازی عملیات‌هایی مانند موازی‌سازی تنسوری و کارشناسان (MoE) حاصل شده است. مدل‌های دستکاری شده همچنان قابل کامپایل با torch هستند و می‌توانند در آموزش و ارزیابی نیز مورد استفاده قرار گیرند. این پیشرفت اهمیت زیادی دارد زیرا امکان استفاده از مدل‌های ترنسفورمرز را با کارایی بالا در vLLM فراهم می‌کند، بدون نیاز به بازنویسی کد. این امر زمان و هزینه توسعه را کاهش می‌دهد و دسترسی به تکنیک‌های استنتاج بهینه‌سازی شده vLLM را برای جامعه گسترده‌تری از توسعه‌دهندگان امکان‌پذیر می‌سازد. علاوه بر این، این ادغام انعطاف‌پذیری بیشتری را برای استفاده از یک کد واحد در آموزش، ارزیابی و استنتاج فراهم می‌کند. این فناوری می‌تواند هزینه‌های عملیاتی را برای شرکت‌هایی که از مدل‌های بزرگ زبانی استفاده می‌کنند، کاهش دهد. با بهبود کارایی استنتاج، شرکت‌ها می‌توانند منابع سخت‌افزاری کمتری مصرف کنند و در نتیجه هزینه‌های خود را کاهش دهند. همچنین، این امر می‌تواند سرعت ارائه خدمات مبتنی بر هوش مصنوعی را افزایش دهد و تجربه کاربری را بهبود بخشد. ایران می‌تواند از این فناوری برای بهبود زیرساخت‌های هوش مصنوعی خود بهره‌برداری کند. با کاهش هزینه‌های عملیاتی و افزایش کارایی، پژوهشگران و شرکت‌های ایرانی می‌توانند مدل‌های پیشرفته‌تری را با منابع محدودتر پیاده‌سازی کنند. این امر می‌تواند به رشد اکوسیستم هوش مصنوعی در ایران کمک کند. این پیشرفت می‌تواند تأثیراتی بر مالکیت فکری و مجوزهای نرم‌افزاری داشته باشد. استفاده از کدهای باز و ادغام آنها در چارچوب‌های مختلف می‌تواند چالش‌های حقوقی جدیدی را ایجاد کند. همچنین، بهینه‌سازی استنتاج می‌تواند تأثیراتی بر حریم خصوصی و امنیت داده‌ها داشته باشد که نیاز به بررسی دقیق دارد. این فناوری بیشتر جنبه فنی دارد و تأثیر مستقیم بر روابط ژئوپلیتیکی ندارد. با این حال، دسترسی به فناوری‌های پیشرفته هوش مصنوعی می‌تواند در بلندمدت بر تعادل قدرت فنی بین کشورها تأثیر بگذارد. فنی و تخصصی ادغام ترنسفورمرز و vLLM امکان استنتاج کارآمد مدل‌های هوش مصنوعی را بدون نیاز به بازنویسی کد فراهم می‌کند. این پیشرفت می‌تواند هزینه‌ها را کاهش و کارایی را افزایش دهد.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

این پیشرفت اهمیت زیادی دارد زیرا امکان استفاده از مدل‌های ترنسفورمرز را با کارایی بالا در vLLM فراهم می‌کند، بدون نیاز به بازنویسی کد. این امر زمان و هزینه توسعه را کاهش می‌دهد و دسترسی به تکنیک‌های استنتاج بهینه‌سازی شده vLLM را برای جامعه گسترده‌تری از توسعه‌دهندگان امکان‌پذیر می‌سازد. علاوه بر این، این ادغام انعطاف‌پذیری بیشتری را برای استفاده از یک کد واحد در آموزش، ارزیابی و استنتاج فراهم می‌کند.

اثر کسب‌وکاری

این فناوری می‌تواند هزینه‌های عملیاتی را برای شرکت‌هایی که از مدل‌های بزرگ زبانی استفاده می‌کنند، کاهش دهد. با بهبود کارایی استنتاج، شرکت‌ها می‌توانند منابع سخت‌افزاری کمتری مصرف کنند و در نتیجه هزینه‌های خود را کاهش دهند. همچنین، این امر می‌تواند سرعت ارائه خدمات مبتنی بر هوش مصنوعی را افزایش دهد و تجربه کاربری را بهبود بخشد.

اثر احتمالی برای ایران

ایران می‌تواند از این فناوری برای بهبود زیرساخت‌های هوش مصنوعی خود بهره‌برداری کند. با کاهش هزینه‌های عملیاتی و افزایش کارایی، پژوهشگران و شرکت‌های ایرانی می‌توانند مدل‌های پیشرفته‌تری را با منابع محدودتر پیاده‌سازی کنند. این امر می‌تواند به رشد اکوسیستم هوش مصنوعی در ایران کمک کند.

ارتباط با LegalTech

این پیشرفت می‌تواند تأثیراتی بر مالکیت فکری و مجوزهای نرم‌افزاری داشته باشد. استفاده از کدهای باز و ادغام آنها در چارچوب‌های مختلف می‌تواند چالش‌های حقوقی جدیدی را ایجاد کند. همچنین، بهینه‌سازی استنتاج می‌تواند تأثیراتی بر حریم خصوصی و امنیت داده‌ها داشته باشد که نیاز به بررسی دقیق دارد.

زاویه رسانه/کشور منبع

فنی و تخصصی

برچسب‌ها