معماری مرجع برای اجرای مدل‌های زبانی بزرگ با RAG بر روی OKE: راه‌اندازی LLMs با vLLM، Qdrant و Terraform در Oracle Cloud

Oracle BlogUS / Global3 دقیقه مطالعه۱۴۰۵/۰۵/۲۵ ساعت ۱۰:۰۰

تصویر مرتبط با خبر: Open-Source AI on OCI: Serving LLMs on Kubernetes with vLLM, Qdrant, and Terraform
تصویر مرتبط با خبر: Open-Source AI on OCI: Serving LLMs on Kubernetes with vLLM, Qdrant, and Terraform
خلاصه سریع

اصل خبر در چند خط

اوراکل معماری مرجع جدیدی برای اجرای مدل‌های زبانی بزرگ (LLM) با پشتیبانی GPU و تکنولوژی RAG بر روی Oracle Container Engine for Kubernetes (OKE) معرفی کرده است. این معماری کاملا با ابزارهای متن‌باز ساخته شده و شامل اجزایی مانند vLLM برای استنتاج مدل، Qdrant برای ذخیره‌سازی برداری و Terraform برای استقرار خودکار است. سیستم ارائه شده شامل لایه‌های Load Balancer، Frontend، Backend و پایگاه داده برداری است که همگی بر روی OKE اجرا می‌شوند. این معماری امکان جداسازی استخرهای نود CPU و GPU را فراهم می‌کند تا هزینه‌ها بهینه‌سازی شوند. اوراکل با این رویکرد، کنترل کامل بر زیرساخت را به کاربران می‌دهد و امکان سازگاری با بارهای کاری مختلف را فراهم می‌سازد.

متن خبر

شرح خبر

تیم‌های فنی که زیرساخت ابری اوراکل (OCI) را برای بارهای کاری هوش مصنوعی ارزیابی می‌کنند، اغلب با این پرسش مواجه می‌شوند: چگونه می‌توان قطعات مختلف را برای ارائه یک مدل زبانی بزرگ (LLM) در محیط تولید به هم متصل کرد؟ نه به عنوان یک فراخوان API میزبانی‌شده، بلکه به عنوان زیرساختی که مالکیت، زمان‌بندی و کنترل آن در دست شما باشد. اوراکل برای پاسخ عملی به این سوال، یک برنامه مرجع کامل در OCI ایجاد کرده است: سیستمی مبتنی بر تولید افزایش‌یافته با بازیابی (RAG) با لایه عامل، که یک مدل با وزن‌های باز را بر روی GPU ارائه می‌دهد. این سیستم کاملا بر روی Oracle Container Engine for Kubernetes (OKE) اجرا می‌شود و به صورت پایان‌به‌پایان با Terraform تهیه می‌شود. معماری این سیستم شامل مسیری مانند Load Balancer → Frontend → Backend → (پایگاه داده برداری + استنتاج GPU) است. در این معماری، vLLM مدل زبانی را از طریق API سازگار با OpenAI ارائه می‌دهد، Qdrant ذخیره‌سازی برداری را فراهم می‌کند و تمام اجزا به عنوان بار کاری بر روی OKE اجرا می‌شوند. این رویکرد نه تنها انعطاف‌پذیری بالایی دارد، بلکه کنترل هزینه‌های GPU را نیز بهینه می‌سازد. اوراکل معماری مرجع جدیدی برای اجرای مدل‌های زبانی بزرگ (LLM) با پشتیبانی GPU و تکنولوژی RAG بر روی Oracle Container Engine for Kubernetes (OKE) معرفی کرده است. این معماری کاملا با ابزارهای متن‌باز ساخته شده و شامل اجزایی مانند vLLM برای استنتاج مدل، Qdrant برای ذخیره‌سازی برداری و Terraform برای استقرار خودکار است. سیستم ارائه شده شامل لایه‌های Load Balancer، Frontend، Backend و پایگاه داده برداری است که همگی بر روی OKE اجرا می‌شوند. این معماری امکان جداسازی استخرهای نود CPU و GPU را فراهم می‌کند تا هزینه‌ها بهینه‌سازی شوند. اوراکل با این رویکرد، کنترل کامل بر زیرساخت را به کاربران می‌دهد و امکان سازگاری با بارهای کاری مختلف را فراهم می‌سازد. این معماری نشان می‌دهد که چگونه می‌توان زیرساخت‌های هوش مصنوعی را با استفاده از ابزارهای متن‌باز و بر روی ابر اوراکل پیاده‌سازی کرد، بدون وابستگی به سرویس‌های میزبانی‌شده. این رویکرد به سازمان‌ها اجازه می‌دهد تا کنترل کامل بر زیرساخت خود داشته باشند و هزینه‌های GPU را با جداسازی استخرهای نود بهینه‌سازی کنند. علاوه بر این، استفاده از OKE و Terraform امکان استقرار سریع و مقیاس‌پذیر را فراهم می‌کند که برای پروژه‌های هوش مصنوعی در مقیاس بزرگ حیاتی است. این معماری می‌تواند هزینه‌های عملیاتی را با بهینه‌سازی استفاده از GPU کاهش دهد و انعطاف‌پذیری بیشتری در مدیریت بارهای کاری هوش مصنوعی فراهم کند. شرکت‌ها می‌توانند با استفاده از این الگوی مرجع، زمان و هزینه‌های توسعه را کاهش دهند و سریع‌تر به بازار عرضه شوند. برای شرکت‌ها و پژوهشگران ایرانی که به دنبال پیاده‌سازی راهکارهای هوش مصنوعی با هزینه‌های بهینه هستند، این معماری می‌تواند الگوی مناسبی باشد. با توجه به محدودیت‌های دسترسی به برخی سرویس‌های ابری، استفاده از ابزارهای متن‌باز و زیرساخت‌های قابل کنترل می‌تواند راهگشا باشد. این معماری نشان می‌دهد که چگونه می‌توان با استفاده از ابزارهای متن‌باز و استانداردهای باز، زیرساخت‌های هوش مصنوعی را بدون وابستگی به ارائه‌دهندگان خاص پیاده‌سازی کرد. این امر می‌تواند به کاهش ریسک‌های حقوقی مرتبط با وابستگی به فناوری‌های اختصاصی کمک کند. این معماری توسط اوراکل، یکی از غول‌های فناوری آمریکا، ارائه شده است و می‌تواند به عنوان ابزاری برای رقابت با سایر ارائه‌دهندگان ابری مانند AWS و Azure در نظر گرفته شود. استفاده از ابزارهای متن‌باز ممکن است به کاهش وابستگی به فناوری‌های آمریکایی کمک کند. Oracle Blog اوراکل با معرفی معماری مرجع جدید، امکان اجرای مدل‌های زبانی بزرگ با پشتیبانی GPU و RAG را بر روی OKE فراهم کرده است. این سیستم با ابزارهای متن‌باز ساخته شده و شامل vLLM، Qdrant و Terraform است.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

این معماری نشان می‌دهد که چگونه می‌توان زیرساخت‌های هوش مصنوعی را با استفاده از ابزارهای متن‌باز و بر روی ابر اوراکل پیاده‌سازی کرد، بدون وابستگی به سرویس‌های میزبانی‌شده. این رویکرد به سازمان‌ها اجازه می‌دهد تا کنترل کامل بر زیرساخت خود داشته باشند و هزینه‌های GPU را با جداسازی استخرهای نود بهینه‌سازی کنند. علاوه بر این، استفاده از OKE و Terraform امکان استقرار سریع و مقیاس‌پذیر را فراهم می‌کند که برای پروژه‌های هوش مصنوعی در مقیاس بزرگ حیاتی است.

اثر کسب‌وکاری

این معماری می‌تواند هزینه‌های عملیاتی را با بهینه‌سازی استفاده از GPU کاهش دهد و انعطاف‌پذیری بیشتری در مدیریت بارهای کاری هوش مصنوعی فراهم کند. شرکت‌ها می‌توانند با استفاده از این الگوی مرجع، زمان و هزینه‌های توسعه را کاهش دهند و سریع‌تر به بازار عرضه شوند.

اثر احتمالی برای ایران

برای شرکت‌ها و پژوهشگران ایرانی که به دنبال پیاده‌سازی راهکارهای هوش مصنوعی با هزینه‌های بهینه هستند، این معماری می‌تواند الگوی مناسبی باشد. با توجه به محدودیت‌های دسترسی به برخی سرویس‌های ابری، استفاده از ابزارهای متن‌باز و زیرساخت‌های قابل کنترل می‌تواند راهگشا باشد.

ارتباط با LegalTech

این معماری نشان می‌دهد که چگونه می‌توان با استفاده از ابزارهای متن‌باز و استانداردهای باز، زیرساخت‌های هوش مصنوعی را بدون وابستگی به ارائه‌دهندگان خاص پیاده‌سازی کرد. این امر می‌تواند به کاهش ریسک‌های حقوقی مرتبط با وابستگی به فناوری‌های اختصاصی کمک کند.

زاویه رسانه/کشور منبع

Oracle Blog

برچسب‌ها