تصویر مرتبط با خبر: Open-Source AI on OCI: Serving LLMs on Kubernetes with vLLM, Qdrant, and Terraform
خلاصه سریع
اصل خبر در چند خط
اوراکل معماری مرجع جدیدی برای اجرای مدلهای زبانی بزرگ (LLM) با پشتیبانی GPU و تکنولوژی RAG بر روی Oracle Container Engine for Kubernetes (OKE) معرفی کرده است.
این معماری کاملا با ابزارهای متنباز ساخته شده و شامل اجزایی مانند vLLM برای استنتاج مدل، Qdrant برای ذخیرهسازی برداری و Terraform برای استقرار خودکار است.
سیستم ارائه شده شامل لایههای Load Balancer، Frontend، Backend و پایگاه داده برداری است که همگی بر روی OKE اجرا میشوند.
این معماری امکان جداسازی استخرهای نود CPU و GPU را فراهم میکند تا هزینهها بهینهسازی شوند.
اوراکل با این رویکرد، کنترل کامل بر زیرساخت را به کاربران میدهد و امکان سازگاری با بارهای کاری مختلف را فراهم میسازد.
متن خبر
شرح خبر
تیمهای فنی که زیرساخت ابری اوراکل (OCI) را برای بارهای کاری هوش مصنوعی ارزیابی میکنند، اغلب با این پرسش مواجه میشوند: چگونه میتوان قطعات مختلف را برای ارائه یک مدل زبانی بزرگ (LLM) در محیط تولید به هم متصل کرد؟
نه به عنوان یک فراخوان API میزبانیشده، بلکه به عنوان زیرساختی که مالکیت، زمانبندی و کنترل آن در دست شما باشد.
اوراکل برای پاسخ عملی به این سوال، یک برنامه مرجع کامل در OCI ایجاد کرده است: سیستمی مبتنی بر تولید افزایشیافته با بازیابی (RAG) با لایه عامل، که یک مدل با وزنهای باز را بر روی GPU ارائه میدهد.
این سیستم کاملا بر روی Oracle Container Engine for Kubernetes (OKE) اجرا میشود و به صورت پایانبهپایان با Terraform تهیه میشود.
معماری این سیستم شامل مسیری مانند Load Balancer → Frontend → Backend → (پایگاه داده برداری + استنتاج GPU) است.
در این معماری، vLLM مدل زبانی را از طریق API سازگار با OpenAI ارائه میدهد، Qdrant ذخیرهسازی برداری را فراهم میکند و تمام اجزا به عنوان بار کاری بر روی OKE اجرا میشوند.
این رویکرد نه تنها انعطافپذیری بالایی دارد، بلکه کنترل هزینههای GPU را نیز بهینه میسازد.
اوراکل معماری مرجع جدیدی برای اجرای مدلهای زبانی بزرگ (LLM) با پشتیبانی GPU و تکنولوژی RAG بر روی Oracle Container Engine for Kubernetes (OKE) معرفی کرده است.
این معماری کاملا با ابزارهای متنباز ساخته شده و شامل اجزایی مانند vLLM برای استنتاج مدل، Qdrant برای ذخیرهسازی برداری و Terraform برای استقرار خودکار است.
سیستم ارائه شده شامل لایههای Load Balancer، Frontend، Backend و پایگاه داده برداری است که همگی بر روی OKE اجرا میشوند.
این معماری امکان جداسازی استخرهای نود CPU و GPU را فراهم میکند تا هزینهها بهینهسازی شوند.
اوراکل با این رویکرد، کنترل کامل بر زیرساخت را به کاربران میدهد و امکان سازگاری با بارهای کاری مختلف را فراهم میسازد.
این معماری نشان میدهد که چگونه میتوان زیرساختهای هوش مصنوعی را با استفاده از ابزارهای متنباز و بر روی ابر اوراکل پیادهسازی کرد، بدون وابستگی به سرویسهای میزبانیشده.
این رویکرد به سازمانها اجازه میدهد تا کنترل کامل بر زیرساخت خود داشته باشند و هزینههای GPU را با جداسازی استخرهای نود بهینهسازی کنند.
علاوه بر این، استفاده از OKE و Terraform امکان استقرار سریع و مقیاسپذیر را فراهم میکند که برای پروژههای هوش مصنوعی در مقیاس بزرگ حیاتی است.
این معماری میتواند هزینههای عملیاتی را با بهینهسازی استفاده از GPU کاهش دهد و انعطافپذیری بیشتری در مدیریت بارهای کاری هوش مصنوعی فراهم کند.
شرکتها میتوانند با استفاده از این الگوی مرجع، زمان و هزینههای توسعه را کاهش دهند و سریعتر به بازار عرضه شوند.
برای شرکتها و پژوهشگران ایرانی که به دنبال پیادهسازی راهکارهای هوش مصنوعی با هزینههای بهینه هستند، این معماری میتواند الگوی مناسبی باشد.
با توجه به محدودیتهای دسترسی به برخی سرویسهای ابری، استفاده از ابزارهای متنباز و زیرساختهای قابل کنترل میتواند راهگشا باشد.
این معماری نشان میدهد که چگونه میتوان با استفاده از ابزارهای متنباز و استانداردهای باز، زیرساختهای هوش مصنوعی را بدون وابستگی به ارائهدهندگان خاص پیادهسازی کرد.
این امر میتواند به کاهش ریسکهای حقوقی مرتبط با وابستگی به فناوریهای اختصاصی کمک کند.
این معماری توسط اوراکل، یکی از غولهای فناوری آمریکا، ارائه شده است و میتواند به عنوان ابزاری برای رقابت با سایر ارائهدهندگان ابری مانند AWS و Azure در نظر گرفته شود.
استفاده از ابزارهای متنباز ممکن است به کاهش وابستگی به فناوریهای آمریکایی کمک کند.
Oracle Blog اوراکل با معرفی معماری مرجع جدید، امکان اجرای مدلهای زبانی بزرگ با پشتیبانی GPU و RAG را بر روی OKE فراهم کرده است.
این سیستم با ابزارهای متنباز ساخته شده و شامل vLLM، Qdrant و Terraform است.
این صفحه خلاصه و تحلیل فارسی خبر را نمایش میدهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.
تحلیل تحریریه
ابعاد مهم خبر
چرا مهم است؟
این معماری نشان میدهد که چگونه میتوان زیرساختهای هوش مصنوعی را با استفاده از ابزارهای متنباز و بر روی ابر اوراکل پیادهسازی کرد، بدون وابستگی به سرویسهای میزبانیشده.
این رویکرد به سازمانها اجازه میدهد تا کنترل کامل بر زیرساخت خود داشته باشند و هزینههای GPU را با جداسازی استخرهای نود بهینهسازی کنند.
علاوه بر این، استفاده از OKE و Terraform امکان استقرار سریع و مقیاسپذیر را فراهم میکند که برای پروژههای هوش مصنوعی در مقیاس بزرگ حیاتی است.
اثر کسبوکاری
این معماری میتواند هزینههای عملیاتی را با بهینهسازی استفاده از GPU کاهش دهد و انعطافپذیری بیشتری در مدیریت بارهای کاری هوش مصنوعی فراهم کند.
شرکتها میتوانند با استفاده از این الگوی مرجع، زمان و هزینههای توسعه را کاهش دهند و سریعتر به بازار عرضه شوند.
اثر احتمالی برای ایران
برای شرکتها و پژوهشگران ایرانی که به دنبال پیادهسازی راهکارهای هوش مصنوعی با هزینههای بهینه هستند، این معماری میتواند الگوی مناسبی باشد.
با توجه به محدودیتهای دسترسی به برخی سرویسهای ابری، استفاده از ابزارهای متنباز و زیرساختهای قابل کنترل میتواند راهگشا باشد.
ارتباط با LegalTech
این معماری نشان میدهد که چگونه میتوان با استفاده از ابزارهای متنباز و استانداردهای باز، زیرساختهای هوش مصنوعی را بدون وابستگی به ارائهدهندگان خاص پیادهسازی کرد.
این امر میتواند به کاهش ریسکهای حقوقی مرتبط با وابستگی به فناوریهای اختصاصی کمک کند.