معرفی معماری CPD توسط Together AI: سرویس‌دهی ۴۰ درصد سریع‌تر مدل‌های زبانی با context بلند

Together AI BlogUnited States3 دقیقه مطالعه۱۴۰۵/۰۶/۰۸ ساعت ۱۷:۳۰

تصویر مرتبط با خبر: Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving
تصویر مرتبط با خبر: Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving
خلاصه سریع

اصل خبر در چند خط

Together AI معماری CPD را برای سرویس‌دهی کارآمدتر مدل‌های LLM با context بلند معرفی کرد. این معماری با جداسازی بارهای سرد و گرم بر اساس نرخ hit کش، توان عملیاتی را تا ۴۰ درصد افزایش و TTFT را کاهش می‌دهد. CPD از سه نوع گره (Pre-Prefill، Prefill، Decode) استفاده می‌کند تا درخواست‌های گرم را اولویت‌بندی کند و از KV cache توزیع‌شده بهره ببرد. این روش در ترافیک مختلط و واقعی، کارایی را بهبود می‌بخشد و تاخیر را کاهش می‌دهد. CPD بر اساس معماری‌های قبلی مانند PD و prefix caching توسعه یافته است، اما با افزودن لایه pre-prefill اختصاصی، چالش‌های بارهای کاری سنگین را حل می‌کند.

متن خبر

شرح خبر

شرکت Together AI معماری جدیدی به نام cache-aware prefill–decode disaggregation (CPD) را برای بهبود کارایی سرویس‌دهی مدل‌های زبانی بزرگ (LLM) با context بلند معرفی کرد. این معماری با جداسازی بارهای کاری سرد و گرم بر اساس نرخ hit کش، توان عملیاتی پایدار را تا ۴۰ درصد افزایش و زمان تا اولین توکن (TTFT) را به‌ویژه در ترافیک مختلط واقعی کاهش می‌دهد. در بارهای کاری واقعی، بسیاری از درخواست‌ها حاوی بخش‌های بزرگی از context قبلاً دیده‌شده (گرم) هستند، در حالی که برخی دیگر context جدیدی معرفی می‌کنند (سرد). CPD با مسیریابی هوشمندانه درخواست‌ها به گره‌های اختصاصی (Pre-Prefill، Prefill، Decode) و استفاده از KV cache توزیع‌شده، مانع از مسدود شدن درخواست‌های گرم توسط درخواست‌های سرد می‌شود. این نوآوری در ارزیابی‌ها توان عملیاتی QPS را ۳۵ تا ۴۰ درصد بهبود بخشید و محدودیت‌های تاخیر tail را حتی در حضور پرامپت‌های سرد بزرگ حفظ کرد. Together AI معماری CPD را برای سرویس‌دهی کارآمدتر مدل‌های LLM با context بلند معرفی کرد. این معماری با جداسازی بارهای سرد و گرم بر اساس نرخ hit کش، توان عملیاتی را تا ۴۰ درصد افزایش و TTFT را کاهش می‌دهد. CPD از سه نوع گره (Pre-Prefill، Prefill، Decode) استفاده می‌کند تا درخواست‌های گرم را اولویت‌بندی کند و از KV cache توزیع‌شده بهره ببرد. این روش در ترافیک مختلط و واقعی، کارایی را بهبود می‌بخشد و تاخیر را کاهش می‌دهد. CPD بر اساس معماری‌های قبلی مانند PD و prefix caching توسعه یافته است، اما با افزودن لایه pre-prefill اختصاصی، چالش‌های بارهای کاری سنگین را حل می‌کند. این معماری پاسخگویی به چالش‌های سرویس‌دهی context بلند در مدل‌های LLM را متحول می‌کند. با جداسازی هوشمندانه بارهای سرد و گرم، CPD کارایی سیستم را در شرایط واقعی بهبود می‌بخشد و مانع از هدررفت منابع می‌شود. این نوآوری می‌تواند برای شرکت‌ها و توسعه‌دهندگان AI که با ترافیک مختلط و پرامپت‌های بلند کار می‌کنند، به‌ویژه در کاربردهایی مانند Copilot، عامل‌های هوشمند و سیستم‌های retrieval-augmented، بسیار ارزشمند باشد. CPD می‌تواند هزینه‌های عملیاتی را با بهبود کارایی سخت‌افزار و کاهش زمان پاسخگویی کاهش دهد. شرکت‌ها می‌توانند با استفاده از این معماری، سرویس‌های AI خود را مقیاس‌پذیرتر و کارآمدتر کنند، که منجر به تجربه بهتر کاربر و کاهش هزینه‌ها می‌شود. این امر به‌ویژه برای استارت‌آپ‌ها و شرکت‌های بزرگ که از مدل‌های LLM استفاده می‌کنند، اهمیت دارد. در ایران، توسعه‌دهندگان و شرکت‌های فعال در حوزه هوش مصنوعی می‌توانند از این معماری برای بهبود کارایی مدل‌های زبانی فارسی استفاده کنند. این امر می‌تواند به کاهش هزینه‌ها و افزایش کیفیت سرویس‌های مبتنی بر AI در کشور کمک کند، به‌ویژه در کاربردهایی مانند چت‌بات‌ها، ترجمه ماشینی و سیستم‌های توصیه‌گر. CPD می‌تواند بر استانداردهای فنی و پروتکل‌های سرویس‌دهی مدل‌های LLM تأثیر بگذارد. این معماری ممکن است به عنوان یک استاندارد جدید در صنعت AI مورد توجه قرار گیرد و شرکت‌ها را به استفاده از روش‌های مشابه برای بهبود کارایی ترغیب کند. همچنین، ممکن است بر قوانین و مقررات مربوط به کارایی و مصرف انرژی در مراکز داده تأثیر بگذارد. این نوآوری توسط Together AI در ایالات متحده توسعه یافته است و می‌تواند بر رقابت جهانی در حوزه هوش مصنوعی تأثیر بگذارد. کشورهایی که در توسعه فناوری‌های AI پیشرو هستند، ممکن است از این معماری برای بهبود زیرساخت‌های خود استفاده کنند. Together AI Blog Together AI معماری جدیدی به نام CPD را معرفی کرد که سرویس‌دهی مدل‌های زبانی بزرگ را تا ۴۰ درصد سریع‌تر می‌کند. این معماری با جداسازی بارهای سرد و گرم، کارایی را بهبود می‌بخشد.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

این معماری پاسخگویی به چالش‌های سرویس‌دهی context بلند در مدل‌های LLM را متحول می‌کند. با جداسازی هوشمندانه بارهای سرد و گرم، CPD کارایی سیستم را در شرایط واقعی بهبود می‌بخشد و مانع از هدررفت منابع می‌شود. این نوآوری می‌تواند برای شرکت‌ها و توسعه‌دهندگان AI که با ترافیک مختلط و پرامپت‌های بلند کار می‌کنند، به‌ویژه در کاربردهایی مانند Copilot، عامل‌های هوشمند و سیستم‌های retrieval-augmented، بسیار ارزشمند باشد.

اثر کسب‌وکاری

CPD می‌تواند هزینه‌های عملیاتی را با بهبود کارایی سخت‌افزار و کاهش زمان پاسخگویی کاهش دهد. شرکت‌ها می‌توانند با استفاده از این معماری، سرویس‌های AI خود را مقیاس‌پذیرتر و کارآمدتر کنند، که منجر به تجربه بهتر کاربر و کاهش هزینه‌ها می‌شود. این امر به‌ویژه برای استارت‌آپ‌ها و شرکت‌های بزرگ که از مدل‌های LLM استفاده می‌کنند، اهمیت دارد.

اثر احتمالی برای ایران

در ایران، توسعه‌دهندگان و شرکت‌های فعال در حوزه هوش مصنوعی می‌توانند از این معماری برای بهبود کارایی مدل‌های زبانی فارسی استفاده کنند. این امر می‌تواند به کاهش هزینه‌ها و افزایش کیفیت سرویس‌های مبتنی بر AI در کشور کمک کند، به‌ویژه در کاربردهایی مانند چت‌بات‌ها، ترجمه ماشینی و سیستم‌های توصیه‌گر.

ارتباط با LegalTech

CPD می‌تواند بر استانداردهای فنی و پروتکل‌های سرویس‌دهی مدل‌های LLM تأثیر بگذارد. این معماری ممکن است به عنوان یک استاندارد جدید در صنعت AI مورد توجه قرار گیرد و شرکت‌ها را به استفاده از روش‌های مشابه برای بهبود کارایی ترغیب کند. همچنین، ممکن است بر قوانین و مقررات مربوط به کارایی و مصرف انرژی در مراکز داده تأثیر بگذارد.

زاویه رسانه/کشور منبع

Together AI Blog

برچسب‌ها