چانکینگ پویا: انقلاب در بهبود کارایی سیستمهای RAG
اکثر تیمها اندازه چانکها را ثابت در نظر میگیرند و از تنظیمات استانداردی مانند ۵۱۲ توکن با ۵۰ توکن همپوشانی استفاده میکنند. با رشد دادهها و پیچیدهتر شدن پرسوجوها، این انتخاب …
آخرین اخبار، تحلیلها و تحولات مرتبط با بهینهسازی در Titr Tech.
اکثر تیمها اندازه چانکها را ثابت در نظر میگیرند و از تنظیمات استانداردی مانند ۵۱۲ توکن با ۵۰ توکن همپوشانی استفاده میکنند. با رشد دادهها و پیچیدهتر شدن پرسوجوها، این انتخاب …
Together AI شریک ابر ترجیحی برای مدل MiniMax M3 شده و پس از انتشار عمومی، آن را به عنوان نقطه پایانی برای توسعهدهندگان میزبانی خواهد کرد. تیمهای استنتاج و هسته این شرکت با بهینه…
OpenAI در ژوئیه ۲۰۲۶ سری GPT-5.6 را منتشر کرد و اعلام نمود که برای بهبود کارایی محاسباتی و بهینهسازی GPU، خود مدل GPT-5.6 را به کار گرفته است. این بهبودها شامل کاهش ۲۰ درصدی هزینه…
مطالعه موردی AMD نشان میدهد که فعالسازی کش KV در فرمت FP8 روی مدل Kimi-K2.5-W4A8 و ۸ GPU مینست MI308X، علیرغم بهبود ۳۴ درصدی هسته دیکد MLA، منجر به افزایش ۰.۰۸ درصدی زمان کل GPU…
سامسونگ بهروزرسانی ژوئیه One UI 8.5 را برای سری گلکسی S24 منتشر کرد. این بهروزرسانی در حال حاضر در کره جنوبی با شمارههای ساخت خاص در دسترس است و به زودی در اروپا و سایر کشورها ع…
Smartsheet، پلتفرم مدیریت کار سازمانی، یک سرور راه دور MCP روی AWS ساخته است تا به عاملهای هوش مصنوعی دسترسی ساختاریافته به دادههای خود بدهد. این سرور به APIهای موجود و لایه هوش …
OpenAI چکلیست استقرار API خود را منتشر کرد که به توسعهدهندگان کمک میکند تا از API پرچمدار این شرکت، یعنی Responses API، به بهترین شکل استفاده کنند. این راهنما پارامترهایی مانند …
مایکروسافت در وبلاگ Azure به بررسی روشهای طراحی و بهینهسازی زیرساخت ابری برای کارایی بلندمدت پرداخته است. ماشینهای مجازی جدید Azure Cobalt 200 با بهبود ۵۰ درصدی عملکرد، مخصوص با…
ایامدی مجموعه ابزارهای جدید خود به نام AMD Zen Software Studio را معرفی کرد. این مجموعه شامل کامپایلرهای پرسرعت برای زبانهای C، C++ و فورترن است. کتابخانههای عددی برای محاسبات …
AMD سیستم جدیدی به نام ROCm Hyperloom معرفی کرده است که به صورت خودکار و متنباز، بهینهسازی بارهای کاری استنتاج هوش مصنوعی را انجام میدهد. این سیستم با معماری حلقه بسته، فرآیند د…
AMD با معرفی SGLang-ATOM، راهکاری برای یکپارچهسازی سرویسدهی مدلهای زبانی بزرگ با شتابدهندههای ROCm ارائه کرده است. این فناوری به عنوان پل بین چارچوب سرویسدهی SGLang و موتور ا…
NVIDIA کتابخانه NeMo AutoModel را برای شتابدهی تنظیم دقیق مدلهای ترنسفورمر معرفی کرد. این کتابخانه بر پایه ترنسفورمرز نسخه ۵ ساخته شده و با افزودن موازیسازی متخصص، DeepEP و هسته…
هاگینگ فیس پشتیبانی بومی از چکپوینتهای Nunchaku را به کتابخانه Diffusers اضافه کرده است. این فناوری با استفاده از روش کوانتایز SVDQuant، لایههای اصلی ترنسفورمر را با وزنها و فعال…
چارچوب SGLang با معرفی SGLang Diffusion، توانایی سرویسدهی مدلهای انتشار را روی GPUهای AMD بهبود بخشیده است. این چارچوب با بهرهگیری از زمانبندی با توان عملیاتی بالا و هستههای مح…
کلادفلر قابلیت Workers Cache را معرفی کرد که یک کش چندلایه پیش از اجرا شدن Worker است. این کش با استفاده از هدرهای Cache-Control و تنظیمات ساده در Wrangler پیکربندی میشود. در صورت…
انویدیا با پشته نرمافزاری استنتاج خود، هزینه هر توکن را در مدلهای هوش مصنوعی به طور چشمگیری کاهش داده است. این پشته که با سختافزارهای Blackwell همطراحی شده، در مدل DeepSeek V4 ه…
هوش مصنوعی در حال تغییر کشاورزی است، اما موفقیت آن به دادههای دقیق و ساختاریافته بستگی دارد. تحقیقات نشان میدهد که مدلهای هوش مصنوعی میتوانند عملکرد محصول را تا ۲۶ درصد بهبود ب…