AWS و تغییر تقاضای هوش مصنوعی: استنتاج در کانون توجه
مَت گارمن، مدیرعامل AWS، اعلام کرد که استنتاج هوش مصنوعی اکنون دو سوم از تقاضای محاسباتی AI را تشکیل میدهد، در حالی که این رقم در سال 2023 یک سوم بود. او استنتاج را یک بلوک ساختما…
آخرین اخبار، تحلیلها و تحولات مرتبط با استنتاج در Titr Tech.
مَت گارمن، مدیرعامل AWS، اعلام کرد که استنتاج هوش مصنوعی اکنون دو سوم از تقاضای محاسباتی AI را تشکیل میدهد، در حالی که این رقم در سال 2023 یک سوم بود. او استنتاج را یک بلوک ساختما…
سامبا نووا و Intel طرحی ناهمگن برای استنتاج هوش مصنوعی ارائه کردند که بر اساس تقسیم وظایف بین GPU، RDU و CPU استوار است. عاملهای هوش مصنوعی نیازمند سرعت بالای رمزگشایی (۲۰۰+ توکن …
شرکت Cognition با همکاری Cerebras مدل SWE-1.6 را معرفی کرد که عملکرد کدگذاری در سطح مرزهای دانش را با سرعتی تا ۵ برابر سریعتر از GPU ارائه میدهد. این مدل با سرعت ۹۵۰ توکن بر ثانی…
API رسمی Llama توسط Groq شتاب گرفته است و اکنون سریعترین راه برای اجرای مدلهای باز و قابل اعتماد جهان محسوب میشود. این سرویس بر روی تراشه کارآمد استنتاج Groq ارائه میشود و بدون…
هزینه هوش مصنوعی به سرعت در حال کاهش است و امروزه تواناییهای همسطح با GPT-4 با کمتر از ۱ دلار در دسترس هستند. این کاهش هزینه، عصر هوش تقریباً رایگان را نوید میدهد. مقاله حاضر، نو…
OpenAI مدل جدید GPT-5.6 را معرفی کرده است که کارایی هوش مصنوعی را در مدلها، فرآیند استنتاج و جریانهای کاری عاملمحور بهبود میبخشد. این مدل با هدف ارائه هوش مفیدتر در ازای هر دلا…
AMD سیستم جدیدی به نام ROCm Hyperloom معرفی کرده است که به صورت خودکار و متنباز، بهینهسازی بارهای کاری استنتاج هوش مصنوعی را انجام میدهد. این سیستم با معماری حلقه بسته، فرآیند د…
AMD Quark، کتابخانه کوانتیزاسیون پیشرفته، با فعالسازی MXFP4 روی GPUهای AMD Instinct MI350، توانسته است سرعت استنتاج مدلهای دیفیوژن مانند FLUX.1-dev را تا ۱.۹۲ برابر نسبت به حالت …
آمازون سیجمیکر هایپرپاد با معرفی قابلیتهای جدیدی مانند ثبت دادهها در نقاط مختلف مسیر استنتاج، استقرار مدلها از هابهای جامعه بدون پیشبارگذاری وزنها، و استفاده از ذخیرهسازی NVM…
پژوهشگران آیبیام، رد هت و نکسجن هند با استفاده از چارچوب llm-d توانستند سرعت استنتاج مدلهای هوش مصنوعی را ۳ تا ۵ برابر افزایش دهند. این چارچوب منبعباز با هماهنگسازی موتورهای ا…
AMD و Cerebras همکاری جدیدی را برای توسعه زیرساخت استنتاج هوش مصنوعی با تاخیر پایین اعلام کردند. در این پروژه، رک AMD Helios با موتور Wafer-Scale Engine (WSE) Cerebras ادغام میشود…
AMD با معرفی SGLang-ATOM، راهکاری برای یکپارچهسازی سرویسدهی مدلهای زبانی بزرگ با شتابدهندههای ROCm ارائه کرده است. این فناوری به عنوان پل بین چارچوب سرویسدهی SGLang و موتور ا…
اوپنایآی و برادکام تراشه «جالاپینو» را معرفی کردند که مخصوص استنتاج مدلهای زبانی بزرگ طراحی شده است. این تراشه کارایی، بازدهی انرژی و مقیاسپذیری سیستمهای هوش مصنوعی را بهبود م…
انویدیا با پشته نرمافزاری استنتاج خود، هزینه هر توکن را در مدلهای هوش مصنوعی به طور چشمگیری کاهش داده است. این پشته که با سختافزارهای Blackwell همطراحی شده، در مدل DeepSeek V4 ه…