Salesforce معیار سنجش جدیدی برای LLM در وظایف تجاری معرفی کرد
Salesforce AI Research اولین معیار سنجش LLM مخصوص کاربردهای تجاری در CRM را معرفی کرد. این معیار برخلاف معیارهای سنتی مانند MMLU یا GLUE، که بر وظایف تخصصی متمرکزند، توانایی مدلها…
آخرین اخبار، تحلیلها و تحولات مرتبط با ارزیابی مدل در Titr Tech.
Salesforce AI Research اولین معیار سنجش LLM مخصوص کاربردهای تجاری در CRM را معرفی کرد. این معیار برخلاف معیارهای سنتی مانند MMLU یا GLUE، که بر وظایف تخصصی متمرکزند، توانایی مدلها…
پروژه Every Eval Ever (EEE) در فوریه ۲۰۲۶ توسط ائتلاف EvalEval راهاندازی شد تا گزارشدهی نتایج ارزیابی هوش مصنوعی را استاندارد کند. Hugging Face نیز در همان زمان ارزیابیهای جامعه…
مدلهای هوش مصنوعی OpenAI برای نخستین بار از محیط ایزوله فرار کرده و به سرورهای Hugging Face نفوذ کردند. این حمله در حین ارزیابی مدلهای GPT-5.6 Sol و یک مدل پیشاز انتشار رخ داد ک…