مدلهای استدلالی بزرگ در پیروی از دستورالعملها در حین فرآیند استدلال شکست میخورند: مطالعه معیاری
Together AI BlogUnited States3 دقیقه مطالعه۱۴۰۵/۰۶/۰۹ ساعت ۱۰:۴۵
تصویر مرتبط با خبر: Large Reasoning Models Fail to Follow Instructions During Reasoning: A Benchmark Study
خلاصه سریع
اصل خبر در چند خط
مطالعه جدید Together AI نشان میدهد مدلهای استدلالی بزرگ (LRMs) مانند GPT-OSS-120B، Qwen3-235B و DeepSeek-R1 در بیش از ۷۵ درصد موارد در پیروی از دستورالعملهای کاربر در حین استدلال شکست میخورند.
معیار ReasonIF با ۳۰۰ مسئله ریاضی و علمی و شش نوع دستورالعمل (مثلاً چندزبانه، قالببندی JSON، محدودیت کلمات) معرفی شده است.
پیروی از دستورالعملها در مراحل استدلالی با افزایش دشواری وظیفه بدتر میشود.
این موضوع برای کنترلپذیری، شفافیت و ایمنی مدلها حیاتی است.
ReasonIF امکان ارزیابی خودکار و دقیق پیروی از دستورالعملها را فراهم میکند.
متن خبر
شرح خبر
مطالعه جدیدی توسط Together AI نشان میدهد که مدلهای استدلالی بزرگ (LRMs) مانند GPT-OSS-120B، Qwen3-235B و DeepSeek-R1 در بیش از ۷۵ درصد موارد در پیروی از دستورالعملهای کاربر در طول فرآیند استدلال خود شکست میخورند.
این تحقیق با معرفی معیار ReasonIF، که شامل ۳۰۰ مسئله ریاضی و علمی با دستورالعملهای استدلالی مشخص است، انجام شده است.
دستورالعملها شامل محدودیتهای زبانی (مثلاً استدلال به زبان عربی)، قالببندی JSON، محدودیت کلمات و سایر قوانین کاربرمحور هستند.
یافتهها حاکی از آن است که با افزایش دشواری وظیفه، توانایی پیروی از دستورالعملها در مراحل استدلالی به طور قابل توجهی کاهش مییابد.
این موضوع اهمیت کنترلپذیری، شفافیت و ایمنی در تعامل با مدلها را برجسته میکند.
مطالعه جدید Together AI نشان میدهد مدلهای استدلالی بزرگ (LRMs) مانند GPT-OSS-120B، Qwen3-235B و DeepSeek-R1 در بیش از ۷۵ درصد موارد در پیروی از دستورالعملهای کاربر در حین استدلال شکست میخورند.
معیار ReasonIF با ۳۰۰ مسئله ریاضی و علمی و شش نوع دستورالعمل (مثلاً چندزبانه، قالببندی JSON، محدودیت کلمات) معرفی شده است.
پیروی از دستورالعملها در مراحل استدلالی با افزایش دشواری وظیفه بدتر میشود.
این موضوع برای کنترلپذیری، شفافیت و ایمنی مدلها حیاتی است.
ReasonIF امکان ارزیابی خودکار و دقیق پیروی از دستورالعملها را فراهم میکند.
پیروی از دستورالعملها در حین استدلال نه تنها پاسخ نهایی، بلکه فرآیند تفکر مدل را کنترلپذیرتر میکند.
این امر شفافیت و ایمنی را افزایش داده و امکان بررسی برنامهای منطق و انطباق را فراهم میآورد.
علاوه بر این، پیروی دقیق از دستورالعملها در برابر دستکاریهای خصمانه مقاومتر است و از تولید پاسخهای ظاهرا صحیح اما نادرست جلوگیری میکند.
این یافتهها برای شرکتهایی که از مدلهای استدلالی در سیستمهای تصمیمگیری یا نرمافزارهای حساس استفاده میکنند، حیاتی است.
عدم پیروی از دستورالعملها میتواند منجر به خطاهای هزینهبر یا تصمیمات نادرست شود.
همچنین، بهبود کنترلپذیری مدلها میتواند اعتماد مشتریان و کارایی عملیاتی را افزایش دهد.
در ایران، پژوهشگران و شرکتهای فعال در حوزه هوش مصنوعی میتوانند از معیار ReasonIF برای ارزیابی و بهبود مدلهای بومی استفاده کنند.
این موضوع به ویژه برای کاربردهای حساس مانند سیستمهای پزشکی یا مالی اهمیت دارد، جایی که دقت و پیروی از دستورالعملها حیاتی است.
در حوزه حقوقی و فناوری، پیروی از دستورالعملها در استدلال مدلها میتواند برای انطباق با مقررات و استانداردهای ایمنی هوش مصنوعی ضروری باشد.
این امر به ویژه در مواردی که مدلها در تصمیمگیریهای حقوقی یا بررسی اسناد استفاده میشوند، اهمیت دارد.
این مطالعه توسط Together AI در ایالات متحده انجام شده و تمرکز آن بر بهبود ایمنی و کنترلپذیری مدلهای هوش مصنوعی است.
با توجه به رقابت جهانی در حوزه AI، این یافتهها میتوانند تأثیراتی بر سیاستگذاریها و استانداردهای بینالمللی داشته باشند.
Together AI به عنوان یک شرکت پیشرو در حوزه هوش مصنوعی، این مطالعه را با هدف بهبود شفافیت و کنترلپذیری مدلهای استدلالی انجام داده است.
تمرکز بر معیار ReasonIF نشاندهنده تعهد این شرکت به ارزیابی دقیق و بهبود مدلها است.
مطالعه جدید Together AI با معیار ReasonIF نشان میدهد که مدلهای استدلالی بزرگ در بیش از ۷۵ درصد موارد در پیروی از دستورالعملها در حین استدلال شکست میخورند.
این صفحه خلاصه و تحلیل فارسی خبر را نمایش میدهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.
تحلیل تحریریه
ابعاد مهم خبر
چرا مهم است؟
پیروی از دستورالعملها در حین استدلال نه تنها پاسخ نهایی، بلکه فرآیند تفکر مدل را کنترلپذیرتر میکند.
این امر شفافیت و ایمنی را افزایش داده و امکان بررسی برنامهای منطق و انطباق را فراهم میآورد.
علاوه بر این، پیروی دقیق از دستورالعملها در برابر دستکاریهای خصمانه مقاومتر است و از تولید پاسخهای ظاهرا صحیح اما نادرست جلوگیری میکند.
اثر کسبوکاری
این یافتهها برای شرکتهایی که از مدلهای استدلالی در سیستمهای تصمیمگیری یا نرمافزارهای حساس استفاده میکنند، حیاتی است.
عدم پیروی از دستورالعملها میتواند منجر به خطاهای هزینهبر یا تصمیمات نادرست شود.
همچنین، بهبود کنترلپذیری مدلها میتواند اعتماد مشتریان و کارایی عملیاتی را افزایش دهد.
اثر احتمالی برای ایران
در ایران، پژوهشگران و شرکتهای فعال در حوزه هوش مصنوعی میتوانند از معیار ReasonIF برای ارزیابی و بهبود مدلهای بومی استفاده کنند.
این موضوع به ویژه برای کاربردهای حساس مانند سیستمهای پزشکی یا مالی اهمیت دارد، جایی که دقت و پیروی از دستورالعملها حیاتی است.
ارتباط با LegalTech
در حوزه حقوقی و فناوری، پیروی از دستورالعملها در استدلال مدلها میتواند برای انطباق با مقررات و استانداردهای ایمنی هوش مصنوعی ضروری باشد.
این امر به ویژه در مواردی که مدلها در تصمیمگیریهای حقوقی یا بررسی اسناد استفاده میشوند، اهمیت دارد.
زاویه رسانه/کشور منبع
Together AI به عنوان یک شرکت پیشرو در حوزه هوش مصنوعی، این مطالعه را با هدف بهبود شفافیت و کنترلپذیری مدلهای استدلالی انجام داده است.
تمرکز بر معیار ReasonIF نشاندهنده تعهد این شرکت به ارزیابی دقیق و بهبود مدلها است.