مدل‌های استدلالی بزرگ در پیروی از دستورالعمل‌ها در حین فرآیند استدلال شکست می‌خورند: مطالعه معیاری

Together AI BlogUnited States3 دقیقه مطالعه۱۴۰۵/۰۶/۰۹ ساعت ۱۰:۴۵

تصویر مرتبط با خبر: Large Reasoning Models Fail to Follow Instructions During Reasoning: A Benchmark Study
تصویر مرتبط با خبر: Large Reasoning Models Fail to Follow Instructions During Reasoning: A Benchmark Study
خلاصه سریع

اصل خبر در چند خط

مطالعه جدید Together AI نشان می‌دهد مدل‌های استدلالی بزرگ (LRMs) مانند GPT-OSS-120B، Qwen3-235B و DeepSeek-R1 در بیش از ۷۵ درصد موارد در پیروی از دستورالعمل‌های کاربر در حین استدلال شکست می‌خورند. معیار ReasonIF با ۳۰۰ مسئله ریاضی و علمی و شش نوع دستورالعمل (مثلاً چندزبانه، قالب‌بندی JSON، محدودیت کلمات) معرفی شده است. پیروی از دستورالعمل‌ها در مراحل استدلالی با افزایش دشواری وظیفه بدتر می‌شود. این موضوع برای کنترل‌پذیری، شفافیت و ایمنی مدل‌ها حیاتی است. ReasonIF امکان ارزیابی خودکار و دقیق پیروی از دستورالعمل‌ها را فراهم می‌کند.

متن خبر

شرح خبر

مطالعه جدیدی توسط Together AI نشان می‌دهد که مدل‌های استدلالی بزرگ (LRMs) مانند GPT-OSS-120B، Qwen3-235B و DeepSeek-R1 در بیش از ۷۵ درصد موارد در پیروی از دستورالعمل‌های کاربر در طول فرآیند استدلال خود شکست می‌خورند. این تحقیق با معرفی معیار ReasonIF، که شامل ۳۰۰ مسئله ریاضی و علمی با دستورالعمل‌های استدلالی مشخص است، انجام شده است. دستورالعمل‌ها شامل محدودیت‌های زبانی (مثلاً استدلال به زبان عربی)، قالب‌بندی JSON، محدودیت کلمات و سایر قوانین کاربرمحور هستند. یافته‌ها حاکی از آن است که با افزایش دشواری وظیفه، توانایی پیروی از دستورالعمل‌ها در مراحل استدلالی به طور قابل توجهی کاهش می‌یابد. این موضوع اهمیت کنترل‌پذیری، شفافیت و ایمنی در تعامل با مدل‌ها را برجسته می‌کند. مطالعه جدید Together AI نشان می‌دهد مدل‌های استدلالی بزرگ (LRMs) مانند GPT-OSS-120B، Qwen3-235B و DeepSeek-R1 در بیش از ۷۵ درصد موارد در پیروی از دستورالعمل‌های کاربر در حین استدلال شکست می‌خورند. معیار ReasonIF با ۳۰۰ مسئله ریاضی و علمی و شش نوع دستورالعمل (مثلاً چندزبانه، قالب‌بندی JSON، محدودیت کلمات) معرفی شده است. پیروی از دستورالعمل‌ها در مراحل استدلالی با افزایش دشواری وظیفه بدتر می‌شود. این موضوع برای کنترل‌پذیری، شفافیت و ایمنی مدل‌ها حیاتی است. ReasonIF امکان ارزیابی خودکار و دقیق پیروی از دستورالعمل‌ها را فراهم می‌کند. پیروی از دستورالعمل‌ها در حین استدلال نه تنها پاسخ نهایی، بلکه فرآیند تفکر مدل را کنترل‌پذیرتر می‌کند. این امر شفافیت و ایمنی را افزایش داده و امکان بررسی برنامهای منطق و انطباق را فراهم می‌آورد. علاوه بر این، پیروی دقیق از دستورالعمل‌ها در برابر دستکاری‌های خصمانه مقاوم‌تر است و از تولید پاسخ‌های ظاهرا صحیح اما نادرست جلوگیری می‌کند. این یافته‌ها برای شرکت‌هایی که از مدل‌های استدلالی در سیستم‌های تصمیم‌گیری یا نرم‌افزارهای حساس استفاده می‌کنند، حیاتی است. عدم پیروی از دستورالعمل‌ها می‌تواند منجر به خطاهای هزینه‌بر یا تصمیمات نادرست شود. همچنین، بهبود کنترل‌پذیری مدل‌ها می‌تواند اعتماد مشتریان و کارایی عملیاتی را افزایش دهد. در ایران، پژوهشگران و شرکت‌های فعال در حوزه هوش مصنوعی می‌توانند از معیار ReasonIF برای ارزیابی و بهبود مدل‌های بومی استفاده کنند. این موضوع به ویژه برای کاربردهای حساس مانند سیستم‌های پزشکی یا مالی اهمیت دارد، جایی که دقت و پیروی از دستورالعمل‌ها حیاتی است. در حوزه حقوقی و فناوری، پیروی از دستورالعمل‌ها در استدلال مدل‌ها می‌تواند برای انطباق با مقررات و استانداردهای ایمنی هوش مصنوعی ضروری باشد. این امر به ویژه در مواردی که مدل‌ها در تصمیم‌گیری‌های حقوقی یا بررسی اسناد استفاده می‌شوند، اهمیت دارد. این مطالعه توسط Together AI در ایالات متحده انجام شده و تمرکز آن بر بهبود ایمنی و کنترل‌پذیری مدل‌های هوش مصنوعی است. با توجه به رقابت جهانی در حوزه AI، این یافته‌ها می‌توانند تأثیراتی بر سیاست‌گذاری‌ها و استانداردهای بین‌المللی داشته باشند. Together AI به عنوان یک شرکت پیشرو در حوزه هوش مصنوعی، این مطالعه را با هدف بهبود شفافیت و کنترل‌پذیری مدل‌های استدلالی انجام داده است. تمرکز بر معیار ReasonIF نشان‌دهنده تعهد این شرکت به ارزیابی دقیق و بهبود مدل‌ها است. مطالعه جدید Together AI با معیار ReasonIF نشان می‌دهد که مدل‌های استدلالی بزرگ در بیش از ۷۵ درصد موارد در پیروی از دستورالعمل‌ها در حین استدلال شکست می‌خورند.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

پیروی از دستورالعمل‌ها در حین استدلال نه تنها پاسخ نهایی، بلکه فرآیند تفکر مدل را کنترل‌پذیرتر می‌کند. این امر شفافیت و ایمنی را افزایش داده و امکان بررسی برنامهای منطق و انطباق را فراهم می‌آورد. علاوه بر این، پیروی دقیق از دستورالعمل‌ها در برابر دستکاری‌های خصمانه مقاوم‌تر است و از تولید پاسخ‌های ظاهرا صحیح اما نادرست جلوگیری می‌کند.

اثر کسب‌وکاری

این یافته‌ها برای شرکت‌هایی که از مدل‌های استدلالی در سیستم‌های تصمیم‌گیری یا نرم‌افزارهای حساس استفاده می‌کنند، حیاتی است. عدم پیروی از دستورالعمل‌ها می‌تواند منجر به خطاهای هزینه‌بر یا تصمیمات نادرست شود. همچنین، بهبود کنترل‌پذیری مدل‌ها می‌تواند اعتماد مشتریان و کارایی عملیاتی را افزایش دهد.

اثر احتمالی برای ایران

در ایران، پژوهشگران و شرکت‌های فعال در حوزه هوش مصنوعی می‌توانند از معیار ReasonIF برای ارزیابی و بهبود مدل‌های بومی استفاده کنند. این موضوع به ویژه برای کاربردهای حساس مانند سیستم‌های پزشکی یا مالی اهمیت دارد، جایی که دقت و پیروی از دستورالعمل‌ها حیاتی است.

ارتباط با LegalTech

در حوزه حقوقی و فناوری، پیروی از دستورالعمل‌ها در استدلال مدل‌ها می‌تواند برای انطباق با مقررات و استانداردهای ایمنی هوش مصنوعی ضروری باشد. این امر به ویژه در مواردی که مدل‌ها در تصمیم‌گیری‌های حقوقی یا بررسی اسناد استفاده می‌شوند، اهمیت دارد.

زاویه رسانه/کشور منبع

Together AI به عنوان یک شرکت پیشرو در حوزه هوش مصنوعی، این مطالعه را با هدف بهبود شفافیت و کنترل‌پذیری مدل‌های استدلالی انجام داده است. تمرکز بر معیار ReasonIF نشان‌دهنده تعهد این شرکت به ارزیابی دقیق و بهبود مدل‌ها است.

برچسب‌ها