CoderForge-Preview: بزرگترین مجموعه‌داده باز با تأیید آزمون برای آموزش عامل‌های کدگذاری کارآمد

Together AI BlogUnited States3 دقیقه مطالعه۱۴۰۵/۰۶/۰۹ ساعت ۰۹:۳۰

تصویر مرتبط با خبر: CoderForge-Preview: SOTA open dataset for training efficient coding agents
تصویر مرتبط با خبر: CoderForge-Preview: SOTA open dataset for training efficient coding agents
خلاصه سریع

اصل خبر در چند خط

Together AI مجموعه‌داده CoderForge-Preview را به عنوان بزرگترین مجموعه‌داده باز با تأیید آزمون برای عامل‌های کدگذاری معرفی کرد. این مجموعه شامل ۲۵۸ هزار مسیر تاییدشده آزمون در ۵۱ هزار وظیفه است که از سه منبع R2E-Gym، SWE-Smith و SWE-Rebench استخراج شده‌اند. تنظیم دقیق Qwen-3 32B با این داده‌ها، عملکرد آن را در SWE-Bench Verified به ۵۹.۴٪ رساند که ۲۳٪ بهبود نسبت به مدل پایه دارد. تولید داده‌ها با استفاده از Qwen3-Coder-480B و داربست OpenHands انجام شد. هزینه کل تولید این مجموعه‌داده حدود ۱۳۰ هزار دلار بوده است.

متن خبر

شرح خبر

Together AI بزرگترین مجموعه‌داده باز با تأیید آزمون برای عامل‌های کدگذاری به نام CoderForge-Preview را منتشر کرد. این مجموعه شامل ۲۵۸ هزار مسیر تاییدشده آزمون (۱۵۵ هزار موفق و ۱۰۳ هزار ناموفق) در ۵۱ هزار وظیفه و ۱۶۵۵ مخزن است. با استفاده از آن برای تنظیم دقیق Qwen-3 32B، عملکرد SWE-Bench Verified به ۵۹.۴٪ رسید که ۲۳٪ بالاتر از مدل پایه است و در رده اول مدل‌های با داده باز در محدوده پارامتر ≤32B قرار گرفت. هدف از انتشار باز این مجموعه‌داده، شتاب بخشیدن به پیشرفت جامعه هوش مصنوعی منبعباز و توانمندسازی محققان برای ساخت و بهبود مدل‌ها است. هزینه تولید این مجموعه‌داده حدود ۱۳۰ هزار دلار برآورد شده است. Together AI مجموعه‌داده CoderForge-Preview را به عنوان بزرگترین مجموعه‌داده باز با تأیید آزمون برای عامل‌های کدگذاری معرفی کرد. این مجموعه شامل ۲۵۸ هزار مسیر تاییدشده آزمون در ۵۱ هزار وظیفه است که از سه منبع R2E-Gym، SWE-Smith و SWE-Rebench استخراج شده‌اند. تنظیم دقیق Qwen-3 32B با این داده‌ها، عملکرد آن را در SWE-Bench Verified به ۵۹.۴٪ رساند که ۲۳٪ بهبود نسبت به مدل پایه دارد. تولید داده‌ها با استفاده از Qwen3-Coder-480B و داربست OpenHands انجام شد. هزینه کل تولید این مجموعه‌داده حدود ۱۳۰ هزار دلار بوده است. پیشرفت عامل‌های کدگذاری به شدت به دسترسی به مجموعه‌داده‌های آموزش باز و با کیفیت بالا وابسته است. CoderForge-Preview با ارائه ۲۵۸ هزار مسیر تاییدشده آزمون، گلوگاه اصلی جامعه تحقیقاتی را برطرف می‌کند. این مجموعه‌داده نه تنها مقیاس و کیفیت بی‌سابقه‌ای دارد، بلکه با انتشار باز، امکان رقابت مدل‌های منبعباز با مدل‌های انحصاری را فراهم می‌آورد و نوآوری در حوزه هوش مصنوعی را شتاب می‌بخشد. این مجموعه‌داده می‌تواند به شرکت‌ها و محققان کمک کند تا مدل‌های کدگذاری کارآمدتری را با هزینه کمتر توسعه دهند. بهبود عملکرد مدل‌ها در وظایف کدگذاری می‌تواند به افزایش بهره‌وری در توسعه نرم‌افزار و کاهش هزینه‌های عملیاتی منجر شود. علاوه بر این، دسترسی به داده‌های باز می‌تواند رقابت در بازار هوش مصنوعی را عادلانه‌تر کند. دسترسی به مجموعه‌داده‌های باز مانند CoderForge-Preview می‌تواند برای محققان و استارت‌آپ‌های ایرانی در حوزه هوش مصنوعی مفید باشد. این مجموعه‌داده امکان آموزش مدل‌های کدگذاری پیشرفته را بدون وابستگی به منابع انحصاری فراهم می‌کند و می‌تواند به رشد اکوسیستم فناوری ایران کمک کند. انتشار باز مجموعه‌داده‌های آموزش می‌تواند چالش‌های حقوقی مربوط به مالکیت فکری و استفاده از داده‌ها را کاهش دهد. این رویکرد شفافیت بیشتری در توسعه مدل‌های هوش مصنوعی ایجاد می‌کند و می‌تواند به تدوین استانداردهای جدیدی برای اشتراک‌گذاری داده‌ها در جامعه فناوری منجر شود. انتشار مجموعه‌داده‌های باز می‌تواند تأثیرات ژئوپلیتیکی داشته باشد، زیرا کشورها و شرکت‌هایی که به منابع انحصاری دسترسی ندارند، می‌توانند از این داده‌ها برای رقابت در حوزه هوش مصنوعی استفاده کنند. این امر می‌تواند تعادل قدرت در صنعت فناوری را تغییر دهد. Together AI با انتشار CoderForge-Preview، مجموعه‌داده‌ای با ۲۵۸ هزار مسیر تاییدشده آزمون، عملکرد Qwen-3 32B را در SWE-Bench به ۵۹.۴٪ رساند.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

پیشرفت عامل‌های کدگذاری به شدت به دسترسی به مجموعه‌داده‌های آموزش باز و با کیفیت بالا وابسته است. CoderForge-Preview با ارائه ۲۵۸ هزار مسیر تاییدشده آزمون، گلوگاه اصلی جامعه تحقیقاتی را برطرف می‌کند. این مجموعه‌داده نه تنها مقیاس و کیفیت بی‌سابقه‌ای دارد، بلکه با انتشار باز، امکان رقابت مدل‌های منبعباز با مدل‌های انحصاری را فراهم می‌آورد و نوآوری در حوزه هوش مصنوعی را شتاب می‌بخشد.

اثر کسب‌وکاری

این مجموعه‌داده می‌تواند به شرکت‌ها و محققان کمک کند تا مدل‌های کدگذاری کارآمدتری را با هزینه کمتر توسعه دهند. بهبود عملکرد مدل‌ها در وظایف کدگذاری می‌تواند به افزایش بهره‌وری در توسعه نرم‌افزار و کاهش هزینه‌های عملیاتی منجر شود. علاوه بر این، دسترسی به داده‌های باز می‌تواند رقابت در بازار هوش مصنوعی را عادلانه‌تر کند.

اثر احتمالی برای ایران

دسترسی به مجموعه‌داده‌های باز مانند CoderForge-Preview می‌تواند برای محققان و استارت‌آپ‌های ایرانی در حوزه هوش مصنوعی مفید باشد. این مجموعه‌داده امکان آموزش مدل‌های کدگذاری پیشرفته را بدون وابستگی به منابع انحصاری فراهم می‌کند و می‌تواند به رشد اکوسیستم فناوری ایران کمک کند.

ارتباط با LegalTech

انتشار باز مجموعه‌داده‌های آموزش می‌تواند چالش‌های حقوقی مربوط به مالکیت فکری و استفاده از داده‌ها را کاهش دهد. این رویکرد شفافیت بیشتری در توسعه مدل‌های هوش مصنوعی ایجاد می‌کند و می‌تواند به تدوین استانداردهای جدیدی برای اشتراک‌گذاری داده‌ها در جامعه فناوری منجر شود.

زاویه رسانه/کشور منبع

Together AI

برچسب‌ها