CoderForge-Preview: بزرگترین مجموعهداده باز با تأیید آزمون برای آموزش عاملهای کدگذاری کارآمد
Together AI BlogUnited States3 دقیقه مطالعه۱۴۰۵/۰۶/۰۹ ساعت ۰۹:۳۰
تصویر مرتبط با خبر: CoderForge-Preview: SOTA open dataset for training efficient coding agents
خلاصه سریع
اصل خبر در چند خط
Together AI مجموعهداده CoderForge-Preview را به عنوان بزرگترین مجموعهداده باز با تأیید آزمون برای عاملهای کدگذاری معرفی کرد.
این مجموعه شامل ۲۵۸ هزار مسیر تاییدشده آزمون در ۵۱ هزار وظیفه است که از سه منبع R2E-Gym، SWE-Smith و SWE-Rebench استخراج شدهاند.
تنظیم دقیق Qwen-3 32B با این دادهها، عملکرد آن را در SWE-Bench Verified به ۵۹.۴٪ رساند که ۲۳٪ بهبود نسبت به مدل پایه دارد.
تولید دادهها با استفاده از Qwen3-Coder-480B و داربست OpenHands انجام شد.
هزینه کل تولید این مجموعهداده حدود ۱۳۰ هزار دلار بوده است.
متن خبر
شرح خبر
Together AI بزرگترین مجموعهداده باز با تأیید آزمون برای عاملهای کدگذاری به نام CoderForge-Preview را منتشر کرد.
این مجموعه شامل ۲۵۸ هزار مسیر تاییدشده آزمون (۱۵۵ هزار موفق و ۱۰۳ هزار ناموفق) در ۵۱ هزار وظیفه و ۱۶۵۵ مخزن است.
با استفاده از آن برای تنظیم دقیق Qwen-3 32B، عملکرد SWE-Bench Verified به ۵۹.۴٪ رسید که ۲۳٪ بالاتر از مدل پایه است و در رده اول مدلهای با داده باز در محدوده پارامتر ≤32B قرار گرفت.
هدف از انتشار باز این مجموعهداده، شتاب بخشیدن به پیشرفت جامعه هوش مصنوعی منبعباز و توانمندسازی محققان برای ساخت و بهبود مدلها است.
هزینه تولید این مجموعهداده حدود ۱۳۰ هزار دلار برآورد شده است.
Together AI مجموعهداده CoderForge-Preview را به عنوان بزرگترین مجموعهداده باز با تأیید آزمون برای عاملهای کدگذاری معرفی کرد.
این مجموعه شامل ۲۵۸ هزار مسیر تاییدشده آزمون در ۵۱ هزار وظیفه است که از سه منبع R2E-Gym، SWE-Smith و SWE-Rebench استخراج شدهاند.
تنظیم دقیق Qwen-3 32B با این دادهها، عملکرد آن را در SWE-Bench Verified به ۵۹.۴٪ رساند که ۲۳٪ بهبود نسبت به مدل پایه دارد.
تولید دادهها با استفاده از Qwen3-Coder-480B و داربست OpenHands انجام شد.
هزینه کل تولید این مجموعهداده حدود ۱۳۰ هزار دلار بوده است.
پیشرفت عاملهای کدگذاری به شدت به دسترسی به مجموعهدادههای آموزش باز و با کیفیت بالا وابسته است.
CoderForge-Preview با ارائه ۲۵۸ هزار مسیر تاییدشده آزمون، گلوگاه اصلی جامعه تحقیقاتی را برطرف میکند.
این مجموعهداده نه تنها مقیاس و کیفیت بیسابقهای دارد، بلکه با انتشار باز، امکان رقابت مدلهای منبعباز با مدلهای انحصاری را فراهم میآورد و نوآوری در حوزه هوش مصنوعی را شتاب میبخشد.
این مجموعهداده میتواند به شرکتها و محققان کمک کند تا مدلهای کدگذاری کارآمدتری را با هزینه کمتر توسعه دهند.
بهبود عملکرد مدلها در وظایف کدگذاری میتواند به افزایش بهرهوری در توسعه نرمافزار و کاهش هزینههای عملیاتی منجر شود.
علاوه بر این، دسترسی به دادههای باز میتواند رقابت در بازار هوش مصنوعی را عادلانهتر کند.
دسترسی به مجموعهدادههای باز مانند CoderForge-Preview میتواند برای محققان و استارتآپهای ایرانی در حوزه هوش مصنوعی مفید باشد.
این مجموعهداده امکان آموزش مدلهای کدگذاری پیشرفته را بدون وابستگی به منابع انحصاری فراهم میکند و میتواند به رشد اکوسیستم فناوری ایران کمک کند.
انتشار باز مجموعهدادههای آموزش میتواند چالشهای حقوقی مربوط به مالکیت فکری و استفاده از دادهها را کاهش دهد.
این رویکرد شفافیت بیشتری در توسعه مدلهای هوش مصنوعی ایجاد میکند و میتواند به تدوین استانداردهای جدیدی برای اشتراکگذاری دادهها در جامعه فناوری منجر شود.
انتشار مجموعهدادههای باز میتواند تأثیرات ژئوپلیتیکی داشته باشد، زیرا کشورها و شرکتهایی که به منابع انحصاری دسترسی ندارند، میتوانند از این دادهها برای رقابت در حوزه هوش مصنوعی استفاده کنند.
این امر میتواند تعادل قدرت در صنعت فناوری را تغییر دهد.
Together AI با انتشار CoderForge-Preview، مجموعهدادهای با ۲۵۸ هزار مسیر تاییدشده آزمون، عملکرد Qwen-3 32B را در SWE-Bench به ۵۹.۴٪ رساند.
این صفحه خلاصه و تحلیل فارسی خبر را نمایش میدهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.
تحلیل تحریریه
ابعاد مهم خبر
چرا مهم است؟
پیشرفت عاملهای کدگذاری به شدت به دسترسی به مجموعهدادههای آموزش باز و با کیفیت بالا وابسته است.
CoderForge-Preview با ارائه ۲۵۸ هزار مسیر تاییدشده آزمون، گلوگاه اصلی جامعه تحقیقاتی را برطرف میکند.
این مجموعهداده نه تنها مقیاس و کیفیت بیسابقهای دارد، بلکه با انتشار باز، امکان رقابت مدلهای منبعباز با مدلهای انحصاری را فراهم میآورد و نوآوری در حوزه هوش مصنوعی را شتاب میبخشد.
اثر کسبوکاری
این مجموعهداده میتواند به شرکتها و محققان کمک کند تا مدلهای کدگذاری کارآمدتری را با هزینه کمتر توسعه دهند.
بهبود عملکرد مدلها در وظایف کدگذاری میتواند به افزایش بهرهوری در توسعه نرمافزار و کاهش هزینههای عملیاتی منجر شود.
علاوه بر این، دسترسی به دادههای باز میتواند رقابت در بازار هوش مصنوعی را عادلانهتر کند.
اثر احتمالی برای ایران
دسترسی به مجموعهدادههای باز مانند CoderForge-Preview میتواند برای محققان و استارتآپهای ایرانی در حوزه هوش مصنوعی مفید باشد.
این مجموعهداده امکان آموزش مدلهای کدگذاری پیشرفته را بدون وابستگی به منابع انحصاری فراهم میکند و میتواند به رشد اکوسیستم فناوری ایران کمک کند.
ارتباط با LegalTech
انتشار باز مجموعهدادههای آموزش میتواند چالشهای حقوقی مربوط به مالکیت فکری و استفاده از دادهها را کاهش دهد.
این رویکرد شفافیت بیشتری در توسعه مدلهای هوش مصنوعی ایجاد میکند و میتواند به تدوین استانداردهای جدیدی برای اشتراکگذاری دادهها در جامعه فناوری منجر شود.