مقایسه عملکرد و هزینه-کارایی چهار مدل هوش مصنوعی در ترسیم آثار هنری: GPT-5.6 Sol برنده، Grok 4.5 شکست خورده
GIGAZINEJapan1 دقیقه مطالعه۱۴۰۵/۰۶/۱۹ ساعت ۲۱:۰۰
تصویر مرتبط با خبر: モナリザなどをAIに描かせて完成物やコスパを比較、特にGrokだけが飛び抜けて奇妙な結果に
خلاصه سریع
اصل خبر در چند خط
پلتفرم TryAI چهار مدل هوش مصنوعی شامل Claude Fable 5، GPT-5.6 Sol، Grok 4.5 و Gemini 3.6 Flash را در ترسیم آثار هنری مورد آزمایش قرار داد.
این مدلها با استفاده از روش «کنترل برنامه نقاشی» موظف به بازسازی آثار معروف و ترسیم از صفر شدند.
نتایج نشان داد که GPT-5.6 Sol بهترین عملکرد را داشت، در حالی که Grok 4.5 به شدت مورد انتقاد قرار گرفت.
از نظر هزینه، Claude Fable 5 گرانترین و کندترین مدل بود، اما Grok 4.5 به دلیل استفاده از کش، هزینه بسیار پایینی داشت.
TryAI تأکید کرد که هدف این تست نشان دادن شکاف بین فناوریهای پیشرفته و باز و همچنین هزینههای واقعی وظایف طولانیمدت بوده است.
متن خبر
شرح خبر
پلتفرم TryAI با هدف ارزیابی توانایی چهار مدل پیشرفته هوش مصنوعی شامل Claude Fable 5 (Anthropic)، GPT-5.6 Sol (OpenAI)، Grok 4.5 (SpaceXAI) و Gemini 3.6 Flash (گوگل) در تولید تصویر، تستی را با استفاده از روش «کنترل برنامه نقاشی» انجام داد.
این مدلها که فاقد توانایی مستقیم تولید تصویر بودند، موظف به بازسازی آثار معروفی همچون «مونالیزا» و «شب پرستاره» و همچنین ترسیم از صفر بر اساس دستورهای متنی شدند.
نتایج نشان داد که GPT-5.6 Sol با دقت بالا و جزئیات برجسته، به ویژه در ترسیم «شب پرستاره» و «گل سرخ»، عملکردی شگفتانگیز داشت.
در مقابل، Grok 4.5 به دلیل عدم توانایی در درک خروجیهای بصری و کیفیت پایین، تقریباً غیرقابل استفاده ارزیابی شد.
از نظر هزینه، Claude Fable 5 گرانترین و کندترین مدل بود، در حالی که Grok 4.5 به دلیل استفاده از کش ۹۸ درصدی، هزینه بسیار پایینی داشت.
این تست نه تنها شکاف بین فناوریهای پیشرفته و باز را نشان داد، بلکه هزینههای واقعی وظایف طولانیمدت را نیز آشکار کرد.
این صفحه خلاصه و تحلیل فارسی خبر را نمایش میدهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.
تحلیل تحریریه
ابعاد مهم خبر
چرا مهم است؟
این تست نشان میدهد که علیرغم پیشرفتهای چشمگیر در حوزه هوش مصنوعی، هنوز تفاوتهای قابل توجهی بین مدلهای مختلف از نظر کیفیت، هزینه و کارایی وجود دارد.
عملکرد ضعیف Grok 4.5 میتواند نشاندهنده چالشهای فنی در توسعه مدلهای هوش مصنوعی باشد که قادر به درک و تولید خروجیهای بصری با کیفیت نیستند.
علاوه بر این، مقایسه هزینه-کارایی مدلها میتواند برای کسبوکارها و توسعهدهندگان در انتخاب مدل مناسب برای پروژههای خود مفید باشد.
اثر کسبوکاری
این نتایج میتواند بر تصمیمگیری شرکتها در انتخاب مدلهای هوش مصنوعی برای پروژههای خود تأثیر بگذارد.
مدلهایی مانند GPT-5.6 Sol که عملکرد بالایی دارند، ممکن است برای پروژههایی که کیفیت بالا اهمیت دارد، ترجیح داده شوند.
از سوی دیگر، مدلهایی مانند Grok 4.5 که هزینه پایینی دارند، ممکن است برای پروژههایی با بودجه محدود مناسب باشند، هرچند که کیفیت پایینتری ارائه میدهند.
اثر احتمالی برای ایران
در ایران، که دسترسی به برخی از مدلهای پیشرفته هوش مصنوعی ممکن است محدود باشد، این نتایج میتواند به توسعهدهندگان و کسبوکارها کمک کند تا مدلهای جایگزین را ارزیابی کنند.
علاوه بر این، آگاهی از هزینهها و کیفیت مدلهای مختلف میتواند به بهینهسازی منابع در پروژههای هوش مصنوعی کمک کند.
ارتباط با LegalTech
این تست میتواند بر بحثهای مربوط به مالکیت فکری و حقوقی در حوزه هوش مصنوعی تأثیر بگذارد.
برای مثال، توانایی مدلها در بازسازی آثار هنری معروف میتواند سوالاتی در مورد حقوق کپیرایت و استفاده از آثار هنری توسط هوش مصنوعی ایجاد کند.