مقایسه عملکرد و هزینه-کارایی چهار مدل هوش مصنوعی در ترسیم آثار هنری: GPT-5.6 Sol برنده، Grok 4.5 شکست خورده

GIGAZINEJapan1 دقیقه مطالعه۱۴۰۵/۰۶/۱۹ ساعت ۲۱:۰۰

تصویر مرتبط با خبر: モナリザなどをAIに描かせて完成物やコスパを比較、特にGrokだけが飛び抜けて奇妙な結果に
تصویر مرتبط با خبر: モナリザなどをAIに描かせて完成物やコスパを比較、特にGrokだけが飛び抜けて奇妙な結果に
خلاصه سریع

اصل خبر در چند خط

پلتفرم TryAI چهار مدل هوش مصنوعی شامل Claude Fable 5، GPT-5.6 Sol، Grok 4.5 و Gemini 3.6 Flash را در ترسیم آثار هنری مورد آزمایش قرار داد. این مدل‌ها با استفاده از روش «کنترل برنامه نقاشی» موظف به بازسازی آثار معروف و ترسیم از صفر شدند. نتایج نشان داد که GPT-5.6 Sol بهترین عملکرد را داشت، در حالی که Grok 4.5 به شدت مورد انتقاد قرار گرفت. از نظر هزینه، Claude Fable 5 گران‌ترین و کندترین مدل بود، اما Grok 4.5 به دلیل استفاده از کش، هزینه بسیار پایینی داشت. TryAI تأکید کرد که هدف این تست نشان دادن شکاف بین فناوری‌های پیشرفته و باز و همچنین هزینه‌های واقعی وظایف طولانی‌مدت بوده است.

متن خبر

شرح خبر

پلتفرم TryAI با هدف ارزیابی توانایی چهار مدل پیشرفته هوش مصنوعی شامل Claude Fable 5 (Anthropic)، GPT-5.6 Sol (OpenAI)، Grok 4.5 (SpaceXAI) و Gemini 3.6 Flash (گوگل) در تولید تصویر، تستی را با استفاده از روش «کنترل برنامه نقاشی» انجام داد. این مدل‌ها که فاقد توانایی مستقیم تولید تصویر بودند، موظف به بازسازی آثار معروفی همچون «مونالیزا» و «شب پرستاره» و همچنین ترسیم از صفر بر اساس دستورهای متنی شدند. نتایج نشان داد که GPT-5.6 Sol با دقت بالا و جزئیات برجسته، به ویژه در ترسیم «شب پرستاره» و «گل سرخ»، عملکردی شگفت‌انگیز داشت. در مقابل، Grok 4.5 به دلیل عدم توانایی در درک خروجی‌های بصری و کیفیت پایین، تقریباً غیرقابل استفاده ارزیابی شد. از نظر هزینه، Claude Fable 5 گران‌ترین و کندترین مدل بود، در حالی که Grok 4.5 به دلیل استفاده از کش ۹۸ درصدی، هزینه بسیار پایینی داشت. این تست نه تنها شکاف بین فناوری‌های پیشرفته و باز را نشان داد، بلکه هزینه‌های واقعی وظایف طولانی‌مدت را نیز آشکار کرد.

این صفحه خلاصه و تحلیل فارسی خبر را نمایش می‌دهد. نسخه کامل/اصلی از طریق لینک منبع در دسترس است.

تحلیل تحریریه

ابعاد مهم خبر

چرا مهم است؟

این تست نشان می‌دهد که علیرغم پیشرفت‌های چشمگیر در حوزه هوش مصنوعی، هنوز تفاوت‌های قابل توجهی بین مدل‌های مختلف از نظر کیفیت، هزینه و کارایی وجود دارد. عملکرد ضعیف Grok 4.5 می‌تواند نشان‌دهنده چالش‌های فنی در توسعه مدل‌های هوش مصنوعی باشد که قادر به درک و تولید خروجی‌های بصری با کیفیت نیستند. علاوه بر این، مقایسه هزینه-کارایی مدل‌ها می‌تواند برای کسب‌وکارها و توسعه‌دهندگان در انتخاب مدل مناسب برای پروژه‌های خود مفید باشد.

اثر کسب‌وکاری

این نتایج می‌تواند بر تصمیم‌گیری شرکت‌ها در انتخاب مدل‌های هوش مصنوعی برای پروژه‌های خود تأثیر بگذارد. مدل‌هایی مانند GPT-5.6 Sol که عملکرد بالایی دارند، ممکن است برای پروژه‌هایی که کیفیت بالا اهمیت دارد، ترجیح داده شوند. از سوی دیگر، مدل‌هایی مانند Grok 4.5 که هزینه پایینی دارند، ممکن است برای پروژه‌هایی با بودجه محدود مناسب باشند، هرچند که کیفیت پایین‌تری ارائه می‌دهند.

اثر احتمالی برای ایران

در ایران، که دسترسی به برخی از مدل‌های پیشرفته هوش مصنوعی ممکن است محدود باشد، این نتایج می‌تواند به توسعه‌دهندگان و کسب‌وکارها کمک کند تا مدل‌های جایگزین را ارزیابی کنند. علاوه بر این، آگاهی از هزینه‌ها و کیفیت مدل‌های مختلف می‌تواند به بهینه‌سازی منابع در پروژه‌های هوش مصنوعی کمک کند.

ارتباط با LegalTech

این تست می‌تواند بر بحث‌های مربوط به مالکیت فکری و حقوقی در حوزه هوش مصنوعی تأثیر بگذارد. برای مثال، توانایی مدل‌ها در بازسازی آثار هنری معروف می‌تواند سوالاتی در مورد حقوق کپی‌رایت و استفاده از آثار هنری توسط هوش مصنوعی ایجاد کند.

زاویه رسانه/کشور منبع

فنی و تحلیلی

برچسب‌ها