الذكاء الاصطناعي
OpenAI تطلق ChatGPT Images 2.0 مع تحسين عرض النصوص
أصدرت OpenAI نموذج ChatGPT Images 2.0، وهو نموذج جديد يتميز بتحسين عرض النصوص، ودقة تصل إلى 2K، و"قدرات تفكير" لمهام توليد الصور المعقدة.
أطلقت شركة OpenAI نموذج ChatGPT Images 2.0، وهو نموذج يحسّن بشكل كبير عرض النصوص والعناصر الدقيقة مثل الأيقونات ومكونات واجهة المستخدم (UI). تاريخياً، واجهت مولدات الصور صعوبة في التهجئة، وغالباً ما كانت تنتج نصوصاً غير مقروءة. يعالج النموذج الجديد هذه المشكلة من خلال توليد نصوص فعالة داخل الصور، مثل إنشاء قائمة مطعم تدرج طبق “سيفيتشي” بسعر 13.50 دولاراً دون أخطاء إملائية شائعة في النماذج الأقدم مثل DALL-E 3. بالإضافة إلى ذلك، يُظهر النموذج تقدماً ملحوظاً في التعامل مع النصوص غير اللاتينية، وتحديداً باللغات اليابانية والكورية والهندية والبنغالية.
في بيان صحفي، ذكرت OpenAI: “يجلب Images 2.0 مستوى غير مسبوق من الدقة والوضوح لإنشاء الصور. فهو لا يستطيع تصور صور أكثر تعقيداً فحسب، بل إنه يجسد هذه الرؤية بفعالية، وقادر على اتباع التعليمات، والحفاظ على التفاصيل المطلوبة، وعرض العناصر الدقيقة التي غالباً ما تعطل نماذج الصور: النصوص الصغيرة، والأيقونات، وعناصر واجهة المستخدم، والتكوينات الكثيفة، والقيود الأسلوبية الدقيقة، كل ذلك بدقة تصل إلى 2K”. يقدم النموذج ما تسميه OpenAI “قدرات تفكير”، والتي تدعي الشركة أنها تسمح للنظام بالبحث في الويب، وتوليد صور متعددة من مطالبة واحدة، والتحقق المزدوج من إبداعاته الخاصة. ومع ذلك، يجب على المستخدمين ملاحظة أن تاريخ قطع المعرفة الخاص بالنموذج — وهو التاريخ الذي لا يملك النموذج بعده أي بيانات تدريب — هو ديسمبر 2025.
تاريخياً، عانت مولدات صور الذكاء الاصطناعي من صعوبة في التهجئة لأنها استخدمت عموماً نماذج الانتشار (diffusion models)، وهي نماذج ذكاء اصطناعي تعيد بناء الصور من الضوضاء. قال Asmelash Teka Hadgu، المؤسس والرئيس التنفيذي لشركة Lesan AI، لـ TechCrunch في عام 2024: “نماذج الانتشار […] تعيد بناء مدخلات معينة. يمكننا افتراض أن الكتابات على الصورة هي جزء صغير جداً جداً، لذا يتعلم مولد الصور الأنماط التي تغطي المزيد من هذه البكسلات”. وبينما استكشف الباحثون آليات أخرى مثل النماذج الانحدارية الذاتية (autoregressive models)، رفضت OpenAI الإجابة عن نوع النموذج الذي يشغل ChatGPT Images 2.0.
يبدأ الوصول إلى النموذج الجديد يوم الثلاثاء لجميع مستخدمي ChatGPT وCodex، مع توفير مستويات مدفوعة لمخرجات أكثر تقدماً. كما تطلق OpenAI واجهة برمجة التطبيقات gpt-image-2 للمطورين، مع تسعير يعتمد على جودة ودقة المخرجات.
لماذا يهم
يمثل إصدار ChatGPT Images 2.0 تحسناً كبيراً في توليد صور الذكاء الاصطناعي، وتحديداً في القدرة على عرض النصوص والعناصر الدقيقة مثل الأيقونات وعناصر واجهة المستخدم، والتي كانت تاريخياً صعبة بالنسبة لنماذج الانتشار.