⚖️ مقارنة

GPT-5.6 يتحدى Fable 5: من يفوز في سباق البرمجة الوكيلية؟

ماذا حدث؟

بعد أسبوع واحد فقط من عودة Fable 5 للعمل بشكل كامل عقب توقف دام 19 يوماً بسبب قيود تصدير أمريكية، طرحت OpenAI عائلة GPT-5.6 مقسّمة إلى ثلاث فئات أداء: Sol في القمة، وTerra في الوسط، وLuna في القاعدة، كل فئة بسعرها الخاص. تشير النتائج إلى أن Fable 5 لا يزال متفوقاً بوضوح على مقياس SWE-Bench Pro، الذي يقيس إصلاح أخطاء محددة داخل قاعدة كود كبيرة، بفارق يقارب 15 نقطة، بينما تتصدر Sol مقياس Artificial Analysis Coding Agent Index بفارق طفيف نحو 2.8 نقطة فقط، مستخدمة أقل من نصف عدد الرموز والوقت الذي يحتاجه Fable 5. كما تفوقت Sol في مقاييس أخرى مثل BrowseComp وOSWorld 2.0، وأعلنت OpenAI أيضاً عن ChatGPT Work، وضع وكيلي منافس مباشر لـClaude Cowork، يعتمد على GPT-5.6 لقراءة البريد وتلخيص النصوص وبناء لوحات بيانات.

ماذا يعني؟

الفارق بين المقياسين يعكس اختلافاً جوهرياً في طبيعة كل نموذج: SWE-Bench Pro يشبه تكليف شخص بإصلاح عطل محدد بدقة دون التأثير على بقية النظام، وهو ما يتفوق فيه Fable 5، بينما Terminal-Bench يقيس القدرة العامة على تشغيل بيئة كاملة من الصفر، وهنا تتفوق Sol بفضل أداة Codex المصممة خصيصاً لها. لذلك لا يمكن القول إن نموذجاً واحداً تجاوز الآخر بالكامل؛ فكل منهما يتفوق في نوع مختلف من العمل، بينما تتفوق OpenAI بوضوح في كفاءة استهلاك الرموز والوقت والتكلفة.

لماذا يهمك؟

إذا كانت مهمتك تتمركز حول إصلاح أخطاء دقيقة داخل مشروع برمجي قائم، فـFable 5 لا يزال الخيار الأقوى حتى الآن. أما إذا كانت أولويتك تشغيل مهام تشغيلية متكاملة بسرعة وبتكلفة أقل، فقد يكون GPT-5.6 Sol خياراً أكثر كفاءة، لكن تذكّر أن نتائج OpenAI مستندة إلى أداة Codex الخاصة بها، فقد يقل هذا التفوق عند استخدام أدوات مختلفة.

← كل المستجدات