🐡 أدوات

Sakana Fugu Ultra — نظام وكلاء ياباني يتخطى GPT-5.5 وOpus 4.8 في المعايير القياسية دون استخدام Fable 5

ماذا حدث؟

في ٢٢ يونيو ٢٠٢٦، أطلقت Sakana AI اليابانية نظام Sakana Fugu: منصة تُحرّك مجموعة من النماذج الكبرى كوحدة واحدة — تُسمّى 'agent pool' — وتوزّع المهام بينها تلقائياً حسب طبيعة كل سؤال. يأتي بنسختين: Fugu للمهام اليومية، وFugu Ultra لأعلى دقة ممكنة. النتائج على المعايير القياسية لـFugu Ultra: 73.7% على SWE-Bench Pro (مقابل GPT-5.5 بـ58.6% وOpus 4.8 بـ69.2%)، و95.5% على GPQA-D للعلوم، و82.1% على TerminalBench 2.1، و50.0% على Humanity's Last Exam (مقابل Opus 4.8 بـ49.8%). الملاحظة المهمة: هذه المقارنات تستثني Fable 5 وMythos 5 من pool الوكلاء لأنهما محظوران للوصول العام، مما يعني أن Fugu Ultra يحقق هذه النتائج من خلال نماذج متاحة للعموم فقط. التسعير: API بـ$5 لكل مليون token مدخل و$30 مخرج، واشتراكات بـ$20 شهرياً (Standard) و$100 (Pro) و$200 (Max). رسالة Sakana للدول المقيّدة من Fable 5 وMythos 5 كانت مباشرة: 'الفجو يتيح تبديل النماذج بمرونة — حتى لو قُيّدت نماذج بعينها، يستمر النظام'.

ماذا يعني؟

Sakana Fugu يُثبت نظرية ظلّت نظرية: تنسيق عدة نماذج متوسطة قد يتفوق على نموذج واحد عملاق. لكن الجدل الحقيقي حول قيمة هذا النهج يدور حول قابلية التحقق — المستخدم لا يعرف أي نموذج أجاب على سؤاله بعينه. النقطة الأكثر أهمية استراتيجياً: Fugu يُقدّم نفسه كبديل لمن يقع خارج نطاق القيود التصديرية لـFable 5 وMythos 5، وهذا يفتح سوقاً ضخماً لم تستطع Anthropic خدمته.

لماذا يهمك؟

إذا كنت تستخدم كلود في مهام كود معقدة وتجد التكلفة مرتفعة، جرّب Fugu عبر API المتاح على console.sakana.ai — الأداء على SWE-Bench Pro أعلى من Opus 4.8 بتكلفة مقاربة. لمشاريع تتطلب أعلى دقة في المسائل العلمية والرياضية، Fugu Ultra قد يكون خياراً يستحق الاختبار. النقطة التي تحتاج انتباهاً: لا تعرف أي نموذج يعمل خلف أجابتك — وهذا يُعقّد الـdebugging إذا جاءت المخرجات غير متوقعة.

← كل المستجدات