الأخبار

هل يتفوق Claude Opus 5 على Claude Fable 5 في الألعاب والتصميم والروبوتات؟

أطلقت شركة Anthropic رسميًا نموذج Claude Opus 5 الجديد، والذي يقترب في مستوى الذكاء من أقوى نماذجها Claude Fable 5، ولكن بنصف التكلفة تقريبًا.

لكن هناك مفارقة مثيرة للاهتمام، إذ تصفه الشركة بأنه أكثر نماذجها توافقًا مع معايير السلامة حتى الآن، ومع ذلك فهو أيضًا النموذج الذي تتعامل معه بحذر شديد فيما يتعلق بالأمن السيبراني.

فلماذا يكون النموذج الأكثر أمانًا هو نفسه النموذج الذي تفرض عليه الشركة أكبر قدر من القيود؟

في حلقة اليوم من أخبار الذكاء الاصطناعي، نستعرض أفضل ما يقدمه Opus 5، ونوضح بالتفصيل المجالات التي يتفوق فيها على المنافسين، ولماذا تعترف Anthropic بأنها حدّت من بعض قدراته عمدًا، وهل يستحق بالفعل الانتقال إليه؟

هيا بنا نبدأ.

منذ اللحظة الأولى، أصبح Opus 5 يؤدي دورين رئيسيين داخل منظومة Anthropic.

فقد أصبح النموذج الافتراضي الجديد لمشتركي Claude Max، كما أصبح أقوى نموذج متاح لمستخدمي Claude Pro.

وتصفه Anthropic بأنه نموذج ذكي واستباقي، صُمم للاستخدام اليومي، وليس فقط لتنفيذ المهام المعقدة بين الحين والآخر.

والأرقام تؤكد ذلك.

فقد حقق أفضل النتائج عالميًا في مجموعتين من أشهر الاختبارات القياسية:
- Frontier Bench لقياس قدرات البرمجة.
- GDP Vala لقياس أداء النماذج في الأعمال المعرفية.

لكن هناك ملاحظة مهمة.

فبحسب إعلان الشركة نفسه، لا يزال Opus 5 أقل من نموذجها الأكثر تقييدًا Mythos 5 في مهام الأمن السيبراني.

لكن قبل أن نتحدث عن ذلك، دعونا نرى ما يستطيع Opus 5 فعله في العالم الحقيقي.

في أحد الاختبارات، طُلب من ذراع روبوتية تمتلك ست درجات من الحرية تنفيذ مهمة ترتيب الأوعية فوق بعضها، كما طُلب منها وضع شوكة داخل وعاء، وكل ذلك دون أي تدريب مسبق (Zero-Shot).

وقد نجح الروبوت في تنفيذ المهمتين من المحاولة الأولى.

وهذا إنجاز لافت، لأن نماذج اللغة الكبيرة ليست مدربة أساسًا للتحكم في الروبوتات، ومع ذلك تمكن Opus 5 من استنتاج الطريقة الصحيحة للتنفيذ.

والآن لنتحدث عن السعر، بينما نستعرض قدراته في التصميم الهندسي ثلاثي الأبعاد (CAD).

لم تغيّر Anthropic أسعار النموذج مقارنة بالإصدار السابق.

- 5 دولارات لكل مليون رمز إدخال (Input Tokens).
- 25 دولارًا لكل مليون رمز إخراج (Output Tokens).

أي أنها نفس أسعار Opus 4.8.

لكن مقابل هذا السعر، تحصل على أداء أعلى بكثير.

ففي اختبار Frontier Bench 0.1 حقق Opus 5 أكثر من ضعف نتيجة Opus 4.8، وفي الوقت نفسه بتكلفة أقل لكل مهمة.

أما في اختبار Cursor Bench 3.2 عند أعلى إعدادات التفكير، فقد وصل إلى نتيجة تقل بأقل من 0.5% فقط عن Claude Fable 5.

وبعبارة أخرى...

رغم أن Fable 5 هو أقوى وأغلى نموذج لدى Anthropic، فإن Opus 5 يقدم تقريبًا نفس الأداء مقابل نصف تكلفة التنفيذ.

وقدمت Anthropic أيضًا ميزة جديدة تسمى Effort Setting.

ويمكن تشبيهها بمقبض يسمح للمستخدم بالاختيار بين:
- سرعة أعلى وتكلفة أقل.
- أو تفكير أعمق وأداء أقوى.

وفي جميع مستويات التفكير (High وExtra High وMax)، تمكن Opus 5 من التفوق على جميع المنافسين.

قد يبدو تحقيق 99.12% من أداء أقوى نموذج برمجي مقابل نصف السعر أمرًا يصعب تصديقه.

لذلك أجرت الشركة اختبارات أكثر صعوبة لقياس التفكير والاستدلال الحقيقي، وليس البرمجة فقط.

في اختبار ARC AGI 3، المصمم لقياس القدرة على حل المشكلات الجديدة التي لا يمكن حفظ إجاباتها مسبقًا، سجل Opus 5 نتيجة تعادل ثلاثة أضعاف أفضل نموذج منافس.

أما في اختبار Zapier Automation Bench، الذي يقيس قدرة النموذج على تنفيذ مهام أعمال حقيقية من البداية حتى النهاية، فقد حقق معدل نجاح يزيد بحوالي مرة ونصف عن أقرب منافس بنفس التكلفة.

والأكثر إثارة أنه حتى عند استخدام أقل إعداد للتفكير، ظل متفوقًا على أفضل نتائج جميع النماذج الأخرى.

وفي اختبار OSWorld 2.0، الذي يتطلب من النموذج استخدام الكمبيوتر كما يفعل الإنسان، تفوق Opus 5 على جميع المنافسين في كل مستويات الأسعار.

بل إنه تفوق على أفضل نتيجة لـ Fable 5 رغم أن تكلفته لا تتجاوز ثلث تكلفة الأخير تقريبًا.

كما حقق أفضل النتائج أيضًا في:
- GDP Val AA v2
- HLE
- Deep Search QA

والآن قارنوا بين Opus 5 وFable 5 إلى جانب بقية النماذج الرائدة، وأخبرونا في التعليقات أيهما ترون الأفضل.

لكن بينما كان الجميع يحتفل بقفزة الأداء، كانت Anthropic تختبر جانبًا آخر أكثر أهمية...

المخاطر الأمنية.

والنتائج كانت مفاجئة.

خلال اختبارات ما قبل الإطلاق، أظهرت مراجعة السلوك الآلية الخاصة بالشركة أن Opus 5 هو أكثر نماذج Anthropic توافقًا مع معايير السلامة حتى الآن.

بل إنه تفوق على:
- Opus 4.8
- Sonnet 5
- وحتى Fable 5

كما سجل أقل معدل للسلوك الخادع بين جميع نماذج Claude الحديثة.

وليس هذا فقط...

فهو أيضًا الأقل عرضة للخداع أو الاستغلال في الاستخدامات غير المشروعة.

وفي مقياس Anthropic للسلوك غير المتوافق حصل على 2.3، وهو أفضل تقييم بين أحدث نماذج الشركة.

كما وصفته Anthropic بأنه أكثر نماذجها أمانًا فيما يتعلق بتجنب التصرفات المتهورة التي قد تؤدي إلى آثار يصعب التراجع عنها.

لكن...

كون النموذج أكثر أمانًا لا يعني أنه غير قادر على إحداث الضرر، فالأمران مختلفان تمامًا.

قد تكون نتائج الاختبارات رائعة، لكن البعض يرى أن اختبارات القياس يمكن التلاعب بها.

لذلك دعونا نرى كيف تصرف Opus 5 عند مواجهة مشكلات حقيقية دون أي تعليمات.

عرضت Anthropic ثلاثة أمثلة، وأحدها كان مذهلًا بالفعل.

في المثال الأول، أعطت الشركة Opus 5 صورة لقطعة ميكانيكية، وطلبت منه إعادة بنائها كنموذج CAD ثلاثي الأبعاد.

لكن كانت هناك خدعة.

فقد مُنع النموذج عمدًا من رؤية الصورة مباشرة.

فماذا فعل؟

قام بكتابة نظام رؤية حاسوبية كامل من الصفر ليستخرج الأبعاد الهندسية من وحدات البكسل بنفسه، ثم استخدم تلك البيانات لإعادة بناء القطعة بالكامل.

ونجح في ذلك عدة مرات متتالية، بينما فشلت جميع النماذج المنافسة في تنفيذ المهمة حتى مرة واحدة خلال خمس محاولات.

في المثال الثاني، عُرض على Opus 5 خطأ برمجي حقيقي داخل أحد أشهر مديري الحزم مفتوحة المصدر.

لم يكتفِ بإصلاح المشكلة الظاهرة، بل اكتشف السبب الحقيقي للمشكلة، وأصلح حالة خاصة كان حتى الإصلاح الرسمي للمجتمع البرمجي قد أغفلها.

أما بقية النماذج، فقد أصلحت العرض الظاهري فقط وأعلنت أن المشكلة انتهت.

أما المثال الثالث، فكان أكثر إثارة.

طُلب من Opus 5 إنشاء نظام بث مباشر لبيانات سوق مالي جديد بالكامل خلال جلسة واحدة.

وكانت النماذج السابقة عاجزة تمامًا عن تنفيذ المهمة، حتى مع حصولها على خطط تفصيلية من المهندسين.

لكن Opus 5 ابتكر حلًا مذهلًا.

فحين لم يجد مصدر بيانات مباشر لاختبار عمله، قام ببناء بيئة اختبار خاصة به للتحقق من أن الكود الذي كتبه يستطيع قراءة بيانات السوق بشكل صحيح.

بمعنى آخر...

قام الذكاء الاصطناعي بإنشاء نظام ضمان الجودة الخاص به دون أن يطلب منه أحد ذلك.

وهنا تضع Anthropic خطًا أحمر واضحًا.

فـ Opus 5 لا يتجاوز الحدود فيما يتعلق بالقدرات الخطيرة ذات الاستخدام المزدوج.

ولا يزال أقل قدرة من Mythos 5 في مجالي:
- أبحاث الأحياء.
- والأمن السيبراني الدفاعي.

ومن أكثر التفاصيل إثارة أن اختبار OSS Fuzz أظهر أن Opus 5 يكاد يضاهي Mythos 5 في اكتشاف الثغرات الأمنية، لكنه أضعف بكثير في استغلالها.

ويرجع ذلك إلى أن Anthropic اختارت عمدًا عدم تدريبه على المهام الهجومية في الأمن السيبراني.

كما وضعت الشركة ضوابط صارمة تمنعه من:
- فحص الثغرات في الملفات الثنائية.
- اختبارات الاختراق.
- توليد أكواد الاستغلال.

بينما تسمح له فقط باكتشاف الثغرات داخل الشفرة المصدرية.

أما الباحثون والمؤسسات المعتمدة، فيمكنهم الحصول على صلاحيات أوسع عبر برنامج Cyber Verification Program.

وفي مجال علوم الحياة، حقق Opus 5 تقدمًا ملحوظًا مقارنة بـ Opus 4.8.

فقد ارتفعت نتائجه في الكيمياء العضوية بمقدار 10.2 نقطة مئوية.

كما تحسنت نتائجه في المهام المتعلقة بالبروتينات، مثل توقع تأثير تغيرات التسلسل الجيني على وظيفة البروتين، بمقدار 7.7 نقطة مئوية.

ويتوفر Opus 5 بدءًا من اليوم على جميع المنصات، مصحوبًا بميزتين تجريبيتين جديدتين.

الأولى: إمكانية تغيير الأدوات المتاحة لـ Claude أثناء المحادثة دون فقدان ذاكرة الطلبات السابقة.

الثانية: التحويل التلقائي إلى نموذج آخر عند حظر أحد الطلبات، بدلًا من رفضه مباشرة، مما يضمن استمرار عمل واجهات البرمجة (API) دون انقطاع.

وكما هو الحال مع الإصدارات السابقة من Opus، لا يوجد أي شرط للاحتفاظ ببيانات المستخدمين في الاستخدام العام.