News8 min read٢٦ يوليو ٢٠٢٦

Claude Opus 5: ذكاء متقدم بتكلفة أقل لكل مهمة

صدر في 24 يوليو 2026، ويتصدّر Claude Opus 5 مؤشر الذكاء من Artificial Analysis بتكلفة أقل بنسبة 26% لكل مهمة من Fable 5 — ويتفوق عليه صراحةً بأقل من نصف السعر عند الجهد العالي.

أطلقت Anthropic نموذج Claude Opus 5 في 24 يوليو 2026. وفي مؤشر الذكاء المستقل من Artificial Analysis، بات الآن — بفارق ضئيل — أذكى نموذج جرى تقييمه، ويبلغ هذا الموقع بتكلفة أقل بنسبة 26% لكل مهمة من Claude Fable 5 الذي تجاوزه.

وهذا المزيج هو جوهر الخبر. فـOpus 5 ليس تحديثاً هامشياً، بل هو اللحظة التي توقفت فيها القدرة المتقدمة عن حمل سعر متقدم.

الأرقام

عند أقصى جهد، يحقق Claude Opus 5 نتيجة 61 في مؤشر الذكاء من Artificial Analysis، مقابل 60 لـClaude Fable 5، و59 لـGPT-5.6 Sol، و57 لـKimi K3، و56 لـClaude Opus 4.8. والفارق في القمة ضئيل، أما فارق التكلفة فلا: 2.03 دولار لكل مهمة مقابل 2.75 دولار لـFable 5.

والنتيجة الأوضح في العمل المعرفي الوكيلي، حيث الفجوة ليست هامشية إطلاقاً:

  • في GDPval-AA v2، يسجّل Opus 5 عند أقصى جهد 1861 نقطة Elo — بفارق يتجاوز 100 نقطة عن كل من Claude Fable 5 وGPT-5.6 Sol
  • في AA-Briefcase، وهو أقوى ما ظهرت فيه Anthropic، يسجّل 1720 نقطة Elo، بفارق 146 نقطة عن Fable 5
  • كما يتفوق إعدادا xhigh (1693) وhigh (1606) على Fable 5 بتكلفة أقل بكثير

ومنحنى التكلفة تحت هذه الأرقام هو ما ينبغي أن يهم كل من يدير ميزانية. فـOpus 5 عند أقصى جهد يكلف 17.79 دولاراً لكل مهمة في AA-Briefcase، أي أقل بنحو 20% من Fable 5 عند 22.30 دولاراً. لكنه عند الجهد العالي لا يزال يتفوق على Fable 5 — بفارق 32 نقطة Elo — بتكلفة 10.41 دولار لكل مهمة، أي أقل من نصف السعر.

وفي البرمجة، يحتل Opus 5 عند إعداد xhigh ضمن Claude Code المركز الأول مناصفةً في مؤشر وكلاء البرمجة، بما في ذلك أعلى نتيجة مسجلة في SWE-Atlas-QnA. وفي Terminal-Bench v2.1 يبلغ 89% عند أقصى جهد، أي على مستوى المتصدر GPT-5.6 Sol تقريباً. وفي اختبار Humanity's Last Exam يسجّل 53%، بما يتماشى مع Fable 5.

ولم يتغير التسعير عن Opus 4.8: خمسة دولارات لكل مليون رمز إدخال وخمسة وعشرون دولاراً لكل مليون رمز إخراج، مع علاوة 25% على الكتابة في الذاكرة المؤقتة وخصم 90% على القراءة منها. ونافذة السياق مليون رمز.

ما ينبغي الانتباه إليه

ثلاث نتائج تستحق اهتماماً أكبر من النتائج الرئيسية.

ارتفع معدل الهلوسة. ففي AA-Omniscience، يحسّن Opus 5 الدقة الواقعية بسبع نقاط عن Opus 4.8 — لكنه أيضاً يجيب أكثر عند عدم اليقين، وارتفع معدل هلوسته بأربع عشرة نقطة ليبلغ 50%. ونموذج أكثر دقة وأكثر استعداداً للتخمين في آن واحد نتيجة مختلطة فعلاً. وفي أي عبء عمل تكون فيه الإجابة الخاطئة الواثقة أسوأ من الاعتراف بالنقص، يستلزم هذا طبقة تحقق صريحة.

جودة العرض متأخرة عن التحليل. فمكاسب Opus 5 مدفوعة بمعدل اجتياز المعايير وجودة التحليل — إذ يبلغ تقييم جودته التحليلية 2016 نقطة Elo، متقدماً بنحو 300 نقطة على Fable 5. أما تقييم جودة العرض فيبلغ 1628، متأخراً بنحو 40 نقطة عن GPT-5.6 Sol.

المهام تستغرق وقتاً أطول بكثير. فإعدادات الجهد الثلاثة العليا تستغرق في المتوسط أكثر من 25 دقيقة لكل مهمة في AA-Briefcase — 36.2 و34.3 و25.7 دقيقة. وعند أقصى جهد يزيد ذلك بنحو 50% عن Opus 4.8، مدفوعاً أساساً بعدد الدورات: 103 دورات لكل مهمة مقابل 55 لـOpus 4.8. وأي نظام ضُبطت مهلته الزمنية على سلوك Opus 4.8 سيحتاج إلى مراجعة.

إرشادات عملية

لا تجعل أقصى جهد هو الافتراضي. فالأدلة تشير إلى العكس: في هذا النموذج، يقع إعدادا high وxhigh عند نقطة أفضل على منحنى التكلفة مقابل الجودة لمعظم الأعمال، وكلاهما يتفوق أصلاً على النموذج المتقدم السابق.

ولاحظ أيضاً أن الاستدلال بات مفعّلاً افتراضياً — فالطلب الذي يغفل الإعداد تماماً سيستدل، بينما لم يكن ليفعل في Opus 4.8. وأي عبء عمل كان يعتمد ضمناً على تعطيل الاستدلال سيشهد استهلاكاً أعلى للرموز، وقد يشهد مخرجات مبتورة إذا كان حد الإخراج مضبوطاً بإحكام حول الإجابة وحدها.

ماذا يعني هذا لمؤسسات الخليج

على مدى ثمانية عشر شهراً، كان القيد العملي على نشر النماذج المتقدمة على نطاق واسع هو التكلفة لكل مهمة، لا القدرة. وقد حرّك Opus 5 هذا الخط: فعند الجهد العالي يقدّم نتائج تفوق Fable 5 بأقل من نصف سعره. والأعباء التي أُرجئت لعدم جدواها الاقتصادية عند الحد المتقدم السابق تستحق إعادة تسعير.

وتتبع ذلك ثلاثة إجراءات.

أعد دراسة الجدوى لكل ما رفضته لأسباب تتعلق بالتكلفة خلال العام الماضي، فقد تغيّرت الحسابات بما يكفي لنقض بعض تلك القرارات.

امسح مستويات الجهد على مجموعة التقييم الخاصة بك بدلاً من توريث إعداد افتراضي، فالفارق بين المنخفض والأقصى في هذا النموذج يمتد مئات النقاط ونحو ثمانية أضعاف في استهلاك الرموز.

خصّص ميزانية للتحقق، خاصة مع ارتفاع معدل الهلوسة. فالوفر الناتج عن النزول إلى الجهد العالي يغطي خطوة تدقيق وأكثر.

لقد بات التنافس على الصدارة حقيقياً — إذ تبادلت Anthropic وOpenAI الموقع الأول مرتين في شهر واحد. وبالنسبة للمؤسسات، فإن الفائز بهذا السباق أقل أهمية بكثير من بناء أنظمة قادرة على التبديل بين النماذج كلما تغيّر الترتيب. فقابلية النقل هي الميزة الدائمة، لا لوحة الصدارة.

Ready to Apply This to Your Business?

Book a 30-minute strategy call. We'll take the thinking in this article and apply it directly to your workflows and business context.