| Claude Opus 4.7 |
| يلخص LLM Stats الاختبارات العشرة المشتركة بأن Claude Opus 4.7 يتقدم في 6 منها مقابل 4 لـGPT-5.5. |
| تشغيل الأدوات، التصفح، والمهام الطويلة داخل الطرفية أو الأنظمة | GPT-5.5 | وفق LLM Stats، يتفوق GPT-5.5 في اختبارات مثل Terminal-Bench 2.0 وBrowseComp وOSWorld-Verified وCyberGym. |
| نموذج مفتوح الأوزان مع سرعة وسعر جيدين | Kimi K2.6 | في جدول Artificial Analysis للنماذج المفتوحة، يظهر Kimi K2.6 بدرجة Intelligence 54، وسياق 256k، وسعر $1.7، وسرعة 112 tokens/s. |
| سياق طويل وسعر API منخفض | DeepSeek V4 Pro / عائلة DeepSeek V4 | يعرض Artificial Analysis سياقاً بطول 1M لـDeepSeek V4 Pro، وتورد Mashable أن سعر API لـDeepSeek V4 أقل من GPT-5.5 وClaude Opus 4.7. |
بين GPT-5.5 وClaude Opus 4.7، لا يوجد نمط بسيط يقول إن أحدهما يربح في كل شيء. الأرقام التي نقلتها Mashable تظهر أن Claude Opus 4.7 يتقدم في SWE-Bench Pro وGPQA Diamond، بينما يتقدم GPT-5.5 في Terminal-Bench 2.0 وHumanity's Last Exam وBrowseComp وARC-AGI-1 Verified.
| الاختبار | GPT-5.5 | Claude Opus 4.7 | المتقدم في جدول Mashable |
|---|---|---|---|
| SWE-Bench Pro | 58.6% | 64.3% | Claude Opus 4.7 |
| Terminal-Bench 2.0 | 82.7% | 69.4% | GPT-5.5 |
| Humanity's Last Exam | 40.6% | 31.2% | GPT-5.5 |
| Humanity's Last Exam with tools | 52.2% | 54.7% | Claude Opus 4.7 |
| BrowseComp | 84.4% | 79.3% | GPT-5.5 |
| GPQA Diamond | 93.6% | 94.2% | Claude Opus 4.7 |
| ARC-AGI-1 Verified | 94.5% | 92.0% | GPT-5.5 |
لكن LLM Stats يقدم زاوية مختلفة قليلاً: في 10 اختبارات مشتركة، يتقدم Claude Opus 4.7 في 6 ويتقدم GPT-5.5 في 4، مع تركّز أفضلية Claude في اختبارات التفكير والمراجعة، وأفضلية GPT-5.5 في اختبارات الاستخدام الطويل للأدوات.
النقطة المهمة هنا أن LLM Stats نفسه ينبه إلى أن هذه النتائج مأخوذة من مستويات التفكير العالية لدى كل مزود، وأنها قابلة للمقارنة من حيث الشكل العام، لا من حيث تطابق المنهجية بالكامل. لذلك إذا بدا أن Humanity's Last Exam، مثلاً، يعطي صورة مختلفة من مصدر إلى آخر، فهذه ليست مفارقة بقدر ما هي تذكير بأن الإعدادات والمنهجيات قد تغير النتيجة.
Kimi K2.6 وDeepSeek V4 Pro أقرب إلى كونهما خيارين تشغيليين في عالم النماذج المفتوحة الأوزان، لا مجرد منافسين مباشرين للنماذج المغلقة الأعلى سعراً. جدول Artificial Analysis للنماذج المفتوحة يضعهما بهذا الشكل:
| المؤشر | Kimi K2.6 | DeepSeek V4 Pro |
|---|---|---|
| Artificial Analysis Intelligence | 54 | 52 |
| طول السياق | 256k | 1.00M |
| خانة السعر | $1.7 | $2.2 |
| سرعة الإخراج | 112 tokens/s | 36 tokens/s |
بهذه القراءة، Kimi K2.6 يبدو أقوى في درجة Intelligence وسرعة الإخراج، بينما DeepSeek V4 Pro يتفوق بوضوح في طول السياق البالغ 1M. وتنقل The Decoder عن Moonshot AI أن Kimi K2.6 حقق 54.0 في HLE with Tools و58.6 في SWE-Bench Pro و83.2 في BrowseComp.
مع ذلك، لا ينبغي قراءة أرقام Kimi K2.6 كأنها مقارنة كاملة ومتزامنة مع GPT-5.5 وClaude Opus 4.7. بطاقة النموذج على Hugging Face توضح أن تجارب Kimi K2.6 أجريت مع تفعيل thinking mode، وtemperature 1.0، وtop-p 1.0، وسياق 262,144 توكناً، وأن المقارنات الأساسية كانت مع Claude Opus 4.6 وGPT-5.4 وGemini 3.1 Pro.
أما DeepSeek V4 Pro، فالأفضل فهمه كنموذج يبحث عن توازن بين القرب من نماذج القمة والكلفة المنخفضة، لا كنموذج يطيح بالصدارة المطلقة. DataCamp تلخص ذلك بوضوح: DeepSeek V4 لا يتفوق في القدرة الصرفة على GPT-5.5 أو Claude Opus 4.7، لكنه يقدم أداء قريباً من نماذج المقدمة بتكلفة أقل.
كثير من سوء الفهم في مقارنات النماذج يأتي من كلمة السعر. الرقم قد يعني سعر API، أو خانة سعر في لوحة مقارنة، أو تكلفة تشغيل اختبار معياري كامل.
أولاً، هناك سعر API لكل مليون توكن. تورد Mashable أن DeepSeek V4 يكلف $1.74 لكل مليون توكن إدخال و$3.48 لكل مليون توكن إخراج، مقابل $5/$30 لـGPT-5.5 و$5/$25 لـClaude Opus 4.7.
ثانياً، هناك خانة السعر في جدول Artificial Analysis للنماذج المفتوحة. في هذا الجدول يظهر Kimi K2.6 بسعر $1.7 وDeepSeek V4 Pro بسعر $2.2، لكن لا ينبغي التعامل مع هذه الخانة كأنها مطابقة مباشرة لسعر API الذي تورده Mashable.
ثالثاً، هناك تكلفة تشغيل الاختبار نفسه. في مقال Artificial Analysis عن DeepSeek V4 Pro، بلغت تكلفة تشغيل Artificial Analysis Intelligence Index نحو $1,071 لـDeepSeek V4 Pro، و$948 لـKimi K2.6، و$4,811 لـClaude Opus 4.7.
لذلك، عندما تقول إن DeepSeek أرخص أو إن Kimi أفضل سعراً أو إن Claude مكلف، اسأل أولاً: هل نتحدث عن سعر التوكن في API، أم تكلفة اختبار معياري، أم تكلفة تشغيل فعلية تتأثر بطول الإجابة وعدد الخطوات؟
في Claude Opus 4.7، توجد إشارات تتعلق بالثقة والسلوك لا يجب خلطها مباشرة بدرجات البرمجة أو الرياضيات. تنقل Mashable عن Anthropic أن Claude Opus 4.7 لديه honesty rate بنسبة 92% وأنه أقل ميلاً إلى sycophancy، أي مجاراة المستخدم بطريقة غير نقدية.
كما تقول Anthropic إن Claude Opus 4.7 تعادل في صدارة معيار داخلي لوكلاء البحث بدرجة إجمالية 0.715 عبر 6 وحدات، وإنه حسّن نتيجة General Finance من 0.767 في Opus 4.6 إلى 0.813.
هذه مؤشرات مهمة لمن يستخدم النموذج في مراجعة مستندات، تحليل مالي، أو مهام تحتاج إلى انضباط في الإفصاح عن البيانات. لكنها تبقى محوراً مختلفاً عن اختبارات مثل SWE-Bench Pro أو GPQA Diamond أو BrowseComp. في الاستخدام الحقيقي، ينبغي فصل القدرة، الكلفة، السرعة، مخاطر الهلوسة، وسهولة التدقيق بدلاً من جمعها في رقم واحد.
إذا كنت تبني منتجاً أو خط عمل آلياً، فغالباً لن يكون الحل الأمثل هو اختيار نموذج واحد لكل الطلبات. المقاربة الأكثر واقعية هي توجيه المهام: النموذج السريع أو الأرخص للمهام الروتينية، والنموذج الأعمق للمهام الحساسة أو المعقدة.
في مقارنة MindStudio لمهام برمجية واقعية، استخدم GPT-5.5 توكنات إخراج أقل بنسبة 72% من Claude Opus 4.7 على المهام نفسها، بينما يمكن أن تبرر دقة Opus 4.7 وتفصيله كلفته في قواعد الشيفرة الكبيرة والمعقدة ذات العبء العالي في التفكير.
بناءً على ذلك، يمكن البدء عملياً بهذا التقسيم: GPT-5.5 للإنشاء والتعديل والمهام القياسية وتشغيل الأدوات، Claude Opus 4.7 للمراجعة العميقة والحكم التخصصي، Kimi K2.6 لتجارب النماذج المفتوحة السريعة، وDeepSeek V4 Pro للمهام ذات السياق الطويل أو المعالجة الكثيفة التي تحتاج إلى كلفة API منخفضة نسبياً.
من المعلومات العامة المتاحة حالياً، الاختيار الأكثر أماناً ليس إعلان فائز واحد بين GPT-5.5 وClaude Opus 4.7 وDeepSeek V4 Pro وKimi K2.6. الأفضل هو الاختيار حسب المهمة: GPT-5.5 قوي في الأداء العام والمهام الاقتصادية، Claude Opus 4.7 قوي في التفكير والمراجعة، Kimi K2.6 جذاب في السرعة والسعر ضمن النماذج المفتوحة، وDeepSeek V4 Pro يبرز في طول السياق وانخفاض سعر API لعائلة DeepSeek V4.
حتى داخل Artificial Analysis، تختلف الصورة بحسب الصفحة والإعداد: صفحة GPT-5.5 high تعرض درجة Intelligence 59، بينما تعرض صفحة النماذج العامة Claude Opus 4.7 Adaptive Reasoning, Max Effort في الصدارة بدرجة 57. هذه ليست تفصيلة هامشية؛ إنها سبب كافٍ لاستخدام الاختبارات كنقطة بداية فقط، ثم إجراء اختبار صغير على مهامك الفعلية، بميزانيتك، ومتطلبات زمن الاستجابة لديك، ومستوى الخطأ الذي تستطيع تحمله.