GPT-5.6 يدخل في معاينة محدودة: أقوى نموذج لـ OpenAI، والذي تم إعاقته بسبب مخاطر السلامة الخاصة به
الملخص
يدخل GPT-5.6 في معاينة محدودة مع مستويات Sol وTerra وLuna. يسلط OpenAI الضوء على المكاسب التي تحققت في مجال البرمجة والمعلوماتية الحيوية والأمن السيبراني مع وضع الوصول تحت قيود أكثر صرامة تتعلق بالسلامة والمراجعة الحكومية.
الآن، دخلت عائلة GPT-5.6 رسميًا في مرحلة المعاينة، ولكن لم يتم فتحها على نطاق واسع. وبدلاً من ذلك، يبدأ OpenAI بمعاينة محدودة.

باعتباره أقوى جيل من OpenAI حتى الآن، يصل GPT-5.6 بثلاثة نماذج أسماؤها شاعرية عن عمد:
Sol هو النموذج الرئيسي، ويطلق عليه OpenAI أقوى طراز حتى الآن.
Terra هو النموذج المتوازن للعمل اليومي، ويتنافس مع GPT-5.5 بينما يكلف حوالي نصف التكلفة.
تركز Luna على السرعة والتكلفة المنخفضة، مما يجعلها أرخص طراز في عائلة GPT-5.6.
**بالحكم على نظام التسمية هذا، استوعب Sam Altman بوضوح بعض قواعد اللعبة التسويقية لـ Anthropic. ** إلى جانب إطلاق GPT-5.6، أعاد OpenAI أيضًا تنظيم هيكل تسمية النموذج الخاص به.
يمثل الرقم الجيل، بينما يمثل Sol وTerra وLuna مستويات قدرة مختلفة. من حيث المنتج، يستهدف Sol المهام الصعبة والمعقدة، ويغطي Terra عمليات سير العمل اليومية، ويهدف Luna إلى إجراء مكالمات منخفضة التكلفة.
بمعنى آخر، GPT-5.6 ليس مجرد ترقية للقدرة. إنها أيضًا محاولة OpenAI لتقسيم خط إنتاجها النموذجي بشكل أكثر وضوحًا.

🔗 https://openai.com/index/previewing-gpt-5-6-sol/
GPT-5.6 يصل بين عشية وضحاها، متصدرًا المعايير عبر العائلة
وباعتباره أقوى نموذج لـ OpenAI حتى الآن، تتركز قصة قدرة GPT-5.6 Sol في ثلاثة مجالات: البرمجة والمعلوماتية الحيوية والأمن السيبراني.
تشترك هذه السيناريوهات في ميزة واحدة:
إنها معقدة وطويلة الأفق وتعتمد بشكل كبير على السياق. يجب أن يستمر النموذج في التخطيط والتفكير واستدعاء الأدوات وتصحيح الأخطاء ودفع العملية إلى الأمام. يطلق OpenAI على هذه القدرات الوكيلة، مما يعني أن النموذج يتصرف مثل الوكيل الذي يمكنه تنفيذ المهام بشكل مستقل.
في مجال البرمجة، لم يعد GPT-5.6 Sol يتوقف عند إكمال التعليمات البرمجية. يصل إلى عمل سطر الأوامر المعقد.
يقول OpenAI أن Sol قام بتحديث الأداء على Terminal-Bench 2.1، وهو معيار لسير عمل سطر الأوامر الذي يختبر التخطيط والتكرار وتنسيق الأدوات.

تظهر النتائج المعيارية أن GPT-5.6 Sol Ultra سجل 91.9% على Terminal-Bench 2.1، بينما سجل GPT-5.6 Sol 88.8%. للمقارنة، حصل GPT-5.5 على 88.0%، وGPT-5.6 Terra على 82.5%، وGPT-5.6 Luna على 84.3%.
بالمقارنة مع الطرز الأخرى، حصل Claude Mythos 5 على 84.3%، وClaude Fable 5 على 83.4%، وClaude Opus 4.8 على 78.9%، وGemini 3.1 Pro Preview على 70.7%.

تشير نتيجة Sol Ultra أيضًا إلى الميزة الأساسية لـ GPT-5.6.
من ناحية، يتيح الحد الأقصى لجهد الاستدلال للنموذج قضاء المزيد من الوقت في الاستدلال العميق. ومن ناحية أخرى، يقوم الوضع Ultra الجديد بإرسال العديد من الوكلاء الفرعيين لتقسيم المهام المعقدة ومن ثم دمج النتائج.
في أعمال التطوير الحقيقية، غالبًا ما يتعين على النموذج فهم بنية المشروع، وقراءة الملفات، وتغيير التعليمات البرمجية، وتشغيل الأوامر، وتحليل الأخطاء، ومواصلة المراجعة. عادة لا يمكن إكمال المهمة المعقدة في إجابة واحدة. يهدف الوضع Ultra إلى السماح للوكلاء الفرعيين المختلفين بالتعامل مع أجزاء مختلفة من سير العمل قبل دمج النتائج، مما يؤدي إلى تحسين كفاءة إكمال المهام المعقدة.
في علم الأحياء، يظهر تحسين GPT-5.6 Sol على GeneBench v1. يركز هذا المعيار على علم الجينوم طويل المدى ومهام التحليل البيولوجي الكمي. يقول OpenAI أن Sol يحقق نتائج أقوى من GPT-5.5 مع استخدام عدد أقل من رموز الإخراج.



اسحب لليسار لرؤية المزيد.

وهذا مهم بشكل خاص في مجال البحث. غالبًا ما تتطلب المعلوماتية الحيوية وعلم الجينوم وعلم الأحياء الكمي نموذجًا لمواصلة تحليل البيانات وشرح النتائج واختيار الأساليب ومقارنة الفرضيات والحفاظ على السياق عبر خطوات متعددة. إن ما إذا كان النموذج يمكنه إكمال هذه المهام أمر مهم، وما إذا كان يمكنه القيام بذلك بتكلفة رمزية أقل أمر مهم بنفس القدر.
إذا تمكن Sol من تحقيق نتائج أقوى بعدد أقل من الرموز المميزة للمخرجات، فهذا يعني كفاءة أفضل من حيث التكلفة في سير العمل العلمي الاحترافي. بالنسبة للمختبرات وفرق البحث والتطوير في المؤسسات وسيناريوهات الطب الحيوي، يؤثر استهلاك الرمز المميز بشكل مباشر على تكلفة الاتصال وما إذا كان النموذج يمكنه الدخول في مسارات عمل واسعة النطاق.
يعد الأمن السيبراني مجال القدرات الأكثر حساسية لدى GPT-5.6 Sol.
تقول OpenAI أن Sol هو أقوى نموذج للأمن السيبراني حتى الآن، مما يدفع حدود الأداء والكفاءة للمهام الأمنية طويلة المدى، بما في ذلك أبحاث الثغرات الأمنية والمهام المتعلقة بالاستغلال.
في ExploitBench، يعمل GPT-5.6 Sol بالقرب من Mythos Preview أثناء استخدام ما يقرب من ثلث الرموز المميزة للإخراج.

يذكر OpenAI أيضًا ExploitGym، وهو نظام تقييم أنشأته جامعة كاليفورنيا في بيركلي مع العديد من المعامل الرائدة لقياس قدرة النموذج في المهام الأمنية. مع تحسن التفكير، يحقق كل من Sol وTerra وLuna تقدمًا واضحًا في هذا المجال.

لكن من الواضح أن OpenAI يضخ الفرامل في هذا القسم.
يؤكد التفسير الرسمي على أن Sol أفضل في العثور على نقاط الضعف وإصلاحها، لكنه لا يزال غير قادر على إكمال الهجمات الشاملة بشكل موثوق. في التقييمات التي تتضمن Chromium وFirefox، يستطيع Sol تحديد الأخطاء وعيوب البرنامج، وهي المكونات الأساسية للاستغلال، ولكن في ظل ظروف الاختبار، لا يقوم Sol بإنشاء سلسلة هجوم كاملة تعمل بشكل مستقل.
بناءً على هذه النتائج، خلص OpenAI إلى أن GPT-5.6 Sol لم يتجاوز عتبة المخاطر الحرجة للأمن السيبراني في إطار الاستعداد الخاص به.

بطاقة النظام 🔗: https://deploymentsafety.openai.com/gpt-5-6-preview/introduction
من الواضح أن هذا الحكم الحذر يهدف إلى تجنب تكرار حلقة ميثوس.
من ناحية، يريد OpenAI إثبات أن Sol أقوى بكثير في مهام الأمن السيبراني. ومن ناحية أخرى، يجب أيضًا توضيح أن سول لم يصل إلى مستوى المخاطرة الذي يتطلب تقييدًا شديدًا. ومن المثير للسخرية أن معظم هذا الضغط يأتي من السرد الضجيج لـ AI الذي ساعد OpenAI نفسه في تشكيله.
وفي الوقت نفسه، يعترف OpenAI بأن المعايير لا يمكن أن تغطي كل استخدام في العالم الحقيقي. لا يمكن لأي تقييم أن يمثل كل تكوين منتج، أو هجوم متعدد الخطوات، أو سير العمل الفعلي. قد يكون النموذج متصلاً بأدوات أخرى أو يتم وضعه داخل سلسلة هجوم أكثر تعقيدًا.
إن عدم اليقين هذا هو بالضبط سبب إصدار GPT-5.6 بحذر شديد.
الأداء الأقوى، ولكن سلامة AI تسلط الضوء
تستحوذ السلامة على حصة كبيرة بشكل غير عادي من إعلان GPT-5.6.
قام OpenAI بتكوين مستويات حماية لـ Sol وTerra وLuna. كلما كان النموذج أقوى، كانت حواجز الحماية أكثر صرامة. الهدف هو قمع الاستخدامات المسيئة مع الحفاظ على السيناريوهات المشروعة مثل مراجعة التعليمات البرمجية وأبحاث الثغرات الأمنية.
في طبقة النموذج، يتم تدريب النظام على رفض طلبات الأمن السيبراني غير المسموح بها، حتى عندما يحاول المستخدمون إخفاءها أو تجاوزها. أثناء الإنشاء، تقوم أدوات التصنيف في الوقت الفعلي باكتشاف المحتوى عالي الخطورة وحظره، ويمكن للنماذج ذات القدرة الأعلى مراجعة الحالات الحدودية عند الحاجة. في طبقة الحساب، يجمع OpenAI بين سلوك المحادثة المتبادلة وإشارات المخاطر لتحديد إساءة الاستخدام المستمرة.
توصف هذه الآلية بأنها حزمة أمان متعددة الطبقات تغطي رفض النماذج، والكشف في الوقت الفعلي، ومراجعة الحساب، والوصول المتمايز، والاختبار المستمر. تعمل الطبقات معًا ضد الإساءات المعقدة بينما تحاول تقليل تعطيل العمل المشروع.
**بالنسبة لعملاء المؤسسات، يقترح OpenAI أيضًا اكتشاف الحفاظ على الخصوصية، ** إعدادات الأمان التي يتحكم فيها العميل، والوصول إلى مستويات المخاطر، في محاولة لإيجاد توازن بين السلامة وحماية البيانات.

لتجنب تكرار أخطاء الماضي، أنفق OpenAI أكثر من 700,000 ساعة GPU مكافئة لـ A100 في اختبار الفريق الأحمر الآلي، مع التركيز على عمليات كسر الحماية العامة، بالإضافة إلى اختبارات بشرية متخصصة. قامت OpenAI أيضًا ببناء عملية استجابة سريعة لإعادة إنتاج نقاط الضعف الجديدة وتقييمها وإصلاحها وإدراجها في التقييم المستمر.
من حيث التوفر، لا يزال GPT-5.6 في معاينة محدودة.
تشير OpenAI إلى أن النماذج ستكون متاحة أولاً من خلال API وCodex لمجموعة صغيرة من الشركاء الموثوقين، ثم تتوسع تدريجيًا لتشمل ChatGPT وCodex ومستخدمي API على نطاق أوسع.
تقول OpenAI أيضًا إنها تعتقد أنه يجب إتاحة النماذج الرائدة على نطاق واسع قدر الإمكان، وتخطط لنقل GPT-5.6 Sol وTerra وLuna إلى إتاحة أكثر عمومية في الأسابيع المقبلة.

رد الفعل المبكر لا يبدو ممتعًا بشكل خاص.
تم الإعلان عن الأسعار في نفس الوقت:
لكل مليون رمز، تبلغ تكلفة Sol 5 دولارات للإدخال و30 دولارًا للإخراج؛ تبلغ تكلفة Terra 2.50 دولارًا للمدخلات و15 دولارًا للمخرجات؛ تبلغ تكلفة Luna دولارًا واحدًا للمدخلات و6 دولارات للمخرجات.

يقدم GPT-5.6 أيضًا تخزينًا مؤقتًا سريعًا يمكن التنبؤ به بشكل أكبر، مع نقاط توقف صريحة لذاكرة التخزين المؤقت وعمر ذاكرة تخزين مؤقت يبلغ 30 دقيقة على الأقل. تتم محاسبة عمليات الكتابة في ذاكرة التخزين المؤقت بمبلغ 1.25 ضعف سعر الإدخال غير المخبأ، بينما تحصل عمليات القراءة على خصم بنسبة 90%.
وبطبيعة الحال، سيستغرق الأمر بعض الوقت قبل أن يتمكن معظم المستخدمين من الوصول إليه. **أعلنت OpenAI أن GPT-5.6 Sol سيصل إلى Cerebras في يوليو، بسرعات تصل إلى 750 رمزًا في الثانية. ** سيقتصر هذا الإصدار أيضًا في البداية على عملاء محددين، مع توسيع نطاق الوصول مع نمو السعة.
بمعنى آخر، المعاينة المحدودة لـ GPT-5.6 ليست مجرد طرح للمنتج. إنها أيضًا عملية التحقق من السلامة. يحتاج OpenAI إلى إيجاد توازن يمكن التحكم فيه بين القدرة والمخاطر والانفتاح.
تدخل إصدارات الطراز Frontier دورة جديدة
قبل أسبوعين، قامت Anthropic بتعطيل أحد أقوى نماذجها، Fable 5، بعد أن طلبت الحكومة الأمريكية من الشركة تقييد استخدام النموذج من قبل المواطنين الأجانب داخل الولايات المتحدة وخارجها، بدعوى الأمن القومي.
في طرح GPT-5.6، لم يتم تحديد المستخدمين الأوائل بشكل كامل بواسطة OpenAI.
يقول OpenAI في مدونته الرسمية إنه أظهر قدرات الحكومة الأمريكية GPT-5.6 وخطة الإصدار قبل الإطلاق. بناءً على طلب الحكومة، سيتم إطلاق النموذج كمعاينة محدودة، متاح فقط لعدد صغير من الشركاء الموثوق بهم، وقد تمت مشاركة المعلومات حول هؤلاء الشركاء مع الحكومة.

وذكرت صحيفة واشنطن بوست أن الحكومة الفيدرالية الأمريكية ستراجع الشركات التي يمكنها الوصول إلى أحدث تقنيات OpenAI. في الوقت الحالي، لا يمكن سوى للشركات المعتمدة من قبل حكومة الولايات المتحدة الوصول إلى النموذج الجديد، وليس لدى المستخدمين الأفراد أي قناة للتطبيقات.
ذكرت بلومبرج أن حوالي 20 شريكًا موجودون في مجموعة الوصول الأولى لـ GPT-5.6، وقد تكون إحدى نقاط الدخول المحتملة هي منصة Bedrock الخاصة بأمازون.
من الواضح أن موقف OpenAI تجاه هذا الترتيب غامض إلى حد ما. في منشور المدونة، تقول OpenAI إنها لا تعتقد أن مشاركة الحكومة في الوصول إلى النماذج يجب أن تصبح الخيار الافتراضي على المدى الطويل، لأن ذلك من شأنه أن يبقي أفضل الأدوات بعيدًا عن المستخدمين والمطورين والشركات والمدافعين السيبرانيين والشركاء العالميين.

ولكن من الناحية العملية، ما زالت OpenAI تختار قبول الترتيب، قائلة إنها تريد الفوز بانفتاح أوسع أثناء العمل مع الحكومة الأمريكية على عملية إصدار نموذج قابلة للتكرار.
وراء هذا التحول، يتم دمج نماذج AI الحدودية تدريجيًا في أطر الأمن القومي.
في الماضي، كان إطلاق الطراز الجديد يمثل في الأساس مشكلة متعلقة بدورة منتجات الشركة. الآن، بمجرد أن يتجاوز النموذج عتبات القدرات الجديدة في البرمجة، والأمن السيبراني، والبيولوجيا، وسير العمل الوكيل، فإن إيقاع إصداره قد يدخل في مناقشات السلامة ومراقبة الصادرات.
بالنسبة لـ OpenAI، يعد GPT-5.6 بمثابة معاينة للنموذج الرئيسي وتجربة للسياسة. يحتاج OpenAI إلى إثبات أن Sol قوي بما فيه الكفاية، وإثبات أن نظام السلامة الخاص به صارم بما فيه الكفاية، وإيجاد مسار قابل للتنفيذ بين مراجعة الحكومة الأمريكية والانفتاح التجاري.

فريق التحرير
Product Team @ WebCal
فريق منتج WebCal الرسمي. نبني بنية حوسبة عالية الأداء وحلول سحابة لامركزية.



