GPT-5.6 सीमित पूर्वावलोकन में प्रवेश करता है: OpenAI का सबसे मजबूत मॉडल, जो अपने स्वयं के सुरक्षा जोखिमों के कारण टिका हुआ है
सारांश
GPT-5.6 सोल, टेरा और लूना स्तरों के साथ सीमित पूर्वावलोकन में प्रवेश करता है। OpenAI कड़ी सुरक्षा और सरकारी-समीक्षा बाधाओं के तहत पहुंच रखते हुए कोडिंग, जैव सूचना विज्ञान और साइबर सुरक्षा में लाभ पर प्रकाश डालता है।
अभी, GPT-5.6 परिवार ने आधिकारिक तौर पर पूर्वावलोकन में प्रवेश किया है, लेकिन इसे व्यापक रूप से नहीं खोला जा रहा है। इसके बजाय, OpenAI एक सीमित पूर्वावलोकन के साथ शुरू हो रहा है।

OpenAI की अब तक की सबसे मजबूत पीढ़ी के रूप में, GPT-5.6 तीन मॉडलों के साथ आता है जिनके नाम जानबूझकर काव्यात्मक हैं:
सोल प्रमुख मॉडल है, और OpenAI इसे अब तक का सबसे मजबूत मॉडल कहता है।
टेरा रोजमर्रा के काम के लिए संतुलित मॉडल है, जो GPT-5.5 को टक्कर देता है जबकि इसकी कीमत लगभग आधी है।
लूना गति और कम लागत पर ध्यान केंद्रित करती है, जिससे यह GPT-5.6 परिवार में सबसे सस्ता मॉडल बन जाता है।
इस नामकरण प्रणाली को देखते हुए, सैम ऑल्टमैन ने Anthropic की कुछ मार्केटिंग प्लेबुक को स्पष्ट रूप से आत्मसात कर लिया है। GPT-5.6 लॉन्च के साथ, OpenAI ने अपने मॉडल नामकरण संरचना को भी पुनर्गठित किया है।
संख्या पीढ़ी का प्रतिनिधित्व करती है, जबकि सोल, टेरा और लूना विभिन्न क्षमता स्तरों का प्रतिनिधित्व करते हैं। उत्पाद के संदर्भ में, सोल का लक्ष्य कठिन और जटिल कार्य हैं, टेरा रोजमर्रा के वर्कफ़्लो को कवर करता है, और लूना कम लागत वाली कॉल के लिए है।
दूसरे शब्दों में, GPT-5.6 केवल एक क्षमता उन्नयन नहीं है। यह OpenAI का अपने मॉडल उत्पाद लाइन को अधिक स्पष्ट रूप से विभाजित करने का प्रयास भी है।

🔗 https://openai.com/index/previewing-gpt-5-6-sol/
GPT-5.6 पूरे परिवार में बेंचमार्क में शीर्ष पर पहुँचते हुए रातों-रात पहुँच गया
OpenAI के अब तक के सबसे मजबूत मॉडल के रूप में, GPT-5.6 Sol की क्षमता की कहानी तीन क्षेत्रों में केंद्रित है: कोडिंग, जैव सूचना विज्ञान और साइबर सुरक्षा।
ये परिदृश्य एक विशेषता साझा करते हैं:
वे जटिल, दीर्घ-क्षितिज वाले और संदर्भ पर अत्यधिक निर्भर हैं। मॉडल को योजना बनाना, तर्क करना, उपकरण बुलाना, गलतियों को सुधारना और प्रक्रिया को आगे बढ़ाना चाहिए। OpenAI इसे एजेंटिक क्षमताएं कहता है, जिसका अर्थ है कि मॉडल एक एजेंट की तरह व्यवहार करता है जो स्वतंत्र रूप से कार्यों को निष्पादित कर सकता है।
कोडिंग में, GPT-5.6 Sol अब कोड पूरा होने पर नहीं रुकता। यह जटिल कमांड-लाइन कार्य तक पहुँचता है।
OpenAI का कहना है कि सोल ने टर्मिनल-बेंच 2.1 पर प्रदर्शन को ताज़ा किया है, जो कमांड-लाइन वर्कफ़्लो के लिए एक बेंचमार्क है जो योजना, पुनरावृत्ति और उपकरण समन्वय का परीक्षण करता है।

बेंचमार्क नतीजे दिखाते हैं कि GPT-5.6 Sol Ultra को टर्मिनल-बेंच 2.1 पर 91.9% स्कोर मिला है, जबकि GPT-5.6 Sol को 88.8% स्कोर मिला है। तुलना के लिए, GPT-5.5 का स्कोर 88.0%, GPT-5.6 टेरा का स्कोर 82.5% और GPT-5.6 लूना का स्कोर 84.3% है।
अन्य मॉडलों की तुलना में, Claude Mythos 5 का स्कोर 84.3%, Claude Fable 5 का स्कोर 83.4%, Claude Opus 4.8 का स्कोर 78.9% और जेमिनी 3.1 प्रो प्रीव्यू का स्कोर 70.7% है।

सोल अल्ट्रा का स्कोर GPT-5.6 की मुख्य विशेषता की ओर भी इशारा करता है।
एक तरफ, अधिकतम तर्क प्रयास मॉडल को गहन तर्क पर अधिक समय बिताने की सुविधा देता है। दूसरी ओर, नया अल्ट्रा मोड जटिल कार्यों को विभाजित करने और फिर परिणामों को समेकित करने के लिए कई उप-एजेंटों को भेजता है।
वास्तविक विकास कार्य में, एक मॉडल को अक्सर प्रोजेक्ट संरचना को समझना होता है, फ़ाइलें पढ़नी होती हैं, कोड बदलना होता है, कमांड चलाना होता है, त्रुटियों का विश्लेषण करना होता है और संशोधित करते रहना होता है। एक जटिल कार्य आमतौर पर एक उत्तर में पूरा नहीं किया जा सकता है। अल्ट्रा मोड का उद्देश्य विभिन्न उप-एजेंटों को परिणामों को मर्ज करने से पहले वर्कफ़्लो के विभिन्न हिस्सों को संभालने देना है, जिससे जटिल कार्यों के लिए पूर्णता दक्षता में सुधार होता है।
जीव विज्ञान में, GPT-5.6 Sol का सुधार GeneBench v1 पर दिखाई देता है। यह बेंचमार्क लंबे-क्षितिज जीनोमिक्स और मात्रात्मक जीव विज्ञान विश्लेषण कार्यों पर केंद्रित है। OpenAI का कहना है कि Sol कम आउटपुट टोकन का उपयोग करते हुए GPT-5.5 की तुलना में अधिक मजबूत परिणाम प्राप्त करता है।



और अधिक देखने के लिए बाईं ओर स्वाइप करें.

यह विशेष रूप से अनुसंधान में मायने रखता है। जैव सूचना विज्ञान, जीनोमिक्स और मात्रात्मक जीव विज्ञान को अक्सर डेटा का विश्लेषण करने, परिणामों की व्याख्या करने, तरीकों का चयन करने, परिकल्पनाओं की तुलना करने और कई चरणों में संदर्भ बनाए रखने के लिए एक मॉडल की आवश्यकता होती है। क्या कोई मॉडल इन कार्यों को पूरा कर सकता है, और क्या वह कम टोकन लागत के साथ ऐसा कर सकता है, यह भी उतना ही मायने रखता है।
यदि सोल कम आउटपुट टोकन के साथ मजबूत परिणाम प्राप्त कर सकता है, तो इसका मतलब पेशेवर वैज्ञानिक वर्कफ़्लो में बेहतर लागत दक्षता है। प्रयोगशालाओं, उद्यम अनुसंधान एवं विकास टीमों और बायोमेडिसिन परिदृश्यों के लिए, टोकन की खपत सीधे कॉल लागत को प्रभावित करती है और क्या मॉडल बड़े पैमाने पर वर्कफ़्लो में प्रवेश कर सकता है।
साइबर सुरक्षा GPT-5.6 Sol का सबसे संवेदनशील क्षमता क्षेत्र है।
OpenAI का कहना है कि सोल इसका अब तक का सबसे मजबूत साइबर सुरक्षा मॉडल है, जो भेद्यता अनुसंधान और शोषण-संबंधित कार्यों सहित लंबी-क्षितिज सुरक्षा कार्यों के लिए प्रदर्शन और दक्षता सीमा को आगे बढ़ाता है।
एक्सप्लॉइटबेंच पर, GPT-5.6 सोल लगभग एक-तिहाई आउटपुट टोकन का उपयोग करते हुए मिथोस प्रीव्यू के करीब प्रदर्शन करता है।

OpenAI में एक्सप्लॉइटजिम का भी उल्लेख किया गया है, जो सुरक्षा कार्यों में मॉडल क्षमता को मापने के लिए यूसी बर्कले द्वारा कई अग्रणी प्रयोगशालाओं के साथ निर्मित एक मूल्यांकन प्रणाली है। जैसे-जैसे तर्क में सुधार होता है, सोल, टेरा और लूना सभी इस क्षेत्र में स्पष्ट प्रगति करते हैं।

लेकिन OpenAI स्पष्ट रूप से इस खंड में ब्रेक पंप करता है।
आधिकारिक स्पष्टीकरण इस बात पर जोर देता है कि सोल कमजोरियों को खोजने और उन्हें ठीक करने में बेहतर है, लेकिन फिर भी विश्वसनीय रूप से एंड-टू-एंड हमलों को पूरा नहीं कर सकता है। क्रोमियम और फ़ायरफ़ॉक्स से जुड़े मूल्यांकन में, सोल बग और प्रोग्राम दोषों, शोषण के बुनियादी घटकों की पहचान कर सकता है, लेकिन परीक्षण स्थितियों के तहत यह स्वायत्त रूप से पूर्ण कार्यशील आक्रमण श्रृंखला उत्पन्न नहीं करता है।
इन परिणामों के आधार पर, OpenAI ने निष्कर्ष निकाला है कि GPT-5.6 Sol ने अपनी तैयारी रूपरेखा में साइबर सुरक्षा महत्वपूर्ण-जोखिम सीमा को पार नहीं किया है।

सिस्टम कार्ड 🔗: https://deploymentsafety.openai.com/gpt-5-6-preview/introduction
यह सतर्क निर्णय स्पष्ट रूप से मिथोस प्रकरण को दोहराने से बचने के लिए है।
एक ओर, OpenAI यह साबित करना चाहता है कि सोल साइबर सुरक्षा कार्यों में अधिक मजबूत है। दूसरी ओर, यह भी समझाने की जरूरत है कि सोल जोखिम स्तर तक नहीं पहुंचा है जिसके लिए अत्यधिक प्रतिबंध की आवश्यकता है। अधिक विडंबना यह है कि, इसमें से अधिकांश दबाव AI प्रचार कथा से आता है जिसे OpenAI ने स्वयं आकार देने में मदद की।
साथ ही, OpenAI स्वीकार करता है कि बेंचमार्क वास्तविक दुनिया के हर उपयोग को कवर नहीं कर सकते हैं। कोई भी मूल्यांकन प्रत्येक उत्पाद कॉन्फ़िगरेशन, बहु-चरणीय हमले या वास्तविक वर्कफ़्लो का प्रतिनिधित्व नहीं कर सकता है। एक मॉडल को अन्य उपकरणों से जोड़ा जा सकता है या अधिक जटिल आक्रमण श्रृंखला के अंदर रखा जा सकता है।
यही अनिश्चितता है कि GPT-5.6 को इतनी सावधानी से क्यों जारी किया जा रहा है।
सबसे मजबूत प्रदर्शन, लेकिन AI सुरक्षा पर ध्यान जाता है
सुरक्षा GPT-5.6 घोषणा का असामान्य रूप से बड़ा हिस्सा लेती है।
OpenAI ने सोल, टेरा और लूना के लिए स्तरीय सुरक्षा कॉन्फ़िगर की है। मॉडल जितना मजबूत होगा, रेलिंग उतनी ही सख्त होगी। लक्ष्य कोड समीक्षा और भेद्यता अनुसंधान जैसे वैध परिदृश्यों को संरक्षित करते हुए आक्रामक उपयोग को दबाना है।
मॉडल स्तर पर, सिस्टम को अस्वीकृत साइबर सुरक्षा अनुरोधों को अस्वीकार करने के लिए प्रशिक्षित किया जाता है, तब भी जब उपयोगकर्ता उन्हें छिपाने या बायपास करने का प्रयास करते हैं। पीढ़ी के दौरान, वास्तविक समय क्लासिफायर उच्च जोखिम वाली सामग्री का पता लगाते हैं और उसे ब्लॉक करते हैं, और उच्च क्षमता वाले मॉडल जरूरत पड़ने पर सीमा रेखा के मामलों की समीक्षा कर सकते हैं। खाता स्तर पर, OpenAI लगातार दुरुपयोग की पहचान करने के लिए क्रॉस-बातचीत व्यवहार और जोखिम संकेतों को जोड़ता है।
इस तंत्र को एक स्तरित सुरक्षा स्टैक के रूप में वर्णित किया गया है जिसमें मॉडल इनकार, वास्तविक समय का पता लगाना, खाता समीक्षा, विभेदित पहुंच और निरंतर परीक्षण शामिल है। वैध काम में व्यवधान को कम करने की कोशिश करते हुए परतें जटिल दुरुपयोग के खिलाफ मिलकर काम करती हैं।
**एंटरप्राइज़ ग्राहकों के लिए, OpenAI गोपनीयता-संरक्षण पहचान, ** ग्राहक-नियंत्रित सुरक्षा सेटिंग्स और जोखिम-स्तरीय पहुंच का भी प्रस्ताव करता है, सुरक्षा और डेटा सुरक्षा के बीच संतुलन खोजने की कोशिश करता है।

पिछली गलतियों को दोहराने से बचने के लिए, OpenAI ने स्वचालित रेड-टीम परीक्षण पर 700,000 A100-समकक्ष GPU घंटे से अधिक खर्च किए, सामान्य जेलब्रेक पर ध्यान केंद्रित किया, विशेषज्ञ मानव परीक्षण द्वारा पूरक। OpenAI ने नई कमजोरियों को पुन: उत्पन्न करने, मूल्यांकन करने और उन्हें ठीक करने और उन्हें निरंतर मूल्यांकन में बदलने के लिए एक तीव्र-प्रतिक्रिया प्रक्रिया भी बनाई है।
उपलब्धता के संदर्भ में, GPT-5.6 अभी भी सीमित पूर्वावलोकन में है।
OpenAI का कहना है कि मॉडल पहले API और कोडेक्स के माध्यम से विश्वसनीय भागीदारों के एक छोटे समूह के लिए उपलब्ध होंगे, फिर धीरे-धीरे ChatGPT, कोडेक्स और व्यापक API उपयोगकर्ताओं तक विस्तारित होंगे।
OpenAI का यह भी कहना है कि उसका मानना है कि फ्रंटियर मॉडल को यथासंभव व्यापक रूप से उपलब्ध कराया जाना चाहिए, और आने वाले हफ्तों में GPT-5.6 सोल, टेरा और लूना को अधिक सामान्य उपलब्धता में स्थानांतरित करने की योजना है।

प्रारंभिक प्रतिक्रिया विशेष रूप से आकर्षक नहीं लगती।
मूल्य निर्धारण की घोषणा उसी समय की गई:
प्रति मिलियन टोकन, सोल की लागत इनपुट के लिए $5 और आउटपुट के लिए $30 है; टेरा की लागत इनपुट के लिए $2.50 और आउटपुट के लिए $15 है; लूना की लागत इनपुट के लिए $1 और आउटपुट के लिए $6 है।

GPT-5.6 स्पष्ट कैश ब्रेकप्वाइंट और कम से कम 30 मिनट के कैश जीवनकाल के साथ अधिक पूर्वानुमानित त्वरित कैशिंग भी पेश करता है। कैश राइट का बिल अनकैच्ड इनपुट मूल्य के 1.25 गुना पर दिया जाता है, जबकि रीड पर 90% की छूट मिलती है।
बेशक, अधिकांश उपयोगकर्ताओं तक इस तक पहुंचने में अभी भी कुछ समय लगेगा। OpenAI ने घोषणा की कि GPT-5.6 Sol जुलाई में 750 टोकन प्रति सेकंड की गति के साथ सेरेब्रा पर पहुंचेगा। वह संस्करण भी शुरू में चुनिंदा ग्राहकों तक सीमित होगा, क्षमता बढ़ने के साथ व्यापक पहुंच का विस्तार होगा।
दूसरे शब्दों में, GPT-5.6 का सीमित पूर्वावलोकन केवल एक उत्पाद रोलआउट नहीं है। यह एक सुरक्षा सत्यापन प्रक्रिया भी है। OpenAI को क्षमता, जोखिम और खुलेपन के बीच एक नियंत्रणीय संतुलन खोजने की आवश्यकता है।
फ्रंटियर मॉडल रिलीज़ एक नए चक्र में प्रवेश करती है
दो सप्ताह पहले, Anthropic ने अपने सबसे मजबूत मॉडलों में से एक, फ़ेबल 5 को निष्क्रिय कर दिया था, जब अमेरिकी सरकार ने कंपनी से राष्ट्रीय सुरक्षा का हवाला देते हुए संयुक्त राज्य अमेरिका के अंदर और बाहर विदेशी नागरिकों द्वारा मॉडल के उपयोग को प्रतिबंधित करने के लिए कहा था।
GPT-5.6 के रोलआउट में, पहले उपयोगकर्ता भी पूरी तरह से OpenAI द्वारा तय नहीं किए जाते हैं।
अपने आधिकारिक ब्लॉग में, OpenAI का कहना है कि इसने लॉन्च से पहले अमेरिकी सरकार GPT-5.6 की क्षमताओं और रिलीज़ योजना को दिखाया। सरकार के अनुरोध पर, मॉडल एक सीमित पूर्वावलोकन के रूप में लॉन्च होगा, केवल कुछ विश्वसनीय भागीदारों के लिए उपलब्ध, और उन भागीदारों के बारे में जानकारी सरकार के साथ साझा की गई है।

वाशिंगटन पोस्ट ने बताया कि अमेरिकी संघीय सरकार समीक्षा करेगी कि कौन सी कंपनियां OpenAI की नवीनतम तकनीक तक पहुंच सकती हैं। वर्तमान में, केवल अमेरिकी सरकार द्वारा अनुमोदित कंपनियां ही नए मॉडल तक पहुंच सकती हैं, और व्यक्तिगत उपयोगकर्ताओं के पास कोई एप्लिकेशन चैनल नहीं है।
ब्लूमबर्ग ने बताया कि लगभग 20 भागीदार GPT-5.6 के लिए पहले एक्सेस समूह में हैं, और एक संभावित प्रवेश बिंदु अमेज़ॅन का बेडरॉक प्लेटफ़ॉर्म हो सकता है।
इस व्यवस्था के प्रति OpenAI का रवैया स्पष्ट रूप से कुछ अस्पष्ट है। ब्लॉग पोस्ट में, OpenAI का कहना है कि उसका मानना है कि मॉडल एक्सेस में सरकार की भागीदारी दीर्घकालिक डिफ़ॉल्ट नहीं बननी चाहिए, क्योंकि इससे सर्वोत्तम उपकरण उपयोगकर्ताओं, डेवलपर्स, कंपनियों, साइबर रक्षकों और वैश्विक भागीदारों से दूर रहेंगे।

लेकिन व्यवहार में, OpenAI ने फिर भी इस व्यवस्था को स्वीकार करना चुना, यह कहते हुए कि वह एक प्रतिकृति मॉडल रिलीज प्रक्रिया पर अमेरिकी सरकार के साथ काम करते हुए व्यापक खुलापन हासिल करना चाहता है।
इस बदलाव के पीछे, सीमांत AI मॉडल को धीरे-धीरे राष्ट्रीय सुरक्षा ढांचे में शामिल किया जा रहा है।
अतीत में, एक नया मॉडल लॉन्च मुख्य रूप से कंपनी के उत्पाद-चक्र का मुद्दा था। अब, एक बार जब कोई मॉडल प्रोग्रामिंग, साइबर सुरक्षा, जीव विज्ञान और एजेंटिक वर्कफ़्लो में नई क्षमता सीमा को पार कर लेता है, तो इसकी रिलीज़ लय सुरक्षा और निर्यात-नियंत्रण चर्चा में प्रवेश कर सकती है।
OpenAI के लिए, GPT-5.6 एक फ्लैगशिप मॉडल पूर्वावलोकन और नीति परीक्षण दोनों है। OpenAI को यह साबित करने की जरूरत है कि सोल काफी मजबूत है, यह साबित करना है कि इसकी सुरक्षा प्रणाली काफी सख्त है, और अमेरिकी सरकार की समीक्षा और वाणिज्यिक खुलेपन के बीच एक निष्पादन योग्य रास्ता ढूंढना है।

Editorial team
Product Team @ WebCal
WebCal की आधिकारिक product team। हम high-performance computing infrastructure और decentralized cloud solutions बनाते हैं।



