剛剛,GPT-5.6 正式發布,史上最強但被自己坑慘了
內容摘要
GPT-5.6 系列以有限預覽發布,Sol、Terra、Luna 分層亮相;OpenAI 強調程式設計、生物資訊學和網路安全能力,同時將存取節奏置於更嚴格的安全與政府審查框架中。
**就在剛剛,GPT-5.6 系列正式發布,不過,它並沒有直接全面開放,而是以「有限預覽」的方式先行試水。 **

身為 OpenAI 最強的一代,GPT-5.6 一口氣端出三款型號,名字起得頗有詩意:
Sol(太陽)是旗艦模型,也是 OpenAI 口中目前最強的模型;
Terra(地球/大地)是日常工作的平衡型模型,性能可以與 GPT-5.5 競爭,同時價格便宜一半;
Luna(月亮)主打速度和低成本,是 GPT-5.6 系列中最便宜的模型。
**從這命名方式來看,奧特曼私底下沒少學習 Anthropic 行銷的精髓。 **而藉著 GPT-5.6 的發布,OpenAI 也順手把命名體系重新整理了一遍:
數字表示代際,Sol、Terra、Luna 對應不同能力層級,以便區分智慧等級、速度與成本。產品定位上,Sol 面向高難複雜任務,Terra 涵蓋日常工作流程,Luna 主打低成本呼叫。
換句話說,GPT-5.6 不只是一次能力升級,也是 OpenAI 對模型產品線的一次重新分層。

🔗 https://openai.com/index/previewing-gpt-5-6-sol/
GPT-5.6 深夜突襲,能力全系霸榜
作為 OpenAI 迄今最強模型。 GPT-5.6 Sol 的能力展示,主要集中在程式設計、生物資訊學和網路安全三個方向。
這三類場景有一個共同特徵:
**複雜、長鏈條、強烈依賴上下文。模型需要在任務中持續規劃、推理、呼叫工具、修正錯誤,並持續推進流程。 OpenAI 把這種能力稱為 agentic capabilities-讓模型更像一個能獨立執行任務的 agent。 **
在程式設計場景中,GPT-5.6 Sol 已經不再停留在程式碼補全,而是深入到命令列環境中的複雜操作。
OpenAI 稱,Sol 在 Terminal-Bench 2.1 上刷新了表現。 Terminal-Bench 2.1 測試的是命令列工作流程,任務要求模型具備規劃、迭代和工具協調能力。

基準測試成績顯示,GPT-5.6 Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,GPT-5.6 Sol 得分 88.8%。作為對照,GPT-5.5 為 88.0%,GPT-5.6 Terra 為 82.5%,GPT-5.6 Luna 為 84.3%。
橫向比較其它模型,Claude Mythos 5 為 84.3%,Claude Fable 5 為 83.4%,Claude Opus 4.8 為 78.9%,Gemini 3.1 Pro Preview 為 70.7%。

Sol Ultra 的成績,也對應 GPT-5.6 的核心功能。
**一方面,max 等級的推理強度讓模型可以投入更多時間進行深度推理;另一方面,新增的 Ultra 模式會調度多個子 Agent,把複雜任務拆分處理,再統一匯總結果。 **
在真實開發場景裡,模型經常需要理解專案結構、讀取檔案、修改程式碼、執行指令、分析報錯、繼續修改。一個複雜任務通常無法靠一次回答完成。 Ultra 模式的方向,是讓多個子 Agent 分別處理不同環節,再把結果匯總起來,從而提高複雜任務的完成效率。
生物方向上,GPT-5.6 Sol 的提升體現在 GeneBench v1 上。這個評測主要面向長週期基因體學和定量生物分析任務。 OpenAI 稱,Sol 相比 GPT-5.5 取得了更強結果,而且使用的輸出 tokens 更少。



向左滑動查看更多內容

這一點對科研場景尤其關鍵。生物資訊學、基因組學和定量生物分析,經常需要模型持續分析數據、解釋結果、選擇方法、比較假設,並在多輪操作中保持上下文一致。模型能不能完成這類任務很重要,能不能用更低 tokens 成本完成長鏈分析同樣重要。
**如果 Sol 能在更少輸出 tokens 下取得更強結果,意味著它在專業科學研究工作流程中有更好的成本效率。對實驗室、企業研發團隊和生醫場景來說,tokens 消耗直接影響呼叫成本,也影響模型能否進入大規模工作流程。 **
網路安全則是 GPT-5.6 Sol 最敏感的能力方向。
OpenAI 稱,Sol 是其迄今最強的網路安全模型,能夠推進長週期安全任務的效能和效率邊界,包括漏洞研究和 exploitation 相關任務。
在 ExploitBench 上,GPT-5.6 Sol 的表現接近 Mythos Preview,但只使用了大約三分之一的輸出 tokens。

同時,OpenAI 也提到 ExploitGym——一個由 UC Berkeley 聯合多家前沿實驗室打造的評測體系,用來衡量模型在安全任務中的能力。隨著推理能力提升,Sol、Terra、Luna 在這一領域都有明顯進步。

不過,OpenAI 對這部分錶述明顯踩了煞車。
官方強調,Sol 更擅長發現和修復漏洞,還不能穩定完成端到端攻擊。在涉及 Chromium 和 Firefox 的評估中,Sol 可以識別 bug 和程式缺陷,也就是漏洞利用的基礎元件,但在測試條件下沒有自主產生可運行的完整攻擊鏈。
基於這些結果,OpenAI 判斷 **GPT-5.6 Sol 尚未跨越 Preparedness Framework 中的網路安全關鍵風險閾值。 **

System Card 🔗:https://deploymentsafety.openai.com/gpt-5-6-preview/introduction
**這種踩煞車的判斷顯然是為了避免重走「Mythos」的老路。 **
一方面,OpenAI 要證明 Sol 在網路安全任務上確實強了很多;另一方面,它也要說明 Sol 還沒有達到必須極端限制的風險等級。更諷刺的是,**這種壓力很大程度上來自 OpenAI 自己參與塑造的 AI 行業炒作敘事。 **
同時,OpenAI 也承認,基準測試無法涵蓋所有現實用法。沒有任何評測可以代表所有產品配置、多步驟攻擊和真實工作流程。模型可能被連接到其他工具,也可能被放進更複雜的攻擊鏈裡。
正是這種不確定性,讓 GPT-5.6 的發布方式變得格外謹慎。
性能最強,但戲份卻給了 AI 安全
GPT-5.6 的發布說明中,安全罕見地佔據了較大篇幅。
OpenAI 為 Sol、Terra、Luna 配置了分級防護體系,能力越強,防護越嚴,目標是在壓制攻擊性用途的同時保留程式碼審查、漏洞研究等合法場景。
模型層面,系統被訓練為拒絕違規網路安全請求,即便使用者嘗試偽裝或繞過。生成階段引入即時分類器,對高風險內容進行偵測與攔截,必要時交由更強模型複核。帳號層面則結合跨對話行為與風險訊號,辨識持續性濫用。
這套機制稱為分層安全棧,涵蓋模型拒答、即時檢測、帳號審查、差異化存取與持續測試。多層協同用於應對複雜濫用,同時盡量減少對正常工作的干擾。
**面向企業客戶,OpenAI 也提出了隱私保護偵測、**自主安全控制以及風險分級存取等方案,試圖在安全與資料保護之間找到平衡點。

為了避免重蹈覆轍,OpenAI 在自動化紅隊測試上投入了超過 70 萬 A100 等效 GPU 小時,重點尋找通用 jailbreak(越獄),並輔以專家人工測試。 OpenAI 也建立快速回應流程,對新漏洞進行復現、評估與修復,並納入持續評測體系。
可用性方面,GPT-5.6 目前仍處於有限預覽階段。
**OpenAI 表示,模型將先透過 API 和 Codex 向一部分可信合作夥伴開放,隨後再逐步擴展到 ChatGPT、Codex 和更廣泛的 API 用戶。 **
**同時,OpenAI 也強調,自己相信前沿模型應該盡可能廣泛地開放,併計劃在未來幾週內,讓 GPT-5.6 Sol、Terra 和 Luna 進入更普遍的可用狀態。 **

看起來評價不太妙
價格體係也同步公佈:
**按每百萬 tokens 計費,Sol 輸入 5 美元、輸出 30 美元;Terra 輸入 2.5 美元、輸出 15 美元;Luna 輸入 1 美元、輸出 6 美元。 **

同時,GPT-5.6 引入了更可預測的 prompt caching 機制,支援明確 cache breakpoints,並提供至少 30 分鐘快取生命週期。快取寫入以未快取輸入價格的 1.25 倍計費,讀取則享有 90% 折扣。
當然,想要用上還需要一些時日,**OpenAI 宣布 GPT-5.6 Sol 將在 7 月登陸 Cerebras,最高速度可達每秒 750 tokens。 **這個版本初期同樣只對部分客戶開放,後續會隨著容量擴展逐步放開。
換句話說,GPT-5.6 的「限量預覽」不只是產品灰階發布,更是一套安全驗證流程。 OpenAI 需要在能力、風險與開放之間,找到一個可控制的平衡點。
前沿模型發布節奏,進入新周期
兩週前,Anthropic 停用了其最強模型之一 Fable 5,因為美國政府要求該公司限制美國境內外外國公民使用相關模型,理由是國家安全。
而在 GPT-5.6 的發布流程中,第一批使用使用者同樣不完全由 OpenAI 自己決定。
OpenAI 在官方部落格中揭露,在發布前已向美國政府展示 GPT-5.6 的能力與發布計劃。根據美國政府要求,模型將以有限預覽形式上線,僅向少數可信任合作夥伴開放,並且這些合作夥伴的資訊已與政府共享。

《華盛頓郵報》的報導提到,美國聯邦政府將審查哪些公司可以存取 OpenAI 的最新技術。且目前只有獲得美國政府批准的公司可以存取新模型,**個人用戶沒有申請通道。 **
彭博社則報道稱,**GPT-5.6 首批開放對象約為 20 家合作夥伴,其中一個入口可能是亞馬遜的 Bedrock 平台。 **
對此,OpenAI 的態度顯然是有些模凌兩可。 OpenAI 在部落格中表示,不認為美國政府參與模型存取流程應成為長期預設機制,因為這會讓最好的工具遠離使用者、開發者、企業、網路防禦者和全球合作夥伴。

但現實是,OpenAI 仍選擇接受這項安排,理由是希望爭取更廣泛開放,同時與美國政府共同製定一套可複製的模型發布流程。
這項變化背後,是前沿 AI 模型逐漸被納入國家安全框架。
過去,新模型發布主要是公司產品節奏問題。現在,一旦模型在程式設計、網路安全、生物和代理式工作流程上跨過新的能力區間,發布節奏就可能被納入安全和出口控制討論。
對 OpenAI 來說,GPT-5.6 既是一次旗艦模型預覽,也是一次政策試探。 OpenAI 需要證明 Sol 夠強,也需要證明安全體系夠嚴密,還要在美國政府審查和商業開放之間找到可執行路徑。

官方團隊
Product Team @ WebCal
WebCal 官方產品團隊。我們致力於構建高效能運算基礎設施與去中心化雲解決方案。



