GPT-5.6 が限定プレビューに登場: OpenAI の最強モデル、それ自体の安全リスクにより抑制されている
要約
GPT-5.6 は、Sol、Terra、Luna 層の限定プレビューに入ります。 OpenAI は、アクセスをより厳格な安全性と政府審査の制約下に置きながら、コーディング、バイオインフォマティクス、サイバーセキュリティの向上を強調しています。
ちょうど今、GPT-5.6 ファミリが正式にプレビューに入りましたが、広く公開されていません。代わりに、OpenAI は限定的なプレビューで開始されます。

これまでのところ OpenAI の最強世代として、GPT-5.6 には意図的に詩的な名前が付けられた 3 つのモデルが付属しています。
Solはフラッグシップモデルであり、OpenAIはこれまでで最強のモデルと呼んでいます。
Terra は日常業務向けのバランスの取れたモデルで、GPT-5.5 と競合しながら価格は約半分です。
Luna はスピードと低コストを重視しており、GPT-5.6 ファミリの中で最も安価なモデルです。
この命名システムから判断すると、Sam Altman は明らかに Anthropic のマーケティング戦略の一部を吸収しています。 GPT-5.6 の発売と並行して、OpenAI もモデルの命名構造を再編成しました。
数字は世代を表し、Sol、Terra、Luna はさまざまな機能層を表します。製品に関して言えば、Sol は困難で複雑なタスクを対象とし、Terra は日常のワークフローをカバーし、Luna は低コストの通話を対象としています。
つまり、GPT-5.6 は単なる機能アップグレードではありません。これは、OpenAI のモデル製品ラインをより明確にセグメント化する試みでもあります。

🔗 https://openai.com/index/previewing-gpt-5-6-sol/
GPT-5.6 が一夜にして登場し、ファミリー全体のベンチマークを上回りました
これまでの OpenAI の最強モデルである GPT-5.6 Sol の機能ストーリーは、コーディング、バイオインフォマティクス、サイバーセキュリティの 3 つの領域に集中しています。
これらのシナリオには、次の 1 つの特徴があります。
それらは複雑で、長期にわたるものであり、コンテキストに大きく依存します。モデルは計画を立て、推論し、ツールを呼び出し、間違いを修正し、プロセスを前進させ続ける必要があります。 OpenAI はこれをエージェント機能と呼びます。これは、モデルがタスクを独立して実行できるエージェントのように動作することを意味します。
コーディング中、GPT-5.6 Sol はコード完了時に停止しなくなりました。複雑なコマンドライン作業にまで及びます。
OpenAI によると、Sol は、計画、反復、ツールの調整をテストするコマンドライン ワークフローのベンチマークである Terminal-Bench 2.1 のパフォーマンスを更新しました。

ベンチマーク結果は、GPT-5.6 Sol Ultra のスコアが Terminal-Bench 2.1 で 91.9% であるのに対し、GPT-5.6 Sol のスコアは 88.8% であることを示しています。比較のために、GPT-5.5 のスコアは 88.0%、GPT-5.6 Terra のスコアは 82.5%、GPT-5.6 Luna のスコアは 84.3% です。
他のモデルと比較すると、Claude Mythos 5 スコアは 84.3%、Claude Fable 5 スコアは 83.4%、Claude Opus 4.8 スコアは 78.9%、Gemini 3.1 Pro Preview スコアは 70.7% です。

Sol Ultra のスコアは、GPT-5.6 の中核機能も示しています。
一方で、推論の労力を最大限に高めることで、モデルは深い推論により多くの時間を費やすことができます。一方、新しい Ultra モードは、複数のサブエージェントをディスパッチして複雑なタスクを分割し、結果を統合します。
実際の開発作業では、モデルは多くの場合、プロジェクト構造を理解し、ファイルを読み取り、コードを変更し、コマンドを実行し、エラーを分析し、修正を続ける必要があります。複雑なタスクは通常、1 つの答えでは完了できません。 Ultra モードは、結果を結合する前に、さまざまなサブエージェントにワークフローのさまざまな部分を処理させ、複雑なタスクの完了効率を向上させることを目的としています。
生物学では、GPT-5.6 Sol の改善が GeneBench v1 に現れています。このベンチマークは、長期的なゲノミクスおよび定量的生物学の分析タスクに焦点を当てています。 OpenAI によれば、Sol はより少ない出力トークンを使用しながら、GPT-5.5 よりも強力な結果を達成します。



さらに見るには左にスワイプします。

これは研究において特に重要です。バイオインフォマティクス、ゲノミクス、定量生物学では、多くの場合、データの分析、結果の説明、方法の選択、仮説の比較、および複数のステップにわたるコンテキストの維持を継続するためのモデルが必要です。モデルがこれらのタスクを完了できるかどうかが重要であり、より低いトークンコストでそれを完了できるかどうかも同様に重要です。
Sol がより少ない出力トークンでより強力な結果を達成できる場合、それは専門的な科学ワークフローのコスト効率が向上することを意味します。研究室、企業の研究開発チーム、生物医学のシナリオでは、トークンの消費は通話コストとモデルが大規模なワークフローに入ることができるかどうかに直接影響します。
サイバーセキュリティは、GPT-5.6 Sol の最も機密性の高い機能領域です。
OpenAI によれば、Sol はこれまでのところ同社最強のサイバーセキュリティ モデルであり、脆弱性調査や悪用関連タスクなど、長期的なセキュリティ タスクのパフォーマンスと効率性の最前線を押し広げています。
ExploitBench では、GPT-5.6 Sol は、出力トークンの約 3 分の 1 を使用しながら、Mythos プレビューに近いパフォーマンスを発揮します。

OpenAI では、セキュリティ タスクにおけるモデルの能力を測定するために、カリフォルニア大学バークレー校がいくつかのフロンティア ラボと協力して構築した評価システムである ExploitGym についても言及しています。推理力が向上するにつれ、ソル、テラ、ルナはこの分野で明らかな進歩を遂げます。

しかし、OpenAI はこのセクションで明らかにブレーキをかけています。
公式説明では、Sol は脆弱性の発見と修正には優れているものの、依然としてエンドツーエンド攻撃を確実に完了することはできないと強調しています。 Chromium と Firefox を含む評価では、Sol は悪用の基本コンポーネントであるバグとプログラムの欠陥を特定できますが、テスト条件下では完全に機能する攻撃チェーンを自律的に生成することはできません。
これらの結果に基づいて、OpenAI は GPT-5.6 Sol は準備フレームワークにおけるサイバーセキュリティの重大リスクのしきい値を超えていないと結論付けています。

システムカード 🔗: https://deploymentsafety.openai.com/gpt-5-6-preview/introduction
この慎重な判断は明らかに、ミュトスのエピソードの繰り返しを避けることを目的としています。
一方では、OpenAI は、Sol がサイバーセキュリティタスクにおいてはるかに強力であることを証明したいと考えています。一方で、ソルは極端な制限を必要とするリスクレベルに達していないことも説明する必要がある。さらに皮肉なことに、このプレッシャーの多くは、OpenAI 自体が形成に貢献した AI の誇大広告から来ています。
同時に、OpenAI は、ベンチマークが実際の使用をすべてカバーできるわけではないことも認めています。すべての製品構成、複数ステップの攻撃、または実際のワークフローを表現できる評価はありません。モデルは他のツールに接続されたり、より複雑な攻撃チェーン内に配置されたりする可能性があります。
この不確実性こそが、GPT-5.6 が非常に慎重にリリースされる理由です。
最強のパフォーマンスだが、AI の安全性が脚光を浴びる
GPT-5.6 の発表では、安全性が異常に大きな割合を占めています。
OpenAI は、Sol、Terra、Luna の段階的な保護を構成しました。モデルが強力であればあるほど、ガードレールは厳しくなります。目標は、コードレビューや脆弱性調査などの正当なシナリオを維持しながら、攻撃的な使用を抑制することです。
モデル層では、システムは、ユーザーが許可されていないサイバーセキュリティ要求を偽装したりバイパスしようとした場合でも、拒否するようにトレーニングされます。生成中に、リアルタイム分類器が高リスクのコンテンツを検出してブロックし、より高機能なモデルが必要に応じて境界線のケースをレビューできます。アカウント層では、OpenAI は会話間の動作とリスク信号を組み合わせて、持続的な不正行為を特定します。
このメカニズムは、モデルの拒否、リアルタイム検出、アカウントレビュー、差別化されたアクセス、継続的テストをカバーする階層化された安全スタックとして説明されています。各レイヤーは、正当な業務への中断を軽減しながら、複雑な不正行為に対して連携して取り組みます。
企業顧客向けに、OpenAI はプライバシー保護の検出、 顧客制御のセキュリティ設定、およびリスク階層型アクセスも提案し、安全性とデータ保護のバランスを見つけようとしています。

過去の過ちを繰り返さないために、OpenAI は A100 に相当する GPU の 700,000 時間を超える自動レッドチーム テストを費やし、一般的なジェイルブレイクに重点を置きました。これを専門家による人間によるテストで補完しました。 OpenAI は、新しい脆弱性を再現、評価、修正し、継続的な評価に組み込むための迅速な対応プロセスも構築しました。
可用性の点では、GPT-5.6 はまだ限定的なプレビュー段階にあります。
OpenAI によれば、モデルはまず API および Codex を通じて信頼できるパートナーの小グループに提供され、その後徐々に ChatGPT、Codex、およびより広範な API ユーザーに拡大される予定です。
OpenAI はまた、フロンティア モデルは可能な限り広く利用できるようにする必要があると考えており、今後数週間のうちに GPT-5.6 Sol、Terra、および Luna をより一般的に利用できるようにする予定であると述べています。

初期の反応は特に喜ばしいものではありません。
同時に価格も発表されました。
Sol は 100 万トークンあたり、入力に 5 ドル、出力に 30 ドルかかります。 Terra の料金は入力に 2.50 ドル、出力に 15 ドルです。 Luna のコストは入力に 1 ドル、出力に 6 ドルです。

GPT-5.6 では、明示的なキャッシュ ブレークポイントと少なくとも 30 分のキャッシュ有効期間を備えた、より予測可能なプロンプト キャッシュも導入されています。キャッシュ書き込みにはキャッシュされていない入力価格の 1.25 倍の料金が請求されますが、読み取りには 90% の割引が適用されます。
もちろん、ほとんどのユーザーがアクセスできるようになるまでにはまだ時間がかかります。 OpenAI は、毎秒最大 750 トークンの速度を持つ GPT-5.6 Sol が 7 月に Cerebras に登場すると発表しました。 このバージョンも当初は一部の顧客に限定されますが、容量が増加するにつれてアクセス範囲も拡大します。
つまり、GPT-5.6 の限定プレビューは単なる製品の公開ではありません。これは安全性を検証するプロセスでもあります。 OpenAI は、機能、リスク、オープン性の間で制御可能なバランスを見つける必要があります。
フロンティア モデルのリリースが新たなサイクルに入る
2週間前、米国政府が国家安全保障を理由に米国内外の外国人によるモデルの使用を制限するようAnthropicに要請したため、Anthropicは同社の最強モデルの1つであるFable 5を無効にした。
GPT-5.6 の展開では、最初のユーザーも OpenAI によって完全に決定されるわけではありません。
OpenAIは公式ブログで、発売前に米国政府にGPT-5.6の機能とリリース計画を示したと述べている。政府の要請により、このモデルは 少数の信頼できるパートナーのみが利用できる限定プレビューとして開始され、これらのパートナーに関する情報は政府と共有されています。

ワシントン・ポスト紙は、米連邦政府がどの企業がOpenAIの最新技術にアクセスできるかを検討すると報じた。現時点では、米国政府によって承認された企業のみが新しいモデルにアクセスでき、個人ユーザーにはアプリケーション チャネルがありません。
ブルームバーグは、約 20 のパートナーが GPT-5.6 の最初のアクセス グループに属しており、考えられるエントリ ポイントの 1 つは Amazon の Bedrock プラットフォームである可能性があると報告しました。
この取り決めに対する OpenAI の態度は明らかにやや曖昧です。 OpenAIはブログ投稿の中で、モデルアクセスへの政府の関与が長期的なデフォルトになるべきではないと考えていると述べている、それはユーザー、開発者、企業、サイバー防御者、グローバルパートナーから最良のツールを遠ざけることになるからである。

しかし実際には、OpenAIは依然として協定を受け入れることを選択しており、複製可能なモデルのリリースプロセスに関して米国政府と協力しながら、より広範な公開性を勝ち取りたいと述べている。
この変化の背後では、フロンティアの AI モデルが徐々に国家安全保障の枠組みに組み込まれています。
以前は、新モデルの発売は主に企業の製品サイクルの問題でした。現在、モデルがプログラミング、サイバーセキュリティ、生物学、およびエージェントのワークフローにおいて新しい機能のしきい値を超えると、そのリリースのリズムが安全性と輸出管理の議論に入る可能性があります。
OpenAI の場合、GPT-5.6 は主力モデルのプレビューとポリシーのトライアルの両方です。 OpenAIは、Solが十分に強力であることを証明し、その安全システムが十分に厳格であることを証明し、米国政府の審査と商業的開放の間の実行可能な道を見つける必要がある。

編集チーム
Product Team @ WebCal
WebCalを支える公式プロダクトチームです。私たちは、高性能なコンピューティングインフラと分散型クラウドソリューションを構築しています。



