GPT-5.6, 제한된 미리보기 시작: OpenAI의 가장 강력한 모델, 자체 안전 위험으로 인해 보류됨
요약
GPT-5.6는 Sol, Terra 및 Luna 계층으로 제한된 미리 보기에 들어갑니다. OpenAI는 코딩, 생물정보학 및 사이버 보안의 이점을 강조하는 동시에 더 엄격한 안전 및 정부 검토 제약 하에 액세스를 배치합니다.
지금 GPT-5.6 제품군은 공식적으로 미리 보기에 들어갔지만 광범위하게 공개되지는 않습니다. 대신 OpenAI는 제한된 미리보기로 시작됩니다.

지금까지 OpenAI의 가장 강력한 세대인 GPT-5.6는 이름이 의도적으로 시적인 세 가지 모델과 함께 출시되었습니다.
Sol은 주력 모델이며 OpenAI는 현재까지 가장 강력한 모델이라고 부릅니다.
Terra는 GPT-5.5와 경쟁하면서 일상 작업을 위한 균형 잡힌 모델이며 비용은 대략 절반 정도입니다.
Luna는 속도와 저렴한 비용에 중점을 두어 GPT-5.6 제품군 중 가장 저렴한 모델입니다.
이 명명 시스템으로 판단하면 Sam Altman은 Anthropic의 마케팅 플레이북 중 일부를 확실히 흡수했습니다. GPT-5.6 출시와 함께 OpenAI는 모델 명명 구조도 재구성했습니다.
숫자는 세대를 나타내고, Sol, Terra 및 Luna는 서로 다른 기능 계층을 나타냅니다. 제품 측면에서 Sol은 어렵고 복잡한 작업을, Terra는 일상적인 작업 흐름을, Luna는 저렴한 통화를 목표로 합니다.
즉, GPT-5.6는 단순한 기능 업그레이드가 아닙니다. 이는 모델 제품 라인을 더욱 명확하게 세분화하려는 OpenAI의 시도이기도 합니다.

🔗 https://openai.com/index/previewing-gpt-5-6-sol/
GPT-5.6는 하룻밤 사이에 상륙하여 제품군 전반에 걸쳐 벤치마크를 넘어섰습니다.
지금까지 OpenAI의 가장 강력한 모델인 GPT-5.6 Sol의 역량 스토리는 코딩, 생물정보학, 사이버 보안의 세 가지 영역에 집중되어 있습니다.
이러한 시나리오는 한 가지 기능을 공유합니다.
복잡하고 범위가 넓으며 상황에 따라 크게 달라집니다. 모델은 계속해서 계획하고, 추론하고, 도구를 호출하고, 실수를 수정하고, 프로세스를 진행해야 합니다. OpenAI는 이를 에이전트 기능이라고 부릅니다. 즉, 모델이 독립적으로 작업을 실행할 수 있는 에이전트처럼 동작한다는 의미입니다.
코딩 시 GPT-5.6 Sol은 더 이상 코드 완료 시 멈추지 않습니다. 복잡한 명령줄 작업에 도달합니다.
OpenAI에 따르면 Sol은 계획, 반복 및 도구 조정을 테스트하는 명령줄 워크플로에 대한 벤치마크인 Terminal-Bench 2.1에서 성능을 새로 고쳤습니다.

벤치마크 결과에 따르면 GPT-5.6 Sol Ultra는 Terminal-Bench 2.1에서 91.9%를 기록했고 GPT-5.6 Sol은 88.8%를 기록했습니다. 비교를 위해 GPT-5.5 점수는 88.0%, GPT-5.6 Terra 점수는 82.5%, GPT-5.6 Luna 점수는 84.3%입니다.
다른 모델과 비교했을 때 Claude Mythos 5는 84.3%, Claude Fable 5는 83.4%, Claude Opus 4.8은 78.9%, Gemini 3.1 Pro Preview는 70.7%를 기록했습니다.

Sol Ultra의 점수는 또한 GPT-5.6의 핵심 기능을 나타냅니다.
한편으로는 최대 추론 노력을 통해 모델이 심층 추론에 더 많은 시간을 할애할 수 있습니다. 반면, 새로운 Ultra 모드는 여러 하위 에이전트를 파견하여 복잡한 작업을 분할한 다음 결과를 통합합니다.
실제 개발 작업에서 모델은 프로젝트 구조를 이해하고, 파일을 읽고, 코드를 변경하고, 명령을 실행하고, 오류를 분석하고, 계속 수정해야 하는 경우가 많습니다. 복잡한 작업은 일반적으로 하나의 답변으로 완료할 수 없습니다. Ultra 모드는 결과를 병합하기 전에 여러 하위 에이전트가 워크플로의 여러 부분을 처리할 수 있도록 하여 복잡한 작업의 완료 효율성을 높이는 것을 목표로 합니다.
생물학에서는 GPT-5.6 Sol의 개선이 GeneBench v1에 나타납니다. 이 벤치마크는 장거리 유전체학 및 정량적 생물학 분석 작업에 중점을 둡니다. OpenAI는 Sol이 더 적은 출력 토큰을 사용하면서 GPT-5.5보다 더 강력한 결과를 달성했다고 말합니다.



더 보려면 왼쪽으로 스와이프하세요.

이는 특히 연구에서 중요합니다. 생물정보학, 유전체학, 정량 생물학에서는 데이터를 계속 분석하고, 결과를 설명하고, 방법을 선택하고, 가설을 비교하고, 여러 단계에 걸쳐 맥락을 유지하는 모델이 필요한 경우가 많습니다. 모델이 이러한 작업을 완료할 수 있는지 여부가 중요하며, 더 낮은 토큰 비용으로 이를 수행할 수 있는지 여부도 그만큼 중요합니다.
Sol이 더 적은 수의 출력 토큰으로 더 강력한 결과를 얻을 수 있다면 이는 전문 과학 워크플로우에서 더 나은 비용 효율성을 의미합니다. 실험실, 기업 R&D 팀, 생물의학 시나리오의 경우 토큰 소비는 통화 비용과 모델이 대규모 워크플로에 들어갈 수 있는지 여부에 직접적인 영향을 미칩니다.
사이버 보안은 GPT-5.6 Sol의 가장 민감한 기능 영역입니다.
OpenAI는 Sol이 지금까지 가장 강력한 사이버 보안 모델로서 취약성 연구 및 악용 관련 작업을 포함한 장기적인 보안 작업에 대한 성능과 효율성의 한계를 뛰어넘고 있다고 말합니다.
ExploitBench에서 GPT-5.6 Sol은 출력 토큰의 약 1/3을 사용하면서 Mythos Preview에 가까운 성능을 발휘합니다.

OpenAI는 또한 보안 작업에서 모델 기능을 측정하기 위해 UC Berkeley가 여러 첨단 연구실과 함께 구축한 평가 시스템인 ExploitGym을 언급합니다. 추론이 향상됨에 따라 Sol, Terra 및 Luna는 모두 이 영역에서 분명한 진전을 이루었습니다.

그러나 OpenAI는 이 섹션에서 브레이크를 확실히 작동합니다.
공식적인 설명은 Sol이 취약점을 찾아 수정하는 데 더 뛰어나지만 여전히 엔드투엔드 공격을 안정적으로 완료할 수 없다는 점을 강조합니다. Chromium 및 Firefox와 관련된 평가에서 Sol은 악용의 기본 구성 요소인 버그 및 프로그램 결함을 식별할 수 있지만 테스트 조건에서는 전체 작동 공격 체인을 자동으로 생성하지 않습니다.
이러한 결과를 바탕으로 OpenAI는 GPT-5.6 Sol이 준비 프레임워크에서 사이버 보안 중요 위험 임계값을 넘지 않았다는 결론을 내렸습니다.

시스템 카드 🔗: https://deploymentsafety.openai.com/gpt-5-6-preview/introduction
이러한 신중한 판단은 신화 에피소드가 반복되는 것을 피하기 위한 것임이 분명합니다.
한편으로 OpenAI는 Sol이 사이버 보안 작업에 훨씬 더 강력하다는 것을 증명하고 싶어합니다. 다른 한편으로는 솔이 극단적인 제한이 필요한 위험 수준에 도달하지 않았다는 점도 설명할 필요가 있다. 더 아이러니하게도 이러한 압력의 대부분은 OpenAI 자체가 형성에 도움이 된 AI 과대 광고 내러티브에서 비롯됩니다.
동시에 OpenAI는 벤치마크가 모든 실제 사용을 다룰 수는 없다는 점을 인정합니다. 어떤 평가도 모든 제품 구성, 다단계 공격 또는 실제 워크플로를 나타낼 수는 없습니다. 모델은 다른 도구에 연결되거나 더 복잡한 공격 체인 내에 배치될 수 있습니다.
이러한 불확실성이 바로 GPT-5.6가 그토록 조심스럽게 출시되는 이유입니다.
성능은 최강이지만 AI 안전성이 주목받는다
안전은 GPT-5.6 발표에서 비정상적으로 큰 부분을 차지합니다.
OpenAI는 Sol, Terra 및 Luna에 대한 계층형 보호를 구성했습니다. 모델이 강할수록 가드레일도 더 엄격해집니다. 목표는 코드 검토 및 취약점 연구와 같은 합법적인 시나리오를 유지하면서 공격적인 사용을 억제하는 것입니다.
모델 계층에서 시스템은 사용자가 위장하거나 우회하려고 시도하는 경우에도 허용되지 않는 사이버 보안 요청을 거부하도록 훈련됩니다. 생성 중에 실시간 분류자는 고위험 콘텐츠를 감지하고 차단하며, 더 높은 기능의 모델은 필요할 때 경계선 사례를 검토할 수 있습니다. 계정 계층에서 OpenAI는 교차 대화 동작과 위험 신호를 결합하여 지속적인 남용을 식별합니다.
이 메커니즘은 모델 거부, 실시간 감지, 계정 검토, 차별화된 액세스 및 지속적인 테스트를 포함하는 계층화된 안전 스택으로 설명됩니다. 계층은 합법적인 작업에 대한 중단을 줄이려고 노력하는 동시에 복잡한 남용에 맞서 함께 작동합니다.
**기업 고객을 위해 OpenAI는 개인 정보 보호 감지, ** 고객 제어 보안 설정 및 위험 계층 액세스를 제안하여 안전과 데이터 보호 사이의 균형을 찾으려고 노력합니다.

과거의 실수를 반복하지 않기 위해 OpenAI는 전문가의 인간 테스트로 보완된 일반 탈옥에 초점을 맞춘 자동화된 레드팀 테스트에 700,000 A100와 동등한 GPU 시간 이상을 소비했습니다. OpenAI는 또한 새로운 취약점을 재현, 평가 및 수정하고 이를 지속적인 평가에 포함시키기 위한 신속한 대응 프로세스를 구축했습니다.
가용성 측면에서 GPT-5.6는 아직 제한된 미리 보기 상태입니다.
OpenAI에 따르면 이 모델은 먼저 API 및 Codex를 통해 신뢰할 수 있는 소규모 파트너 그룹에 제공되고 점차적으로 ChatGPT, Codex 및 더 광범위한 API 사용자로 확장됩니다.
OpenAI는 또한 프론티어 모델이 가능한 한 광범위하게 제공되어야 한다고 믿으며 앞으로 몇 주 안에 GPT-5.6 Sol, Terra 및 Luna를 보다 일반적인 가용성으로 전환할 계획이라고 밝혔습니다.

초기 반응은 특별히 좋아 보이지는 않습니다.
동시에 가격이 발표되었습니다.
백만 개의 토큰당 Sol의 비용은 입력 비용 5달러, 출력 비용 30달러입니다. Terra의 비용은 입력 비용이 2.50달러, 출력 비용이 15달러입니다. Luna의 비용은 입력 비용 1달러, 출력 비용 6달러입니다.

GPT-5.6는 또한 명시적인 캐시 중단점과 최소 30분의 캐시 수명을 통해 보다 예측 가능한 프롬프트 캐싱을 도입합니다. 캐시 쓰기에는 캐시되지 않은 입력 가격의 1.25배가 청구되고, 읽기에는 90% 할인이 적용됩니다.
물론 대부분의 사용자가 액세스할 수 있기까지는 여전히 시간이 걸릴 것입니다. OpenAI는 GPT-5.6 Sol이 초당 최대 750개의 토큰 속도로 7월에 Cerebras에 도착할 것이라고 발표했습니다. 해당 버전은 또한 처음에는 일부 고객에게만 제한되며 용량이 증가함에 따라 액세스 범위가 더 넓어집니다.
즉, GPT-5.6의 제한된 미리보기는 단순한 제품 출시가 아닙니다. 안전성 검증 과정이기도 합니다. OpenAI는 기능, 위험 및 개방성 사이에서 제어 가능한 균형을 찾아야 합니다.
프론티어 모델 출시, 새로운 사이클 돌입
2주 전, Anthropic는 미국 정부가 국가 안보를 이유로 미국 내외 외국인의 모델 사용을 제한하도록 회사에 요청한 후 가장 강력한 모델 중 하나인 Fable 5를 비활성화했습니다.
GPT-5.6의 출시에서 첫 번째 사용자도 OpenAI에 의해 전적으로 결정되지 않습니다.
OpenAI는 공식 블로그를 통해 출시 전 미국 정부에 GPT-5.6의 성능과 출시 계획을 보여줬다고 밝혔습니다. 정부의 요청에 따라 이 모델은 제한된 미리 보기로 출시되며 신뢰할 수 있는 소수의 파트너에게만 제공되며 해당 파트너에 대한 정보는 정부와 공유됩니다.

워싱턴포스트(WP)는 미국 연방정부가 어떤 기업이 OpenAI의 최신 기술에 접근할 수 있는지 검토할 것이라고 보도했다. 현재는 미국 정부의 승인을 받은 기업만 새 모델에 접근할 수 있으며, 개인 사용자는 신청 채널이 없습니다.
Bloomberg는 약 20개의 파트너가 GPT-5.6의 첫 번째 액세스 그룹에 속해 있으며 가능한 진입점 중 하나는 Amazon의 Bedrock 플랫폼일 수 있다고 보고했습니다.
이 합의에 대한 OpenAI의 태도는 분명히 다소 모호합니다. 블로그 게시물에서 OpenAI는 모델 액세스에 대한 정부의 개입이 장기적인 기본값이 되어야 한다고 생각하지 않는다고 말합니다. 그렇게 하면 사용자, 개발자, 회사, 사이버 방어자 및 글로벌 파트너로부터 최고의 도구를 멀리하게 될 것이기 때문입니다.

그러나 실제로 OpenAI는 복제 가능한 모델 출시 프로세스에 대해 미국 정부와 협력하면서 더 넓은 개방성을 확보하고 싶다며 여전히 합의를 수락하기로 결정했습니다.
이러한 변화 뒤에는 최첨단 AI 모델이 점차 국가 안보 프레임워크로 통합되고 있습니다.
과거에는 신모델 출시는 주로 회사의 제품주기 문제였습니다. 이제 모델이 프로그래밍, 사이버 보안, 생물학 및 에이전트 워크플로에서 새로운 기능 임계값을 넘으면 해당 모델의 출시 리듬이 안전 및 수출 통제 논의에 들어갈 수 있습니다.
OpenAI의 경우 GPT-5.6는 플래그십 모델 미리보기이자 정책 시험판입니다. OpenAI는 Sol이 충분히 강력하다는 것을 증명하고, 안전 시스템이 충분히 엄격하다는 것을 증명하고, 미국 정부 검토와 상업적 개방 사이에서 실행 가능한 경로를 찾아야 합니다.

편집팀
Product Team @ WebCal
WebCal 공식 제품팀입니다. 우리는 고성능 컴퓨팅 인프라와 탈중앙화 클라우드 솔루션을 구축합니다.



