2026년 7월 9일, OpenAI는 GPT-5.6 시리즈 모델을 전 세계에 전면 출시(GA)했습니다. GPT-5.6은 6월 25일 미국 정부와의 사전 협의에 따라 소수의 신뢰 파트너 대상 제한 프리뷰(limited preview)로 먼저 공개되었고, 약 2주 만에 광범위 배포로 전환되었습니다. 동시에 Microsoft Foundry 플랫폼에는 아시아-태평양 데이터 존(Asia-Pacific Data Zone)과 Hosted Agent 정식 버전(GA)이 함께 추가되었습니다. 이 일련의 움직임은 AI 업계가 '모델 능력 경쟁'에서 '프로덕션급 배포 및 비용 효율성'을 종합적으로 겨루는 새로운 국면으로 접어들었음을 의미합니다.

1. GPT-5.6 시리즈: 계층화된 제품, 각자 역할

GPT-5.6 시리즈는 Sol(태양), Terra(지구), Luna(달) 세 가지 모델로 명명되었으며, 각각 다른 사용 시나리오에 맞춰 조정되었습니다. 새 네이밍 체계에서 숫자(5.6)는 세대(generation)를, Sol/Terra/Luna는 각자 독립적 주기로 발전하는 지속형 능력 티어(durable capability tier)를 가리킵니다.

모델 포지셔닝 핵심 특징
GPT-5.6 Sol 플래그십 복잡한 추론, 코드 개발, 과학 연구, 사이버 보안, 장시간 실행 에이전트 작업에 최적화
GPT-5.6 Terra 밸런스형 GPT-5.5 수준의 성능을 절반 비용으로 제공
GPT-5.6 Luna 경량 고효율 가장 작은 규모, 가장 낮은 비용, 고속·저비용 시나리오에 적합

가격(백만 토큰당)은 Sol이 입력 $5 / 출력 $30, Terra가 입력 $2.50 / 출력 $15, Luna가 입력 $1 / 출력 $6으로 책정되었습니다. 세 모델 모두 지식 컷오프 2026년 2월 16일, 컨텍스트 윈도 100만 토큰, 최대 출력 12만 8천 토큰 사양을 공유합니다.

GPT-5.6 Sol은 두 가지 새로운 기능을 도입했습니다. '최대 추론 노력(max reasoning effort)' 모드는 복잡한 작업에서 모델이 더 오래 '생각'할 수 있게 해주며, 'Ultra 모드'는 여러 하위 에이전트를 조정하여 단일 모델의 한계를 뛰어넘는 협업을 가능하게 합니다. Responses API에는 모델이 작성한 JavaScript로 도구 호출을 오케스트레이션하는 Programmatic Tool Calling도 추가되었습니다. Sam Altman은 CNBC 인터뷰에서 Sol이 에이전트형 프로그래밍 작업에서 토큰 사용 효율을 54% 향상시켰다고 밝혔습니다. 아울러 Cerebras 추론 인프라를 통해 Sol을 최대 초당 750토큰 속도로 제공한다는 계획도 발표되었습니다.

2. 플랫폼 및 인프라 - 모델에서 프로덕션까지의 완결

이번 업데이트는 모델 자체뿐만 아니라 배포 및 실행 환경의 전면적인 진화를 포함합니다.

1) 아시아-태평양 데이터 존(Asia-Pacific Data Zone)

Microsoft Foundry의 Data Zone 배포 옵션은 기존 미국(US)·유럽연합(EU) 2개 존 체제였으나, 이번에 아시아-태평양 존이 추가되었습니다. APAC 고객은 프롬프트와 응답이 아시아-태평양 역내에서만 처리되는 조건으로 최신 OpenAI 모델을 실행할 수 있습니다. 이는 데이터 주권(data sovereignty) 규정의 영향을 받는 기업 사용자, 특히 한국·일본·싱가포르 등 데이터 국외 이전 규제가 있는 시장의 기업에게 매우 중요한 의미를 갖습니다.

2) Hosted Agent 정식 GA + Azure VNet 통합

Foundry Agent Service의 Hosted Agent가 정식 버전(GA)으로 출시되었습니다. Foundry Agent Service 자체는 2026년 3월에 이미 GA에 도달했고, 당시 Hosted Agent는 프리뷰 단계로 East US, Southeast Asia, Japan East 등 6개 리전에 배포된 바 있습니다. 이번 GA 전환으로 VM 수준 샌드박스, 영구 파일시스템, 독립 Microsoft Entra 아이덴티티를 갖춘 에이전트 실행 환경을 프로덕션 SLA 하에서 사용할 수 있게 되었습니다.

기업 환경의 보안·규정 준수 관점에서 핵심은 3월 GA에서 도입된 엔드투엔드 사설 네트워킹 기반과의 결합입니다. 프라이빗 네트워크(BYO VNet, 공용 인터넷 이그레스 없음), 컨테이너/서브넷 주입, MCP 서버·Azure AI Search·Fabric 데이터 에이전트까지 확장된 사설 경로, Entra 기반 RBAC, 그리고 프로덕션 수준 평가(Evaluations GA) 및 연속 모니터링이 하나의 스택으로 제공됩니다. Microsoft CEO Satya Nadella는 GPT-5.6 시리즈가 Copilot Chat, M365 앱, GitHub 및 Foundry에 동시 탑재되었음을 확인했습니다.

3) Microsoft 365 Copilot 및 Teams로의 배포

Foundry Agent Service는 에이전트를 Microsoft 365 Copilot 및 Microsoft Teams에 직접 배포할 수 있는 기능을 제공하여 개발부터 유통까지의 전체 경로를 연결합니다.

3. 3강 비교: ChatGPT (GPT-5.6) vs Claude vs DeepSeek

1) 성능 대결: 누가 앞서나?

Terminal-Bench 2.1(커맨드라인 워크플로 테스트)에서의 점수는 다음과 같습니다.

모델 점수
GPT-5.6 Sol Ultra 91.9%
GPT-5.6 Sol (표준) 88.8%
Claude Mythos 5 88.0%
Claude Fable 5 84.3%
Claude Opus 4.8 78.9%
Gemini 3.1 Pro Preview 70.7%

Artificial Analysis Intelligence Index v4.1에서는 Claude Fable 5가 59.9점으로 GPT-5.6 Sol(최대 추론, 58.9점)을 1점 차로 앞섰습니다. 다만 Sol은 이 지능 수준을 훨씬 낮은 실행 비용으로 달성했으며(OpenAI 자체 추산 기준 약 3분의 1), 리스트 가격 기준으로도 Fable 5의 절반입니다. Agents' Last Exam(55개 전문 분야의 장시간 실행 워크플로 평가)에서는 GPT-5.6 Sol이 53.6점으로 신기록을 세우며 Claude Fable 5(adaptive reasoning 설정)를 13.1점 차로 앞섰습니다.

사이버 보안 평가 ExploitBench에서 Sol은 Mythos Preview와 비슷한 수준을 약 3분의 1의 토큰 소비로 달성했습니다.

반면 Claude 진영이 확실히 우위인 지표도 있습니다. SWE-Bench Pro에서 Claude Mythos 5는 80.3%, Fable 5는 80.0%를 기록해 GPT-5.6 Sol(64.6%)을 약 15점 차로 크게 앞섰습니다. 흥미로운 대목은 OpenAI가 GPT-5.6 발표 직전 SWE-bench Pro 과제의 약 30%가 결함이 있다는 자체 감사 결과를 공개했다는 점으로, 벤치마크 자체의 신뢰성 논쟁으로 번지고 있습니다. GDPval-AA v2(전문 지식 노동 평가)와 Toolathlon(도구 사용)에서도 Fable 5가 Sol을 앞섰습니다.

2) 가격 비교 - DeepSeek의 가격 우위는 여전히 뚜렷

모델 입력 가격 (/백만 토큰) 출력 가격 (/백만 토큰)
GPT-5.6 Sol $5 $30
GPT-5.6 Terra $2.50 $15
GPT-5.6 Luna $1 $6
Claude Fable 5 / Mythos 5 $10 $50
Claude Opus 4.8 $5 $25
DeepSeek V4 Pro (공식가) $0.435 $0.87

DeepSeek V4 Pro의 현행 가격에는 주의가 필요합니다. 출시 초기 기준가는 입력 $1.74 / 출력 $3.48이었고 75% 할인 프로모션이 병행되었으나, 2026년 5월 31일 이후 할인가($0.435 / $0.87)가 그대로 공식 상시 가격(원 기준가의 4분의 1)으로 전환되었습니다. 캐시 히트 입력은 백만 토큰당 $0.003625까지 내려갑니다.

즉 DeepSeek는 여전히 자릿수 수준의 가격 우위를 유지하고 있습니다. 공식가 기준으로도 GPT-5.6 Sol 입력가의 10분의 1 미만입니다. 하지만 GPT-5.6은 단위 비용 대비 지능 수준에서 격차를 좁히고 있습니다. OpenAI는 Terra와 Luna가 Claude Fable 5 대비 약 16분의 1 비용으로 특정 에이전트 워크로드에서 더 나은 성과를 낸다고 주장합니다.

3) 각 모델의 강점 - 어떻게 선택할까?

GPT-5.6 Sol: 터미널 에이전트 작업, 사이버 보안, 장시간 에이전트 워크플로에서 두각을 나타내며, 토큰 효율이 뛰어나 실행 비용 관점에서 유리합니다. Microsoft 생태계(Foundry, M365, GitHub Copilot)와 긴밀히 통합되어 있어 이미 Azure/M365 환경을 사용 중인 기업에 적합합니다.

Claude Fable 5 / Mythos 5: Artificial Analysis Intelligence Index, SWE-Bench Pro, GDPval 등 종합 지능·실전 코딩 지표에서 여전히 선두를 유지하는 최고 수준의 지능을 제공합니다. 극한의 추론 능력과 코드 품질이 필요한 경우에 적합하나 가격은 3사 중 가장 높습니다. Mythos 5는 승인된 조직에만 제공되는 제한 배포 모델이라는 점도 조달 시 고려해야 합니다.

DeepSeek V4 Pro: 가격 경쟁력이 압도적이며(공식가 $0.435/$0.87, 1M 컨텍스트), 중국어 작업 및 프로그래밍에서 강력한 성능(자체 발표 SWE-bench 91%)을 보여 대규모·고처리량 애플리케이션에 적합합니다. 오픈 웨이트(MIT 라이선스)로 자체 호스팅 옵션이 있다는 점도 데이터 주권 관점의 대안이 됩니다.

4. 맺음말

2026년 7월의 이번 업데이트는 AI 업계에 중요한 전환점을 알립니다. 모델 능력만이 유일한 경쟁 차원이 아니게 된 것입니다. GPT-5.6 시리즈는 계층화된 제품을 통해 프리미엄부터 가성비까지 전 가격대를 커버합니다. Microsoft Foundry는 아시아-태평양 데이터 존, VNet 통합, Hosted Agent GA를 통해 AI를 '장난감'에서 실제 프로덕션 환경에서 운영될 수 있는 '도구'로 탈바꿈시켰습니다. Claude는 종합 지능과 실전 코딩 품질에서, DeepSeek는 비용과 오픈 웨이트 유연성에서 각자의 영역을 지키며 경쟁력을 강화하고 있습니다.

한 가지 주목할 지점은 이번 출시가 미국 정부와의 사전 협의 및 제한 프리뷰를 거쳐 진행되었다는 사실입니다. 프런티어 모델의 배포가 순수한 시장 이벤트를 넘어 국가 안보·규제 프로세스의 일부로 편입되고 있음을 보여주는 사례입니다.

기업 사용자에게 있어 어떤 모델을 선택할지는 더 이상 '누가 가장 강한가'라는 단일 질문이 아니라, '어떤 시나리오에, 어떤 모델을, 얼마의 비용으로 쓸 것인가'라는 종합적인 의사 결정이 되었습니다. GPT-5.6 Sol과 Azure 생태계의 조합은 엔터프라이즈 AI 배포의 '기본 옵션' 중 하나로 자리 잡고 있습니다. 이것이 이번 업데이트가 지닌 가장 심원한 의미일 것입니다.


본 글은 2026년 7월 10일 기준 공개 정보를 바탕으로 작성되었으며, 가격 및 성능 데이터(벤더 자체 발표 수치 포함)는 참고용입니다.