ChatGPT Images 2.5: 로컬 편집과 스케치가 이끄는 이미지 혁명
작성 Gab

목차
ChatGPT Images 2.5는 단순한 미적 업그레이드에 그치지 않는다. OpenAI는 2026년 9월 8일에 게시한 스레드를 통해 모델과 네 가지 약속, Sketch 기능, 포맷 템플릿을 세 개의 게시물에 걸쳐 차례로 발표했다. 첫 번째 게시물은 공개 후 몇 시간 만에 180만 회 이상의 조회수와 13,700개의 좋아요를 기록했다.
이 모델이 내세운 네 가지 약속은 더 빠른 생성, 향상된 시각적 충실도, 여러 차례 수정해도 세부 요소를 유지하는 능력, 그리고 특정 코멘트를 통한 수정이다. 속도는 가장 쉽게 내세울 수 있는 장점이다. 하지만 크리에이티브, 제품, 마케팅 팀에 가장 흥미로운 변화는 다른 데 있다. OpenAI는 OpenAI 이미지 생성을 자연어와 드로잉으로 모두 제어할 수 있는 반복적 편집 도구로 만들고자 한다. 이제 핵심은 단순히 설득력 있는 이미지를 만드는 데 그치지 않고, 장면 전체를 새로 만들지 않으면서 특정 요소만 수정하는 것이다.
게시물 1, ChatGPT Images 2.5
https://x.com/OpenAI/status/2097394956457623964
이 첫 번째 게시물에서 OpenAI는 ChatGPT Images 2.5의 특징을 네 가지로 요약한다.
- 더 빠른 이미지 생성
- 더욱 자연스럽고 알아보기 쉬운 이미지를 위한 향상된 충실도
- 여러 차례 편집한 후에도 일관되게 유지되는 세부 요소
- 요청한 요소만 변경하는 코멘트 기반 수정
핵심 약속은 단순한 시각적 품질 향상이 아니라, 수정 과정에서도 기존 이미지를 유지하는 것이다.
네 가지 약속, 그러나 중요도는 서로 다르다
속도에 대한 약속은 직접적인 기대에 부응한다. 제작 워크플로에서 이미지가 더 빨리 생성되면 더 많은 반복 작업을 이어갈 수 있고, 대화를 중단하지 않고도 고객의 요청에 대응할 수 있다. 하지만 OpenAI의 스레드는 평균 생성 시간이나 방법론에 따른 비교, 성능 지표를 제시하지 않는다.
충실도 역시 신중하게 접근해야 한다. OpenAI는 이미지가 더 « 자연스럽고 » « 알아보기 쉬워졌다 »고 설명한다. 이 표현은 무엇보다 결과물에 대한 약속을 뜻한다. 즉, 덜 인위적인 조명, 더 일관된 질감, 참조 대상인 사물이나 인물을 더 명확하게 알아볼 수 있는 표현을 의미한다. 이 게시물에는 벤치마크나 성공률, 얼굴 충실도 또는 프롬프트 준수 여부에 관한 정량적 사례가 제시되지 않는다.
이러한 지표의 부재가 발표의 가치를 없애는 것은 아니다. 다만 이를 통해 내릴 수 있는 결론의 범위를 제한할 뿐이다. ChatGPT Images 2.5는 제품 개선을 발표한 것이지, 독립적인 성능 검증 결과를 제시한 것은 아니다.
오랫동안 이어진 진짜 문제: 수정할 때마다 나머지 부분이 망가질 수 있다
가장 실질적인 부분은 여러 차례 수정하는 동안 세부 요소의 일관성을 유지하겠다는 약속이다. 이는 이미지 생성 모델에서 가장 큰 비용을 초래하는 결함 중 하나다. 객체를 옮기거나 얼굴을 조정해 달라고 요청하면 예상보다 훨씬 넓은 범위가 다시 생성되는 경우가 많다.
전문가들에게는 익숙한 결과다.
- 캐릭터가 고유한 특징을 잃는다.
- 브랜드나 로고가 미묘하게 달라진다.
- 조명, 그림자 또는 배경이 새롭게 해석된다.
- 제품의 비율이 변한다.
- 처음에 승인된 구도의 균형이 무너진다.
일회성 작업에서는 이러한 차이가 허용될 수도 있다. 하지만 캠페인, 제품 목업 또는 일련의 전자상거래용 비주얼에서는 곧바로 장애물이 된다. 국소적인 수정 하나하나가 새로운 품질 관리 단계로 이어지며, 심한 경우 프롬프트를 처음부터 다시 작성해야 한다.
따라서 AI 이미지의 일관성은 단순한 포토리얼리즘 향상보다 더 야심 찬 목표다. 이는 여러 버전에 걸쳐 에셋의 연속성을 유지하는 것을 목표로 한다. 이제 이미지의 품질은 첫 번째 결과물만으로 평가되지 않으며, 연속된 일련의 요청에도 원형을 유지할 수 있는 능력으로 평가된다.
전체 프롬프트에서 코멘트를 통한 이미지 편집으로
OpenAI는 또한 « comment-based edits », 즉 코멘트를 통한 이미지 편집을 소개한다. 이 용어는 상호작용 방식의 변화를 시사한다는 점에서 중요하다.
기존 모델에서는 사용자가 전체 프롬프트를 작성한 다음 수정할 때마다 이를 다시 작성한다. 이미지를 참조 자료로 사용하는 경우에도 지시는 대체로 포괄적이다. « 빨간 컵이 있는 장면으로 다시 만들어 줘 », « 캐릭터는 유지하되 배경을 바꿔 줘 »와 같은 식이다. 그러면 AI가 무엇을 그대로 유지하고 무엇을 새롭게 해석할 수 있는지 스스로 판단해야 한다.
코멘트 기반 편집은 이미지 보정에 더 가까운 방식을 지향한다.
- 기존 이미지가 작업 문서가 된다.
- 특정 부분을 대상으로 지정한다.
- 사용자가 수정하고 싶은 내용을 지시한다.
- 모델은 관련 없는 요소를 그대로 유지해야 한다.
잠재적인 이점은 재생성에서 국소 수정으로 전환하는 데 있다.
이는 디자인 업계에 중요한 발전이다. 모델을 레이어, 마스크 또는 선택적 보정 방식에 한층 더 가깝게 만든다. 언어는 단순한 생성 지시가 아니라 편집 명령이 된다.
이러한 일관성을 기술적으로 유지하기 어려운 이유
이 문제가 왜 오랫동안 해결되지 않았는지 이해하면 이러한 약속을 평가하는 데 도움이 된다. 확산 모델은 이미지를 조작 가능한 객체의 조합으로 저장하지 않는다. 대신 시각적 콘텐츠가 이름이 붙은 독립적인 요소로 나뉘어 있지 않은 압축 표현인 잠재 공간에서 작동한다.
수정할 때마다 발생하는 변형은 세 가지 메커니즘으로 설명할 수 있다.
첫 번째는 재인코딩이다. 기존 이미지를 편집하기 위해 모델은 이미지를 다시 인코더에 통과시킨 다음 결과물을 재구성한다. 이 왕복 과정은 결코 완전히 중립적이지 않다. 미세한 질감, 입자감, 섬세한 윤곽선이 다시 해석된다. 이 작업을 열 번 반복하면 복사본을 다시 복사하는 것처럼 차이가 누적된다.
두 번째는 전역 어텐션 필드다. 최신 확산 아키텍처에서는 이미지의 각 영역이 다른 모든 영역과 상호작용한다. 이 덕분에 조명과 원근감이 일관된 장면을 만들 수 있지만, 동시에 국소적인 지시가 주변으로 퍼지게 된다. 객체 하나의 색상을 바꾸면 주변의 반사가 달라지고, 이에 따라 빛의 균형이 바뀌며, 결국 배경까지 변한다.
세 번째는 지속적인 정체성의 부재다. 모델은 한 버전의 얼굴이 다음 버전에서도 동일한 얼굴이라는 사실을 알지 못한다. 그저 그럴듯한 특징의 분포를 재현할 뿐이다. 정확히 같은 얼굴을 다시 만들어 낸다는 보장은 없다.
이 문제에 대한 전형적인 기술적 해결책은 마스크 기반 인페인팅이다. 대상 영역 밖의 픽셀은 고정하고 마스크 내부만 재생성하는 방식이다. 효과적이지만 잘 알려진 두 가지 한계가 있다. 조명이나 질감이 다르면 마스크 경계의 이음새가 눈에 띈다. 또한 모델이 고정된 영역의 맥락을 충분히 활용하지 못하면, 국소적으로는 올바르지만 장면과는 일관되지 않은 콘텐츠를 생성하기도 한다.
따라서 편집 간 일관성을 보장하려면 두 가지를 모두 충족해야 한다. 기존 요소를 보존하는 동시에 수정 사항이 자연스럽게 어우러질 만큼 충분한 맥락을 유지해야 한다. 이는 단순히 켜고 끄는 문제가 아니라 절충의 문제이며, 실제 신뢰성은 바로 여기에서 판가름 날 것이다.
이러한 약속은 여전히 까다로운 상황에서 검증되어야 한다. 여러 이미지에 등장하는 동일한 인물, 서로 다른 각도에서 촬영된 제품 시리즈, 엄격한 브랜드 가이드라인, 텍스트가 포함된 이미지 등이 그 예다. 실제로 해당 게시물도 완벽한 일관성을 주장하지는 않는다. 개선을 예고할 뿐, 적용 조건이나 성공률은 명시하지 않는다.
게시물 2, ChatGPT의 Sketch
스레드의 두 번째 게시물에서 OpenAI가 선보인 Sketch 시연.
https://x.com/OpenAI/status/2097394958516781301
스레드의 다음 게시물에서는 Sketch ChatGPT를 소개한다. OpenAI는 어떤 아이디어는 말로 설명하는 것보다 그림으로 표현하기가 더 쉽다고 설명하며, 사용자에게 ChatGPT에서 직접 그림을 그리고 「@ Sketch」로 도구를 호출해 보라고 권한다.
Sketch는 자연어를 대체하지 않는다. 텍스트로는 표현하기 어려운 공간적 정밀성을 더해 준다.
스케치가 프롬프트의 한계를 보완하는 이유
텍스트는 의도를 설명할 수 있다. 하지만 정확한 위치, 형태, 수정 영역 또는 여러 요소 사이의 기하학적 관계를 설명하는 데는 훨씬 비효율적이다.
흔한 요청이지만 모호하지 않게 표현하기 어려운 사례를 살펴보자.
- 객체를 시각적으로 몇 센티미터 정도 오른쪽으로 옮기기
- 복잡한 꽃에서 꽃잎 하나만 수정하기
- 피사체는 건드리지 않고 그림자만 늘이기
- 여러 제품 중 색상을 변경할 제품 지정하기
- 레이아웃을 흐트러뜨리지 않고 로고 위치 조정하기
- 추가할 요소의 정확한 위치 그리기
이러한 경우 사용자는 매우 상세한 프롬프트를 작성할 수 있다. 하지만 여전히 모델의 해석에 좌우될 수밖에 없다. 화살표, 원 또는 빗금 친 영역을 사용하면 모호함을 줄일 수 있다. 그림은 배치 정보를 제공하고, 텍스트는 의도를 전달한다.
이것이 제안의 핵심이다. 언어는 무엇을 해야 하는지 설명하고, 스케치는 어디에 어떻게 개입해야 하는지를 구체화한다.
스케치는 인코딩 문제도 해결한다
이러한 상호보완성에는 더 근본적인 이유가 있다. 텍스트 지시는 텍스트 인코더를 거쳐 의미 공간에 투영된다. 이 투영은 개념은 잘 포착하지만 좌표는 제대로 포착하지 못한다. “꽃병 왼쪽, 약간 뒤쪽”이라는 표현은 위치가 아니라 의미 벡터가 된다.
반면 스케치는 이미지와 동일한 채널, 즉 각 영역이 출력의 특정 영역에 대응하는 픽셀 그리드를 통해 모델에 입력된다. 언어라는 병목을 거치지 않으므로 공간적 대응이 직접적이다. 그래서 영역을 지정할 때는 대충 그린 낙서가 잘 다듬어진 문단보다 더 효과적일 수 있다.
모델만큼이나 인터페이스의 선택
암묵적으로 지향하는 바는 대화형 인터페이스에 통합된 제작 환경이다. 사용자는 더 이상 이미지 생성기에서 편집기로, 다시 동료에게 수정 사항을 설명하기 위한 메신저로 옮겨 다닐 필요가 없어진다.
워크플로는 다음과 같이 바뀔 수 있다.
- 첫 번째 시안을 생성한다.
- 수정할 요소에 코멘트를 단다.
- 특정 영역을 시각적으로 표시한다.
- @ Sketch를 호출한다.
- 수정을 요청한다.
- 이전 선택을 유지하면서 반복 작업한다.
이러한 통합은 전략적이다. 이미지 모델은 독립된 도구라기보다 제작 대화에 통합된 기능이 된다. 따라서 OpenAI의 차별화 요소는 최종 결과물의 품질뿐만 아니라 수정 과정의 접근성에도 있다.
포스트 3, 포맷 템플릿
https://x.com/OpenAI/status/2097394960366456951
스레드의 마지막 메시지는 가장 눈에 띄지 않지만, 아마도 포지셔닝을 가장 잘 드러낸다. OpenAI는 포스터나 굿즈 같은 인기 포맷용 템플릿을 제공하며, 사용자는 여기에 자신의 메시지, 디자인 요소 또는 스타일을 추가할 수 있다고 발표한다.
템플릿은 렌더링이나 배치가 아니라 프레임을 해결한다.
이는 앞선 두 문제와는 구별되는 세 번째 문제 범주다. 포스터에는 정해진 규격, 여백, 시선의 위계, 제목 영역, 인쇄 제약이 있다. 굿즈에는 인쇄 가능한 영역과 대비의 한계가 있다. 이는 비디자이너 사용자가 표현하기 어려운 실무 관행이며, 대개는 그런 관행이 존재한다는 사실조차 모르기 때문이다. 어떤 프롬프트로도 이를 드러낼 수 없고, 스케치 역시 마찬가지다.
따라서 스레드를 전체적으로 보면 세 가지 지원 단계를 다룬다.
- 모델은 렌더링을 담당한다.
- 스케치는 배치를 담당한다.
- 템플릿은 프레임을 담당한다.
이는 대상 사용자층을 상당히 명확하게 확장하는 것이기도 하다. 앞선 두 포스트는 이미 무엇을 얻고 싶은지 아는 사람들을 대상으로 한다. 세 번째 포스트는 어디서부터 시작해야 할지 모르는 사람들을 대상으로 한다. 스레드에서는 템플릿이 몇 개나 있는지, 어떤 종류인지, 콘텐츠 외의 요소까지 사용자 지정할 수 있는지는 밝히지 않는다.
이것이 시사하는 바
다른 이미지 모델과 비교할 때 OpenAI는 순수한 미적 혁명을 약속하기보다 더 쉽게 제어할 수 있는 워크플로를 제공하려 한다. 경쟁은 첫 이미지가 얼마나 아름다운지에만 달려 있지 않다. 열 번, 스무 번의 수정 후에도 그 이미지를 실제로 활용 가능한 결과물로 바꿀 수 있는지가 관건이다.
전문가에게 ChatGPT Images 2.5의 가치는 첫 결과물의 생성 속도뿐만 아니라 반복 작업의 안정성에 달려 있다.
디자인 및 제품 팀이 얻을 수 있는 이점
실제 사례에서도 약속한 성능을 보여준다면 여러 작업이 한층 원활해질 수 있다.
- 마케팅: 승인된 제품, 로고 또는 구도를 변경하지 않고 캠페인 비주얼의 다양한 버전을 제작할 수 있다.
- 이커머스: 제품 표현을 유지하면서 색상, 액세서리 또는 배경을 국소적으로 변경할 수 있다.
- UX 및 제품: 일러스트레이션과 목업을 빠르게 제작한 뒤 피드백을 바탕으로 특정 요소를 수정할 수 있다.
- 편집: 전체 이미지를 다시 생성하지 않고 비주얼의 구도를 조정할 수 있다.
- 캐릭터 제작: 표정, 의상 또는 배경을 여러 차례 조정하는 동안 속성의 일관성을 유지할 수 있다.
- 아트 디렉션: 길고 부정확한 지시를 텍스트 요청과 결합된 시각적 주석으로 대체할 수 있다.
속도는 대기 시간을 줄인다. 충실도는 체감 품질을 높일 수 있다. 하지만 세부 사항을 보존하는 능력은 무엇보다도 반복 작업의 숨은 비용을 줄인다. 전문적인 환경에서는 바로 이 비용이 AI 도구가 실제 워크플로에 편입될지, 아니면 탐색 단계에만 머물지를 결정하는 경우가 많다.
스레드에서 여전히 답하지 않은 한계
이번 발표에는 실제 도입 조건에 관한 정보가 여전히 크게 부족하다. 스레드에서는 다음 사항을 명시하지 않았다.
- 어떤 구독 플랜에서 ChatGPT Images 2.5를 이용할 수 있는지
- Sketch ChatGPT가 모든 사용자에게 제공되는지, 아니면 특정 요금제에만 제공되는지
- 이러한 기능이 API를 통해 제공될지
- 가격, 할당량 또는 생성 한도가 어떻게 될지
- 여러 차례 수정한 후에도 실제로 캐릭터와 구도가 유지되는 경우가 어디까지인지
- 발표된 충실도 및 일관성 향상을 벤치마크로 측정할지
- 정당하다고 판단되는 요청이 검토 과정에서 차단될 경우 이를 어떻게 처리할지
마지막 항목은 조직에 특히 중요하다. 수정 기능이 기술적으로 뛰어나더라도, 검토 규칙이 실질적인 설명 없이 요청을 차단한다면 프로덕션 프로세스에 통합하기 어려울 수 있다. 사용자들은 여전히 느린 속도와 지나치게 공격적인 검토를 지적하고 있다. 이 스레드에서는 해당 문제에 대한 공식 답변이나 구체적인 정책을 제공하지 않는다.
핵심 요약
ChatGPT Images 2.5를 단순히 더 빠르거나 더 사실적인 모델로만 봐서는 안 된다. 가장 중요한 목표는 제어 가능한 편집이다. 특정 영역을 수정하고 나머지는 그대로 유지한 다음, 초기 에셋을 흐트러뜨리지 않으면서 이 과정을 반복하는 것이다.
Sketch ChatGPT 기능과 템플릿은 이러한 목표를 자연스럽게 보완한다. 텍스트는 의도를 표현하고, 스케치는 위치를 구체화하며, 템플릿은 틀을 제공한다. 이들은 함께 일회성 이미지 생성기보다는 대화형 크리에이티브 도구에 더 가까운 형태의 편집 방식을 제시한다.
하지만 이 스레드는 가용성, API, 가격, 할당량, 검토, 여러 차례 편집한 후의 실제 신뢰성 수준과 같은 핵심 질문에 답하지 않는다. 문서상으로는 설득력 있는 약속이다. 그러나 복잡한 장면, 브랜드 제약 조건, 그리고 일관성이 부가적인 장점이 아니라 필수 요건인 워크플로에서 이를 검증해야 한다.