27.03.2025
OpenAI는 ChatGPT 기능에 이미지를 통합하여 사용자가 GPT-4o 모델의 강력한 기능을 통해 챗봇에서 직접 이미지를 생성할 수 있도록 합니다.
3월 26일 OpenAI는 ChatGPT의 이미지 초기 릴리스가 주로 이미지 생성에 중점을 두고 있으며 Plus, Pro, Team 또는 무료 구독 패키지 사용자가 사용할 수 있다고 밝혔습니다. 이전에 ChatGPT에서는 사진 생성이 허용되었지만 Dall-E 모델을 통해서는 기능이 제한되어 있었고 하루에 무료 사진 3장만 허용되었습니다.
소셜 네트워크에서 많은 사람들이 이 도구를 사용해 보고 새로운 도구에 대해 놀라움을 표시했습니다. "실물 같은 이미지가 저를 놀라게 했습니다. 이것이 AI 사진이라는 메모가 아니었다면 아마도 깨닫지 못했을 것입니다. 이전에 경험했던 이미지 생성 도구보다 품질이 뛰어납니다"라고 Facebook 계정인 Hoang Vy는 말했습니다. Cong Tam 계정은 "가까운 미래에 온라인에서 보는 이미지는 실제가 아닐 수도 있다"고 말했고, The Ha 계정은 "어쩌면 그래픽 디자이너와 사진 편집자가 AI를 사용하기 위해 스스로 업그레이드해야 할 수도 있고 그렇지 않으면 직업을 잃게 될 것"이라고 말했습니다.

더 버지 OpenAI 대변인 Taya Christianson의 말에 따르면 무료 버전은 기능이 제한되어 있지만 여전히 Dall-E보다 성능이 뛰어납니다.
수석 연구원 Gabriel Goh는 "새로운 기능은 이전 모델에 비해 큰 발전입니다."라고 말하며 그의 팀은 ChatGPT의 이미징 기능을 위해 OpenAI의 가장 강력한 언어 모델 중 하나인 멀티모달 플랫폼 GPT-4o를 사용했다고 덧붙였습니다.
Goh에 따르면 GPT-4o를 사용한 ChatGPT의 이미지 생성 기능의 눈에 띄는 개선 사항을 "바인딩"이라고 합니다. 이는 AI 이미지 생성기가 속성과 개체 간의 정확한 연관성을 유지하는 정도를 나타내는 용어입니다. 예를 들어 파란색 별과 빨간색 삼각형이 함께 표시되는 경우 정렬이 잘못된 패턴은 삼각형 없이 빨간색 별만 생성합니다. Goh는 대부분의 이미지 모델이 이 문제로 어려움을 겪고 있으며, 동시에 여러 요청을 받으면 색상과 모양이 뒤섞이는 경우가 많다고 말했습니다.
Goh는 “Binding을 갖춘 새로운 시각화 엔진은 혼동 없이 15~20개 개체의 속성을 정확하게 바인딩할 수 있어 정확성과 신뢰성이 크게 향상되었음을 보여줍니다.”라고 말했습니다.
ChatGPT의 이미지 생성기는 또한 이미지의 텍스트 표시를 개선하여 "왜곡"되지 않고 더욱 일관적인 텍스트를 생성하는 데 도움이 됩니다. 고씨에 따르면 제목이나 텍스트 요소에 오류가 있으면 전체 이미지를 사용할 수 없기 때문에 이 역시 중요한 과제라고 합니다.
또한 새로운 도구는 대부분의 이미저에서 사용하는 확산 모델링 기술 대신 텍스트를 쓰는 것과 유사하게 왼쪽에서 오른쪽, 위에서 아래로 순차적으로 이미지를 생성하는 자동 회귀 방법을 사용합니다. 이러한 기술적 차이로 인해 ChatGPT의 이미지는 이미지의 텍스트를 더 잘 렌더링하고 연결할 수 있습니다.
고씨는 “완벽해지기까지 수개월이 걸리는 반복적인 과정”이라고 강조했다. 그는 완벽하지는 않지만 ChatGPT의 이미지 생성 기능이 "생성된 제품의 품질을 사용할 수 있는 지점에 도달했습니다"라고 덧붙였습니다.
새로운 기능 데모에서 OpenAI는 정확하게 라벨이 지정된 색상 구성 요소를 사용한 뉴턴 프리즘 실험의 과학 다이어그램과 같이 ChatGPT의 원활한 이미징 기능을 보여주는 몇 가지 예를 제시합니다. 일관된 캐릭터와 말풍선을 갖춘 다중 패널 만화; 또는 스티커, 로고 및 레스토랑 메뉴의 투명한 배경.

그러나 다른 모델에 비해 ChatGPT의 이미지는 이미지를 생성하는 데 시간이 더 오래 걸립니다. ChatGPT의 다중 모드 제품 관리자인 Jackie Shannon에 따르면 이는 "가치 있는 절충안"입니다.
Shannon은 블로그에 “대기 시간을 확실히 개선할 것이지만 이미지를 생성하는 기존 기능과 생성되는 이미지의 품질은 실제로 추가 대기 시간을 상쇄할 수 있습니다.”라고 썼습니다.
가짜 누드 사진 생성 위험에 대해 Shannon은 ChatGPT의 이미지가 포르노 딥페이크 콘텐츠를 방지하고 '사기성' 요청을 거부하는 등 강력한 보호 기능을 갖추고 있다고 말했지만 자세한 내용은 언급하지 않았습니다. 생성된 이미지에는 C2PA 표준 메타데이터도 통합되어 AI가 생성한 것으로 표시되며, 이를 탐지 도구로 조회할 수 있습니다.
“물론 완벽한 시스템은 없지만 우리는 지속적으로 보호 기능을 개선하고 있습니다.”라고 Shannon은 덧붙였습니다.
바오람 (The Verge, TechCrunch에 따르면)