제4장. 이미지 생성을 위한트랜스포머
이 작품은 AI를 사용하여 번역되었습니다. 여러분의 피드백과 의견을 환영합니다: translation-feedback@oreilly.com
DALL·E, Imagen, Midjourney, Stable Diffusion과 같은 텍스트-이미지(T2I) 생성 모델 의 개발로, 사실적인 이미지 생성의 새로운 시대가 열렸습니다. 이러한 모델은 텍스트 입력을 바탕으로 매우 상세하고 맥락적으로 정확한 이미지와 예술 작품을 생성할 수 있어, 예술가, 디자이너는 물론 창작 활동이 익숙하지 않은 사람들도 전례 없이 손쉽게 자신의 아이디어를 현실로 구현할 수 있게 해줍니다.
이러한 모델의 핵심 구성 요소는 확산( diffusion)입니다. 확산은 물리학에서 분자가 고농도 영역에서 저농도 영역으로 이동하는 과정을 설명하는 현상입니다( ). 이미지 생성 분야에서 확산 모델은 이 원리를 활용하여 일련의 반복적인 정제 과정을 통해 무작위 노이즈를 일관성 있고 상세한 이미지로 점진적으로 변환합니다.
이러한 확산 기반 접근 방식은 최신 최첨단(SOTA) 모델의 중추가 되었으며, 생성적 적대 신경망(GANs)과 같은 초기 방법들을 대체했습니다.1 이전에 이미지 생성을 주도했던 GAN(Generative Adversarial Networks) 등을 대체했습니다. 이러한 변화는 확산 모델이 고품질의 다양한 출력을 생성하는 데 더 효과적임이 입증되었기 때문입니다. 특히, 초기 DALL·E 모델은 자기회귀형이었으나, 이후 DALL·E 2와 DALL·E 3는 확산 기반 방식을 채택했습니다.
현재 확산 모델에 대한 연구 관심이 높아짐에 따라, 이 장에서는 이미지 생성 작업을 위한 첫 번째 확산 트랜스포머(DiT), PIXART-α, PixArt-Σ, DiffiT와 같은 확산 모델에 중점을 둘 것입니다. 또한, 오픈 소스 모델과 이를 활용해 효율적으로 이미지를 생성하는 방법, 혹은 자신의 이미지 데이터를 사용하여 이러한 모델을 미세 조정하는 방법에 대해 다룰 것입니다.
생성형 이미지 모델 소개
노이즈 제거 확산 확률 모델( DDPMs)2 및 스코어 기반 생성 모델3 는 특히 이미지 생성 모델로서 큰 성공을 거두었으며, 컨볼루션 U-Nets4 이 접근법들의 사실상의 백본 아키텍처로 자리 잡았습니다. 그러나 생성적 이미지 모델링에 사용되는 방법은 이것들만이 아닙니다. 다른 두 가지 주요 접근법은 GAN과 자기회귀 모델이며, 각각 고유한 장점과 과제를 가지고 있습니다. 다음 섹션에서는 이러한 생성적 모델링 기법들의 주요 특징과 차이점을 살펴봅니다.
GAN은 생성기(generator)와 판별기(discriminator)라는 두 신경망이 협력하는 게임 이론적 프레임워크를 통해 작동합니다. 생성기는 이미지를 생성하고, 판별기는 실제 이미지와 생성된 이미지를 구별하려고 시도합니다. 시간이 지남에 따라 생성기는 판별기가 더 이상 차이를 구분할 수 없을 정도로 출력 품질을 향상시킵니다. 그러나 생성기가 제한된 종류의 출력만 생성하는 모드 붕괴(mode collapse)와 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access