
FLUX.1 Kontext는 Black Forest Labs에서 개발한 차세대 이미지 생성 및 편집 모델로, 기존의 텍스트-이미지(Text-to-Image) 모델을 넘어선 혁신적인 명령 기반 이미지 편집(Instruction-based image editing) 기능을 제공합니다.
💥 명령기반 이미지 편집이란?
이번 FLUX.1 Kontext에서 가장 중요한 기능이 바로 명령기반 이미지 편집(Instruction-based image editing)입니다. 명령기반 이미지 편집이란 인공지능 이미지 모델이 사용자가 제공하는 구체적인 자연어 명령(instruction)을 이해하고, 그에 따라 기존 이미지를 직접 수정하거나 변경하는 능력을 의미합니다. 쉽게 말해, 과거에는 이미지의 특정 부분을 수정하려면 복잡한 이미지 편집 소프트웨어를 사용하거나, 텍스트 프롬프트로 원하는 결과물을 '새롭게 생성'해야 했습니다. 하지만 Instruction-based Image Editing 기능을 갖춘 모델은 마치 사람에게 지시를 내리듯이 간단한 텍스트 명령만으로 이미지의 특정 속성이나 내용을 변경할 수 있게 해줍니다.

💢 Instruction-based Image Editing의 핵심 특징
✔ 자연어 명령 이해
(예: "소파의 색깔을 파란색으로 바꿔줘", "뒤에 있는 액자를 다른 그림으로 바꿔줘", "하늘에 구름을 좀 더 넣어줘", "이 사람의 안경을 벗겨줘" 등)
✔ 정밀한 편집
다른 요소들은 최대한 보존하면서 원하는 부분만 수정할 수 있다는 장점을 가집니다.
✔ 문맥 이해
예를 들어, "고양이 귀를 더 크게 만들어줘"라는 명령을 내리면, 이미지 속의 고양이 귀를 인식하고 그 크기를 적절하게 조절합니다.
✔ 다양한 편집 유형 지원
색상 변경, 객체 추가/제거, 스타일 변경, 내용 수정, 배경 변경 등 다양한 유형의 편집 작업을 텍스트 명령만으로 수행할 수 있습니다.
1. FLUX.1 Kontext의 알고리즘 (핵심 원리)
FLUX.1 Kontext는 멀티모달 플로우 모델(Multimodal Flow Model) 또는 확산 트랜스포머(Diffusion Transformer, DiT) 아키텍처를 기반으로 합니다.
💦 플로우 매칭 (Flow Matching)
이는 생성 모델 훈련을 위한 일반적이고 개념적으로 간단한 방법으로, 확산 모델을 특수한 경우로 포함합니다. FLUX.1은 이를 통해 이전 최첨단 확산 모델보다 향상된 성능을 제공합니다.
💦 하이브리드 아키텍처
트랜스포머와 확산 기술을 결합한 하이브리드 아키텍처를 사용하며, 120억 개의 매개변수(parameter)로 확장되었습니다. 이는 이전 모델들(예: Stable Diffusion XL의 약 35억 개)보다 훨씬 큰 규모입니다.
💦 멀티모달 트랜스포머 기반 확산 백본 (MM-DiT)
텍스트-이미지 작업의 멀티모달 특성을 고려하여 설계된 새로운 아키텍처로, 기존 트랜스포머 기반 확산 백본의 성능을 능가합니다.
💦 맥락 이해 (Context Understanding)
FLUX.1 Kontext는 단순히 텍스트 프롬프트를 해석하는 것을 넘어, 입력된 이미지의 맥락을 이해하고 사용자의 편집 지시를 정확히 파악하여 원하는 부분만 수정합니다. 이는 "이미지 전체를 다시 생성"하는 것이 아니라 "정확히 무엇을 변경할지" 이해하는 데 중점을 둡니다.
2. 이전 모델과의 차별점
FLUX.1 Kontext의 가장 큰 차별점은 다음과 같습니다.
💦 명령 기반 이미지 편집 (Instruction-based Image Editing)
기존 텍스트-이미지 모델은 "만들고 싶은 전체 이미지"를 묘사해야 했다면, FLUX.1 Kontext는 "무엇을 변경하고 싶은지"를 구체적인 명령으로 전달할 수 있습니다. 예를 들어, "자동차 색깔을 빨간색으로 바꿔줘", "배경의 사람을 지워줘", "간판의 텍스트를 바꿔줘"와 같이 정확한 수술적 편집이 가능합니다.
이는 사용자가 전체 이미지를 다시 생성할 필요 없이, 특정 부분만 정밀하게 수정할 수 있게 하여 워크플로우를 혁신적으로 개선합니다.
💦 멀티모달 입력 처리
기존 모델들이 주로 텍스트 프롬프트만 사용했던 것과 달리, FLUX.1 Kontext는 텍스트와 이미지를 모두 입력으로 받아들여 문맥 내 이미지 생성 및 편집을 가능하게 합니다. 이를 통해 시각적 개념을 원활하게 추출하고 수정하여 새롭고 일관성 있는 렌더링을 생성할 수 있습니다.
💦 통합된 기능
단일 모델에서 로컬 편집, 문맥 내 생성 수정, 텍스트-이미지 생성 등 다양한 기능을 통합하여 제공합니다. 이는 복잡한 파인튜닝이나 여러 모델을 사용하는 복잡한 편집 워크플로우 없이도 다양한 작업을 수행할 수 있게 합니다.
💦 캐릭터 및 스타일 일관성
여러 편집 단계나 다양한 장면과 환경에서도 참조 캐릭터나 개체의 고유한 요소를 일관성 있게 유지하는 데 뛰어납니다.
💦 빠른 반복 편집 (Iterative Editing)
이전 편집 위에 새로운 지시를 계속 추가하여 복잡한 변경 사항을 단계별로 구축하고, 이미지 품질과 일관성을 유지하면서 세부적인 수정을 할 수 있습니다.
FLUX.1 Kontext는 단순히 이미지를 "생성"하는 것을 넘어, 사용자의 의도를 "이해"하고 "수정"하는 데 초점을 맞춰, AI 이미지 편집의 새로운 지평을 열었다고 평가받고 있습니다.

🎬 WebUI Forge에서 FLUX.1 Kontext 모델 사용하기
이번 포스팅에서는 WebUI Forge에서의 사용을 기준으로 테스트 한 내용을 다루고 있습니다.
WebUI Forge에서 Flux계열의 모델을 사용하는데 여러가지 제약이 있습니다.
대체적으로 기본 생성 외에 대부분의 기능은 안된다고 보시면 됩니다.
WebUI Forge는 SDXL 계열에 최적화 되어 있습니다. 특히 illustriousXL 계열의 모델 외에 Flux나 SD3.5, HiDream 등의 모델을 효과적으로 사용하기 위해서는 ComfyUI를 사용하는게 좋습니다.
일단 Forge에서는 컨트롤넷 적용이 안됩니다.
Flux.1-kontext- dev 다운로드 및 설치
모델의 다운로드 및 설치 방법은 아래 링크를 참고 하시기 바랍니다.
https://kwoon.tistory.com/102
FLUX.1-Kontext-dev버전 🍉 출시
그동안 API로만 제공되었던 black-forest-labs의 FLUX.1-Kontext가 dev버전으로 공개되었습니다. FLUX.1 Kontext는 Black Forest Labs에서 개발한 혁신적인 멀티모달 이미지 편집 모델로, 텍스트와 이미지 동시 입력
kwoon.tistory.com
참고로 Forge에서는 flux1-dev-kontext_fp8_scaled 모델로는 이미지 생성이 안됩니다.(Comfy-Org에서 스케일링한 FP8버전은 Forge에서는 안되는 듯 싶습니다.)
🥝 Txt2Img를 통하여 생성한 경우

프롬프트로 제어를 시도 해봤습니다만, 만족할만한 결과를 얻기 힘들었습니다. WebUI Forge 에서는 Instruction-based Image Editing의 장점을 살리기 힘들었습니다.

FLUX.1 Kontext는 Forge에서 샘플러의 특성을 좀 타는거 같습니다. 샘플링 단계를 높이면 노이즈가 해결되는 경우도 있습니다. 하지만 그런 경우엔 이미지 생성 시간이 그만큼 올라 갑니다.

🥥 SDXL과의 이미지 생성 비교

원본 이미지는 컨트롤넷에 사용된 이미지 입니다. 프롬프트 역시 원본 이미지를 기반으로 추출한 프롬프트를 사용하였습니다. 결과물의 포즈를 보시면 Flux Kontext는 컨트롤넷이 적용 안되는것을 알 수 있습니다.(물론 SDXL, Flux 모델 각각 경우 전용 컨트롤넷을 사용하였습니다)
🍉 Img2Img 생성모드 사용
Flux 모델(특히 FLUX.1 같은 새로운 아키텍처)을 사용할 때 CFG Scale 값이 1로 고정되고 네거티브 프롬프트가 비활성화되는 것은 일반적인 Stable Diffusion 모델과는 다른, 새로운 guidance(안내) 방식을 사용하기 때문에 CFG Scale 값으로 제어하기 어렵습니다. 또한 컨트롤넷도 적용외 되지 않구요. 스타일 역시 정상적으로 반영이 안됩니다.
때문에 img2img모드에서 원본 이미지로 제어를 하는게 효과적인 이미지 생성에 도움이 됩니다. 만약, Txt2Img 모드를 사용하려 한다면 프롬프트 구성에 신경을 써야 합니다. Flux 모델은 주로 프롬프트 구성 자체를 통해 원하는 결과물을 유도하기 때문입니다.
예시
A futuristic city (기본)
A futuristic city, neon lights (요소 추가)
A futuristic city, neon lights, flying cars, cyberpunk style (더 세부적인 스타일 및 요소 추가)
Flux 모델은 프롬프트의 단어 순서에 더 민감하게 반응하는 경향이 있습니다. 중요한 키워드나 핵심 아이디어를 프롬프트의 앞부분에 배치하는 것이 좋습니다.
🍑 버전별 이미지 생성 비교

img2img에서는 윈본 이미지의 기준점이 있어서 대체적으로 포즈가 유지됩니다. 이미지 생성 과정에서는 FLUX.1 Kontext-DAV 버전의 특성인 원본이미지 유지력이 FLUX.1-DAV 보다 높은것으로 보였습니다. 각 버전별로 Toon 스타일을 제어하는 것은 좀 다르게 해야하는 것 같습니다.
FLUX.1 계열의 프롬프트에 대한 충실도가 WebUI Forge에서는 비교적 낮다는 것을 알수 있습니다. 같은 설정, 같은 프롬프트로도 이미지 생성시 화풍이나 화질의 차이가 많이 납니다.(아마도 Forge에서 Flux 모델을 제대로 제어하지 못하는 것이 아닐까 생각됩니다)
Flux 이상의 모델들은 아무래도 ComfyUI를 사용하는게 맞는것 같습니다. WebUI Forge는 딱 SDXL까지 인거 같아요. 사실 Forge도 이제 추가 개발을 중단한 상태니까 이제 더 이상 신규 모델을 사용하는것은 어려울듯 싶네요.
'웹툰AI > WebUI Forge' 카테고리의 다른 글
| WebUI Forge✨Batch count와 Batch size (12) | 2025.07.08 |
|---|---|
| WebUI Forge✨다이나믹 프롬프트 (19) | 2025.07.08 |
| WebUI Forge🍵이미지를 제어하는 컨트롤넷 (38) | 2025.06.30 |
| WebUI Forge🎨Img2Img 세부 설정 (11) | 2025.06.24 |
| WebUI Forge🎨Img2Img 서브 탭들의 사용법 (3) | 2025.06.24 |