7가지 항목의 AI 이미지 생성 프롬프트 기초

소셜미디어 이그재미너가 AI 이미지 프롬프트 작성법을 정리한 가이드를 공개했다. 매체, 피사체와 동작, 배경, 구도, 조명, 미감, 의도 7개 항목으로 프롬프트를 구성하는 방식이며, 레퍼런스 이미지 준비 기준과 매그니픽 활용법을 함께 다뤘다.

 

 

기사는 AI 이미지 컨설턴트 로렌 드베인과의 대담을 정리한 것이다. 드베인은 AI 결과물이 뻔해 보이는 원인을 기술이 아니라 사용자 숙련도로 봤다. 치과 대기실에서 다섯 살 아이가 건반을 두드리는 것만 보고 피아노 음악 전체를 판단하는 것과 같다는 비유를 들었다.

 

모델이 달라진 지점

이전 모델은 확산 방식이었다. 노이즈에서 출발해 조각하듯 깎아내는 구조다. 현재 GPT Image는 수십억 장의 이미지와 설명 텍스트에서 학습한 픽셀 패턴을 바탕으로 새 이미지를 만든다.

 

GPT Image는 대규모 언어 모델을 기반으로 하기 때문에 맥락을 처리한다. 복숭아·파인애플·망고 탄산수 사진을 올리고 이 제품 주위로 세계를 만들어달라고 하면, 모델이 세 과일을 식별해 그에 맞는 장면을 구성한다. 이전 확산 모델에서는 사용자가 모든 요소를 직접 서술해야 했다.

 

텍스트 렌더링도 개선돼 글꼴 지시, 스타일, 배치를 지정한 문단 단위 텍스트를 처리한다. 드베인은 대부분의 사용자가 이런 지시를 주지 않는 것이 문제라고 했다. 전단지를 만들어달라며 정보만 넣으면 모델은 평범한 글꼴과 예측 가능한 아이콘 배치, 무난한 레이아웃을 기본값으로 고른다.

 

7개 기둥 프롬프트 구조

드베인의 프레임워크는 체크리스트가 아니라 조작판에 가깝다. 각 항목에 정보를 넣을수록 결과가 의도에 근접하고, 비워둔 항목은 모델이 알아서 정한다. 그때 모델은 가장 평균적인 값을 고른다.

 

항목 지정할 내용 예시
매체 사진, 일러스트, 3D 렌더, 로고 중 무엇인가. 일러스트라면 어떤 종류인가 사인펜 선화, 순수미술, 크레용 드로잉
피사체와 동작 무엇이 있고 무엇을 하는가. 동작이 이야기를 만든다 ‘사람’이 아니라 ‘만족스러운 표정으로 거울을 보는 사람’, ‘음료 캔’이 아니라 ‘물방울이 맺힌 채 모서리로 서 있는 캔’
배경과 장면 피사체를 둘러싼 환경. 사용자가 넣는 디테일이 모델의 기본값을 밀어낸다 ‘복고풍 식당’은 주크박스와 갈색 가죽이 나온다. ‘나무 패널과 네온 맥주 간판이 있는 복고풍 식당’은 다르다
구도 프레이밍. 지정하지 않으면 정면 중앙 배치가 기본값 와이드샷, 클로즈업, 하이앵글, 로우앵글. 그래픽이라면 대칭·미니멀·맥시멀
조명 따뜻한가 차가운가. 분위기를 가장 크게 바꾸는 요소 새벽 커튼 사이로 들어오는 자연광, 구석의 스탠드 하나
미감 특정 작가를 지목해 베끼는 대신, 그 스타일이 왜 끌리는지를 언어로 옮긴다 웨스 앤더슨을 좋아한다면 ‘대칭, 채도 높은 색, 중앙 프레이밍’으로 서술
의도 보는 사람이 무엇을 느끼거나 하게 만들 것인가 스킨케어 광고라면 효능을 느끼게 할 것인가, 구매 급박함을 느끼게 할 것인가

 

드베인은 의도 항목이 2년 전보다 지금 더 중요해졌다고 했다. GPT Image를 뒷받침하는 언어 모델이 감정적 의도를 처리해 표정, 조명의 온도, 색온도 같은 시각적 선택으로 옮기기 때문이다.

 

프롬프트 작성 전 준비

드베인은 취향을 아는 것과 그것을 말로 옮기는 것이 별개라고 했다. 좋은 디자인을 직관적으로 알아보면서도 무엇이 그것을 좋게 만드는지 서술하지 못하는 경우가 많은데, AI에 필요한 건 그 서술이다.

 

훈련 방법으로는 이미지를 보며 이것이 마음에 드는가, 왜 그런가를 의식적으로 묻는 방식을 제안했다. 마음에 드는 이미지들을 모아 ChatGPT나 Claude에 올리고 공통 요소를 분석하게 하면, 자신의 취향을 서술한 결과가 나오고 그것이 반복 사용할 프롬프트의 기초가 된다.

 

레퍼런스 이미지 기준

  • 인물 — 선명한 얼굴 사진 1장, 전신이 나온다면 전신 사진 1장. 두 장이면 될 것을 스무 장 올리지 않는다
  • 제품 — 실제 제품, 로고, 브랜드 패턴. 나이키나 아디다스처럼 알려진 브랜드는 모델이 이미 로고를 안다. 작은 브랜드는 로고를 올리고 변형하지 말라고 명시한다
  • 브랜드 색 — ‘파랑과 주황’ 같은 이름 대신 헥스 코드로 지정한다
  • 캐릭터 — 여러 각도로 등장할 캐릭터는 정면·측면·전신이 한 장에 담긴 컨택트 시트를 먼저 만들게 한 뒤, 그 한 장을 이후 프롬프트에 계속 넣는다
  • 파일 형식 — JPEG와 PNG면 충분하다. EPS나 SVG를 변환할 필요는 없고 스크린샷으로도 된다

 

만들려는 이미지와 무관한 레퍼런스는 넣지 않는다. 클로즈업 헤드샷을 만들면서 전신 사진을 올리면 모델이 전신을 보여줄지 클로즈업을 할지 혼란스러워하고 결과가 나빠진다.

 

제품 이미지 대량 생성

드베인은 가족이 운영하는 클럽 크리터즈를 사례로 들었다. 3D 프린팅 동물 제품을 800개 SKU로 판매하는 회사다.

 

각 동물의 레퍼런스 이미지를 받는 프롬프트 템플릿을 만들었더니, 모델이 동물을 식별하고 색을 읽어 그에 맞는 3D 렌더 환경을 만들었다. 템플릿 하나로 800장의 개별 이미지가 나오면서도 같은 구조를 공유해 통일감이 유지됐다.

 

같은 방식이 한 제품을 열 가지 맛으로 판매하는 경우에도 적용된다. 맛별 레퍼런스 이미지를 넣으면 모델이 제품을 읽고 맛을 파악해 맞는 환경을 구성한다. 분기별 촬영 대신 주 단위로 광고 소재를 갱신할 수 있다는 것이 드베인의 설명이다.

 

실물 제품이 없는 B2B에도 적용된다. 드베인은 자신의 서브 브랜드 판매 페이지 전체를 미래형 카지노 테마로 만들었는데, 히어로 배너부터 섹션 일러스트까지 같은 레퍼런스를 써서 색과 스타일을 통일했다.

 

매그니픽 활용

드베인이 주로 쓰는 도구는 ChatGPT 단독 버전이 아니라 매그니픽이다. 프리픽의 새 이름이다.

 

차이는 생성량이다. ChatGPT는 프롬프트당 이미지 한 장이 기본이고, 여러 변형을 얻으려면 확장 사고를 켜고 따로 요청해야 하는 데다 변형 폭도 제한적이다. 매그니픽은 한 프롬프트로 최대 8장을 동시에 만든다.

 

드베인은 프롬프트를 잘 쓰면 첫 시도에 완벽한 결과가 나온다는 인식에 반대했다. 조명, 텍스트 렌더링, 제품 배치, 구도가 정확히 맞는 경우는 드물고 매 생성마다 세부가 달라진다. 한 장 대신 여덟 장을 받으면 쓸 만한 결과나 다듬을 만한 결과를 찾을 확률이 올라간다는 것이다.

 

같은 프롬프트를 GPT Image와 구글 이미젠(나노바나나)에 나란히 넣어 비교할 수도 있다. 모델마다 잘하는 작업이 달라 결과를 비교하면 맞는 것을 고를 수 있다. 드베인은 일부 요금제에서 이미젠 무제한 생성을 쓰면 GPT Image나 영상, 업스케일링에 크레딧을 남길 수 있다고 덧붙였다.

 

Claude 연동

매그니픽은 최근 MCP 커넥터를 추가했고 Claude 연동이 포함됐다. Claude 안에서 프롬프트를 쓰고 매그니픽으로 이미지를 생성하는 것까지 도구 전환 없이 처리할 수 있다.

 

생성된 이미지는 Claude 대화창과 매그니픽 라이브러리 양쪽에 나타난다. Claude Code나 Cowork가 아닌 일반 Claude 대화 화면에서도 작동하며, Cowork에서는 생성 이미지를 컴퓨터 폴더에 바로 저장할 수 있다.

 

드베인은 Claude에 크리에이티브 디렉터, 촬영감독, 조명 전문가, 스타일리스트 역할을 부여하는 스킬을 쓴다고 밝혔다. 역할을 지정하면 일반적인 요청보다 정교한 프롬프트가 나온다는 설명이다. 매그니픽은 어도비 포토샵과 일러스트레이터 플러그인도 내놨다.

 

의의 및 전망

7개 항목 구조는 특정 도구에 묶이지 않는다. 비워둔 항목을 모델이 평균값으로 채운다는 원리는 다른 이미지 모델에도 적용된다.

 

다만 이 글은 마케팅 매체가 자사 팟캐스트 내용을 정리한 자료이며, 언급된 도구 중 일부는 유료 구독이 필요하다.

 

📅 원문 날짜: 2026년 8월 11일 | 출처: Social Media Examiner