AI 영상 프롬프트 어떻게 써야 할까? 원하는 결과를 만드는 작성법과 실제 예시

AI 영상, 왜 같은 도구를 써도 결과가 다를까?

Veo를 비롯한 AI 영상 생성 도구를 처음 사용하면 대개 비슷한 방식으로 시작합니다.

카페에서 여성이 커피를 마시는 영상 만들어줘.

영상이 만들어지긴 하지만, 막상 결과를 보면 생각했던 것과 다릅니다. 카메라는 엉뚱하게 움직이고, 인물의 행동은 어색하며, 원하지 않았던 물건이 화면에 등장합니다. 분위기도 머릿속으로 생각했던 것과 전혀 다를 수 있습니다.

그래서 흔히 “아직 AI 영상 퀄리티가 별로인가?”라고 생각합니다. 물론 생성 모델 자체의 한계도 존재합니다. 하지만 그 전에 확인해야 할 것이 있습니다.

AI에게 내가 원하는 장면을 충분히 설명했는가?

Google DeepMind 역시 Veo 공식 프롬프트 가이드에서 더 많은 세부 정보를 제공할수록 결과물에 대한 통제력을 높일 수 있다고 설명합니다. 특히 샷 프레이밍과 움직임, 스타일, 조명, 인물, 장소, 행동, 대화 등을 주요 요소로 제시합니다.

따라서 AI 영상 프롬프트는 단순히 ‘무엇을 보여줄 것인가’를 적는 문장이라기보다, ‘어떤 장면을 어떤 방식으로 촬영할 것인가’를 설명하는 촬영 지시서에 가깝게 접근하는 것이 좋습니다.

AI 영상 프롬프트 공식부터 알아보자

Google Cloud는 Veo 3.1 프롬프트 작성법을 다음 다섯 요소로 정리합니다.

촬영 방식 + 주체 + 행동 + 배경·상황 + 스타일·분위기

공식 가이드의 표현으로는 각각 촬영 방식(Cinematography), 주체(Subject), 행동(Action), 배경·상황(Context), 스타일·분위기(Style & Ambiance)에 해당합니다.

실제 작업에서는 여기에 영상 생성 모델들이 지원하는 조명과 오디오까지 구체화하면 다음과 같이 확장할 수 있습니다.

AI 영상 프롬프트 8요소

① 주체(Subject) — 누가/무엇이

영상의 주인공입니다.

② 행동(Action) — 무엇을 하는가

주체가 수행하는 행동입니다.

③ 장소·상황(Location & Context) — 어디에서

장소와 주변 환경을 설명합니다.

④ 샷·구도(Shot) — 어떻게 잡을 것인가

클로즈업, 미디엄 샷, 와이드 샷 등 화면 구도를 결정합니다.

⑤ 카메라 움직임(Camera Movement) — 카메라는 어떻게 움직이는가

고정, 팬, 틸트, 돌리, 트래킹 등의 움직임을 지정합니다.

⑥ 조명(Lighting) — 어떤 빛인가

시간대와 광원의 방향·성격을 지정합니다.

⑦ 스타일·분위기(Style & Mood) — 어떤 느낌인가

실사, 광고, 다큐멘터리, 필름, 애니메이션 등 전체적인 시각적 톤을 지정합니다.

⑧ 오디오(Audio) — 무엇이 들리는가

대사, 효과음, 주변 소리, 음악 등을 지정합니다.

이를 하나의 공식으로 만들면 다음과 같습니다.

[주체] + [행동] + [장소·상황] + [샷·구도] + [카메라 움직임] + [조명] + [스타일·분위기] + [오디오]

모든 프롬프트에 여덟 요소를 억지로 집어넣어야 한다는 의미는 아닙니다. 내가 결과물에서 반드시 통제하고 싶은 요소를 구체적으로 지정하는 체크리스트로 사용하는 편이 좋습니다.

실제로 프롬프트를 한 단계씩 만들어보자

이제 같은 장면을 가지고 실제 프롬프트를 발전시켜 보겠습니다.

STEP 1. 주체와 행동만 적기

20대 여성이 카페에서 커피를 마신다.

가장 기본적인 프롬프트입니다. AI는 누가 무엇을 하는지는 알 수 있습니다. 하지만 아직 결정되지 않은 것이 많습니다.

어떤 카페인지, 낮인지 밤인지, 얼굴을 크게 보여줄지 공간 전체를 보여줄지, 카메라가 움직일지 고정될지 알 수 없습니다.

결국 나머지 선택을 AI에게 맡긴 상태입니다.

STEP 2. 장소와 상황을 추가하기

20대 여성이 늦은 오후의 조용한 카페 창가에 앉아 머그잔을 천천히 들어 커피를 마신다. 창밖에는 비가 내리고 있다.

이제 공간과 시간, 행동의 세부적인 모습이 생겼습니다. 카페보다 늦은 오후의 조용한 카페 창가가 훨씬 많은 정보를 제공합니다.

DeepMind의 공식 가이드 역시 단순히 ‘도시’라고 쓰는 것보다 특정한 분위기와 특징을 가진 도시처럼 장소를 구체적으로 묘사하는 방식을 권장합니다.

STEP 3. 카메라를 지시하기

여기서부터 영상다운 프롬프트가 됩니다.

미디엄 클로즈업. 20대 여성이 늦은 오후의 조용한 카페 창가에 앉아 머그잔을 천천히 들어 커피를 마신다. 카메라는 인물을 향해 천천히 돌리인(Dolly-in)한다. 창밖에는 비가 내리고 있다.

이제 AI에게 단순히 장면을 만드는 것이 아니라 그 장면을 어떻게 촬영할지 알려주고 있습니다.

Google Cloud의 공식 가이드에서도 촬영 방식(Cinematography)을 프롬프트의 중요한 제어 요소로 설명하며 돌리 샷, 트래킹 샷, 크레인 샷, 항공 샷, 슬로우 팬, POV 등을 예로 제시합니다.

여기서 영상 프롬프트에 자주 사용할 수 있는 카메라 표현을 알아두면 편리합니다.

용어의미활용하기 좋은 장면
와이드 샷(Wide shot)인물과 주변 공간을 넓게 보여줌풍경, 장소 소개
미디엄 샷(Medium shot)상반신 중심인터뷰, 대화
클로즈업(Close-up)얼굴·사물을 크게 보여줌감정, 제품 디테일
로우 앵글(Low angle)아래에서 위로 촬영웅장함, 권위
하이 앵글(High angle)위에서 아래로 촬영공간 표현
팬(Pan)카메라가 좌우로 회전공간·풍경 소개
틸트(Tilt)카메라가 위아래로 움직임건물, 인물 전체
돌리인(Dolly-in)카메라 자체가 피사체에 접근집중, 긴장감
트래킹 샷(Tracking shot)움직이는 피사체를 따라감걷기, 달리기
POV 샷(POV shot)등장인물의 시점체험형 장면
고정 샷(Static shot)카메라 고정안정적인 제품·인터뷰 영상

특히 줌인(Zoom-in)과 돌리인(Dolly-in)은 다릅니다. 줌인은 카메라 위치를 유지하면서 렌즈의 화각을 바꾸는 것이고, 돌리인은 카메라 자체가 피사체 쪽으로 이동합니다. 그래서 비슷하게 화면이 커지더라도 공간감과 느낌은 달라질 수 있습니다.

STEP 4. 조명과 스타일을 추가한다

이제 분위기를 결정해 보겠습니다.

미디엄 클로즈업. 20대 여성이 늦은 오후의 조용한 카페 창가에 앉아 머그잔을 천천히 들어 커피를 마신다. 카메라는 인물을 향해 천천히 돌리인한다. 창밖에는 비가 내린다. 창문을 통해 들어오는 부드러운 자연광이 얼굴 한쪽을 비춘다. 얕은 심도, 따뜻한 필름 톤, 차분하고 영화적인 분위기.

같은 장소와 인물이라도 ‘밝은 형광등’과 ‘늦은 오후 창문으로 들어오는 부드러운 자연광’은 전혀 다른 영상을 만듭니다.

공식 Veo 가이드 역시 조명의 종류와 위치를 별도의 프롬프트 요소로 제시하고 있으며, 시각적 스타일도 사실적(Realistic), 카툰(Cartoon), 클레이 애니메이션(Claymation), 필름 누아르(Film noir), 35mm 필름, VHS 등으로 구체화할 수 있다고 설명합니다.

STEP 5. 소리까지 지시한다

Veo 3 계열처럼 네이티브 오디오 생성을 지원하는 모델이라면 영상과 함께 소리도 설계할 수 있습니다. Google의 공식 가이드에서는 오디오를 크게 세 가지로 나누어 설명합니다.

① 효과음(Sound effects)

특정 행동에서 발생하는 효과음

② 주변음(Ambient noise)

공간에서 자연스럽게 들리는 소리

③ 대사(Dialogue)

인물이나 내레이터가 말하는 내용

따라서 앞의 카페 장면에는 이렇게 추가할 수 있습니다.

오디오: 창문을 두드리는 잔잔한 빗소리, 멀리서 들리는 낮은 카페 대화 소리, 머그잔을 테이블 위에 내려놓는 작은 도자기 소리. 배경 음악 없음.

단순히 ‘카페 소리’라고 적는 것보다 무엇이 들려야 하는지를 각각 지정한 것입니다.

최종 프롬프트는 이렇게 완성된다

지금까지의 내용을 합쳐보겠습니다.

처음 작성한 프롬프트

카페에서 여성이 커피를 마시는 영상.

개선한 프롬프트

미디엄 클로즈업. 늦은 오후, 20대 여성이 조용한 카페 창가에 앉아 있다. 여성은 창밖에 내리는 비를 바라보며 세라믹 머그잔을 천천히 들어 커피를 한 모금 마신다. 카메라는 여성을 향해 천천히 돌리인(Dolly-in)한다. 창문으로 들어오는 부드러운 자연광이 얼굴 한쪽을 비춘다. 얕은 심도, 따뜻한 35mm 필름 톤, 차분하고 영화적인 분위기. 오디오: 창문을 두드리는 잔잔한 빗소리, 멀리서 들리는 낮은 카페 대화 소리, 머그잔을 나무 테이블 위에 내려놓을 때 들리는 작은 도자기 소리. 배경 음악 없음. 

차이는 단순히 문장이 길어진 것이 아닙니다.

첫 번째 프롬프트는 무엇을 만들지만 설명했습니다.

두 번째는

  • 무엇을
  • 어디에서
  • 어떻게 행동하고
  • 어떤 구도로
  • 카메라가 어떻게 움직이고
  • 어떤 빛으로
  • 어떤 분위기로
  • 어떤 소리와 함께

촬영할지를 지정했습니다. 즉 AI에게 맡겨둔 선택의 범위를 줄인 것입니다.

원하는 결과가 안 나올 때는 무엇을 고쳐야 할까?

여기서 중요한 실무 팁이 하나 있습니다. 결과가 마음에 들지 않는다고 프롬프트 전체를 무작정 더 길게 만들 필요는 없습니다. 어떤 부분이 잘못됐는지를 먼저 찾아야 합니다.

① 인물이 너무 작다

장소 설명을 더 길게 쓰는 것이 아니라 와이드 샷 → 미디엄 샷 / 클로즈업처럼 샷을 수정합니다.

② 영상이 너무 정적이다

스타일 설명을 늘리기보다 고정 카메라 → 트래킹 샷 / 돌리인처럼 카메라 움직임을 수정합니다.

③ 분위기가 생각과 다르다

인물 묘사를 바꾸기보다 조명 + 스타일 + 분위기를 수정합니다.

④ 행동이 너무 복잡하고 어색하다

한 장면에 너무 많은 행동을 요구하고 있지는 않은지 확인합니다.

특히 짧은 영상에서

문을 열고 들어와서 → 가방을 내려놓고 → 커피를 주문하고 → 자리에 앉아서 → 노트북을 열고 → 전화를 받는다

처럼 여러 행동을 동시에 요구하면 모델이 각 동작을 안정적으로 표현하기 어려울 수 있습니다.

Google DeepMind가 공개한 복잡한 액션 프롬프트 사례 역시 행동의 진행 순서와 카메라, 환경의 반응까지 매우 세밀하게 설명하는 방식으로 구성되어 있습니다.

복잡한 행동일수록 ‘무엇이 일어나는지’뿐 아니라 ‘어떤 순서로 일어나는지’를 명확히 지정하는 것이 좋습니다.

실무에서 바로 쓰는 AI 영상 프롬프트 템플릿

매번 처음부터 프롬프트를 작성할 필요는 없습니다. 아래 구조를 복사해 필요한 부분만 채워도 됩니다.

[샷·카메라]
어떤 구도로 촬영하며 카메라는 어떻게 움직이는가

[주체]
누가 또는 무엇이 등장하는가

[행동]
무엇을 어떻게 하는가

[장소·상황]
어디이며 주변에는 무엇이 있는가

[조명]
시간대, 광원, 빛의 방향과 느낌

[스타일·분위기]
실사·광고·영화·애니메이션 등 스타일과 분위기

[오디오]
대사, 효과음, 주변음, 음악

결론: AI에게 ‘영상’을 주문하지 말고 ‘촬영’을 지시하자

AI 영상 프롬프트를 잘 쓰기 위해 화려한 표현을 많이 알 필요는 없습니다. 가장 중요한 변화는 프롬프트를 바라보는 방식입니다.

“카페에서 커피 마시는 여자 영상을 만들어줘.”

처럼 결과물만 주문하는 것에서,

“누구를, 어디에서, 어떤 행동을 하는 모습으로, 어떤 구도와 카메라 움직임, 조명과 분위기로 촬영할 것인가”

를 설명하는 방식으로 바꾸는 것입니다.

Google이 공식적으로 제시하는 프롬프트 구조 역시 결국 촬영 방식 + 주체 + 행동 + 배경·상황 + 스타일·분위기라는 촬영 설계에 가깝습니다.

그리고 여기에 한 가지를 더 기억하면 좋습니다.

좋은 프롬프트 = 긴 프롬프트는 아닙니다.

원하지 않는 결과가 나왔다면 무조건 설명을 추가하기보다 어떤 요소에 대한 통제가 부족했는지 찾아 그 부분을 수정하는 것이 더 중요합니다.

인물이 문제라면 주체를, 움직임이 문제라면 행동을, 화면 구성이 문제라면 샷과 카메라 움직임을, 분위기가 문제라면 조명과 스타일을 수정하는 식입니다.

AI 영상 생성은 결국 한 번에 완벽한 문장을 쓰는 작업보다, 원하는 장면을 구성하는 요소를 하나씩 통제해 가는 작업에 가깝습니다.

프롬프트를 ‘명령어’가 아니라 촬영 지시서라고 생각하면 AI에게 무엇을 더 설명해야 하는지도 훨씬 명확해집니다.

FAQ: 자주 묻는 질문

Q1. AI 영상 프롬프트는 영어로 작성해야 하나요?
A. 반드시 영어로 작성해야 하는 것은 아닙니다. 다만 모델과 기능에 따라 지원 언어와 언어별 결과에 차이가 있을 수 있으므로 사용하는 서비스의 공식 지원 언어를 확인하는 것이 가장 정확합니다.
Q2. AI 영상 프롬프트는 길수록 좋은가요?
A. 아닙니다. 세부 정보를 추가하면 결과에 대한 통제력을 높일 수 있지만, 핵심은 길이가 아니라 필요한 정보를 명확하게 제공하는 것입니다. Google 역시 프레이밍, 움직임, 스타일, 조명, 인물, 장소, 행동 등을 조합해 원하는 결과를 구체화하는 방식을 안내합니다.
Q3. 카메라 용어를 꼭 알아야 하나요?
A. 필수는 아니지만 알아두면 원하는 결과를 설명하기 쉬워집니다. 예를 들어 ‘사람을 점점 크게 보여줘’보다 ‘카메라가 인물을 향해 천천히 돌리 인(Dolly In)한다’처럼 카메라 움직임을 지정하면 의도를 더 구체적으로 전달할 수 있습니다.
Q4. Veo 3는 영상과 음성을 동시에 만들 수 있나요?
A. 네. Veo 3 계열은 영상과 함께 대사, 효과음, 주변음 등을 네이티브로 생성하는 기능을 지원합니다. 프롬프트에서 원하는 오디오를 별도로 구체화할 수도 있습니다.
Q5. 같은 캐릭터를 여러 영상에서 유지하려면 어떻게 해야 하나요?
A. 텍스트로 외모를 반복해서 설명하는 것만으로는 일관성이 흔들릴 수 있습니다. 지원되는 모델에서는 참조 이미지(Reference Image)를 사용하는 방법이 더 적합할 수 있습니다. Veo 3.1 역시 캐릭터·객체·장면 등의 참조 이미지를 활용한 생성 기능을 제공합니다.

뉴스레터 구독하기

개인정보 수집 및 이용

뉴스레터 발송을 위한 최소한의 개인정보를 수집하고 이용합니다. 수집된 정보는 발송 외 다른 목적으로 이용되지 않으며, 서비스가 종료되거나 구독을 해지할 경우 즉시 파기됩니다.

광고성 정보 수신

제휴 콘텐츠, 프로모션, 이벤트 정보 등의 광고성 정보를 수신합니다.

뉴스레터 구독하기

목차

AI 영상 프롬프트 어떻게 써야 할까? 원하는 결과를 만드는 작성법과 실제 예시

영상 분석과 숏폼 제작,
이제 브이픽 하나면 충분합니다​​

Video analysis and short-form creation,
all in one with Vpick

위로 스크롤