
100% AI로 유튜브 영상 만들기, 3시간과 11달러로 따라 하는 전 과정
원고, 그림, 목소리, 음악, 편집까지 AI로 만든 9분 18초짜리 영상. 여러 AI를 클릭 없이 Claude Code 하나로 부리는 하네스 구조부터 단계별 요청, 비용, 함정까지 따라 할 수 있게 정리했다.
송찬영
CTO
9분 18초짜리 유튜브 영상을 하나 올렸다.
원고, 그림, 목소리, 배경음악, 편집. 이 중에 내 손으로 만든 건 하나도 없다. 목소리는 내 목소리인데, 내가 녹음한 게 아니다. 16초짜리 녹음을 들려주고 AI가 7분 47초를 읽었다.
걸린 시간은 실제로 붙어 있던 기준으로 약 3시간이다. 구독료 말고 추가로 나간 돈은 이미지 생성비 약 11달러였다.
만드는 건 AI가 했다. 고르는 건 내가 했다.
완성된 영상은 이것이다.
유튜브에서 영상 보기: 세상은 좋아진다는데 왜 나는 점점 불안할까
주변에서 어떻게 했냐는 질문을 여러 번 받았다. 그래서 도구와 순서, 실제로 보낸 지시문, 막혔던 지점까지 전부 적어 둔다. 영상을 만들 일이 없는 분이라도, AI에게 일을 맡기는 방식 자체는 다른 업무에 그대로 옮겨 쓸 수 있다.
가장 중요한 것: 클릭하지 않게 만드는 하네스
이 영상에는 AI 모델이 일곱 개 들어갔다. 보통이라면 사이트 일곱 개를 열고, 로그인하고, 결과를 내려받아 다음 도구에 올리는 일을 수십 번 반복해야 한다. 그러면 사람은 AI 사이를 오가는 배달부가 된다.
나는 그 일을 하지 않았다. 모든 도구 호출을 Claude Code 한 곳에서 하게 만들어 둔 구조, 하네스가 있었기 때문이다. 이 글에서 딱 하나만 가져간다면 이것이다.
사람은 방향만 말한다. 도구 사이를 오가는 일은 하네스가 한다.
하네스는 네 층으로 되어 있다.
1. 작업 설명서 (AGENTS.md)
프로젝트 폴더 맨 위에 두는 문서다. 채널의 말투와 화면 원칙, 제작 순서, 파일을 어디에 두는지, 그리고 한 번 겪은 함정을 적어 둔다. Claude Code는 새 대화를 시작할 때 이 문서를 먼저 읽는다. 그래서 매번 같은 설명을 반복하지 않아도 지난번과 같은 방식으로 일한다.
2. 스킬 (SKILL.md와 실행 스크립트)
기능 하나마다 사용 설명서와 실행 스크립트를 한 폴더에 묶어 둔 것이다. Claude Code는 요청을 보고 맞는 스킬을 스스로 찾아 쓴다. 이번에 쓴 스킬은 세 가지다.
- 이미지 생성 스킬: 이미지 목록과 프롬프트 파일을 읽어 OpenAI 이미지 API를 병렬로 호출하고 결과를 폴더에 저장한다.
- 내 목소리 나레이션 스킬: "내 목소리로 나레이션"이라는 말 한마디에 참조 녹음 확인, GPU 장비 상태 점검, 원고 전송, 합성, 결과 검증, 음량 맞춤까지 한 명령으로 끝낸다. 모델과 설정이 고정돼 있어서 다시 고르라고 묻지 않는다.
- GPU 장비 운영 스킬: 사내 DGX Spark에 접속하는 방법, 음악 생성과 음성 인식 서비스를 켜고 끄는 방법, 다른 작업을 건드리지 않는 규칙이 들어 있다.
3. 연결 (API 키와 사내 장비)
외부 API 키는 환경 파일에만 두고 스크립트가 거기서 읽는다. 대화나 원고에는 키가 남지 않는다. GPU 장비는 사내망 안에서 SSH로 연결한다. 연결 정보가 스킬 안에 정리돼 있으니 Claude Code가 알아서 접속한다.
4. 파이프라인 스크립트
원고를 문단으로 나누고, 문단을 샷으로 쪼개고, 나레이션 길이에 맞춰 타임라인을 만들고, 음악을 섞고, 렌더링하는 스크립트들이다. 이것도 처음에 Claude Code가 짰다. 한 번 만들어 두면 다음 에피소드는 원고만 바꿔 같은 순서로 돌린다.
클릭이 사라지는 이유
- 자동 승인: 작업 폴더 안의 명령은 하나씩 허락하지 않아도 실행되게 설정했다.
- 백그라운드 실행: 음악 생성 70분, 렌더링 10분 같은 긴 작업은 뒤에서 돌리고 끝나면 알림을 받는다. 그동안 Claude Code는 다른 작업을 이어 간다.
- 스스로 검증: 렌더링 중간 프레임을 캡처해 화면을 확인하고, 나레이션을 다시 받아 적어 발음을 확인하고, 음량을 측정한다. 나는 검증이 끝난 결과만 본다.
주의할 점도 있다. 자동 승인은 편한 만큼 위험하다. 민감한 자료가 없는 작업 폴더에서만 쓰고, 키는 환경 파일에만 두고, 외부 게시나 삭제처럼 되돌리기 어려운 일은 따로 확인하게 해 두는 편이 안전하다.
하네스를 처음부터 다 만들 필요는 없다. 한 번 손으로 해 본 작업을 Claude Code에게 "방금 한 과정을 스킬로 만들어줘"라고 하면 된다. 다음부터는 그 일이 한 줄 요청이 된다. 나도 목소리, 이미지, GPU 장비를 하나씩 이렇게 붙였다.
결과와 비용
- 영상: 9분 18초, 1920x1080, 30fps. 챕터 8개, 컷 132개
- 나레이션: 내 목소리를 복제한 AI 음성, 50문단, 7분 47초
- 그림: AI 생성 이미지 53장을 만들어 27장 사용
- 음악: AI 생성 배경음악 3곡, 효과음 6종은 코드로 합성
- 시간: 실제 작업 약 3시간 (저녁에 시작해 다음 날 아침에 끝났고, 자는 시간과 10분 이상 기다린 시간은 뺐다)
- 추가 비용: 약 10.60달러, 전부 이미지 생성 API 요금
비용에서 뺀 것도 밝혀 둔다. Claude와 ChatGPT는 원래 쓰던 월 구독으로 썼다. 목소리와 음악은 사무실에 있는 GPU 장비에서 돌렸기 때문에 추가 요금이 없었지만, 장비값과 전기료는 넣지 않았다. 참고로 Claude를 구독 대신 API로 썼다면 공시가 기준 약 29달러가 더 들었을 것이다.
준비물
- ChatGPT 유료 구독: 주제 잡기, 자료조사, 원고 초안. 나는 GPT 6 Pro를 썼다.
- Claude 구독과 Claude Code: 원고를 영상용으로 고치고, 편집 코드를 짜고, 전체 작업을 진행하는 역할. 터미널에서 대화로 일을 시키는 도구다. 코드를 몰라도 된다.
- OpenAI API 키: 이미지 생성용. 쓴 만큼 과금된다.
- 목소리와 음악을 만들 곳: 나는 사내 NVIDIA DGX Spark에서 공개 모델을 돌렸다. GPU가 없다면 뒤에 적은 Typecast 같은 서비스로 대신한다.
- 기본 프로그램: Node.js, Python, FFmpeg. 설치도 Claude Code에게 부탁하면 된다.
전체 흐름
- 주제와 원고 초안 (ChatGPT)
- 영상용 원고로 바꾸기 (Claude Code)
- 화면 스타일 먼저 정하기
- 이미지 만들기 (GPT Image 2.5)
- 내 목소리 나레이션 (VoxCPM2)과 발음 확인 (Whisper)
- 배경음악 (MiniMax Music 3)과 효과음
- 편집과 렌더링 (Remotion)
- 썸네일, 설명, 업로드 전 확인
1번을 빼면 모두 Claude Code 한 대화 안에서 진행했다. 나는 결과물을 보고 한 줄씩 고칠 점을 말했을 뿐이다. 아래 단계마다 실제로 보낸 요청을 화면으로 옮겨 두었다. 1단계의 ChatGPT 요청은 예시로 재구성한 것이고, 2단계부터는 실제로 보낸 문장 그대로다.
1단계. 주제와 원고 초안
ChatGPT에 주제를 주고 자료조사와 에세이 초안을 받았다. 이번 주제는 AI 확산과 국제질서 재편 속에서 개인이 붙잡아야 할 것이었다. 스탠퍼드 AI Index, IEA, IMF, SIPRI 같은 공개 자료를 인용한 초안이 나왔다.
이 단계에서 요청할 것은 두 가지다.
- 인용한 수치마다 출처와 발표 시점을 붙여 달라고 한다. 나중에 사실 확인을 할 때 이 목록이 그대로 체크리스트가 된다.
- 영상 길이를 미리 알려 준다. 10분 영상이면 말로 읽었을 때 대략 8분 분량의 글이 필요하다.
2단계. 읽는 글을 듣는 말로 바꾸기
초안을 Claude Code에 넘기고 영상 기획안을 만들어 달라고 했다. 이 단계가 생각보다 중요하다. 눈으로 읽는 글과 귀로 듣는 말은 다르다.
- 말투: 존댓말 내레이션으로, 질문을 던지고 설명하고 챕터 끝에 정리하는 흐름으로 바꿨다.
- 숫자와 약어: "88%"는 "팔십팔 퍼센트", "AI"는 "에이아이"처럼 소리 내 읽을 원고를 따로 만든다. 화면 자막에는 숫자를 그대로 쓴다. 음성 AI가 숫자와 영어 약어에서 가장 많이 틀린다.
- 연출 지시: 문단마다 [화면], [사운드], [자막] 지시를 같이 적게 했다. 이 기획안이 이후 모든 단계의 기준이 된다.
- 사실 확인 목록: 원고에 들어간 수치를 1차 출처와 대조할 목록을 기획안 끝에 두었다. 업로드 전에 사람이 직접 확인하는 몇 안 되는 일이다.
기획안은 HTML로도 만들어 달라고 해서 브라우저로 훑어봤다. 긴 원고는 화면으로 보는 편이 검토하기 쉽다.
3단계. 화면 스타일을 먼저 정한다
처음에는 위와 같은 파스텔 삽화로 시작했다. 몇 장 보고 나서 이렇게 말했다.
흠 뭔가 이런 그림보다는 모션 인포그래픽이 더 좋을거같아
이 한 줄로 영상의 톤이 통째로 바뀌었다. 삽화 대신 숫자와 도표가 움직이는 모션 그래픽으로 갔고, 레퍼런스로 좋아하는 모션 영상 세 편을 보여 주며 이런 느낌이라고 알려 줬다.
교훈은 분명하다. 스타일부터 정하고 그림을 만들어야 한다. 나는 스타일을 두 번 바꾸면서 이미지 19장을 버렸다. 금액으로는 3.80달러라 크지 않지만, 시간은 그보다 훨씬 많이 버렸다. 레퍼런스 영상이나 이미지를 처음부터 보여 주는 게 가장 빠르다.
하나 더. 수치는 이미지 생성 AI로 그리지 않는다. 이미지 AI는 숫자와 글자를 틀리게 그리기 쉽다. 수치 장면은 편집 코드에서 글자로 직접 그리게 했다.
4단계. 이미지 만들기
이미지는 OpenAI의 GPT Image 2.5로 만들었다. Claude Code가 기획안의 [화면] 지시를 읽고 이미지 목록과 프롬프트를 만들어 한 번에 생성했다.
- 두 가지 모델을 나눠 썼다: 영상 소스는 글자 없는 이미지용 모델(sunburst), 한글 문구가 들어가는 썸네일은 글자 표현에 강한 모델(flare).
- 색감을 통일한다: 모든 프롬프트에 같은 색 지시를 넣어야 장면이 이어져 보인다.
- 실존 인물과 실제 사건 현장처럼 보이는 이미지는 만들지 않는다: 영상 설명에도 AI로 만든 재구성 이미지라고 밝혔다.
- 반복되는 효과 대신 이미지를 끼운다: 편집 초안에서 같은 파티클 효과가 열두 번 반복됐다. 위 화면처럼 해당 장면을 캡처해 붙이고 한 줄 보냈더니, 열두 곳이 아래 같은 새 이미지로 바뀌었다.
비용은 1536x1024 고품질 기준 장당 약 0.20달러로 계산했다. 53장에 약 10.60달러다. 이 단가는 공개된 가격 정리 자료를 바탕으로 한 추정치라, 실제 청구액은 OpenAI 사용량 화면에서 확인하는 게 정확하다.
5단계. 내 목소리 나레이션
목소리는 공개 음성 복제 모델인 VoxCPM2로 만들었다. 조용한 곳에서 내 목소리를 16초 정도 녹음해 참조로 주면, 원고를 그 목소리로 읽는다.
- 원고를 문단으로 나눈다: 한 문단은 1~3문장, 350자 이하로 끊었다. 문단 단위로 생성하면 한 문단만 다시 만들기도 쉽다.
- 설정을 고정한다: 같은 참조 녹음과 같은 설정을 쓰면 편마다 목소리가 흔들리지 않는다.
- AI로 다시 받아 적어 확인한다: 숫자와 영어 약어가 들어간 20개 문단을 음성 인식 모델 Whisper로 다시 받아 적어 원고와 비교했다. 다만 받아쓰기가 다르다고 곧바로 발음이 틀렸다고 단정하지는 않는다. 마지막엔 직접 들어 본다.
50문단, 7분 47초 분량이 약 7분 만에 나왔다. 합성 음성을 쓴 영상은 유튜브 업로드 때 "변경되거나 합성된 콘텐츠" 항목에 표시했다.
6단계. 배경음악과 효과음
배경음악은 공개 음악 생성 모델 MiniMax Music 3로 세 곡을 만들었다. 긴장감 있는 곡, 차분한 곡, 마무리 곡이다. 챕터 분위기에 맞춰 나눠 깔았다.
- 함정 하나: 이 모델은 가사 입력란에 넣는 섹션 태그 수로 곡 길이가 정해진다. 태그를 실제 줄바꿈으로 한 줄씩 넣어야 길게 나온다. 이걸 몰라서 짧은 곡만 두 번 나왔고 27분을 버렸다.
- 효과음은 AI 모델 없이: 휙, 틱, 쿵 같은 효과음 6종은 Claude Code가 코드로 직접 합성했다.
- 믹싱: 나레이션이 나올 때 음악 볼륨이 자동으로 내려가게 했고, 전체 음량은 유튜브 기준(-16 LUFS 안팎)에 맞췄다. 인스타 릴스는 -14 LUFS 정도로 조금 더 크게 맞췄다.
7단계. 편집과 렌더링
편집 프로그램은 쓰지 않았다. Remotion이라는 도구로 영상을 코드로 만들었는데, 그 코드는 전부 Claude Code가 짰다. 내가 한 건 결과 화면을 보고 고칠 점을 말한 것이다.
- 컷은 자막 덩어리마다: 2~3초마다 화면이 바뀌게 했다. 이렇게 132개 컷이 나왔다.
- 나레이션 길이에 맞춘다: 나레이션 파일의 실제 길이를 읽어 컷과 자막 시간을 자동으로 맞췄다. 사람이 타임라인을 끌어 맞추는 작업이 없다.
- 중간 프레임을 먼저 본다: 전체 렌더링은 한 번에 9~12분 걸린다. 몇 장면만 이미지로 뽑아 먼저 확인하고, 괜찮을 때 전체를 렌더링했다. 전체 렌더링은 다섯 번 했다.
8단계. 썸네일, 설명, 업로드 전 확인
썸네일은 짧은 지시를 몇 번 주고받으며 다듬었다. 아래가 그 변천이고, 실제로 보낸 말은 이 정도다.
- "a인데 텍스트 조금 크기 줄이고, 사람 안 나오는 버전으로"
- 마음에 드는 썸네일 이미지를 하나 보여 주고 "약간 요런 텍스트 컨셉"
- "도시 이미지보다 ChatGPT, 클로드, Gemini 심볼들이 떠 있는 게 좋겠어. 텍스트에 배경 넣지 말고"
글자가 들어가는 썸네일은 배경만 AI로 만들고 글자는 따로 얹는 방식이 결국 가장 정확했다. 로고는 AI로 그리면 뭉개지기 쉬워서 공개된 벡터 아이콘을 가져다 썼다. 영상 설명과 챕터 타임스탬프도 Claude Code가 렌더링 결과에서 시간을 뽑아 만들었다.
업로드 전에 사람이 할 일은 세 가지다.
- 원고의 수치를 1차 출처와 대조한다.
- AI 생성 이미지와 합성 음성을 쓴 사실을 설명란과 유튜브 설정에 표시한다.
- 남의 로고나 상표가 들어갔다면 협찬이나 공식 관계로 오해받지 않는지 본다.
GPU가 없다면
이 과정에서 GPU 장비가 필요한 건 목소리, 받아쓰기, 음악 세 곳뿐이다. 원고, 이미지, 편집은 원래부터 노트북 한 대면 된다. 세 곳만 웹 서비스로 바꿔 끼우면 된다.
- 나레이션: 한국어라면 Typecast가 가장 쉽다. 원고를 붙여 넣고 목소리를 고르면 바로 나레이션 파일이 나온다. 내 목소리를 쓰고 싶다면 Typecast나 ElevenLabs처럼 음성 복제를 지원하는 서비스에서 녹음을 올려 목소리를 만든다. 복제 기능과 상업적 이용 범위는 요금제마다 다르니 가입 전에 확인한다.
- 발음 확인: OpenAI의 음성 인식 API로 나레이션을 다시 받아 적어 원고와 비교한다. 짧은 영상이라면 그냥 직접 들어 봐도 충분하다.
- 배경음악: Suno 같은 음악 생성 서비스에서 분위기와 길이를 적어 만든다. 영상에 쓸 거라면 상업적 이용이 되는 요금제인지 먼저 본다.
웹 서비스로 바꿔도 하네스는 그대로 쓸 수 있다. 서비스가 API를 제공하면 그 호출법을 스킬로 만들어 두면 된다. API가 없다면 그 단계만 사람이 파일을 내려받아 폴더에 넣고, 나머지는 Claude Code에 맡긴다.
비용 구조는 다르다. 웹 서비스는 설치가 없는 대신 만들 때마다 요금이 붙고, 내 목소리 샘플을 서비스에 올려야 한다. 같은 공개 모델을 쓰고 싶다면 GPU를 시간 단위로 빌려 돌리는 방법도 있다. 처음 한 편은 Typecast 같은 서비스로 가볍게 만들어 보길 권한다. 매주 만들게 되면 GPU 임대를, 그보다 자주 만들면 그때 장비를 고민해도 늦지 않다.
장비를 직접 두었을 때 좋았던 점도 적어 둔다. 다시 만들어도 추가 요금이 없어서 마음에 들 때까지 뽑을 수 있었다. 내 목소리 녹음이 밖으로 나가지 않았다. 모델 버전을 고정해 두면 같은 원고로 같은 목소리가 나온다. 회사라면 고객 데이터와 사내 자료도 같은 이유로 중요하다.
해보니 알게 된 것
- 하네스가 먼저다. 모델을 잘 고르는 것보다, 모델들을 한곳에서 부를 수 있게 묶어 두는 것이 시간을 훨씬 많이 줄였다.
- 지시는 짧아도 된다. 위에 적은 한 줄짜리 지시들이 영상을 가장 크게 바꿨다. 필요한 건 코드가 아니라 보고 고르는 눈이었다.
- 스타일 먼저, 그림은 나중. 버린 그림 19장이 그 증거다.
- 한 편에 한 대화. 한 대화에서 방향을 여러 번 바꾸면 대화가 길어지고, 구독 사용량이 빨리 찬다. API로 쓴다면 비용이 쌓인다.
- 함정은 기록해 둔다. 음악 줄바꿈 문제처럼 한 번 겪은 함정을 작업 가이드에 적어 두니 다음 편부터는 같은 시간을 버리지 않는다.
- 사람이 끝까지 남는 곳은 확인이다. 사실 확인, AI 사용 표시, 권리 확인은 AI에게 맡기지 않았다.
회사에서 시작한다면
마케팅팀의 제품 소개 영상, 인사팀의 신입 교육 영상, 영업팀의 제안 요약 영상처럼 외주를 맡기거나 미뤄 두던 영상이 있을 것이다. 시작은 작게 하면 된다. 1분짜리 영상 하나를 골라 원고부터 AI에게 맡기고, 결과를 보며 한 줄씩 고친다.
다만 시작 전에 세 가지는 먼저 확인한다. 회사 자료를 외부 AI 서비스에 올려도 되는지, 회사 로고와 제품 이미지를 쓸 권한이 있는지, 그리고 AI로 만든 콘텐츠라는 표시를 어떻게 할지다.
이 글은 풀링포레스트가 현업에서 바로 쓸 수 있는 AI 활용 사례를 소개하는 시리즈의 첫 편이다. 사례를 소개하는 인스타 릴스도 같은 방법으로, 같은 목소리로 만들었다.
만드는 일은 점점 AI가 가져간다. 무엇을 고르고 무엇을 버릴지는, 여전히 우리 몫이다.


