MP4 · MP3 등 — 선택 또는 드래그
.txt · .srt · .vtt — 붙여넣기 우선
파일 선택 또는 여기에 드래그
붙여넣기가 있으면 붙여넣기 우선
보이스 선택 후 «미리듣기» — GPU로 짧은 샘플을 생성합니다.
필터 (성별 · 나이대)
선택한 보이스 설정 (표시범위 · 태그)
다큐·드라마틱 나레이션
지시 없음
보이스 등록 (프리셋 추가)
등록 후 보이스 목록에 바로 추가됩니다
직접 톤 설정
«직접 설정»일 때만 이 값이 적용됩니다.
샘플링 옵션 (톤 일관성)
속도/간격 (싱크 조절)
읽기 속도는 피치를 유지한 채 재생 속도만 바꿉니다(1.1 = 10% 빠르게). 공백은 문장 끝마다(문단 끝은 더 길게) 삽입되는 무음 길이입니다. 영상 싱크에 맞춰 조절하세요.
파일 선택 또는 여기에 드래그
파일 선택 또는 여기에 드래그
YT 다국어
.srt — 선택 또는 드래그 (자막 없이 제목/설명만 진행 가능)
YouTube 제목 한도 100자. 초과분은 저장·업로드 시 자동으로 잘립니다.
파일명 = 앵커/공간 이름. "딸.png"/"딸_2.png"/"딸-3.png"는 전부 "딸" 하나로 묶입니다(끝의 -숫자/_숫자는 여러 장 구분용, 이름에서 제외). 예: 딸.png, 딸_2.png, 엄마.png, 원룸_1.jpg, 원룸_2.jpg
각 샷의 "Image prompt:" 내용만 순서대로 추출합니다. 프롬프트 안의 [ANCHOR-이름]/[SPACE-이름]은 위에서 업로드한 같은 이름의 이미지로(IPAdapter) 주입됩니다. [STYLE-이름]처럼 순수 텍스트 정의는 "비디오 만들기"와 동일하게 첫 샷 헤더 앞에 `[STYLE-이미지]` = "vertical 9:16, photorealistic..." 형식으로 한 번 적어두면 자동 치환됩니다. 같은 방식으로 `[ANCHOR-딸]` = "20대 중반 한국 여성, 오피스룩 정장..."처럼 앵커에도 텍스트 설명을 함께 정의해두면, 이미지(정체성)와 텍스트(성별·복장 등)가 같이 적용되어 결과가 더 안정적입니다 — 이미지만으로는 성별/복장이 의도와 다르게 나올 수 있습니다.
입력하면 ComfyUI의 output/image_gen/이름_jobID앞8자리/ 폴더에 저장됩니다. 비워두면 job ID 폴더에 저장됩니다.
고급 설정 (해상도 / IPAdapter 강도)
너무 높으면 인물 정체성뿐 아니라 레퍼런스 사진의 구도(클로즈업 등)까지 강제돼 배경/장면이 사라질 수 있습니다 — 결과가 이상하면 낮춰보세요.
기본값: 768×1344(9:16 세로), IPAdapter weight 0.75. 체크포인트는 RealVisXL V5.0로 고정.
여러 장을 한 번에 선택하거나 드래그 (scene01, scene02... 또는 01, 02... 순서 권장)
각 샷의 "Video prompt:" 내용만 순서대로 추출해 이미지와 매핑합니다 ("Image prompt:"는 무시). "Video prompt(4s):"처럼 괄호에 초를 적으면 그 샷만 그 길이로 생성되고, 안 적으면 아래 기본 길이를 씁니다.
입력하면 ComfyUI의 output/video_gen/이름_jobID앞8자리/ 폴더에 저장되어 나중에 찾기 쉬워집니다. 영문/숫자/-/_ 외 문자는 자동으로 제거됩니다. 비워두면 기존처럼 job ID 폴더에 저장됩니다.
고급 설정 (해상도 / 길이 / fps)
기본값: 1280×720/5초/15fps. 30fps 이상은 GPU 메모리 부족(OOM)을 유발할 수 있습니다 — 직접 설정 시 24fps 이하 권장.
mp4/mov/mkv/webm — 여러 개를 한 번에 선택하거나 드래그
입력하면 ComfyUI의 output/frame_interp/이름_jobID앞8자리/ 폴더에도 결과가 남아 나중에 찾기 쉬워집니다. 비워두면 job ID 폴더에 저장됩니다.
영상마다 원본 fps를 자동으로 감지해 목표 fps에 가장 가까운 정수 배율로 RIFE 보간합니다(예: 15fps→60fps는 x4). ComfyUI가 꺼져 있으면 작업이 실패하니, "비디오 만들기" 탭에서 먼저 상태를 확인하세요.