영상 자막 자동 만들기

말소리를 글자로. SRT·VTT 자막과 텍스트를 한 번에.

🔒 파일은 서버로 전송되지 않아요

이 도구로 할 수 있는 일

영상이나 녹음 파일의 말소리를 AI(OpenAI가 공개한 Whisper 모델)가 받아써서, 시간이 붙은 자막(SRT·VTT)과 글(TXT)로 만들어 주는 도구예요. 유튜브·릴스 자막, 강의·회의 녹취록, 상담 녹음 정리에 쓰면 좋아요. 받아쓴 자막은 영상과 함께 미리 보면서 글자와 시간을 바로 고친 뒤 저장할 수 있어요. AI가 내 브라우저 안에서 돌아가기 때문에 영상과 소리는 어디로도 올라가지 않아요.

사용 방법

  1. 언어와 모델(빠름·정확)을 고르세요.
  2. 영상이나 녹음 파일을 올리면 AI가 받아쓰기 시작해요.
  3. 자막을 미리 보면서 틀린 글자를 고치고, SRT·VTT·TXT로 저장하세요.

자주 묻는 질문

정말 무료인가요?

네. 회원가입·횟수 제한 없이 무료예요.

영상이 서버로 올라가나요?

아니요. AI가 내 브라우저 안에서 돌아가서 영상과 소리는 어디로도 전송되지 않아요. AI 프로그램 파일만 처음에 공개 저장소에서 내려받아요.

처음에 왜 오래 걸리나요?

처음 한 번은 AI 모델을 내려받아요. 일반 컴퓨터(CPU) 기준 '빠름'은 약 80MB, '정확'은 약 240MB예요. 그래픽카드를 쓸 수 있는 브라우저에서는 훨씬 빠른 대신 파일이 조금 커요(빠름 약 160~200MB, 정확 약 290MB, 가장 정확 약 540MB). 한 번 받으면 같은 브라우저에서는 다시 받지 않아요.

한국어도 정확한가요?

모델마다 달라요. 공개 한국어 음성 15문장(약 2분 40초)으로 직접 재 보니, 틀린 글자 비율이 '빠름' 약 15%, '정확' 약 7%, '가장 정확' 약 3%였어요(또박또박 읽은 음성 기준이라, 잡음·사투리·빠른 말이 섞인 실제 영상은 더 틀릴 수 있어요). 그래서 한국어는 '정확'을 기본으로 했어요. 사람 이름·전문 용어·숫자는 자주 틀리니 저장 전에 꼭 한 번 훑어보세요.

긴 영상도 되나요?

돼요. 다만 속도는 컴퓨터마다 크게 달라요. 저희 테스트 컴퓨터에서 11분 영상은 그래픽카드를 쓰면 '정확'으로 약 1분 30초, 그래픽카드 없이(CPU) '빠름'으로 약 4분 걸렸어요. CPU로 '정확'을 쓰면 영상 길이만큼 걸릴 수 있어요. 영상 전체 소리를 메모리에 올려서 처리하므로 1시간이 넘는 영상이나 1GB가 넘는 파일은 브라우저가 멈추거나 실패할 수 있어요. 그럴 땐 'MP3 추출'로 소리만 뽑거나 영상을 나눠서 올려 주세요.

알아두면 좋은 팁