스피치랩(SpeechLab) — 내 목소리를 학습시켜 음성 합성
안녕하세요. 깍뚜기 머슴입니다. 이번에 새로 만든 스피치랩을 소개해 드릴게요.
영상 만드실 때 목소리 때문에 고생 많으셨죠. 유료 TTS는 글자 수마다 요금이 붙고, 길게 읽히면 중간에서 끊기고, 한 문장 고치자고 전체를 다시 뽑는 일이 흔했습니다. 스피치랩은 그 세 가지를 없애 보려고 만든 프로그램입니다.
원고를 넣으면, 등록해 둔 내 목소리로, 문장마다 음성 파일을 만들어 줍니다. 그 계산은 전부 여러분 컴퓨터 안에서 일어납니다.

1. 어떤 서비스인가요
스피치랩은 웹사이트가 아니라 Windows에 설치해서 쓰는 데스크톱 프로그램입니다. 설치하면 여러분 PC 안에서 작은 서버가 하나 돌고, 그 위에 작업 화면이 뜹니다.
원고.docx ──▶ A0823_0001.wav
A0823_0002.wav ← 파일 번호 = 원고 순서 그대로
A0823_0003.wav
A0823_full.wav · A0823_subtitle.srt · A0823_timeline.csv
제가 가장 신경 쓴 부분이 파일 번호입니다. 번호는 원고를 문장으로 나누는 순간 정해지고, 합성이 끝나는 순서와는 아무 상관이 없습니다. 7번이 3번보다 먼저 만들어져도 이름은 그대로예요. 그래서 편집 프로그램 타임라인에 폴더째 끌어다 놓으면 순서가 맞습니다.
합본 음성(_full.wav), 자막(_subtitle.srt), 타임라인(_timeline.csv)도 같이 나오니
자막을 따로 찍으실 필요도 없습니다.
이런 점을 자랑하고 싶습니다
| 🆓 음성 합성이 무료입니다 | 글자 수 요금도, 월 사용량 제한도 없습니다. 100자를 만들든 10만 자를 만들든 추가 비용이 0원입니다. 계산을 클라우드가 아니라 여러분 그래픽카드가 하기 때문입니다. |
| 🔒 원고가 밖으로 나가지 않습니다 | 아직 공개하지 않은 대본, 회사 자료, 개인 이야기… 인터넷으로 전송되지 않습니다. 녹음한 목소리 파일도 마찬가지고요. |
| 🎙️ 내 목소리로 읽어 줍니다 | 20~30초 녹음 한 번이면 끝입니다. 그다음부터는 원고만 넣으면 됩니다. |
| ✏️ 마음에 안 드는 문장만 다시 | 전체를 다시 만들지 않습니다. 그 한 줄만 고쳐서 다시 만들면 파일 하나만 바뀝니다. |
| 💾 껐다 켜도 이어서 | 어디까지 했는지 프로그램이 알아서 기억합니다. 이미 만든 문장은 다시 만들지 않습니다. |
| 🔄 업데이트는 알림으로 | 새 버전이 나오면 프로그램 안에 알림이 뜹니다. 버튼 한 번이면 갱신되고, 만들어 둔 목소리와 프로젝트는 그대로 남습니다. |
2. 누가 쓰면 좋을까요
- 유튜브 정보·강의 채널을 운영하시는 분 — 매주 원고 분량이 나오는데 TTS 요금이 부담되셨던 분
- 본인 목소리로 영상을 만들고 싶지만 녹음이 힘드신 분 — 목이 아프거나, 조용한 시간을 못 내거나, 발음 실수로 몇 번씩 다시 찍으셨던 분
- 긴 원고를 다루시는 분 — 오디오북, 강의 녹음, 낭독 콘텐츠처럼 한 번에 수십 분씩 뽑아야 하는 작업
- 원고를 밖에 내보내기 어려운 분 — 미공개 대본, 내부 교육 자료, 개인적인 글
- 수정이 잦은 분 — "이 문장만 다시" 가 자주 생기는 작업
반대로 NVIDIA 그래픽카드가 없는 컴퓨터를 쓰신다면 아직은 권해 드리기 어렵습니다. 그래서 사기 전에 확인하실 수 있게 사양 확인 프로그램을 따로 만들어 두었어요 (아래 4번).
3. 어떻게 쓰나요
목소리를 한 번 등록해 두면, 그다음부터는 원고만 올리시면 됩니다.
① 로그인 — 엔라이트랩 회원분들만 쓸 수 있습니다.

프로그램을 켜면 로그인 화면이 뜹니다. 허브에서 쓰시던 그 계정 그대로예요. 구글 계정으로도, 이메일·비밀번호로도 들어오실 수 있습니다. 별도 회원가입은 없습니다.
② 목소리 등록 — 짧은 녹음 하나와, 읽은 문장

조용한 곳에서 20~30초쯤 아무 문장이나 또박또박 읽어 녹음해 주세요. 그 파일을 올리고, 녹음하면서 읽은 문장을 글자 하나 틀리지 않게 적어 주시면 됩니다.
이 전사(轉寫)가 정말 중요합니다. 여기가 틀리면 발음이 흔들려요. 목소리는 여러 개 등록해 두고 프로젝트마다 골라 쓰실 수 있습니다.
③ 원고 올리기 — txt · md · docx

파일을 끌어다 놓거나, 창에 직접 붙여 넣으셔도 됩니다. 빈 줄이 없어도 문장이 끝나면 그때마다 나눕니다. 한 문장이 음성 파일 하나가 돼요. 제목(Heading)은 기본적으로 읽지 않고 문단 경계로만 쓰는데, 원하시면 「제목도 소리내어 읽기」를 켜시면 됩니다.
합성 설정에서 이런 것들을 조절하실 수 있습니다.
- 말하기 빠르기 — 0.85배 ~ 1.16배 (기본 5단계)
- 문장 앞뒤 무음 다듬기 — 앞뒤로 붙는 여백을 잘라 냅니다
- 문장 사이 간격 — 초 단위로 직접
- 문장 중간 긴 침묵 줄이기
- 발음 사전 —
pronounce.csv에 「원문, 읽기」 두 칸으로 적어 두시면 그대로 읽습니다 (숫자·영어·전문 용어에 유용해요) - 저장 위치 — 작업용 드라이브로 바꿔 두시면 매번 복사하지 않으셔도 됩니다
④ 듣고, 고치고, 그 문장만 다시

처음 켜시면 「사용 안내」 가 네 걸음으로 짚어 드립니다 — 목소리 등록 → 원고 올리기 → 문장 하나만 먼저 만들어 보기 → 들어보고 고치기. 상단의 「사용 안내」 버튼으로 언제든 다시 보실 수 있어요.
문장 목록에서 「전체 합성」·「남은 것만 합성」·「체크한 것만 합성」 중에 고르시면 됩니다. 만들어진 문장은 바로 들어 보실 수 있고요.
어색한 데가 있으면 그 줄의 글자를 고치고 다시 만들면 됩니다. 원본 원고 파일은 건드리지 않습니다. 수정본은 따로 보관돼요. 다 고치신 뒤에 「수정한 원고 내보내기」를 누르시면 최종본을 받으실 수 있습니다.
마지막으로 「저장 폴더 열기」를 누르시면 번호 순서대로 정렬된 wav 파일들과 합본·자막·타임라인이 기다리고 있습니다. 편집 프로그램에 그대로 얹으세요.
4. 설치 전에 꼭 확인해 주세요
솔직하게 말씀드릴게요. 이 프로그램은 가리는 게 좀 있습니다. 계산을 클라우드에 맡기지 않고 여러분 컴퓨터에서 하기 때문입니다.
- NVIDIA 그래픽카드가 필요합니다. GTX 1660(6GB) 정도면 돌아갑니다. 성능이 좋을수록 빨라져요.
- Windows 10 / 11 에서 돕니다.
- 설치 중에 2GB 정도를 인터넷으로 더 받습니다. 설치 파일 자체는 작지만, 필요한 것을 그때 받아 갖춥니다.
- 처음 음성을 만들 때 2.4GB 를 한 번 더 받습니다. 음성 모델입니다. 그 뒤로는 다시 받지 않습니다.
- 「Windows의 PC 보호」 창이 뜰 수 있습니다. 「추가 정보」 → 「실행」 을 누르시면 이어집니다. 아직 코드 서명 인증서를 사지 않아서 뜨는 안내예요. 죄송합니다.
💡 구 전에 확인하세요. 상품 페이지의 「내 컴퓨터 확인하기」 버튼을 누르시면
스피치랩-사양확인.exe를 받으실 수 있습니다. 설치할 필요 없이 두 번 누르면 그래픽카드·저장 공간·연결 상태를 한 번에 살펴보고 브라우저에 결과를 띄워 줍니다. 맨 위 한 줄만 보시면 돼요. 「넉넉하게 쓰실 수 있습니다」·「쓰실 수 있습니다」 면 괜찮고, 「많이 느립니다」·「어렵습니다」 면 구매를 다시 생각해 주세요. 컴퓨터 정보를 밖으로 보내지 않습니다. 로그인도 필요 없습니다.

5. 이용 방법
- 엔라이트랩 허브에서 스피치랩 30일 이용권을 구매합니다
- 대시보드 → 스피치랩 카드 → 「스피치랩 다운로드」
- 설치 후, 본인 엔라이트랩 계정으로 로그인하면 바로 쓰실 수 있습니다
이용권은 프로그램을 켜고 합성을 시작할 때 서버에 한 번 확인합니다. 합성 자체에는 요금이 붙지 않습니다. 이용권 기간 안에서는 얼마든지 만드세요.
6. 무엇으로 만들었나요
궁금해하시는 분들이 계셔서 적어 둡니다. 전부 공개된 도구들입니다.
| 역할 | 쓴 것 |
|---|---|
| 음성 합성 모델 | Qwen3-TTS-12Hz-0.6B-Base (qwen-tts) · float32 · sdpa |
| 딥러닝 | PyTorch · torchaudio |
| 서버 | FastAPI + uvicorn (여러분 PC 안에서만 돕니다) |
| 데스크톱 창 | pywebview (Windows 내장 WebView2 사용) |
| 음성 파일 처리 | soundfile · numpy |
| 원고 읽기 | python-docx (txt · md 는 자체 리더) |
| 언어 | Python 3.12 |
| 확인 | pytest · httpx — 단위·통합 테스트 346개, 전체 흐름 확인 54개 |
모델 파일은 프로그램 폴더 안 .models/ 에 받습니다. 그 밖으로 나가지 않습니다.
서버 코드에서 torch 를 아는 파일은 딱 하나(engine.py)로 묶어 두었는데,
덕분에 테스트 346개가 그래픽카드 없이도 돕니다. 이런 게 개발자의 소소한 자랑입니다. 😄
7. 지금까지의 업데이트
v0.1.8 (2026-08-25) — 최신
- ⚡ 여러 문장을 한 번에 만들어 훨씬 빨라졌습니다. 그래픽카드에 여유가 있을수록 차이가 큽니다.
- ✂️ 문장 하나가 음성 파일 하나가 됩니다. 빈 줄이 없어도 문장이 끝나면 나눕니다.
- 📦 설치할 때 필요한 것을 스스로 갖춥니다 — 파이썬과 화면 표시 구성요소를 확인하고 없으면 받습니다.
- 📝 설치가 실패하면 그 이유를 기록으로 남겨, 무엇이 문제였는지 알 수 있습니다.
- 🐞 RTX 30 계열 이상에서 첫 합성이 실패하던 문제를 고쳤습니다.
- 🔄 새 버전이 나오면 프로그램 안에서 알려 드리고, 버튼 한 번으로 갱신됩니다.
v0.1.0 (2026-08-24) — 첫 배포
- 🎙️ 내 목소리를 등록하고 원고를 넣으면 음성 파일을 만듭니다.
- 🔑 엔라이트랩 회원 계정으로 로그인해 사용합니다.
8. 자주 묻는 것
Q. 정말 음성 합성이 공짜인가요? 네. 이용권 기간 동안 만드시는 음성에는 분량 요금이 없습니다. 계산을 여러분 그래픽카드가 하니까요. 대신 전기와 시간은 쓰십니다. 😅
Q. 인터넷이 없어도 되나요? 합성 자체는 인터넷 없이 됩니다. 다만 설치할 때, 처음 모델을 받을 때, 그리고 이용권을 확인할 때는 연결이 필요합니다.
Q. 목소리를 여러 개 쓸 수 있나요? 네. 「목소리 관리」 탭에서 여러 개 등록해 두고 프로젝트마다 골라 쓰시면 됩니다.
Q. 얼마나 걸리나요? 그래픽카드에 따라 다릅니다. 사양 확인 프로그램이 대략의 예상 시간까지 알려 드려요.
Q. 만들던 작업을 중간에 멈춰도 되나요? 됩니다. 프로그램을 껐다 켜도 이미 만든 문장은 그대로 있고, 「남은 것만 합성」을 누르시면 이어집니다.
앞으로도 편하게 쓰실 수 있도록 계속 다듬어 가겠습니다. 🙏 불편한 점이나 아쉬운 점은 언제든 알려 주세요.