콘텐츠 생산 및 자동화

한국어 TTS 무료로 쓰기, 내 컴퓨터와 웹 서비스 뭐가 다른가

AI 로컬 LLM 2026. 9. 11. 13:06

무료 한국어 TTS를 찾아보면 목록이 쏟아진다. 문제는 목록이 없어서가 아니다. 고를 기준이 없어서 하나씩 눌러보다 시간을 날리는 것이다.

기준은 사실 세 개뿐이다. 순서대로 짚으면 답이 나온다.

갈림길 1. 목소리가 내 것이어야 하나

이게 첫 번째다. 여기서 길이 완전히 갈린다.

아니라면 선택지가 넓다. 안내 음성, 자막 읽기, 짧은 영상 내레이션처럼 "알아들을 수 있으면 되는" 경우가 여기다. 굳이 특정 목소리일 필요가 없다.

맞다면 선택지가 좁아진다. 내 목소리, 또는 특정한 누군가의 목소리여야 한다면 녹음을 넘겨야 한다. 그 녹음을 어디에 넘기느냐가 세 번째 갈림길이다.

갈림길 2. 설치가 부담스러운가

목소리를 안 가린다면 다음은 설치 문제다.

맥을 쓰고 있다면 설치할 게 없다. 한국어 목소리가 아홉 개 이미 들어 있다. 터미널에 한 줄이면 파일이 나온다.

say -v Yuna -o out.aiff "읽게 할 문장"

윈도우에도 비슷한 기능이 들어 있고, 웹 브라우저에도 들어 있다. 운영체제에 딸려 온 것부터 써보는 게 순서다. 이게 안 맞을 때 다음을 찾는 것이다.

더 자연스러운 소리가 필요하면 모델을 받아 돌린다. 대신 자리를 차지한다. 우리가 쓰는 모델은 디스크에서 4.6GB를 쓴다. 켤 때마다 메모리에 올리는 데 20초에서 30초가 걸린다.

갈림길 3. 내 녹음을 남의 서버에 올려도 되나

여기가 이 글에서 제일 중요하다.

목소리를 복제하려면 내 녹음을 줘야 한다. 웹 서비스를 쓴다는 것은 그 녹음을 남의 서버에 올린다는 뜻이다. 편하다. 설치도 없고 성능 좋은 기계도 필요 없다.

대신 한 번 올라간 것은 되돌릴 수 없다. 지웠다고 표시되는 것과 실제로 사라지는 것은 다르다. 그 서비스가 나중에 정책을 바꿀 수도 있고, 회사가 팔릴 수도 있고, 털릴 수도 있다.

목소리는 얼굴 사진과 다르게 취급받는 경향이 있는데, 실제 위험은 비슷하거나 더 크다. 십몇 초짜리 녹음이면 복제가 된다는 것이 이 시리즈의 요지다. 그 십몇 초를 남에게 맡기는 것이 이 선택이다.

내 컴퓨터에서 돌리면 녹음이 밖으로 안 나간다. 인터넷 연결도 필요 없다. 모델을 한 번 받아둔 뒤로는 비행기 모드에서도 돌아간다. 이게 설치 부담을 감수할 만한 이유다.

우리가 재본 것

맥미니에서 직접 잰 값이다. 웹 서비스 쪽은 안 써봐서 안 적는다.

  맥에 있는 목소리 내 컴퓨터에서 모델로
설치 없음 디스크 4.6GB
준비 시간 없음 첫 실행 20~30초
51자 만드는 시간 즉시 9.9초
인터넷 불필요 처음 받을 때만
비용 0원 0원
내 목소리 안 됨 됨

둘 다 공짜다. 돈이 아니라 시간과 자리를 쓰는 차이다.

안 해본 것은 안 해봤다고 적는다

이 글에 웹 서비스 순위표가 없는 이유가 있다. 우리가 안 써봤기 때문이다.

써보지도 않고 "A가 B보다 낫다"고 적는 글이 많다. 그런 글은 대개 서로를 베낀 것이라 실제로 써보면 안 맞는다. 우리는 돌려보고 잰 것만 적는다.

웹 서비스가 나쁘다는 말이 아니다. 판단 기준을 드릴 수 있을 뿐, 순위는 못 매긴다는 말이다. 위의 세 갈림길을 통과해서 웹 쪽으로 갔다면, 그때는 무료 한도와 개인정보 처리 방침 두 가지를 직접 확인하시는 게 맞다.

정리하면

  • 알아들을 수만 있으면 된다 → 운영체제에 있는 것부터. 설치도 돈도 안 든다
  • 더 자연스러워야 한다 → 모델을 받아 내 컴퓨터에서. 4.6GB와 20초를 내면 된다
  • 내 목소리여야 한다 → 녹음을 어디에 둘지부터 정한다. 밖으로 내보내지 않을 거면 로컬이 유일한 답이다

같이 보기

여기 나오는 숫자는 맥미니에서 직접 재서 적었다. 재보지 않은 것은 적지 않았다.

맥미니로 만드는 AI 홈서버 — 직접 돌려보고 씁니다