로컬 LLM 구축

맥에서 로컬 LLM 시작하기, 무엇을 받아서 어떻게 켜나

AI 로컬 LLM 2026. 8. 28. 17:11

내 컴퓨터에서 AI 모델을 직접 돌리는 것을 로컬 LLM이라고 한다. 인터넷이 끊겨도 되고, 요금이 안 나가고, 내 파일을 남의 서버에 안 올려도 된다.

맥이라면 생각보다 쉽다. 애플 실리콘은 CPU와 GPU가 메모리를 같이 쓰는 구조라 큰 모델을 올리기에 유리하다. 이 글은 처음 시작하는 순서와, 시작한 다음에 꼭 확인해야 할 것들을 적은 것이다.

필요한 건 메모리다

먼저 정리하면 이렇다. 성능을 정하는 건 메모리다. 모델을 통째로 메모리에 올려야 하기 때문이다.

기준은 간단하다. 내 맥의 메모리에서 몇 GB를 내줄 수 있는지가 고를 수 있는 모델의 크기다. 운영체제와 다른 앱이 쓸 몫을 빼고 남는 만큼이다.

우리 맥미니는 48GB인데, 26GB짜리 모델을 올려두고 나머지로 다른 일을 한다.

1. LM Studio를 깐다

명령줄로 하는 방법도 있지만 처음에는 LM Studio가 편하다. 앱을 깔고, 모델을 검색해서 받고, 채팅창에서 바로 써볼 수 있다.

받은 모델은 이렇게 쌓인다. 우리 목록이다.

크기가 성능이 아니라는 걸 먼저 알아두면 좋다. 목록에서 26B짜리가 22.79GB, 35B짜리가 26.23GB다. 매개변수가 9B 더 많은데 용량 차이는 3.4GB뿐이다. 어떻게 줄여 담았느냐에 따라 달라진다.

2. 어떤 크기를 받나

처음이라면 작은 것부터 받아서 켜지는지 보는 게 낫다. 목록의 4B짜리는 6.86GB다. 메모리 16GB 맥에서도 돌아간다.

  • 4B 안팎 (6~8GB) — 가볍게 켜진다. 요약이나 간단한 정리용
  • 26~35B (22~27GB) — 쓸 만해진다. 메모리 32GB 이상 권한다
  • 그 이상은 메모리 여유가 확실할 때

파일 이름에 4bit나 Q4 같은 표시가 있으면 줄여 담은 것이다. 같은 모델이라도 이런 표시에 따라 용량이 크게 달라지니 받기 전에 용량부터 본다.

3. 켠 다음 반드시 확인할 것

여기부터가 이 글에서 제일 중요하다. 모델을 올렸다고 끝이 아니다.

명령줄 도구가 같이 깔리는데, 지금 어떤 상태로 떠 있는지 한 줄로 보여준다.

~/.lmstudio/bin/lms ps

우리 출력이다.

CONTEXT 칸을 보라. 이게 모델이 한 번에 읽을 수 있는 글의 양이다. 여기가 작으면 긴 문서를 넣어도 앞이나 뒤가 잘린다. 모델은 잘렸다고 말해주지 않고 아는 만큼만 답한다. 그래서 "요약을 못 한다"처럼 보인다.

설정에 넣은 값과 실제로 뜬 값이 다를 수 있다. 우리는 26만을 넣었는데 13만으로 떠 있다. 메모리 사정을 보고 알아서 줄인 것이다. 설정만 바꾸고 넘어가면 안 되고 이 명령으로 실제 값을 봐야 한다.

이 얘기는 따로 자세히 적었다. LM Studio 컨텍스트 길이 제한, 26만 토큰 모델이 4096으로 돌고 있었다

4. 안 쓸 때는 내려놓는다

모델을 올려두면 그만큼 메모리를 계속 차지한다. 위 출력의 TTL 칸이 그것이다. 일정 시간 아무 요청이 없으면 알아서 내리도록 설정할 수 있다.

이걸 안 해두면 다른 작업을 할 때 메모리가 모자란다. 설정하는 방법은 여기에 정리했다. LM Studio 모델 자동 언로드 설정, GUI 로드 메모리 점유 해결

5. 다른 무거운 작업과 같이 돌리지 않는다

애플 실리콘은 CPU와 GPU가 같은 메모리를 나눠 쓴다. 장점이지만 함정이기도 하다.

모델을 올려둔 채로 영상 작업이나 이미지 생성을 같이 돌리면 한 통에서 두 몫을 꺼내 쓴다. 메모리가 모자라면 맥은 디스크를 대신 쓰는데, 그게 물리 메모리 크기만큼 차는 순간 프로세스를 아무 말 없이 종료한다. 에러도 로그도 안 남는다.

우리도 이걸로 몇 번 날렸다. 그 얘기는 여기에 있다. 맥미니 48GB, 스왑이 차면 프로세스가 소리 없이 죽습니다

속도는 어느 정도인가

35B 모델을 맥미니에서 돌렸을 때 초당 28.7토큰이 나왔다. 사람이 읽는 속도보다 빠르다. 대화용으로는 답답하지 않다.

다만 모델을 처음 올리는 데 시간이 걸린다. 26GB짜리가 10초쯤 걸렸다. 그래서 한 번 올려두고 계속 쓰는 게 맞고, 매번 껐다 켜면 그 시간을 반복해서 낸다.

정리

1. 메모리가 고를 수 있는 모델 크기를 정한다. 다른 것부터 보지 않는다

2. LM Studio로 작은 모델부터 켜본다

3. lms ps로 실제로 뜬 컨텍스트 값을 확인한다. 설정값과 다를 수 있다

4. 안 쓸 때 내려가게 해둔다

5. 무거운 작업과 동시에 돌리지 않는다

여기 나오는 용량과 숫자는 맥미니에서 실제로 찍은 값이다.

맥미니로 만드는 AI 홈서버 — 직접 돌려보고 씁니다