이 글에는 쿠팡 파트너스 링크가 있으며, 구매 시 일정액의 수수료를 받습니다.
소형 AI 모델 홈서버 활용법, 2~4GB 모델로 OCR·요약·번역 돌리기
2~4GB짜리 소형 AI 모델을 저전력 홈서버에 올려 24시간 돌리며 실제로 쓰는 방법을 정리했습니다. Zero to MVP 채널의 화자가 보여준 네 가지 쓰임새(스캔 문서 인식, 글 요약, 의료 문서 이해, 외국어 번역)를 옮기고, 같은 구성을 직접 만들려는 사람을 위해 모델 이름과 설치 명령, 폴더 감시 번역 스크립트 예시를 덧붙였습니다.

의료 문서 이해 항목은 의학적 진단이 아닙니다. 증상이나 검사 결과에 대한 판단은 반드시 의사와 상의하세요.
먼저, 이건 가이드가 아니다
화자가 9분 5초짜리 영상의 시작 1분 안에 두 번 선을 긋습니다. "이건 어떤 보편적 가이드(universal guide)가 되려는 게 아니다." "그냥 내 경험을 보여주고 싶다. 내가 소형 모델을 어떻게 쓰고 뭐가 나한테 제일 잘 맞는지." 당신의 경우엔 쓰는 방식이 다를 수 있고, 어쩌면 더 최적일 수도 있다는 말도 붙입니다.
작은 모델이라는 점도 감추지 않습니다. 이것들은 여전히 작은 모델이고, 쓰는 데는 그 나름의 특성이 따라붙는다는 전제를 먼저 깔고 시작합니다.
소형 AI 모델을 어디서 돌리나: 전력 효율이 먼저인 홈서버
화자가 소형 모델에 건 요구 조건은 하나입니다. 항상 켜져 있고 백그라운드에서 돌아갈 것. 그래서 로컬 네트워크에 물린 홈서버에서 돌립니다.
여기서 중요한 단서가 붙습니다. 화자가 말하는 홈서버는 최신 그래픽카드를 단 극강 성능 컴퓨터가 아닙니다. 전기요금을 미친 듯이 내지 않고도 계속 켜 둘 수 있는 에너지 효율형 기기입니다. 기기는 2세대 ZimaCube(IceWhale의 가정용 서버 겸 NAS)입니다.
화자가 이 기기를 좋아하는 이유는 낮은 소비전력 말고도 하나 더 있습니다. 역할 두 개를 겸한다는 점입니다.
- 홈서버
- 네트워크 스토리지(NAS, 네트워크로 연결해 쓰는 저장장치): 드라이브 슬롯이 아주 많아서 모델이 쓸 데이터를 대량으로 쌓아둘 수 있다
사양·가격·실측 소비전력은 영상에서 말하지 않습니다.
쓰임새 ① 스캔 문서를 마크다운으로: GLM-OCR (약 2GB)
첫 번째는 스캔 문서 인식입니다. 화자는 자기가 직접 만든 프로그램으로 텍스트를 인식하고 그걸 마크다운(제목·목록 같은 서식을 기호로 표시하는 텍스트 형식)으로 변환합니다. 이 프로그램은 완전 무료이고 GitHub에 올려뒀으니 직접 만져봐도 된다고 말합니다. 저장소 주소는 영상 음성에 나오지 않아 설명란을 봐야 합니다.
핵심은 모델 쪽입니다. GLM-OCR이라는 소형 전용 모델이고 크기는 약 2GB. 복잡한 문서를 인식하도록 설계된 모델이라고 소개합니다. 크기가 작아서 기기에 부하를 거의 안 주고 잘 돌아간다는 게 화자 설명입니다.
화자가 보여준 실행 순서
- 자기 프로그램을 실행한다
- 프로그램에 "홈서버에서 돌고 있는 모델을 쓰라"고 지정한다
- 시연용으로 5페이지 PDF를 선택한다. 테스트 파일이지만 여러 페이지와 서식 처리 능력을 보여주기엔 충분하다고 말한다
- 인식을 시작한다
확인 포인트는 처리 중의 시스템 부하입니다. 화자가 실행 중에 모니터를 띄워 보여주는데, CPU 코어 두 개만 실제로 쓰이고 나머지는 다른 작업용으로 남아 있습니다. 메모리도 절반 이상 비어 있고요.
결과는 이렇습니다. 모델이 작고 서버 자원이 충분해서 처리가 꽤 빠르게 끝났고, 오류 없이 완료됐으며 모든 페이지에서 텍스트가 온전히 인식됐습니다.
큰 범용 모델로 하면 어떻게 되나
같은 작업을 Gemma 4 26B 또는 31B 파라미터 모델로도 할 수 있습니다. 파라미터(모델 크기를 나타내는 수치, 클수록 무겁다)가 그만큼 크면 시스템 부하가 수십 배 높아지고, 화자의 서버에서는 아마 아예 돌지도 않을 거라고 말합니다. 작은 전용 모델이 이런 종류의 작업을 아주 잘 처리하면서 시스템에는 부하를 거의 안 준다는 것. 이 대목이 영상 전체의 논지입니다.
쓰임새 ② 관심 주제 새 글 자동 요약: Qwen3.5 4B (약 3GB)
두 번째는 관심 주제 글의 요약입니다. 매일 엄청난 수의 새 글이 올라오는데 전부 읽을 시간이 없다는 게 출발점입니다.
돌아가는 방식은 이렇습니다. 화자가 팔로우하는 소스에 새 글이 뜨면, 그 글이 서버의 로컬 모델로 넘어가 요약과 핵심 포인트 추출을 거칩니다. 화자는 그 짧은 요약만 읽습니다.
쓰는 모델은 Qwen3.5 4B 파라미터 버전입니다. 이 작업에는 그 정도면 차고 넘친다고 하고, 크기가 3GB를 조금 넘는 수준이라 홈서버에서 아주 잘 돈다고 덧붙입니다.
전체 분석 과정은 자동화돼 있고, 시연에서만 수동으로 돌려 보여줍니다. 스크립트는 두 개입니다.
- 스크립트 1: 글의 본문 텍스트를 가져온다
- 스크립트 2: 그 텍스트를 모델에 보내고 결과를 받아온다
여기서도 확인 포인트는 부하입니다. 새 탭에서 시스템 모니터를 보여주는데 메모리도 CPU 코어도 여유가 남아 있습니다. 분석 전체는 글 크기에 따라 몇 분 걸리고, 하루에 분석할 글이 그렇게 많지 않아서 이 속도면 충분하다고 말합니다.
쓰임새 ③ 의료 문서·이미지 이해: 구글의 의료 특화 모델
세 번째는 본인과 가족의 의료 정보를 다루는 일입니다. 이걸 로컬로 돌리는 이유를 화자가 분명히 밝힙니다. 이 정보가 비공개로 남길 바라지, 나중에 누군가에게 팔아넘길 가능성이 큰 어느 기업의 서버에 저장되는 건 싫다는 겁니다.
쓰는 모델은 구글이 만든 의료 특화 모델 MedGemma입니다. 화자가 꼽는 장점은 크기가 작은데도 의료 텍스트뿐 아니라 이미지까지 다룬다는 점입니다.
쓰는 경우는 두 가지입니다.
- 의료 문서를 이해해야 할 때. 예를 들어 검사 결과나 의료 이미지
- 궁금한 의료 관련 질문이 있을 때
화자가 곧바로 단서를 붙입니다. 이런 모델은 의사를 완전히 대체하지 않습니다. 그의 용도는 세부 내용을 더 잘 파악해 두고, 필요할 때 진료 방문을 준비하는 것입니다. "무슨 일이 벌어지고 있는지는 모델이 이해를 돕고, 그래서 뭘 할지는 의사와 의논한다."
쓰임새 ④ 외국어 글 자동 번역: 폴더 감시 방식
네 번째는 번역입니다. 화자가 팔로우하는 소스 중에는 자기가 못 읽는 언어로 글을 내는 곳이 있습니다. 그래서 그 글들은 자동으로 번역되고, 번역된 뒤에는 요약을 만들거나 흥미로우면 그냥 읽습니다.
번역에도 앞서 나온 Qwen3.5 4B 모델을 씁니다. 파라미터가 40억뿐인데도 번역을 훌륭하게 해낸다는 게 화자 평가입니다.
구조는 폴더 두 개가 전부다
- Input 폴더: 원본 글을 넣는 곳
- Output 폴더: 번역된 글이 저장되는 곳
Input 폴더는 스크립트가 감시하고 있고, 새 파일이 나타나는 순간 자동으로 번역이 시작됩니다. 이 과정도 평소엔 화자 개입 없이 돌아가고, 시연에서만 수동으로 보여줍니다.
시연 순서
- 일본어로 쓰인 글을 하나 고른다. AI와 언어 모델에 관한 글이라 읽고 싶었다고 말한다
- Output 폴더도 함께 열어둔다. 실시간으로 뭐가 바뀌는지 보기 위해서다
- 일본어 글을 Input 폴더에 넣고 기다린다
확인 포인트는 소요 시간입니다. 글 크기에 따라 수십 초에서 수 분 사이라고 합니다. 창고방에 놓인 ZimaCube가 이걸 문제없이 처리합니다. 잠시 뒤 Output 폴더에 번역본이 나타났고, 열어보니 영어로 번역돼 있었습니다.
화자가 실제로 권한 것: 소형 모델은 다르게 써라
먼저 태도. 소형 모델을 "큰 모델의 작고 조금 약한 버전"으로 생각하지 말라는 것. 화자 의견으로는 접근 방식 자체가 달라야 합니다.
소형 모델이 가장 잘 도는 조건은 이렇습니다.
- 좁고 분명하게 정의된 작업(narrow, clearly defined tasks)
- 작은 입력(a small input)
- 하나의 특정한 동작(a specific operation)
- 엄격하게 정해진 출력 형식(a strictly defined output format)
- 여기에 더해, 결과를 자동으로 검증할 수 있으면 더 좋다
이어서 소형 모델이 특히 효과적인 경우를 나열합니다.
- 모든 것이 완전히 로컬에 남고 비공개여야 할 때
- 인터넷 연결 없이 동작할 능력이 필요할 때
- 저전력 하드웨어에서 돌리고 싶을 때
- 단순한 요청을 대량으로 처리해야 할 때
- 비용을 최소화하고 싶을 때, 그리고 좁은 전문화가 필요할 때
- 백그라운드에서 계속 돌려두고 싶을 때
마지막은 채널 구독과 뉴스레터 안내입니다. 링크는 설명란에 있다고 말합니다.
영상에 없는 배경 (편집자 정리)
여기부터는 영상에서 다루지 않은 내용입니다. 실제로 따라 해보려면 알아야 하는 것들을 따로 정리했습니다. 화자가 어떤 실행 도구를 쓰는지는 영상에 나오지 않아, 가장 흔한 Ollama(내 컴퓨터에서 AI 모델을 내려받아 돌리는 무료 프로그램)를 기준으로 적었습니다.
준비물
- 늘 켜 둘 수 있는 컴퓨터 한 대: 저전력 미니 PC, NAS, 안 쓰는 노트북 모두 됩니다. 아래 모델들은 수 GB 크기라 메모리가 넉넉하면 그래픽카드 없이도 돌아갑니다(속도는 기기에 따라 다름).
- 저장공간: 모델 하나당 수 GB.
- 같은 공유기에 물린 다른 컴퓨터: 서버에 파일을 넣고 결과를 보는 용도.
Ollama 설치와 모델 받기
리눅스 기반 서버라면 터미널에서 아래 한 줄로 설치합니다. 맥·윈도우는 ollama.com에서 설치 파일을 받습니다. NAS 전용 운영체제라면 제조사 앱 목록에 Ollama가 있는지 먼저 확인하세요.
curl -fsSL https://ollama.com/install.sh | sh
영상의 모델들은 Ollama 공식 라이브러리에 비슷한 이름으로 올라와 있습니다.
ollama pull glm-ocr
ollama pull qwen3.5:4b
ollama pull medgemma
ollama list를 치면 받은 모델과 크기가 보입니다.
다른 컴퓨터에서 서버 모델 쓰기
화자처럼 "홈서버에서 돌고 있는 모델을 쓰라"고 지정하려면, 서버의 Ollama가 공유기 안 다른 기기의 요청을 받게 열어야 합니다. 리눅스에서 Ollama를 서비스로 설치했다면 sudo systemctl edit ollama로 설정 파일을 열어 아래 두 줄을 넣고 sudo systemctl restart ollama로 다시 시작합니다.
[Service]
Environment="OLLAMA_HOST=0.0.0.0"
이제 같은 공유기 안에서는 http://서버IP:11434 주소로 모델을 부를 수 있습니다. 이 주소를 인터넷에 그대로 열지는 마세요.
폴더 감시 번역 스크립트 예시
화자의 스크립트가 아니라 같은 구조를 편집자가 최소한으로 만든 예시입니다. 서버에서 input, output 폴더를 만들고, 파이썬 라이브러리 requests를 설치(pip install requests)한 뒤 실행합니다. input 폴더에 .txt 파일을 넣으면 10초 안에 번역을 시작합니다.
import time, pathlib, requests
IN = pathlib.Path("input")
OUT = pathlib.Path("output")
OUT.mkdir(exist_ok=True)
done = set()
while True:
for f in IN.glob("*.txt"):
if f.name in done:
continue
text = f.read_text(encoding="utf-8")
r = requests.post("http://localhost:11434/api/generate", json={
"model": "qwen3.5:4b",
"prompt": "다음 글을 한국어로 번역해. 번역문만 출력해.\n\n" + text,
"stream": False,
"think": False,
})
(OUT / f.name).write_text(r.json()["response"], encoding="utf-8")
done.add(f.name)
time.sleep(10)
요약용으로 바꾸려면 prompt 문장만 "다음 글을 핵심 3줄과 한 문단 요약으로 정리해"처럼 고치면 됩니다. 화자가 말한 조건(좁은 작업, 정해진 출력 형식)을 그대로 적용한 셈입니다.
막히는 지점
- 모델이 느리다: 메모리가 부족하면 디스크를 오가며 느려집니다. 동시에 모델을 여러 개 올리지 말고 하나씩 씁니다.
- 긴 글에서 번역이 끊긴다: 소형 모델은 긴 입력에 약합니다. 화자 말대로 입력을 작게, 문단 단위로 나눠 넣습니다.
- 다른 컴퓨터에서 접속이 안 된다:
OLLAMA_HOST설정 후 재시작했는지, 서버 방화벽이 11434 포트를 막고 있지 않은지 확인합니다.
판단 기준
사람이 바로 읽고 판단하는 긴 대화, 어려운 추론은 클라우드 대형 모델이 낫습니다. 소형 모델은 반복되고 형식이 정해진 일, 밖으로 내보내기 싫은 자료, 밤새 조용히 돌려야 하는 일에 맡길 때 값을 합니다. 의료 문서 해석처럼 틀리면 곤란한 일은 결과를 참고로만 쓰고 전문가 확인을 거쳐야 합니다.
자주 묻는 질문
소형 AI 모델은 어떤 컴퓨터에서 돌릴 수 있나요?
화자는 그래픽카드 없는 저전력 홈서버(ZimaCube)에서 2~4GB 모델을 돌렸습니다. 모델이 수 GB 크기라 메모리가 넉넉한 미니 PC나 NAS에서도 돌아가지만, 속도는 기기 성능에 따라 다릅니다.
소형 AI 모델로 번역이 잘 되나요?
화자는 40억 파라미터인 Qwen3.5 4B로 일본어 글을 영어로 훌륭하게 번역했다고 평가했습니다. 다만 긴 글은 나눠 넣고, 중요한 문서는 사람이 결과를 확인하는 편이 안전합니다.
로컬 AI로 의료 문서를 해석해도 되나요?
화자는 구글의 의료 특화 모델을 검사 결과 이해와 진료 준비용으로만 쓰고, 무엇을 할지는 의사와 상의한다고 했습니다. 모델의 해석은 진단이 아니며, 증상이 계속되거나 결과가 걱정되면 진료를 받아야 합니다.
스캔 문서 OCR에는 어떤 모델을 쓰나요?
화자는 약 2GB 크기의 GLM-OCR을 썼고, 5페이지 PDF를 CPU 코어 두 개만으로 오류 없이 인식했습니다. 같은 일을 Gemma 4 26B나 31B 같은 큰 범용 모델로 하면 부하가 수십 배 높아진다고 했습니다.
이 글은 영어 음성 STT 기반(자동 자막 없음)으로 정리했고 화면은 대조하지 못했습니다. 음성 인식 표기는 "Zima Q"·"Zima Qube"(ZimaCube), "GLM OCR"(GLM-OCR), "Quen 3.5"·"Quent 3.5"(Qwen3.5), "MatchGemma"(MedGemma)였고, "Gemma 4"는 들린 그대로 적었습니다.
출처: youtube.com/…