쓸모 쓸모연구소 · 실전 노트
제 217 호이번 주 새 글 91 편2026 · 09 · 28
AI 업무 자동화
콜리브리

이 글에는 쿠팡 파트너스 링크가 있으며, 구매 시 일정액의 수수료를 받습니다.

그래픽카드 없이 AI 모델 돌리기, 무료 엔진 콜리브리 설치와 사용법

그래픽카드 없이 초대형 AI 모델을 노트북에서 돌린다는 무료 엔진 "콜리브리"가 어떤 원리로 동작하고, 실제로 설치해 쓰려면 무엇이 필요한지 정리했습니다. 숏픽 채널의 56초 쇼츠가 말한 여섯 단계를 순서대로 옮기고, 영상이 말하지 않은 배포 주소, 실제 명령어, 속도와 저장공간 조건은 공개 저장소 문서를 기준으로 채웠습니다.

그래픽카드 없이 AI 모델 돌리기, 무료 엔진 콜리브리 설치와 사용법 삽화
삽화 · 쓸모연구소

그래픽카드 없이 AI 모델을 돌린다는 주장

숏픽 채널의 56초짜리 쇼츠입니다. 주장은 한 문장으로 끝납니다. 그래픽카드가 하나도 없는 노트북이 세계 최대급 모델을 끝까지 돌렸고, 그걸 해낸 건 콜리브리라는 작은 엔진이며, 누구나 공짜로 가져다 쓸 수 있다. 아래 절차 설명은 화자의 말이고, 제가 직접 돌려 본 결과가 아닙니다.

화자가 뒤집었다고 말하는 통념

"덩치 큰 모델을 돌리려면 비싼 그래픽 카드가 꼭 있어야 한다." 이 말을 뒤집었다는 게 화자의 출발점입니다. 누가 만들었는지는 말하지 않고 "이 사람"이라고만 합니다.

영상에서 "오픈소스"라는 단어는 쓰지 않았습니다. 화자가 쓴 표현은 "누구나 공짜로 가져다 쓸 수 있다", 그리고 "값은 0원"입니다.

작동 방식: 필요한 조각만 램에 올린다

원리 설명은 이렇습니다. 덩치가 큰 모델도 한 마디를 만들 때 실제로 깨우는 건 아주 작은 조각이다.

그래서 늘 쓰이는 알맹이 10GB 정도만 램에 올려두고, 나머지는 하드에 눕혀 둡니다. 화자가 붙인 비유는 스트리밍입니다. 영화를 다 받지 않고 보는 방식과 같다는 겁니다.

화자가 내세운 포인트는 네 개입니다.

  • 램에 상주하는 크기: 약 10GB
  • 모델 파일 크기: 370GB
  • 비용: 0원
  • 그래픽카드: 불필요

전문 용어는 영상에 나오지 않습니다. 풀어 쓰면 이 방식은 MoE(전문가 혼합, 질문마다 모델의 일부 전문가 조각만 골라 쓰는 구조) 모델에서, 당장 필요한 조각만 저장장치에서 꺼내 읽는 오프로딩(메모리에 다 못 올리는 부분을 디스크에 두고 필요할 때 불러오는 방식)입니다.

화자가 말한 절차: 여섯 단계

영상이 발화로 짚은 동작을 순서대로 옮깁니다. 각 단계 아래에 공개 저장소 기준으로 실제 할 일을 붙였습니다.

1단계. 콜리브리를 내려받는다

배포 파일을 내려받습니다. 받는 주소는 영상에 나오지 않습니다. 설명과 일치하는 프로젝트는 GitHub의 JustVugg/colibri 저장소이고, 저장소의 Releases(배포판) 메뉴에서 운영체제별 압축 파일을 받습니다. 리눅스·맥·윈도우용이 따로 있습니다.

  • 확인: 내 컴퓨터에 압축 파일 1개가 저장된다.

2단계. 압축을 푼다

"그냥 내려받아 압축만 풀면 설치라고 할 것도 없이 준비는 그걸로 끝." 별도 설치 과정은 없다는 것이 화자의 설명입니다.

  • 확인: 폴더가 하나 생기고, 그 안에 실행 파일이 보인다.

3단계. 모델 파일을 준비한다

"모델 하나뿐인데 크기가 370GB."

  • 확인: 저장장치에 370GB짜리 파일이 자리 잡는다.
  • 모델 이름과 받는 곳은 영상에 없습니다. 저장소 README 기준으로는 GLM-5.2라는 초대형 MoE 모델을 콜리브리용으로 변환한 파일이고, 허깅페이스(AI 모델 공유 사이트)에서 받습니다. README에 적힌 크기는 약 372GB입니다.
  • 이 파일이 없으면 다음 단계로 못 넘어갑니다.

4단계. 대화 모드로 써 본다

채팅창에 실행 한 줄을 칩니다. 자막 발화를 그대로 옮기면 이렇습니다.

프롬프트
콜리브리
  • 확인: 인터넷 없이도 바로 대화가 된다.

실제 명령은 저장소 README 기준으로 아래와 같습니다. /경로/모델폴더에는 3단계에서 받은 모델 폴더 위치를 넣습니다.

명령어
COLI_MODEL=/경로/모델폴더 ./coli chat

5단계. 서버 모드로 연다

같은 명령 뒤에 "서브"를 붙입니다.

프롬프트
콜리브리 서브
  • 확인: 내 컴퓨터 안에 주소가 열린다.

실제 명령은 serve입니다. README에는 기본 포트가 8000이라고 적혀 있습니다.

명령어
./coli serve --model /경로/모델폴더

6단계. 내 코드에 연결한다

기존 코드에서 한 줄을 그 주소로 갈아끼웁니다. 화자 말로는 "그대로 돌아간다". 기존 코드를 고치지 않고도 동작한다는 뜻입니다.

어떤 줄인지는 영상에 없지만, README는 서버가 OpenAI 호환 API(오픈AI와 같은 요청 형식을 받는 주소)라고 안내합니다. 오픈AI 파이썬 라이브러리를 쓰는 코드라면 보통 주소 부분만 바꾸면 됩니다.

프롬프트
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")

모델 이름 등 나머지 값은 README의 예시를 따릅니다.

화자가 실제로 권한 것

끝에 요청이 하나 있습니다. "댓글에 노트북이라고 남겨 주세요." 그 외에 시청자에게 시킨 행동은 없고, 어디서 받으라는 안내도 발화로는 없었습니다.

영상에 없는 배경 (편집자 정리)

여기부터는 영상에서 다루지 않은 내용입니다. 실제로 따라 해보려면 알아야 하는 것들을 따로 정리했습니다. 숫자는 글 작성 시점 저장소 README 기준이고, 버전이 바뀌면 달라질 수 있습니다.

준비물

  • 저장공간: 모델 파일만 약 372GB. 다운로드 중 임시 파일까지 생각하면 그보다 넉넉하게 비어 있는 SSD가 필요합니다. README는 빠른 NVMe SSD(최신 고속 SSD 규격)를 권합니다.
  • 램: README의 최소 사양은 16GB, 여유 있게는 24GB입니다.
  • 그래픽카드: 필요 없습니다. 있으면 선택적으로 쓸 수 있다고 적혀 있습니다.
  • 라이선스: Apache 2.0(상업적 이용도 허용하는 오픈소스 라이선스)입니다.

가장 중요한 조건: 속도

영상이 말하지 않은 부분이 여기입니다. README에 적힌 속도는 램 25GB급 기본 환경에서 초당 0.05~0.1토큰, 램 128GB 데스크톱에서 초당 약 1.8토큰입니다. 토큰은 대략 단어 조각 하나라고 보면 됩니다. 한 문장을 받는 데 몇 분이 걸릴 수 있다는 뜻입니다.

그러니 "돌아간다"와 "쓸 만하다"는 다릅니다. 실시간 대화나 코딩 보조로 쓰기보다는, 초대형 모델을 내 컴퓨터에서 오프라인으로 시험해 보는 용도에 가깝습니다.

막히는 지점

  • 실행 권한 오류(맥·리눅스): 압축을 푼 폴더에서 chmod +x coli를 한 번 실행합니다.
  • 맥에서 "확인되지 않은 개발자" 경고: 시스템 설정 > 개인정보 보호 및 보안 아래쪽에서 "그래도 열기"를 누릅니다. 출처를 확인한 파일에만 하세요.
  • 너무 느리다: 모델을 외장 하드나 느린 SATA SSD에 두면 더 느려집니다. 내장 NVMe SSD로 옮깁니다.
  • 디스크가 꽉 찬다: 다운로드 중간 파일까지 합치면 공간이 더 필요합니다. 받기 전에 여유 공간을 확인합니다.

대안: 작은 모델을 빠르게

그래픽카드 없는 노트북에서 실제로 매일 쓰려면, 작은 모델을 Ollama(로컬 AI 실행 도구) 같은 도구로 돌리는 편이 훨씬 빠릅니다. 초대형 모델의 답이 꼭 필요한 일만 콜리브리로 돌리는 식으로 나누는 것이 현실적인 판단입니다.

자주 묻는 질문

그래픽카드 없이 초대형 AI 모델을 정말 돌릴 수 있나요?

돌아가기는 합니다. 콜리브리는 필요한 조각만 램에 올리고 나머지는 SSD에서 꺼내 읽는 방식이라 그래픽카드가 없어도 됩니다. 다만 README 기준 속도가 초당 1토큰도 안 되는 환경이 많아 실시간 대화용으로는 느립니다.

콜리브리는 어디서 받나요?

영상은 주소를 말하지 않습니다. 설명이 일치하는 공개 프로젝트는 GitHub의 JustVugg/colibri이고, Releases 메뉴에서 운영체제별 압축 파일을 받을 수 있습니다.

저장공간은 얼마나 필요한가요?

영상 기준으로 모델 파일이 370GB, 저장소 README 기준으로 약 372GB입니다. 다운로드 여유분까지 생각해 그보다 넉넉하게 비어 있는 빠른 SSD를 준비하는 편이 안전합니다.

기존에 쓰던 AI 코드에 연결할 수 있나요?

서버 모드로 열면 OpenAI 호환 주소가 생긴다고 README가 안내합니다. 오픈AI 라이브러리를 쓰는 코드라면 base_url을 내 컴퓨터 주소로 바꾸는 방식으로 연결합니다.

이 글은 자동 자막 기반(빠른 모드)으로 정리했고 화면은 대조하지 못했습니다. 도구 이름은 자막에 "콜리브리", "콜리블", "콜리체", 비용은 "영원"(0원), 서버 모드는 "서브"(serve)로 찍혀 있었습니다.

출처: youtube.com/…

원본 영상 보러가기 ↗