Cute Light Pink Flying Butterfly 로컬에서 무료로 돌리는 AI, "Ollama" | - 설치부터 모델 선택, 실전 에이전트 개발 활용 후기 :: 놀면서 돈벌기
본문 바로가기
IT/AI | All

로컬에서 무료로 돌리는 AI, "Ollama" | - 설치부터 모델 선택, 실전 에이전트 개발 활용 후기

by esclife_ 2026. 7. 30.

https://ollama.com/

 

Ollama

Ollama is the easiest way to automate your work using open models, while keeping your data safe.

ollama.com


 

0. 모델 소개

 

Ollama는 내 PC에서 직접 대규모 언어 모델(LLM)을 돌릴 수 있게 해주는 무료 오픈소스 도구입니다. ChatGPT나 Gemini처럼 인터넷 서버에 요청을 보내는 방식이 아니라, 모델 파일을 내 컴퓨터에 다운로드해서 로컬에서 실행합니다.

 



이 AI의 가장 큰 장점은 두 가지입니다.


첫째, 완전 무료이며 토큰 요금이 없습니다. 아무리 많이 써도 돈이 나가지 않습니다.
둘째, 데이터가 외부로 나가지 않습니다. 회사 소스코드나 민감한 문서를 다뤄도 보안에 안전합니다.


물론 단점도 있습니다. 모델 성능이 내 그래픽카드(GPU) 사양에 크게 좌우되고, 

클라우드 최상위 모델보다는 작업이 느리거나 품질이 낮을 수 있습니다.

 

 


 

1. 다운로드 방법

 

공식 홈페이지 ollama.com 에 접속해서 Download 버튼을 누르면 됩니다.

Windows, macOS, Linux를 모두 지원합니다. 윈도우의 경우 설치 파일을 실행하면 자동으로 설치되고,

백그라운드에서 Ollama 서비스가 실행됩니다.

 

https://ollama.com/


 

Ollama

Ollama is the easiest way to automate your work using open models, while keeping your data safe.

ollama.com

 

 

설치가 끝나면 PowerShell이나 명령 프롬프트에서 아래 명령으로 정상 설치를 확인할 수 있습니다.

ollama --version

 

 

2. 모델 설치 방법 (PowerShell 명령어)

모델을 받는 명령은 pull, 실행은 run 입니다.

모델 다운로드만 하기
ollama pull qwen2.5-coder:14b

모델 다운로드 후 바로 대화 실행하기
ollama run llama3.1

설치된 모델 목록 확인하기
ollama list

현재 메모리에 올라와 있는 모델과 사용량 확인하기
ollama ps

모델 삭제하기
ollama rm qwen2.5-coder:14b

모델 이름 뒤의 콜론(:) 다음에 오는 것은 크기나 버전 태그입니다. 예를 들어 14b는 파라미터가 140억 개라는 뜻이며, 숫자가 클수록 똑똑하지만 무겁습니다.

 



3. 모델 종류별 소개

아래는 Ollama에서 많이 쓰이는 대표 모델들입니다.

모델명 설명 추천 작업
lama3.1 메타가 만든 대표적인 범용 모델. 균형이 좋음  일반 대화, 요약, 글쓰기
qwen3  알리바바의 최신 범용 모델. 추론 능력이 강함 복잡한 추론, 분석, 다국어
qwen2.5-coder  코딩에 특화된 모델. 코드 형식 출력이 안정적 코드 생성, 리팩터링, 단위테스트
qwen3-coder 코딩 특화 최신 모델. 전문가혼합(MoE) 구조로 큰 크기 대비 빠름 대규모 코드 작업
deepseek-coder-v2 코드 전용 모델. 다양한 언어 지원 코드 자동완성, 버그 수정
gemma3 구글이 만든 경량 모델. 가볍고 빠름 저사양 PC, 간단한 작업
phi4  마이크로소프트의 소형 고효율 모델 빠른 응답이 필요한 작업
mistral 가볍고 빠른 유럽산 범용 모델   일반 대화, 빠른 처리

 

 

모델 크기 선택 팁을 드리면, 내 그래픽카드의 VRAM(그래픽 메모리) 용량 안에 들어오는 크기의 모델을 고르는 것이 가장 중요합니다. VRAM을 초과하면 일부 연산이 CPU로 넘어가면서 속도가 급격히 느려집니다.

4. 개발 활용기


단위테스트를 자동으로 생성하는 AI 에이전트를 만들면서 여러 Ollama 모델을 직접 돌려봤습니다.

회사에서 다양한 유료 ai tool를 구독해주고 있지만, ollama를 선택한건

역시나 1) 토큰비용 2) 보안성 때문이었습니다.

 

ollama의 여러 모델들을 돌려가며 약 1달반의 기간동안 돌려본 것 같네요.

(테스트 환경은 그래픽카드 RTX 4060, VRAM 8G였습니다.)

실제로 겪은 특징을 모델별로 정리합니다.

- qwen3.6 (약 23기가바이트, 범용 추론형)

가장 똑똑한 축에 속하지만, 크기가 23기가로 VRAM 8기가를 크게 초과했습니다. 그 결과 상당 부분이 CPU에서 처리되어 생성 한 번에 80초 이상 걸릴 정도로 느렸습니다. 또한 이 모델은 답변 전에 생각하는 과정을 길게 출력하는 추론형이라, 정작 필요한 코드 블록을 빠뜨리는 경우가 잦았습니다. 코드 생성 작업에는 오히려 방해가 되었습니다.

- qwen3-coder:30b (약 19기가바이트, 코딩 특화 MoE)

파라미터는 300억 개지만 전문가혼합 구조라 실제 연산은 일부만 사용하는 방식입니다. 품질은 좋았지만 역시 19기가로 VRAM 8기가를 넘겨서, 생성 한 번에 평균 88초가 걸렸습니다. 성능은 좋아도 8기가 환경에서는 실용적인 속도가 안 나왔습니다.

- qwen2.5-coder:14b (약 9기가바이트, 코딩 특화)

저희 환경에서 가장 균형이 좋았습니다. 9기가로 8기가를 살짝 넘지만 앞의 두 모델보다 훨씬 빨랐고, 코딩 특화 모델답게 코드 블록 형식을 안정적으로 지켜서 파싱 실패가 거의 없었습니다. 간단한 요청은 몇 초 안에 응답했습니다.

 

결론적으로 컴퓨터 사양만 더 좋았다면 qwen3-coder:30b로 충분히 에이전트를 돌렸을텐데요

단위테스트 1프로젝트 만드는데 3~4일 이상 소요되어 결국 gemini 2.5-flash 모델로 전환했습니다.

컴퓨터에 돈을쓰느냐, 토큰에 돈을쓰느냐가 문제가 되버렸네요.



정리하면, 저희가 얻은 가장 큰 교훈은 무조건 크고 똑똑한 모델이 정답이 아니라는 것입니다. 

VRAM 용량을 초과하는 순간 속도가 수십 배 느려지기 때문에, 내 하드웨어에 맞는 크기의 특화 모델을 고르는 것이 

에이전트 루프처럼 수백 번 반복 호출하는 작업에서는 훨씬 중요했습니다.

8기가 VRAM 기준으로는 범용 대형 모델보다 코딩 특화 중형 모델이 속도와 품질의 균형점이었고,

 반복 호출이 많은 자동화 작업일수록 이 차이가 누적되어 전체 소요 시간을 크게 좌우했습니다.

로컬 AI를 처음 시작하신다면, 본인 PC의 VRAM 용량부터 확인하고 그에 맞는 모델을 고르는 것을 추천드립니다.

반응형