Artykuł Technologie

Jak zainstalować Ollama - Windows, Linux, macOS

Aby zainstalować Ollamę, na Windows i macOS pobierz instalator z ollama.com/download i kliknij przez kreatora, a na Linuksie uruchom jedną komendę curl -fsSL https://ollama.com/install.sh | sh. Potem wpisz ollama run llama3.2, żeby pobrać i odpalić pierwszy model. Weryfikacja: ollama --version.

W skrócie: Ollama to darmowy, otwarty silnik do uruchamiania dużych modeli językowych (LLM) lokalnie, bez abonamentu i bez wysyłania zapytań do chmury. Poniżej masz gotową komendę dla każdego systemu, wariant przez Docker, Homebrew i pip, oraz weryfikację, że wszystko działa. Wybierz swój system z tabeli i przejdź prosto do właściwej sekcji.

System Metoda Komenda startowa
Windows 10/11 instalator .exe OllamaSetup.exe z ollama.com/download
macOS instalator .dmg lub Homebrew brew install ollama
Linux / Ubuntu skrypt instalacyjny curl -fsSL https://ollama.com/install.sh \| sh
dowolny (kontener) Docker docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
pierwszy model po instalacji silnika ollama run llama3.2

Pro tip: jeśli Twój komputer jest słaby albo chcesz mieć model dostępny 24/7, rozważ uruchomienie Ollamy na zdalnym serwerze - wracam do tego w sekcji o Dockerze i w „Co dalej".

Wymagania wstępne - sprzęt i system

Najważniejsze: Ollama działa na samym procesorze (CPU), a karta graficzna (GPU) tylko przyspiesza generowanie. Nie potrzebujesz drogiego sprzętu, żeby zacząć - potrzebujesz tylko wystarczającej ilości RAM i miejsca na dysku pod wybrany model. Na moim domowym mini-PC z 16 GB RAM małe modele chodzą płynnie na samym CPU, więc do nauki i pierwszych eksperymentów naprawdę wystarczy przeciętny laptop.

  • RAM: na małe modele wystarczy 8 GB, komfortowy próg to 16 GB. Im większy model, tym więcej pamięci pochłania podczas pracy.
  • Dysk: każdy model zajmuje miejsce. Model klasy 3B to około 2 GB, a 7-8B około 5 GB. Kilka modeli naraz szybko urośnie do kilkunastu gigabajtów.
  • GPU (opcjonalnie): akceleracja działa przez NVIDIA CUDA, Apple Silicon Metal oraz AMD ROCm. Bez GPU też ruszy, tylko wolniej.

Konkret: czym jest sam silnik? Ollama pobiera, przechowuje i uruchamia modele językowe na Twoim sprzęcie, a do komunikacji wystawia lokalne API na porcie 11434. Wydawcą jest Ollama Inc. Jeśli chcesz najpierw zrozumieć narzędzie, zanim je zainstalujesz, zajrzyj do przewodnika czym jest Ollama, jeśli masz dedykowaną kartę.

Uwaga: dokładne progi RAM zależą od konkretnego modelu i jego kwantyzacji. Minimalne i zalecane wartości dla danego rozmiaru znajdziesz w aktualnej dokumentacji na docs.ollama.com - warto tam zerknąć, zanim ściągniesz największy wariant.

Instalacja na Windows

Na Windows instalujesz Ollamę przez klikalny instalator - to najprostsza ścieżka, bez terminala. Wymagany jest 64-bitowy Windows 10 lub 11.

  1. Pobierz instalator. Wejdź na ollama.com/download, wybierz Windows i pobierz plik OllamaSetup.exe.
  2. Uruchom kreatora. Kliknij dwukrotnie pobrany plik i przejdź przez instalację. Ollama zainstaluje się i uruchomi w tle - ikona pojawi się w zasobniku systemowym (tray).
  3. Zweryfikuj instalację. Otwórz PowerShell lub wiersz poleceń i wpisz ollama --version. Jeśli zobaczysz numer wersji, silnik działa.

W praktyce: Ollama domyślnie startuje wraz z systemem i nasłuchuje na porcie 11434. Modele lądują na dysku systemowym - jeśli brakuje Ci miejsca na C, zmień lokalizację, ustawiając zmienną środowiskową OLLAMA_MODELS na inny katalog. Po zmianie zrestartuj Ollamę, żeby podłapała nową ścieżkę.

Instalacja na macOS

Na Macu masz dwie drogi: instalator graficzny albo Homebrew dla tych, którzy wolą terminal. Na układach Apple Silicon (M1-M4) Ollama korzysta z akceleracji Metal; na starszych Intelach działa na CPU.

Ścieżka A - instalator .dmg:

  1. Pobierz plik .dmg z ollama.com/download.
  2. Otwórz obraz i przeciągnij Ollamę do folderu Aplikacje.
  3. Uruchom aplikację - silnik wystartuje w tle.

Ścieżka B - Homebrew:

  1. Zainstaluj silnik komendą brew install ollama.
  2. Wystartuj usługę w tle: brew services start ollama.

W obu przypadkach weryfikacja jest ta sama - otwórz Terminal i wpisz ollama --version. Kiedy to ma sens: instalator wybierz, jeśli nie używasz Homebrew; brew install ollama jest wygodniejsze, gdy i tak zarządzasz pakietami przez Homebrew i chcesz aktualizować Ollamę razem z resztą narzędzi jedną komendą.

Instalacja na Linux

Na Linuksie (w tym Ubuntu) instalacja to jedna komenda. Oficjalny skrypt wykrywa system, pobiera binarkę i konfiguruje Ollamę jako usługę systemd, która startuje automatycznie.

curl -fsSL https://ollama.com/install.sh | sh

Pod maską: skrypt instaluje plik wykonywalny ollama i rejestruje usługę systemową, więc silnik chodzi w tle od razu po instalacji. Sprawdź tak, czy usługa wstała:

systemctl status ollama

Uwaga bezpieczeństwa: konstrukcja curl ... | sh uruchamia kod pobrany z sieci od razu. To wygodne, ale dobrym nawykiem jest najpierw pobrać skrypt do pliku, przejrzeć go, a dopiero potem wykonać. Jeśli wolisz pełną kontrolę, dostępna jest też instalacja manualna z binarki - opisuje ją dokumentacja na docs.ollama.com.

Trade-off: dla kart NVIDIA potrzebujesz zainstalowanych sterowników i CUDA, żeby Ollama używała GPU. Bez nich silnik nadal zadziała, tylko policzy wszystko na CPU. Szczegóły konfiguracji karty znajdziesz w sekcji o częstych błędach oraz w konfiguracji GPU dla Ollama albo z automatyzacją w tym samym wzorcu self-host w Docker Compose.

Pierwszy model i test

Po instalacji silnika nie masz jeszcze żadnego modelu - musisz go pobrać. Najprościej jedną komendą, która pobiera i od razu uruchamia rozmowę:

ollama run llama3.2

Przy pierwszym wywołaniu Ollama ściągnie model, a potem otworzy interaktywny czat w terminalu. Wpisz pytanie, a żeby zakończyć rozmowę, wpisz /bye. Jeśli chcesz tylko pobrać model bez uruchamiania, użyj ollama pull <nazwa-modelu>. Listę tego, co masz już na dysku, pokaże:

ollama list

To zależy - od czego wybór modelu? Od Twojego RAM i GPU. Mniejszy model (3B) ruszy na słabszym sprzęcie, większy (7-8B i wyżej) da lepsze odpowiedzi, ale potrzebuje więcej pamięci. Który model pod jaki sprzęt - rozkładam w rankingu jaki model wybrać po instalacji - Open WebUI łączy się z tym samym API.

Częste błędy i rozwiązania

Większość problemów przy starcie to nie awarie silnika, tylko drobiazgi w ścieżkach, portach i sterownikach. Oto te, na które trafia się najczęściej.

Błąd Przyczyna Rozwiązanie
ollama: command not found terminal nie widzi binarki w PATH zamknij i otwórz terminal ponownie; na Linux sprawdź, czy instalacja się powiodła
port 11434 zajęty inny proces (lub druga instancja Ollamy) trzyma port zatrzymaj poprzedni proces albo zmień port w konfiguracji
model nie używa GPU brak sterowników NVIDIA / CUDA lub Container Toolkit doinstaluj sterowniki i CUDA; w Dockerze dodaj --gpus=all
brak pamięci przy dużym modelu model nie mieści się w RAM/VRAM wybierz mniejszy model lub mocniej skwantyzowany wariant
wolne pobieranie modelu przepustowość łącza lub obciążenie repozytorium poczekaj lub ponów ollama pull; pobieranie wznawia się
usługa nie startuje (Linux) usługa systemd zatrzymana uruchom systemctl restart ollama i sprawdź systemctl status ollama

Sprawdź sam: po każdej poprawce wróć do ollama --version i ollama list - jeśli obie komendy odpowiadają, silnik działa poprawnie.

FAQ

Jak zainstalować Ollama na Windows?

Pobierz plik OllamaSetup.exe z ollama.com/download, uruchom kreatora i przejdź przez instalację. Ollama wystartuje w tle, a jej ikona pojawi się w zasobniku systemowym. Na koniec otwórz PowerShell i wpisz ollama --version - numer wersji potwierdza, że silnik zainstalował się poprawnie. Wymagany jest 64-bitowy Windows 10 lub 11.

Jak zainstalować Ollama na Linux lub Ubuntu?

Wystarczy jedna komenda: curl -fsSL https://ollama.com/install.sh | sh. Skrypt pobiera binarkę i konfiguruje Ollamę jako usługę systemd, która startuje automatycznie. Sprawdź jej stan komendą systemctl status ollama. Dla bezpieczeństwa możesz najpierw pobrać skrypt do pliku i przejrzeć go, zanim go uruchomisz.

Jak zainstalować Ollama na Macu przez Homebrew?

Masz dwie drogi. Pierwsza to instalator .dmg z ollama.com/download, który przeciągasz do folderu Aplikacje. Druga to terminal: brew install ollama, a potem brew services start ollama, żeby uruchomić silnik w tle. Na Apple Silicon (M1-M4) działa akceleracja Metal. Weryfikacja w obu przypadkach: ollama --version.

Czym różni się pip install ollama od instalacji silnika?

pip install ollama instaluje klienta Pythona, a nie sam silnik. Klient łączy się z działającym silnikiem przez jego lokalne API pod adresem localhost:11434. Silnik musisz zainstalować osobno - instalatorem, skryptem na Linuksie albo przez Docker. Sam klient bez działającego silnika nie uruchomi żadnego modelu.

Jak zainstalować i uruchomić pierwszy model?

Po instalacji silnika wpisz ollama run llama3.2. Przy pierwszym uruchomieniu Ollama pobierze model, a następnie otworzy czat w terminalu, który zamykasz komendą /bye. Jeśli chcesz tylko pobrać model bez uruchamiania, użyj ollama pull <nazwa-modelu>, a listę zainstalowanych modeli wyświetlisz komendą ollama list.

Jak uruchomić Ollama w Dockerze?

Użyj komendy docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Uruchamia ona kontener w tle, montuje wolumen na modele i wystawia port API 11434. Dla akceleracji NVIDIA dodaj flagę --gpus=all - wymaga to zainstalowanego NVIDIA Container Toolkit na komputerze hosta.

Co dalej

Masz już działający silnik i pierwszy model. Konkret: jeśli sprzęt jest słaby lub potrzebujesz dostępu 24/7, kolejnym krokiem jest uruchomienie Ollamy w kontenerze, a docelowo na zdalnym serwerze. Dobre dalsze ścieżki to wybór modelu pod swój sprzęt w rankingu jaki model wybrać po instalacji oraz porównanie podejść w zestawieniu LM Studio vs Ollama.