Aby zainstalować Ollamę, na Windows i macOS pobierz instalator z ollama.com/download i kliknij przez kreatora, a na Linuksie uruchom jedną komendę curl -fsSL https://ollama.com/install.sh | sh. Potem wpisz ollama run llama3.2, żeby pobrać i odpalić pierwszy model. Weryfikacja: ollama --version.
W skrócie: Ollama to darmowy, otwarty silnik do uruchamiania dużych modeli językowych (LLM) lokalnie, bez abonamentu i bez wysyłania zapytań do chmury. Poniżej masz gotową komendę dla każdego systemu, wariant przez Docker, Homebrew i pip, oraz weryfikację, że wszystko działa. Wybierz swój system z tabeli i przejdź prosto do właściwej sekcji.
| System | Metoda | Komenda startowa |
|---|---|---|
| Windows 10/11 | instalator .exe |
OllamaSetup.exe z ollama.com/download |
| macOS | instalator .dmg lub Homebrew |
brew install ollama |
| Linux / Ubuntu | skrypt instalacyjny | curl -fsSL https://ollama.com/install.sh \| sh |
| dowolny (kontener) | Docker | docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama |
| pierwszy model | po instalacji silnika | ollama run llama3.2 |
Pro tip: jeśli Twój komputer jest słaby albo chcesz mieć model dostępny 24/7, rozważ uruchomienie Ollamy na zdalnym serwerze - wracam do tego w sekcji o Dockerze i w „Co dalej".
Wymagania wstępne - sprzęt i system
Najważniejsze: Ollama działa na samym procesorze (CPU), a karta graficzna (GPU) tylko przyspiesza generowanie. Nie potrzebujesz drogiego sprzętu, żeby zacząć - potrzebujesz tylko wystarczającej ilości RAM i miejsca na dysku pod wybrany model. Na moim domowym mini-PC z 16 GB RAM małe modele chodzą płynnie na samym CPU, więc do nauki i pierwszych eksperymentów naprawdę wystarczy przeciętny laptop.
- RAM: na małe modele wystarczy 8 GB, komfortowy próg to 16 GB. Im większy model, tym więcej pamięci pochłania podczas pracy.
- Dysk: każdy model zajmuje miejsce. Model klasy 3B to około 2 GB, a 7-8B około 5 GB. Kilka modeli naraz szybko urośnie do kilkunastu gigabajtów.
- GPU (opcjonalnie): akceleracja działa przez NVIDIA CUDA, Apple Silicon Metal oraz AMD ROCm. Bez GPU też ruszy, tylko wolniej.
Konkret: czym jest sam silnik? Ollama pobiera, przechowuje i uruchamia modele językowe na Twoim sprzęcie, a do komunikacji wystawia lokalne API na porcie 11434. Wydawcą jest Ollama Inc. Jeśli chcesz najpierw zrozumieć narzędzie, zanim je zainstalujesz, zajrzyj do przewodnika czym jest Ollama, jeśli masz dedykowaną kartę.
Uwaga: dokładne progi RAM zależą od konkretnego modelu i jego kwantyzacji. Minimalne i zalecane wartości dla danego rozmiaru znajdziesz w aktualnej dokumentacji na docs.ollama.com - warto tam zerknąć, zanim ściągniesz największy wariant.
Instalacja na Windows
Na Windows instalujesz Ollamę przez klikalny instalator - to najprostsza ścieżka, bez terminala. Wymagany jest 64-bitowy Windows 10 lub 11.
- Pobierz instalator. Wejdź na ollama.com/download, wybierz Windows i pobierz plik
OllamaSetup.exe. - Uruchom kreatora. Kliknij dwukrotnie pobrany plik i przejdź przez instalację. Ollama zainstaluje się i uruchomi w tle - ikona pojawi się w zasobniku systemowym (tray).
- Zweryfikuj instalację. Otwórz PowerShell lub wiersz poleceń i wpisz
ollama --version. Jeśli zobaczysz numer wersji, silnik działa.
W praktyce: Ollama domyślnie startuje wraz z systemem i nasłuchuje na porcie 11434. Modele lądują na dysku systemowym - jeśli brakuje Ci miejsca na C, zmień lokalizację, ustawiając zmienną środowiskową OLLAMA_MODELS na inny katalog. Po zmianie zrestartuj Ollamę, żeby podłapała nową ścieżkę.
Instalacja na macOS
Na Macu masz dwie drogi: instalator graficzny albo Homebrew dla tych, którzy wolą terminal. Na układach Apple Silicon (M1-M4) Ollama korzysta z akceleracji Metal; na starszych Intelach działa na CPU.
Ścieżka A - instalator .dmg:
- Pobierz plik
.dmgz ollama.com/download. - Otwórz obraz i przeciągnij Ollamę do folderu Aplikacje.
- Uruchom aplikację - silnik wystartuje w tle.
Ścieżka B - Homebrew:
- Zainstaluj silnik komendą
brew install ollama. - Wystartuj usługę w tle:
brew services start ollama.
W obu przypadkach weryfikacja jest ta sama - otwórz Terminal i wpisz ollama --version. Kiedy to ma sens: instalator wybierz, jeśli nie używasz Homebrew; brew install ollama jest wygodniejsze, gdy i tak zarządzasz pakietami przez Homebrew i chcesz aktualizować Ollamę razem z resztą narzędzi jedną komendą.
Instalacja na Linux
Na Linuksie (w tym Ubuntu) instalacja to jedna komenda. Oficjalny skrypt wykrywa system, pobiera binarkę i konfiguruje Ollamę jako usługę systemd, która startuje automatycznie.
curl -fsSL https://ollama.com/install.sh | sh
Pod maską: skrypt instaluje plik wykonywalny ollama i rejestruje usługę systemową, więc silnik chodzi w tle od razu po instalacji. Sprawdź tak, czy usługa wstała:
systemctl status ollama
Uwaga bezpieczeństwa: konstrukcja curl ... | sh uruchamia kod pobrany z sieci od razu. To wygodne, ale dobrym nawykiem jest najpierw pobrać skrypt do pliku, przejrzeć go, a dopiero potem wykonać. Jeśli wolisz pełną kontrolę, dostępna jest też instalacja manualna z binarki - opisuje ją dokumentacja na docs.ollama.com.
Trade-off: dla kart NVIDIA potrzebujesz zainstalowanych sterowników i CUDA, żeby Ollama używała GPU. Bez nich silnik nadal zadziała, tylko policzy wszystko na CPU. Szczegóły konfiguracji karty znajdziesz w sekcji o częstych błędach oraz w konfiguracji GPU dla Ollama albo z automatyzacją w tym samym wzorcu self-host w Docker Compose.
Pierwszy model i test
Po instalacji silnika nie masz jeszcze żadnego modelu - musisz go pobrać. Najprościej jedną komendą, która pobiera i od razu uruchamia rozmowę:
ollama run llama3.2
Przy pierwszym wywołaniu Ollama ściągnie model, a potem otworzy interaktywny czat w terminalu. Wpisz pytanie, a żeby zakończyć rozmowę, wpisz /bye. Jeśli chcesz tylko pobrać model bez uruchamiania, użyj ollama pull <nazwa-modelu>. Listę tego, co masz już na dysku, pokaże:
ollama list
To zależy - od czego wybór modelu? Od Twojego RAM i GPU. Mniejszy model (3B) ruszy na słabszym sprzęcie, większy (7-8B i wyżej) da lepsze odpowiedzi, ale potrzebuje więcej pamięci. Który model pod jaki sprzęt - rozkładam w rankingu jaki model wybrać po instalacji - Open WebUI łączy się z tym samym API.
Częste błędy i rozwiązania
Większość problemów przy starcie to nie awarie silnika, tylko drobiazgi w ścieżkach, portach i sterownikach. Oto te, na które trafia się najczęściej.
| Błąd | Przyczyna | Rozwiązanie |
|---|---|---|
ollama: command not found |
terminal nie widzi binarki w PATH | zamknij i otwórz terminal ponownie; na Linux sprawdź, czy instalacja się powiodła |
| port 11434 zajęty | inny proces (lub druga instancja Ollamy) trzyma port | zatrzymaj poprzedni proces albo zmień port w konfiguracji |
| model nie używa GPU | brak sterowników NVIDIA / CUDA lub Container Toolkit | doinstaluj sterowniki i CUDA; w Dockerze dodaj --gpus=all |
| brak pamięci przy dużym modelu | model nie mieści się w RAM/VRAM | wybierz mniejszy model lub mocniej skwantyzowany wariant |
| wolne pobieranie modelu | przepustowość łącza lub obciążenie repozytorium | poczekaj lub ponów ollama pull; pobieranie wznawia się |
| usługa nie startuje (Linux) | usługa systemd zatrzymana | uruchom systemctl restart ollama i sprawdź systemctl status ollama |
Sprawdź sam: po każdej poprawce wróć do ollama --version i ollama list - jeśli obie komendy odpowiadają, silnik działa poprawnie.
FAQ
Jak zainstalować Ollama na Windows?
Pobierz plik OllamaSetup.exe z ollama.com/download, uruchom kreatora i przejdź przez instalację. Ollama wystartuje w tle, a jej ikona pojawi się w zasobniku systemowym. Na koniec otwórz PowerShell i wpisz ollama --version - numer wersji potwierdza, że silnik zainstalował się poprawnie. Wymagany jest 64-bitowy Windows 10 lub 11.
Jak zainstalować Ollama na Linux lub Ubuntu?
Wystarczy jedna komenda: curl -fsSL https://ollama.com/install.sh | sh. Skrypt pobiera binarkę i konfiguruje Ollamę jako usługę systemd, która startuje automatycznie. Sprawdź jej stan komendą systemctl status ollama. Dla bezpieczeństwa możesz najpierw pobrać skrypt do pliku i przejrzeć go, zanim go uruchomisz.
Jak zainstalować Ollama na Macu przez Homebrew?
Masz dwie drogi. Pierwsza to instalator .dmg z ollama.com/download, który przeciągasz do folderu Aplikacje. Druga to terminal: brew install ollama, a potem brew services start ollama, żeby uruchomić silnik w tle. Na Apple Silicon (M1-M4) działa akceleracja Metal. Weryfikacja w obu przypadkach: ollama --version.
Czym różni się pip install ollama od instalacji silnika?
pip install ollama instaluje klienta Pythona, a nie sam silnik. Klient łączy się z działającym silnikiem przez jego lokalne API pod adresem localhost:11434. Silnik musisz zainstalować osobno - instalatorem, skryptem na Linuksie albo przez Docker. Sam klient bez działającego silnika nie uruchomi żadnego modelu.
Jak zainstalować i uruchomić pierwszy model?
Po instalacji silnika wpisz ollama run llama3.2. Przy pierwszym uruchomieniu Ollama pobierze model, a następnie otworzy czat w terminalu, który zamykasz komendą /bye. Jeśli chcesz tylko pobrać model bez uruchamiania, użyj ollama pull <nazwa-modelu>, a listę zainstalowanych modeli wyświetlisz komendą ollama list.
Jak uruchomić Ollama w Dockerze?
Użyj komendy docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Uruchamia ona kontener w tle, montuje wolumen na modele i wystawia port API 11434. Dla akceleracji NVIDIA dodaj flagę --gpus=all - wymaga to zainstalowanego NVIDIA Container Toolkit na komputerze hosta.
Co dalej
Masz już działający silnik i pierwszy model. Konkret: jeśli sprzęt jest słaby lub potrzebujesz dostępu 24/7, kolejnym krokiem jest uruchomienie Ollamy w kontenerze, a docelowo na zdalnym serwerze. Dobre dalsze ścieżki to wybór modelu pod swój sprzęt w rankingu jaki model wybrać po instalacji oraz porównanie podejść w zestawieniu LM Studio vs Ollama.