Ollama na Windows — instalacja, modele i wymagania sprzętowe

Schemat poglądowy (nie zrzut ekranu): cztery kroki — pobierz i zainstaluj Ollamę, pobierz model, uruchom i testuj, zarządzaj modelami

Ollama to program, który pozwala uruchamiać modele językowe na własnym komputerze, bez wysyłania zapytań do zewnętrznej usługi. Na Windowsie instalacja jest prosta, ale to, jak dobrze będzie działać, zależy od twojego sprzętu. Ten poradnik opiera się na oficjalnej dokumentacji Ollama (sprawdzonej 7 października 2026 r.). Wymagania i ustawienia domyślne opisane poniżej mogą się zmieniać z kolejnymi wersjami, więc przed instalacją zajrzyj do aktualnych stron dokumentacji.

Nie podajemy tu własnych testów ani wyników szybkości modeli, bo ich nie wykonywaliśmy. Wymagania sprzętowe konkretnego modelu zależą od modelu — więcej o pamięci karty graficznej piszemy w tekście Ile VRAM-u potrzeba do lokalnego AI?

Czym jest Ollama

Ollama pobiera modele językowe i uruchamia je lokalnie, udostępniając je przez wiersz poleceń i przez lokalne API. Według FAQ Ollama przy uruchamianiu lokalnym twórcy nie widzą twoich zapytań ani danych. Zwróć jednak uwagę: Ollama oferuje również modele „chmurowe”, do których trzeba się zalogować — to inna usługa niż uruchamianie na własnym komputerze, i przy niej dane nie zostają lokalnie.

Wymagania systemowe (stan na 7 października 2026 r.)

Według dokumentacji dla Windows w dniu sprawdzenia:

  • System: Windows 10 22H2 lub nowszy (Home lub Pro).
  • NVIDIA: sterowniki w wersji 551.61 lub nowszej. Strona o obsługiwanych GPU podaje też, że potrzebna jest karta z compute capability 5.0 lub wyższą, a wymagane wersje sterowników zależą od układu (starsze układy wymagają nowszych sterowników), więc sprawdź tę stronę dla swojej karty.
  • AMD: na Windowsie dokumentacja mówi o sterownikach zgodnych z ROCm v7 / HIP7 albo o sterowniku Radeon obsługującym Vulkan. Strona o obsługiwanych GPU wymienia jako obsługiwane karty Radeon RX serii 7 i 9 oraz wybrane karty Radeon PRO i procesory Ryzen AI; wsparcie Vulkan jest według niej domyślnie włączone, gdy zainstalowany jest odpowiedni backend. Listę konkretnych modeli i jej zmiany sprawdź na stronie dokumentacji — starsze karty mogą korzystać z Vulkan albo działać wolniej na procesorze.
  • Miejsce na dysku: dokumentacja podaje co najmniej 4 GB na pliki programu, a modele zajmują dodatkowo od kilku do kilkuset gigabajtów, zależnie od liczby i rozmiaru.

Procesor graficzny nie jest wymagany: model można uruchomić na samym procesorze (CPU), ale zwykle działa wtedy wolniej. Wersje systemu, sterowników i lista obsługiwanych kart mogą się zmienić — traktuj powyższe jako stan na dzień sprawdzenia, a nie stałe wymagania.

Instalacja na Windowsie

  1. Pobierz instalator OllamaSetup.exe ze strony Ollama (strona podaje też polecenie instalacyjne dla PowerShell).
  2. Uruchom instalator. Według dokumentacji domyślnie instaluje się w katalogu użytkownika i nie wymaga uprawnień administratora; własną lokalizację można wskazać parametrem /DIR="d:\lokalizacja".
  3. Po instalacji otwórz Wiersz poleceń lub PowerShell i uruchom pierwszy model, np. ollama run z nazwą modelu wybranego z biblioteki Ollama.

W szybkim starcie Ollama pokazuje przykładowe polecenie uruchomienia modelu wraz z informacją o rozmiarze pobierania i zalecanej pamięci. Takie połączenie „wielkość + zalecana pamięć” jest dobrym punktem wyjścia przy wyborze modelu, ale konkretny model i jego wymagania sprawdź na jego stronie w bibliotece.

Podstawowe zarządzanie modelami

  • ollama pull nazwa — pobiera model bez uruchamiania,
  • ollama run nazwa — pobiera (jeśli trzeba) i uruchamia rozmowę; /bye kończy sesję,
  • ollama list — pokazuje pobrane modele,
  • ollama ps — pokazuje modele załadowane do pamięci i to, czy działają na GPU, CPU, czy po części na obu,
  • ollama rm nazwa — usuwa model z dysku.

Pełną listę poleceń pokaże ollama --help. Według FAQ model pozostaje w pamięci przez 5 minut po ostatnim użyciu i potem jest zwalniany, co można zmienić zmienną OLLAMA_KEEP_ALIVE.

Gdzie leżą modele i jak zmienić miejsce

Według FAQ domyślnie modele trafiają do katalogu C:\Users\nazwa_użytkownika\.ollama\models. Jeśli dysk systemowy jest mały, ustaw zmienną środowiskową OLLAMA_MODELS na inny folder (w ustawieniach zmiennych środowiskowych Windows) i uruchom Ollamę ponownie. Logi znajdziesz w %LOCALAPPDATA%\Ollama. Dyski SSD przyspieszają ładowanie dużych modeli — przykład szybkiego dysku opisujemy w tekście o YMTC TiPlus9100 (dane producenta).

GPU, CPU, RAM i VRAM

Ollama sama próbuje wykorzystać kartę graficzną. Czy model zmieścił się w jej pamięci, sprawdzisz poleceniem ollama ps — kolumna Processor pokaże np. „100% GPU”, „100% CPU” albo podział, np. „48%/52% CPU/GPU”. Gdy model nie mieści się w VRAM, część trafia do pamięci systemowej i działanie zwykle zwalnia. Dlatego ważne są i VRAM, i RAM — temat rozwijamy w osobnym tekście. Ceny pamięci RAM i dysków mogą wpłynąć na koszt zestawu, o czym piszemy w artykule o drożejących pamięciach.

Rozmiary modeli z biblioteki Ollama (rozmiar pliku do pobrania według strony modelu, sprawdzone 7 października 2026 r.): llama3.2:3b — 2,0 GB, gemma3:4b — 3,3 GB, llama3.1:8b — 4,9 GB, qwen3:8b — 5,2 GB. To tylko rozmiary plików; do działania potrzeba jeszcze pamięci na kontekst rozmowy i narzut programu. Wymagania każdego modelu są inne, dlatego nie ma jednej tabeli „ten sprzęt = te modele”.

Domyślny rozmiar kontekstu (liczba tokenów, które model „właśnie widzi”) wynosi według FAQ 4096 tokenów i można go zmienić, np. zmienną OLLAMA_CONTEXT_LENGTH. Większy kontekst zużywa więcej pamięci. Ustawienia domyślne mogą się zmieniać w nowszych wersjach — sprawdź dokumentację.

Lokalne API

Według dokumentacji Ollama udostępnia API pod adresem http://localhost:11434. Według FAQ domyślnie nasłuchuje tylko na 127.0.0.1, czyli jest dostępna wyłącznie z tego komputera. Przykład zapytania w PowerShell, w dwóch krokach (bez kluczy i haseł — lokalne API ich nie wymaga). Najpierw przygotuj treść zapytania:

$body = @{
    model  = "llama3.2:3b"
    prompt = "Napisz jedno zdanie po polsku."
    stream = $false
} | ConvertTo-Json

Potem wyślij je do lokalnego API:

Invoke-RestMethod `
    -Uri http://localhost:11434/api/generate `
    -Method Post `
    -ContentType "application/json" `
    -Body $body

Znak ` (grawis) na końcu linii w PowerShell oznacza, że polecenie jest kontynuowane w następnej linii. Model llama3.2:3b musi być wcześniej pobrany (ollama pull llama3.2:3b).

Zmienna OLLAMA_HOST pozwala udostępnić usługę w sieci lokalnej, ale zwiększa to ryzyko. Jeśli to robisz, ogranicz dostęp do zaufanych urządzeń i nie wystawiaj portu 11434 do internetu bez uwierzytelniania.

Kiedy lokalne AI ma sens

  • Gdy zależy ci na prywatności i pracy bez wysyłania tekstów do zewnętrznej usługi.
  • Gdy chcesz eksperymentować z modelami bez opłat za każde zapytanie.
  • Gdy potrzebujesz działania offline lub integracji z własnymi narzędziami przez lokalne API.

Ograniczenia

  • Wymagania systemowe, obsługiwane karty, ścieżki i ustawienia domyślne (np. rozmiar kontekstu) pochodzą z dokumentacji w dniu sprawdzenia i mogą się zmienić.
  • Modele, które mieszczą się w typowym domowym sprzęcie, są mniejsze od największych modeli chmurowych i mogą gorzej radzić sobie z trudnymi zadaniami. Nie podajemy tu porównań jakości, bo ich nie mamy.
  • Przy zbyt małej pamięci karty model zwalnia, bo część obliczeń trafia na procesor.
  • Model nie jest źródłem faktów — odpowiedzi trzeba weryfikować.
  • Pracujący całą dobę komputer z kartą graficzną zużywa więcej prądu — zobacz jak policzyć koszt energii.

Przykłady sprzętu do lokalnego AI

Na naszej stronie opisujemy (na podstawie danych producentów) urządzenia projektowane z myślą o lokalnym AI: NVIDIA DGX Spark z 64 GB pamięci i WiCi One. To nie są rekomendacje zakupowe.

Zobacz także

Źródła

Dodaj komentarz