Przejdź do treści

Ollama: własna AI na komputerze bez chmury – instalacja, modele, polski Bielik i jaki sprzęt wybrać (2026)

Prostymi słowami: co to jest Ollama i model lokalny, czym różni się od płatnych asystentów, jak zainstalować na Macu, Windows i Linuksie, pierwsze polecenia, które modele na start (Gemma, Qwen, gpt-oss, Bielik), ile pamięci potrzeba i dlaczego Mac z Apple Silicon i pamięcią wspólną jest do tego wyjątkowo dobry.

Wolisz zapytać niż czytać dalej?

Otwórz asystenta AI i zadaj pytanie do tego poradnika.

ChatGPT, Claude i Gemini działają w chmurze: to, co wpisujesz, jedzie do serwerów producenta. Jest druga droga: pobrać model AI na własny komputer i rozmawiać z nim bez internetu, bez konta, bez abonamentu i bez wysyłania czegokolwiek komukolwiek. Najprostszy program do tego nazywa się Ollama. Ten przewodnik wyjaśnia prostymi słowami, co to jest, co potrafi, a czego nie, czym różni się od płatnych asystentów, jak go zainstalować na Macu, Windows i Linuksie, jaki sprzęt jest potrzebny i dlaczego Mac z procesorem Apple Silicon jest do tego wyjątkowo dobry. Jest w nim też polski model Bielik, który po polsku radzi sobie lepiej niż większość modeli otwartych.

Ostatnia weryfikacja: 6 września 2026. Materiał informacyjny. Wersje programów, nazwy i rozmiary modeli oraz parametry sprzętu zmieniają się co kilka miesięcy; liczby pochodzą z dokumentacji Ollama, Apple, NVIDIA i AMD z dnia weryfikacji. Zanim kupisz sprzęt pod AI, sprawdź aktualne dane u producenta.

W skrócie

Najważniejsze
  • Ollama to bezpłatny program, który pobiera otwarte modele AI (Llama od Meta, Gemma od Google, Qwen, Mistral, DeepSeek, gpt-oss od OpenAI, polski Bielik) i uruchamia je na Twoim komputerze. Ma aplikację z oknem czatu na Maca i Windows oraz wersję dla Linuksa (strona pobierania, o aplikacji).
  • Nic nie wychodzi z komputera. Producent pisze wprost: „Ollama działa lokalnie. Nie widzimy Twoich promptów ani danych, gdy uruchamiasz go lokalnie” (dokumentacja). Działa bez internetu po pobraniu modelu.
  • Cena to sprzęt. Model musi zmieścić się w szybkiej pamięci komputera. Reguła Ollamy: model 7 miliardów parametrów potrzebuje co najmniej 8 GB pamięci, 13 miliardów 16 GB, 33 miliardy 32 GB (dokumentacja Ollama).
  • Mac z Apple Silicon jest do tego wyjątkowo dobry, bo ma pamięć wspólną dla procesora i karty graficznej: cała pamięć komputera może służyć modelowi, a jest jej do 128 GB w MacBooku Pro i do 512 GB w Mac Studio (dane Apple, Mac Studio). Typowa karta graficzna do PC ma 16 albo 32 GB (NVIDIA).
  • Modele lokalne są słabsze od najlepszych chmurowych i nie mają domyślnie dostępu do internetu. Za to są prywatne, bezpłatne i zawsze dostępne. Do dokumentów, tłumaczeń, streszczeń i codziennych pytań wystarczają.
  • Bielik to polski model fundacji SpeakLeash i ACK Cyfronet AGH, na licencji Apache 2.0, dostępny w Ollama jednym poleceniem; wersja 11B w wariancie oszczędnym zajmuje 6,7 GB (Bielik w Ollama).

Co to jest Ollama i „model lokalny”, prostymi słowami

Asystent AI składa się z dwóch rzeczy: z modelu, czyli ogromnego pliku z „wiedzą”, powstałego w wyniku treningu na tekstach, i z programu, który ten plik uruchamia i pozwala z nim rozmawiać. W ChatGPT obie rzeczy są na serwerach OpenAI. Część firm udostępnia jednak swoje modele publicznie, jako pliki do pobrania; mówi się na nie modele otwarte albo o otwartych wagach. Ollama to program, który takie pliki pobiera i uruchamia na Twoim komputerze, a potem daje Ci okno czatu takie jak w ChatGPT.

Modele mają rozmiary opisywane liczbą parametrów: 1B, 4B, 8B, 27B, 70B (B od miliarda). Im więcej parametrów, tym model mądrzejszy, ale tym więcej pamięci potrzebuje i tym wolniej odpowiada. Model 4B mieści się na zwykłym laptopie i odpowiada szybko; model 70B potrzebuje komputera za kilka tysięcy dolarów. Dla porównania: modele chmurowe, jak te w ChatGPT czy Claude, są znacznie większe i działają na tysiącach kart graficznych; dlatego lokalny model nigdy nie będzie równie „mądry”, ale do wielu codziennych zadań nie musi.

Co model lokalny robi dobrze

Streszcza i tłumaczy dokumenty, pisze projekty e-maili i pism, odpowiada na pytania o załączone pliki, pomaga w nauce, układa listy i plany, pomaga w kodzie. Wszystko bez wysyłania treści komukolwiek.

Czego nie robi albo robi gorzej

Nie ma domyślnie internetu, więc nie zna dzisiejszych wiadomości i cen. Ma mniej wiedzy ogólnej niż modele chmurowe, częściej się myli w trudnych pytaniach, na słabym sprzęcie odpowiada wolno. Nie generuje wideo.

Jak o nim myśleć

Jak o dobrym asystencie, który mieszka u Ciebie w domu, nie plotkuje i nie bierze pieniędzy, ale nie czyta gazet i ma mniej doświadczenia niż gwiazdy z chmury.

Chmura czy własny komputer: uczciwe porównanie

CechaAsystent w chmurze (ChatGPT, Claude, Gemini)Model lokalny (Ollama)
KosztWersja darmowa z limitami; 20 USD miesięcznie i więcej za planyProgram i modele bezpłatne; kosztem jest sprzęt i prąd
PrywatnośćDane trafiają do producenta; trenowanie można zwykle wyłączyćNic nie opuszcza komputera; producent nie widzi promptów
Jakość odpowiedziNajwyższa dostępnaDobra do bardzo dobrej w codziennych zadaniach; słabsza w trudnych
InternetWyszukiwanie w sieci, aktualne daneDomyślnie brak; działa bez internetu
SzybkośćSzybko niezależnie od Twojego sprzętuZależy od pamięci i karty graficznej; od bardzo szybko do bardzo wolno
LimityLimity wiadomości, sesji, plikówBrak; ograniczeniem jest tylko sprzęt
Obrazy i głosTak, w większościModele czytające obrazy tak; generowanie obrazów i głos wymagają osobnych narzędzi
Konto i wiekKonto, w Claude 18 latBez konta; instalujesz jak każdy program
Dla kogoWiększość osób na co dzieńOsoby, którym zależy na prywatności, pracujące z poufnymi dokumentami, bez stałego internetu, ciekawe technologii

Kiedy lokalnie ma sens: gdy pracujesz z dokumentami, których nie chcesz wysyłać nikomu (umowy, dane klientów, sprawy rodzinne, medyczne, księgowe); gdy chcesz mieć asystenta bez abonamentu i bez limitów; gdy internet bywa niepewny; gdy chcesz uczyć się, jak to działa. Kiedy nie ma sensu: gdy potrzebujesz najwyższej jakości do trudnych zadań, aktualnych informacji z sieci albo obrazów i wideo. Wiele osób ma oba: chmurę do trudnych rzeczy, Ollamę do poufnych.

Sprzęt: jedna zasada, która wyjaśnia wszystko

Żeby model odpowiadał szybko, cały jego plik musi siedzieć w szybkiej pamięci, do której ma dostęp układ liczący (karta graficzna). Podczas pisania każdego kolejnego słowa komputer przegląda cały model od początku do końca. Wynikają z tego dwie rzeczy:

  1. Ilość pamięci decyduje, jak duży model uruchomisz. Reguła Ollamy: 7B potrzebuje 8 GB, 13B 16 GB, 33B 32 GB, a 70B 64 GB (dokumentacja Ollama). Modele w Ollama są domyślnie „skompresowane” (kwantyzacja), przez co zajmują mniej więcej pół bajta na parametr: 4B to około 3 GB, 8B około 5 GB, 27B około 17 GB (rozmiary z strony Gemma 3, strony Qwen3). Do rozmiaru pliku dolicz kilka gigabajtów na rozmowę i system.
  2. Przepustowość pamięci decyduje, jak szybko model pisze. Skoro każde słowo wymaga przeczytania całego modelu, liczba słów na sekundę jest w przybliżeniu równa przepustowości pamięci podzielonej przez rozmiar modelu. Pamięć 460 GB/s i model 7 GB to najwyżej około 60 słów na sekundę; zwykła pamięć laptopa PC, kilkadziesiąt GB/s, ten sam model pisze kilka słów na sekundę. To przybliżenie, ale dobrze tłumaczy, dlaczego jedne komputery „lecą”, a inne „mielą”.

PC z kartą graficzną: szybko, ale mało pamięci

W zwykłym komputerze PC są dwie pamięci: RAM dla procesora (duża, wolna) i VRAM na karcie graficznej (mała, bardzo szybka). Model uruchamia się dobrze tylko wtedy, gdy mieści się w VRAM. Najmocniejsza konsumencka karta NVIDIA, GeForce RTX 5090, ma 32 GB (NVIDIA); RTX 5080 ma 16 GB przy przepustowości 960 GB/s (NVIDIA). To znaczy: karta za kilka tysięcy dolarów jest bardzo szybka, ale zmieści model do około 30B; modele 70B wymagają dwóch kart albo częściowego użycia wolnej pamięci RAM, co drastycznie zwalnia. Ollama obsługuje karty NVIDIA (od generacji z możliwością obliczeniową 5.0, sterownik 550 lub nowszy), wybrane karty AMD i układy Intel przez Vulkan; bez karty działa na samym procesorze, wolno (o obsłudze sprzętu).

Mac z Apple Silicon: pamięć wspólna, czyli dlaczego to działa tak dobrze

W procesorach Apple M (M1, M2, M3, M4, M5) procesor i układ graficzny korzystają z jednej, wspólnej, szybkiej pamięci; Apple nazywa to pamięcią zunifikowaną. Skutek dla AI jest prosty: prawie cała pamięć komputera może służyć modelowi, a ta pamięć jest szybka. MacBook Pro z układem M5 Max ma do 128 GB pamięci przy przepustowości 460 albo 614 GB/s, M5 Pro 307 GB/s, podstawowy M5 153 GB/s (dane Apple). Mac Studio z M5 Ultra ma 96, 256 albo 512 GB przy 1,2 TB/s (dane Apple); poprzednia generacja z M3 Ultra oferowała do 512 GB przy 819 GB/s (dane Apple). Ollama używa układu graficznego Apple przez Metal (dokumentacja).

Porównaj: laptop za około trzy tysiące dolarów z 64 GB pamięci wspólnej uruchomi model 70B, którego na PC nie zmieści żadna pojedyncza karta konsumencka. Karta PC będzie szybsza przy małych modelach, ale Mac uruchomi większe. Dlatego wśród osób pracujących z lokalnymi modelami Mac Studio z dużą pamięcią stał się standardem. Uwaga na dwie rzeczy: Mac z 8 GB pamięci uruchomi tylko najmniejsze modele, a Maca nie da się rozbudować po zakupie; pamięć wybierasz raz.

Trzecia droga: PC z pamięcią wspólną

AMD produkuje procesory Ryzen AI Max+ 395 z do 128 GB pamięci wspólnej, z której do 96 GB może służyć układowi graficznemu (dane AMD). To odpowiedź PC na pomysł Apple; komputery z tym układem są tańsze od Maca z podobną pamięcią, ale przepustowość pamięci jest niższa, więc duże modele piszą wolniej. Ollama obsługuje te układy jako karty AMD (dokumentacja).

Rekomendacje: co kupić albo co masz

SprzętModele, które uruchomisz wygodnieCo to daje w praktyce
Dowolny laptop z 8 GB RAM, bez karty1B do 4B (Gemma 3 1B i 4B, Qwen3 4B)Proste pytania, krótkie streszczenia, wolno; do spróbowania, nie do pracy
Mac z 16 GB pamięci wspólnej albo PC z kartą 8 GB4B do 8B (Gemma 3 4B, Qwen3 8B, Llama 3.2, Mistral 7B, Bielik 11B w wariancie Q4)Codzienne zadania, dokumenty do kilkunastu stron, płynne odpowiedzi
Mac z 32–64 GB albo PC z kartą 16–24 GB12B do 30B (Gemma 3 12B i 27B, Qwen3 14B i 30B, gpt-oss 20B, Bielik w wyższych wariantach)Wyraźnie mądrzejsze odpowiedzi, długie dokumenty, pomoc w kodzie; sensowny „domowy asystent”
Mac z 128 GB, PC z kartą 32 GB lub dwiemaDo 70B (Llama 3.3 70B, Qwen3 32B) i gpt-oss 120B na 128 GBJakość zbliżona do chmury sprzed roku, dwa; praca zawodowa na poufnych danych
Mac Studio 256–512 GBNajwiększe modele otwarte (Qwen3 235B, gpt-oss 120B z zapasem)Serwer AI dla domu lub małej firmy, bez chmury

Rozmiary modeli: Gemma 3 4B 3,3 GB, 12B 8,1 GB, 27B 17 GB (Ollama); Qwen3 8B 5,2 GB, 14B 9,3 GB, 30B 19 GB, 235B 142 GB (Ollama); Llama 3.3 70B 43 GB (Ollama); gpt-oss 20B około 14 GB, „na komputery z 16 GB pamięci”, 120B około 65 GB (Ollama); Bielik 11B od 6,7 GB (Q4) do 22 GB (pełna precyzja) (Ollama). Jeśli dopiero kupujesz komputer i myślisz o AI: więcej pamięci jest ważniejsze niż szybszy procesor.

Instalacja krok po kroku

Mac

Wymagania: macOS Sonoma (14) lub nowszy; procesory Apple M z obsługą karty graficznej, Intel tylko na procesorze (dokumentacja).

  1. Pobierz

    Wejdź na ollama.com/download/mac i pobierz plik. Otwórz go i przeciągnij ikonę Ollama do folderu Aplikacje.

  2. Uruchom

    Otwórz Ollama z Aplikacji. Przy pierwszym uruchomieniu zapyta o zgodę na dodanie polecenia do terminala; zgódź się, przyda się później.

  3. Wybierz model

    W oknie czatu jest lista modeli do wyboru; pierwsze użycie pobiera model (kilka GB, chwilę trwa). Na start wybierz Gemma 3 4B albo Qwen3 8B, jeśli masz 16 GB pamięci.

  4. Napisz pierwsze pytanie

    Okno działa jak ChatGPT. Pliki PDF i tekstowe przeciągasz do okna; zdjęcia rozumieją modele oznaczone jako obsługujące obrazy (o aplikacji).

Windows

  1. Pobierz i zainstaluj

    ollama.com/download/windows, uruchom instalator, kliknij dalej (dokumentacja).

  2. Karta graficzna

    Jeśli masz kartę NVIDIA, miej aktualne sterowniki; Ollama sama ją wykryje. Bez karty działa na procesorze, wolniej.

  3. Wybierz model i pisz

    Tak samo jak na Macu: okno czatu, lista modeli, przeciąganie plików.

Linux

Jedno polecenie w terminalu, z dokumentacji Ollama; przy kartach NVIDIA potrzebne są sterowniki CUDA, przy AMD ROCm w wersji 7:

Polecenie · instalacja na Linuksie

curl -fsSL https://ollama.com/install.sh | sh

Pierwsze polecenia w terminalu

Aplikacja z oknem czatu wystarcza większości osób. Terminal daje więcej kontroli i jest potrzebny na Linuksie. Na Macu program „Terminal”, na Windows „PowerShell”; wklejasz polecenie i naciskasz Enter. Polecenia pochodzą z dokumentacji Ollama.

Polecenie 1 · pobierz i uruchom mały model (około 3 GB)

ollama run gemma3:4b

Polecenie 2 · polski Bielik 11B w wariancie oszczędnym (6,7 GB, potrzebne około 10 GB pamięci)

ollama run SpeakLeash/bielik-11b-v3.0-instruct:Q4_K_M

Polecenie 3 · większy model, gdy masz 16 GB lub więcej

ollama run qwen3:8b

Polecenia 4 · porządki: lista, pobranie bez uruchamiania, co działa, usunięcie, wyjście z rozmowy

ollama list
ollama pull gemma3:12b
ollama ps
ollama rm gemma3:4b
/bye

Po „ollama run” pojawia się znak zachęty i piszesz jak w czacie. Pierwsze uruchomienie pobiera model; kolejne startują w sekundy. Model po pięciu minutach bezczynności jest zwalniany z pamięci i ładuje się ponownie przy następnym pytaniu (dokumentacja).

Który model na start

ModelProducentRozmiary i plikiDo czego
Gemma 3Google270M, 1B, 4B (3,3 GB), 12B (8,1 GB), 27B (17 GB); czyta obrazy od 4BUniwersalny, dobry start; 4B na słabym sprzęcie, 12B i 27B na mocnym
Qwen3AlibabaOd 0,6B do 235B; 8B 5,2 GB, 14B 9,3 GB, 30B 19 GBBardzo dobry w wielu językach i w kodzie; szeroki wybór rozmiarów
Bielik 11B v3.0SpeakLeash i ACK Cyfronet AGH (Polska)Warianty od 6,7 GB (Q4) do 22 GB (pełna precyzja); 32 języki europejskie, zoptymalizowany pod polski; Apache 2.0Polskie teksty, pisma, tłumaczenia z polskiego i na polski
gpt-ossOpenAI20B (około 14 GB, na komputery z 16 GB), 120B (około 65 GB); Apache 2.0Rozumowanie i zadania wieloetapowe; 20B to dobry wybór na Maca z 32 GB
Llama 3.3Meta70B (43 GB)Dla mocnych komputerów; jakość zbliżona do dużych modeli
DeepSeek-R1DeepSeekKilka rozmiarów, w tym 8BModele „rozumujące”, pokazują tok myślenia; lokalnie bez wysyłania danych do Chin
Mistral 7BMistral AI (Francja)7BKlasyczny, lekki, szybki

Źródła rozmiarów: strony modeli w bibliotece Ollama podlinkowane wyżej i w tabeli źródeł. Nazwy z dwukropkiem (gemma3:12b) to konkretne warianty; bez dwukropka Ollama bierze domyślny. Wariant Q4 to model skompresowany czterokrotnie: mniejszy i szybszy, nieco mniej dokładny; strona Bielika ostrzega, że modele skompresowane „wykazują obniżoną jakość odpowiedzi i możliwe halucynacje”. Do codziennych zadań Q4 wystarcza; do pracy wymagającej precyzji weź Q6 albo Q8, jeśli masz pamięć.

Prompty do wypróbowania lokalnie

Model lokalny nie ma internetu, więc pytaj o rzeczy, które ma „w sobie” albo w załączonym pliku. Cztery elementy dobrego promptu (rola, kontekst, zadanie, format) z przewodnika po ChatGPT działają tu tak samo, a nawet ważniej, bo mniejszy model gorzej zgaduje, o co Ci chodzi.

Prompt 1 · test po polsku (najlepiej z Bielikiem)

Napisz uprzejme pismo do wspólnoty mieszkaniowej z prośbą o naprawę oświetlenia na klatce schodowej, które nie działa od dwóch tygodni. Pół strony, oficjalny ton, z miejscem na moje dane i datę.

Prompt 2 · dokument, którego nie chcesz wysyłać do chmury (przeciągnij plik do okna)

Streść załączony dokument po polsku w pięciu punktach. Osobno wypisz daty, kwoty i moje obowiązki. Nie dodawaj niczego, czego nie ma w dokumencie; jeśli czegoś nie ma, napisz to.

Prompt 3 · tłumaczenie z zachowaniem tonu

Przetłumacz poniższy e-mail z angielskiego na polski, zachowując ton i podział na akapity. Zwroty urzędowe zostaw po angielsku w nawiasie.
[wklej tekst]

Prompt 4 · sprawdź, czy model przyznaje się do niewiedzy

Jaka jest dzisiejsza data i jakie są dziś najważniejsze wiadomości z Polski? Jeśli nie masz dostępu do internetu ani do dzisiejszej daty, napisz to wprost zamiast zgadywać.

Prompt 5 · nauka z ćwiczeniem

Jesteś nauczycielem angielskiego. Naucz mnie pięciu zdań przydatnych u lekarza: zdanie, wymowa zapisana po polsku, tłumaczenie. Potem zadaj mi jedno ćwiczenie i poczekaj na odpowiedź.

Odpowiedź na prompt 4 mówi dużo o modelu: dobry napisze, że nie zna daty ani wiadomości. Słaby wymyśli. Wymyślanie to ta sama wada, co w chmurze, tylko częstsza przy małych modelach; ważne fakty sprawdzasz.

Ustawienia, które warto znać

Długość kontekstu – ile tekstu model widzi naraz. Domyślnie Ollama ustawia 4096 tokenów, czyli kilka stron; przy długich dokumentach trzeba to zwiększyć w ustawieniach aplikacji albo zmienną OLLAMA_CONTEXT_LENGTH, kosztem większego zużycia pamięci (dokumentacja). Jeśli model „nie widzi” końca załączonego pliku, to jest przyczyna.

Gdzie są modele – na Macu w folderze ~/.ollama/models, na Windows w C:\Users\nazwa\.ollama\models; można to zmienić zmienną OLLAMA_MODELS, np. na dysk zewnętrzny (dokumentacja). Modele zajmują od kilku do kilkudziesięciu GB każdy; co jakiś czas usuń nieużywane.

Dostęp z innych urządzeń w domu – domyślnie Ollama słucha tylko na własnym komputerze. Ustawienie OLLAMA_HOST na 0.0.0.0:11434 udostępnia ją w sieci domowej, np. laptopowi albo telefonowi przez aplikację czatu (dokumentacja). Nie udostępniaj jej do internetu; nie ma hasła.

Modele w chmurze Ollamy – Ollama oferuje też uruchamianie dużych modeli na swoich serwerach: plan darmowy z kredytami, Pro za 20 USD i Max za 100 USD miesięcznie, z deklaracją braku logowania, braku trenowania i zerowego przechowywania danych (strona Ollama Cloud). To wygodne, ale to już nie jest „lokalnie”; jeśli chcesz mieć pewność, że nic nie wychodzi, ustaw OLLAMA_NO_CLOUD=1 (dokumentacja).

Inne programy do modeli lokalnych

  • Open WebUI – interfejs czatu w przeglądarce, który łączy się z Ollamą; wygląda jak ChatGPT, ma użytkowników, historię, pracę z dokumentami; dobry, gdy Ollama stoi na jednym komputerze, a korzysta cała rodzina (projekt).
  • LM Studio – alternatywa dla Ollamy z rozbudowanym oknem, wyborem modeli z katalogu i ustawieniami sprzętu; dla osób, które wolą klikać niż pisać polecenia (strona).
  • llama.cpp – silnik, na którym opiera się Ollama i wiele innych programów; dla zaawansowanych (projekt).

Bezpieczeństwo i prywatność

Lokalnie znaczy prywatnie, ale nie „bezmyślnie”
  • Nie udostępniaj Ollamy do internetu. Nie ma hasła; każdy, kto trafi na adres, może z niej korzystać i czytać, co jej wysyłasz. W sieci domowej tak, publicznie nie.
  • Pobieraj modele z biblioteki Ollama albo od znanych producentów. Model to plik; plik od nieznanego autora może być gorszy, niż obiecuje, albo celowo zmanipulowany.
  • Licencje. Bielik i gpt-oss są na Apache 2.0, można ich używać także komercyjnie; Llama i Gemma mają własne licencje z warunkami. Jeśli budujesz coś dla firmy, przeczytaj licencję modelu.
  • Halucynacje są takie same jak w chmurze, tylko częstsze. Mały model pewnym tonem wymyśli datę albo przepis. Sprawdzasz.
  • Prąd i ciepło. Duży model na laptopie grzeje i zużywa baterię; przy dłuższej pracy podłącz zasilanie.

Najczęstsze błędy początkujących

  • Za duży model na za mały komputer. Model, który nie mieści się w pamięci, działa kilkadziesiąt razy wolniej albo wcale. Zacznij od 4B, potem zwiększaj.
  • Oczekiwanie wiedzy o dzisiejszych wydarzeniach. Model lokalny nie ma internetu. Do wiadomości jest Perplexity.
  • Za krótki kontekst przy długim pliku. Zwiększ długość kontekstu w ustawieniach.
  • Dysk pełen modeli. Każdy „ollama run nowość” to kolejne gigabajty; usuwaj nieużywane.
  • Mac z 8 GB „do AI”. Uruchomi tylko najmniejsze modele. Przy zakupie pod AI wybieraj 32 GB i więcej.
  • Prompt jak do ChatGPT. Mniejszy model potrzebuje więcej kontekstu i jaśniejszego formatu; im mniejszy model, tym lepszy musi być prompt.
  • Otwarcie portu do internetu „żeby mieć dostęp z pracy”. Zamiast tego VPN do domu.

Najczęściej zadawane pytania

Czy Ollama jest naprawdę darmowa?

Tak, program i modele otwarte są bezpłatne. Płatna jest tylko opcjonalna chmura Ollamy. Kosztem jest sprzęt i prąd.

Czy to działa bez internetu?

Tak, po pobraniu modelu. Internet jest potrzebny tylko do pobrania programu i modeli.

Czy modele lokalne mówią po polsku?

Większe modele (Gemma 3 12B i 27B, Qwen3 od 8B, gpt-oss, Llama 3.3) tak, choć z gorszą polszczyzną niż chmura. Bielik jest do polskiego stworzony i przy podobnym rozmiarze pisze po polsku najlepiej.

Mam laptopa PC z 16 GB RAM i bez karty graficznej. Czy warto?

Do spróbowania tak: modele 4B do 8B ruszą na procesorze, powoli, ale ruszą. Do codziennej pracy potrzebna jest karta graficzna albo Mac z pamięcią wspólną.

Mac czy PC do AI w domu?

Jeśli chcesz uruchamiać duże modele (30B i więcej) w jednym, cichym komputerze, Mac z 64 GB lub więcej. Jeśli głównie małe i średnie modele i zależy Ci na szybkości oraz grach, PC z kartą NVIDIA 16–32 GB. Jeśli budżet jest ważny, a chcesz dużo pamięci, komputer z AMD Ryzen AI Max+.

Czy mogę używać Ollamy z ChatGPT albo Claude?

To osobne programy. Możesz mieć oba: chmurę do trudnych zadań i aktualności, Ollamę do poufnych dokumentów. Programiści łączą Ollamę z narzędziami do kodu, w tym z Claude Code, ale to temat zaawansowany.

Czy Bielik to to samo co ChatGPT po polsku?

Nie. To mniejszy, otwarty model wytrenowany z myślą o polskim, który działa u Ciebie. Zna polski bardzo dobrze, ale ma mniej wiedzy ogólnej niż największe modele chmurowe i nie ma internetu.

Podsumowanie fact-check

Co wiemy na pewno, a co się zmienia
  • Na pewno prawda: Ollama jest bezpłatna, działa na Macu, Windows i Linuksie, uruchamia modele lokalnie i według producenta nie widzi promptów; obsługuje karty NVIDIA, AMD, układy Apple przez Metal i procesor jako zapas; domyślny kontekst to 4096 tokenów; Bielik 11B jest na licencji Apache 2.0 i dostępny w bibliotece Ollama; MacBook Pro z M5 Max ma do 128 GB pamięci wspólnej, Mac Studio do 512 GB; RTX 5090 ma 32 GB. Wszystko z linkami do dokumentacji producentów.
  • Prawdopodobnie prawda na dzień weryfikacji: rozmiary plików modeli i lista wariantów w bibliotece; ceny chmury Ollamy (Pro 20, Max 100 USD). Zmieniają się z każdą wersją.
  • Co jest niepewne: dokładna szybkość pisania na konkretnym komputerze; reguła „przepustowość przez rozmiar modelu” jest przybliżeniem górnej granicy, a rzeczywistość zależy od modelu, wersji programu i sterowników.
  • Częsty mit: „lokalny model to ChatGPT bez abonamentu”. To mniejszy, prywatny asystent bez internetu; do wielu rzeczy wystarczy, do najtrudniejszych nie.

Źródła

ŹródłoTypWiarygodność
Ollama – pobieranieOficjalneWysoka
Ollama – aplikacja z oknem czatuOficjalneWysoka
Ollama – instalacja na macOSOficjalneWysoka
Ollama – instalacja na WindowsOficjalneWysoka
Ollama – instalacja na LinuksieOficjalneWysoka
Ollama – obsługa sprzętu i kart graficznychOficjalneWysoka
Ollama – pytania i odpowiedzi (kontekst, prywatność, sieć)OficjalneWysoka
Ollama – dokumentacja i wymagania pamięciOficjalneWysoka
Ollama – chmuraOficjalneWysoka
Ollama – Gemma 3OficjalneWysoka
Ollama – Qwen3OficjalneWysoka
Ollama – Llama 3.3OficjalneWysoka
Ollama – gpt-ossOficjalneWysoka
Ollama – DeepSeek-R1OficjalneWysoka
Ollama – MistralOficjalneWysoka
Ollama – Bielik 11B v3.0OficjalneWysoka
SpeakLeash – BielikOficjalneWysoka
SpeakLeash – modele na Hugging FaceOficjalneWysoka
Apple – dane techniczne MacBook ProProducentWysoka
Apple – dane techniczne Mac StudioProducentWysoka
Apple – Mac Studio 2025 (M3 Ultra)ProducentWysoka
NVIDIA – GeForce RTX 5090ProducentWysoka
NVIDIA – GeForce RTX 5080ProducentWysoka
AMD – Ryzen AI Max+ 395ProducentWysoka
Open WebUIProjekt otwartyWysoka
LM StudioProducentWysoka
llama.cppProjekt otwartyWysoka

Powiązane tematy:

← Wróć do Poradnika AI

Czy ten poradnik był pomocny?

Pomóż innym – podziel się doświadczeniem

Odpowiedz na jedno pytanie poniżej. Twoja odpowiedź pomoże osobom w podobnej sytuacji.

Jak długo trwała instalacja Ollama na Twoim komputerze? Czy napotkałeś jakieś trudności podczas tego procesu?

Twoja odpowiedź zostanie sprawdzona przed publikacją.

Komentarze (0)

Brak komentarzy. Bądź pierwszy!


Dodaj komentarz

Zaloguj się aby uniknąć weryfikacji emaila przy każdym komentarzu, lub komentuj jako gość:

Komentarz może być moderowany przed publikacją.