monaltro . pl
← Dziennik
Sztuczna Inteligencja 22 lip 2026 · 10 min czytania · Zespół Monaltro

Llama 4 od Meta w polskiej firmie — realia sprzętowe, licencja i co z polskim językiem

Llama 4 Scout i Maverick to potężne modele otwarte od Meta — ale uruchomienie ich lokalnie wymaga o wiele więcej niż typowy firmowy laptop. Sprawdzamy, co jest możliwe dla MŚP, co mówi licencja i co z brakiem polskiego w oficjalnym wsparciu językowym.

Llama 4 Scout i Maverick to potężne modele otwarte od Meta — ale uruchomienie ich lokalnie wymaga o wiele więcej niż typowy firmowy laptop. Sprawdzamy, co jest możliwe dla MŚP, co mówi licencja i co z brakiem polskiego w oficjalnym wsparciu językowym.

W kwietniu 2025 roku Meta ogłosiła premierę Llama 4 — pierwszej serii modeli open weights, która natywnie rozumie tekst i obrazy, obsługuje okno kontekstowe liczące miliony tokenów i bazuje na architekturze Mixture-of-Experts, wcześniej zarezerwowanej dla największych laboratoriów AI. Reakcja społeczności była natychmiastowa: tysiące pobrań, dziesiątki benchmarków, setki postów z pytaniem „a czy to działa po polsku?“.

Ponad rok po premierze wielu właścicieli firm wciąż zadaje te same pytania: czy powinienem to uruchomić lokalnie? Czy mam sprzęt? Co wolno mi z tym modelem robić komercyjnie? I co z polskim? Ten post daje konkretne odpowiedzi — bez marketingowych uproszczeń, za to z liczbami i pełnymi odniesieniami do oficjalnych dokumentów Meta.

Co to jest Llama 4 — dwa modele i architektura, która zmienia zasady

Llama 4 to dwa różne modele instrukcyjne, zbudowane na tej samej architekturze Mixture-of-Experts (MoE), ale o zupełnie innym charakterze:

Llama 4 ScoutLlama 4 Maverick
Aktywne parametry17 mld (17B)17 mld (17B)
Łączna liczba parametrów109 mld (109B)400 mld (400B)
Liczba ekspertów (MoE)16128
Okno kontekstowe10 milionów tokenów1 milion tokenów
Dane treningowe~40 bln tokenów~22 bln tokenów
WejścieTekst + obrazTekst + obraz
WyjścieTekst + kodTekst + kod
Data premiery5 kwietnia 20255 kwietnia 2025

Liczba 17 miliardów „aktywnych” parametrów może być myląca. Architektura MoE działa tak, że przy każdym zapytaniu model aktywuje tylko część dostępnych ekspertów (te 17B). Ale wszystkie wagi modelu — wszystkie 109B albo 400B — muszą być załadowane do pamięci, bo router decyduje dopiero w czasie rzeczywistym, który ekspert zostanie wywołany.

Prosta analogia: wyobraź sobie firmę z 128 specjalistami siedzącymi w biurze. Żeby odpowiedzieć na Twoje pytanie, do rozmowy wchodzą tylko najlepiej dopasowani — ale wszyscy muszą być w budynku. Ich wynagrodzenia (tutaj: pamięć RAM) płacisz niezależnie od tego, ile osób aktualnie rozmawia.

W praktyce oznacza to, że obliczenia są wydajne (aktywne 17B, a nie 400B), ale wymagania pamięciowe są wysokie — bo całe „biuro” musi być załadowane do pamięci operacyjnej lub VRAM karty graficznej.

Scout z oknem 10 milionów tokenów to jedna z największych przestrzeni kontekstowych dostępnych w open weights: w teorii możesz jednorazowo wczytać całą roczną korespondencję firmy albo kilkusetstronicową umowę i rozmawiać z modelem o jej treści. Maverick z kolei oferuje głębsze rozumowanie dzięki 128 ekspertom — lepiej radzi sobie z zadaniami analitycznymi i kodem.

Na standardowych testach akademickich Scout osiąga wynik MMLU 79,6%, a Maverick — 85,5% (dane z oficjalnego model card Meta). Dla kontekstu: wyniki w górnym zakresie tego benchmarku odpowiadają poziomowi, który jeszcze dwa lata temu był domeną wyłącznie zamkniętych modeli komercyjnych klasy GPT-4. To nieźle pokazuje, jak bardzo rynek open weights dojrzał w ciągu 2024–2025.

Wiedza modeli jest cięta na sierpień 2024 roku, co dla zagadnień prawno-podatkowych w Polsce oznacza brak informacji o zmianach z 2025–2026 roku.

Realia sprzętowe — ile potrzebujesz i co to oznacza dla firmy

Tu zaczyna się rozmowa, której producenci open source zwykle unikają. Ile to zajmuje miejsca na dysku i w pamięci?

Obowiązuje prosta matematyka kwantyzacji: w popularnym formacie Q4_K_M każdy parametr zajmuje ok. 0,5 bajtów. Dla Llama 4 Scout (109B parametrów) oznacza to plik o wadze ok. 55–60 GB. Dla Maverick (400B) — ok. 200 GB.

Cały ten plik musi zmieścić się w pamięci roboczej podczas inferencji. Czy jest to VRAM karty graficznej, zunifikowana pamięć RAM w Apple Silicon, czy hybryda GPU+CPU — zależy od implementacji i sprzętu. W każdym razie liczby są takie:

Scout — wymagania praktyczne

  • Minimum realistyczne: Mac Studio M4 Max z 128 GB RAM lub Mac Studio M4 Ultra z 192 GB RAM (zunifikowana pamięć Apple — VRAM i RAM to jedno). Przy 128 GB model wchodzi z zapasem; przy 64 GB jest zbyt ciasno.
  • PC z kartą graficzną: Uruchomienie na pojedynczej karcie — nawet RTX 4090 z 24 GB VRAM — jest niemożliwe w całości. Wymagana jest konfiguracja wieloGPU (np. 3× RTX 4090 = 72 GB VRAM) albo praca hybrydowa GPU+CPU z 64–96 GB RAM; ta druga opcja jest powolna.
  • Typowy laptop biurowy lub PC z 16–32 GB RAM: nie uruchomisz Llama 4 Scout lokalnie, niezależnie od systemu operacyjnego.

Maverick — wymagania praktyczne

Maverick przy Q4 to ok. 200 GB. To poziom serwerów AI z wieloma kartami A100 lub H100. Poza zasięgiem pojedynczej firmy, chyba że mowa o dużym centrum obliczeniowym lub chmurze.

Co to oznacza dla MŚP

Dla typowego biura (laptopy z 16–32 GB RAM, ewentualnie stacja robocza) lokalne uruchomienie Llama 4 nie wchodzi w grę. Sensowny zakres to:

  • Lokalne modele: modele do ok. 30B parametrów przy Q4 (ok. 18 GB w pamięci). Przykład: Gemma 4 12B, Mistral Small 3.1 22B — sprawdziliśmy je w poprzednim tekście o lokalnym AI bez chmury.
  • Llama 4 przez API (chmura): serwisy jak Groq, Together.ai, Fireworks.ai oferują Llama 4 Scout i Maverick jako usługę. Płacisz za tokeny, nie za sprzęt. To najszybsza droga do przetestowania modelu.
  • Llama 4 lokalnie: realne tylko przy Mac Studio/Pro z 128 GB+ lub dedykowanej stacji AI.

Ostrzeżenie: w sieci krążą poradniki „jak uruchomić Llama 4 na laptopie z 16 GB RAM”. Technicznie możliwe jest załadowanie małej kwantyzacji przez Ollama z częściowym offloadingiem na CPU — ale czas odpowiedzi na pojedyncze zdanie może wynosić kilkanaście minut. Nie jest to użyteczne w pracy firmy.

Licencja Community — co wolno polskiej firmie

Llama 4 nie jest wydany na licencji Apache 2.0 (tak jak Gemma od Google). Ma własną Llama 4 Community License Agreement, obowiązującą od 5 kwietnia 2025 roku.

Kluczowe punkty, które dotyczą MŚP:

Co wolno:

  • Używać modelu komercyjnie do dowolnych celów — analiza dokumentów, chatboty, automatyzacja, fine-tuning na własnych danych.
  • Dystrybuować i wbudowywać w produkty lub usługi.
  • Modyfikować i tworzyć dzieła pochodne (fine-tuning).
  • Łączyć z własnymi danymi przez RAG — własny asystent AI na bazie wiedzy firmy to jedno z najbardziej praktycznych zastosowań.

Co jest wymagane:

  • Przy dystrybucji lub udostępnianiu: wyświetlenie napisu „Built with Llama” na stronie produktu lub interfejsie.
  • Jeśli budujesz na bazie Llama 4 własny model AI, jego nazwa musi zaczynać się od słowa „Llama” (np. „Llama-Firma-XYZ-v1”).
  • Dołączenie kopii licencji do każdej dystrybuowanej wersji modelu.

Główne ograniczenie komercyjne:

Licencja jest bezpłatna dla podmiotów, które nie przekraczają 700 milionów miesięcznie aktywnych użytkowników produktów i usług (łącznie z powiązanymi firmami). Dla każdej polskiej MŚP próg ten jest praktycznie nieistotny — chyba że ktoś prowadzi Facebook Polska.

Czy są ograniczenia geograficzne dla UE?

Treść licencji nie zawiera żadnego ograniczenia terytorialnego dla podmiotów z Unii Europejskiej. Licencja obowiązuje „worldwide” (na całym świecie). W pierwszych tygodniach po premierze, na początku kwietnia 2025, część użytkowników z UE raportowała problemy z dostępem do formularza pobierania modelu na HuggingFace — wynikało to z przejściowych kwestii związanych z rejestracją konta, nie z samej treści licencji. Model jest dostępny na HuggingFace dla zarejestrowanych użytkowników po zaakceptowaniu warunków; na Ollama dostępny bez dodatkowych ograniczeń geograficznych.

Jedną istotną kwestię prawną warto jednak odnotować: model był trenowany m.in. na publicznie udostępnianych postach z Instagrama i Facebooka oraz interakcjach użytkowników z Meta AI. Jeśli Twoje dane firmowe kiedykolwiek trafiły do tych platform — i jeśli zależy Ci na audytowalności łańcucha danych treningowych pod kątem RODO — jest to punkt do dyskusji z prawnikiem przed wdrożeniem.

Polski w Llama 4 — oficjalnie brak, w praktyce: zależy

Oficjalna lista języków wspieranych przez Llama 4 Scout i Maverick obejmuje 12 języków: arabski, angielski, francuski, niemiecki, hindi, indonezyjski, włoski, portugalski, hiszpański, tagalog, tajski i wietnamski.

Polskiego nie ma na liście.

Model card Meta wprost wskazuje: „użycie w językach lub możliwościach wykraczających poza te wymienione w tym modelu jest poza zakresem zastosowania”. Jednocześnie autorzy dodają zastrzeżenie: Llama 4 był pre-trenowany na 200 językach (w ramach projektu NLLB — No Language Left Behind), a deweloperzy mogą fine-tunować go dla języków spoza 12 wspieranych, przyjmując odpowiedzialność za bezpieczeństwo i jakość.

Co to oznacza w praktyce?

Llama 4 po polsku — co działa, co nie

Działa zazwyczaj poprawnie:

  • Prosta korespondencja, e-maile, odpowiedzi na pytania ogólne po polsku.
  • Tłumaczenia z języków ze wspieranej 12-tki (angielski, niemecki, włoski) na polski.
  • Generowanie prostych dokumentów (notatki, podsumowania, listy).

Działa gorzej niż w anglojęzycznych benchmarkach:

  • Złożone analizy prawne lub finansowe — model może „gubić” niuanse polskiego prawa.
  • Zadania wymagające wiedzy po sierpniu 2024 roku (np. zmiany podatkowe 2025–2026).
  • Instruowanie modelu wyłącznie po polsku — angielskie system prompty generalnie dają lepsze wyniki.

Nie testuj bez weryfikacji:

  • Odpowiedzi na pytania o specyficzne polskie przepisy (VAT, ZUS, KSeF) — brak danych po cutoff sierpień 2024 + niższe ogólne wyniki dla polskiego.
  • Analiza umów z polskim prawem jako kontekstem — ryzyko pominięcia kluczowych niuansów.

Jeśli potrzebujesz modelu, który od razu dobrze działa po polsku, warto spojrzeć na Bielik — otwarty model językowy opracowany przez polskie konsorcjum SpeakLeash (na licencji Apache 2.0, dostępny przez Ollama), zoptymalizowany specjalnie pod język polski. Dla zastosowań wymagających perfekcyjnej polszczyzny to aktualnie lepsza baza startowa niż Llama 4.

Kiedy Llama 4 ma sens dla MŚP, a kiedy nie

Poniższa matryca opiera się na rzeczywistych wymaganiach sprzętowych i możliwościach językowych — bez rozmazywania odpowiedzi.

Scenariusze, gdzie Llama 4 ma sens

1. Masz Mac Studio z 128 GB lub więcej i przetwarzasz bardzo długie dokumenty

10-milionowe okno kontekstowe Scout to coś, czego nie oferuje żaden komercyjny model w tej samej formule cenowej (bezpłatna licencja, działanie lokalne). Jeśli przetwarzasz archiwa umów, wielotomowe regulaminy, dokumentację technicznych systemów — Scout lokalnie może być uzasadnioną inwestycją w sprzęt.

2. Chcesz wypróbować Llama 4 bez inwestycji sprzętowej

API na platformach takich jak Groq (lider w prędkości) lub Together.ai daje dostęp do Llama 4 Scout i Maverick bez konfiguracji lokalnej. Przetestuj model w kontekście swoich zadań — zanim zdecydujesz o zakupie drogiego sprzętu.

3. Potrzebujesz multimodalnego modelu open source do zadań wizualnych

Llama 4 natywnie analizuje obrazy (faktury, zdjęcia produktów, schematy). Jeśli budujesz pipeline do automatycznego czytania i indeksowania skanów, Llama 4 jest jedną z niewielu open weights opcji z tym poziomem możliwości wizualnych.

Scenariusze, gdzie lepiej wybrać coś innego

1. Standardowy sprzęt biurowy (laptopy, PC z 16–32 GB RAM)

Zostań przy mniejszych modelach. Pisaliśmy szczegółowo o Gemma 4 12B jako opcji bez chmury — działa na laptopie z 16 GB RAM, na licencji Apache 2.0, i całkowicie bezpłatnie.

2. Główne zastosowanie to praca po polsku z polskim prawem

Llama 4 nie był trenowany na polskich aktach prawnych ani orzecznictwie w zakresie, który dawałby pewność wyników. W tym przypadku:

  • Bielik (polski open source, Apache 2.0) — lepszy punkt startowy dla polskojęzycznych zadań.
  • Claude via API (Anthropic) lub GPT-4o (OpenAI) — znacznie wyższy poziom dla zadań wymagających aktualnej wiedzy prawnej.

3. Potrzebujesz modelu z wiedzą po sierpniu 2024

Knowledge cutoff Llama 4 to sierpień 2024 — przed zmianami VAT 2025–2026, nowelizacjami KSeF, AI Act wejściem w życie. Do zadań wymagających aktualnej wiedzy potrzebujesz modelu chmurowego z dostępem do bieżącej wiedzy lub z odpowiednim kontekstem RAG podanym przez Ciebie.

4. Chcesz szybkiej integracji z narzędziami SaaS (CRM, e-commerce, ERP)

Llama 4 przez API jest wygodna do integracji — ale jeśli nie masz programisty, gotowe ekosystemy jak Claude Projects lub GPT-4o z integracjami są znacznie łatwiejsze w konfiguracji dla zespołu bez zaplecza technicznego.

Jak uruchomić z Ollama (jeśli masz odpowiedni sprzęt)

Jeśli dysponujesz Mac Studio z wystarczającą pamięcią RAM lub konfiguracją wieloGPU, uruchomienie Llama 4 przez Ollama to kilka komend:

# Llama 4 Scout (~55 GB do pobrania)
ollama run llama4:scout

# Llama 4 Maverick (~200 GB)
ollama run llama4:maverick

# Wersja domyślna (Scout instruct)
ollama run llama4

Przed pobraniem zaloguj się na HuggingFace, zaakceptuj licencję Community na stronie modelu meta-llama/Llama-4-Scout-17B-16E-Instruct, a następnie uwierzytelnij Ollama tokenem HuggingFace:

ollama login hf.co

Ollama automatycznie dobierze kwantyzację do dostępnej pamięci. Jeśli pamięć jest niewystarczająca, model się nie uruchomi — nie będzie „działał wolno”, tylko wyświetli komunikat o braku zasobów.

Jeśli chodzi o prędkość: na Mac Studio M4 Ultra (192 GB RAM) możesz oczekiwać od Scoutа ok. 20–30 tokenów na sekundę — to tempo wystarczające do płynnej pracy interaktywnej. Na konfiguracji hybrydowej (GPU + CPU offload) prędkość spada do 5–10 tokenów na sekundę, co w praktyce oznacza kilka sekund oczekiwania na każde zdanie. Maverick lokalnie to scenariusz wyłącznie dla środowisk wieloserwerowych z kilkoma GPU klasy datacenter.

Podsumowanie

Llama 4 to jeden z najważniejszych kroków w historii open weights AI — multimodalność, architektura MoE i gigantyczne okno kontekstowe robią z niego poważnego kandydata dla firm potrzebujących prywatności danych i niezależności od zewnętrznych dostawców. Tyle że ta niezależność ma swoją cenę w postaci wymagań sprzętowych, które wykraczają poza typową firmową infrastrukturę. Dla MŚP bez własnego sprzętu AI kluczową zaletą jest tu możliwość testowania i iterowania przez API zanim podjęta zostanie decyzja o poważnej inwestycji sprzętowej.

Wskazówka: zanim kupisz drogi sprzęt lub serwer, przetestuj Llama 4 Scout przez API (Groq, Together.ai). Sprawdź jakość polskich odpowiedzi dla Twoich zadań. Jeśli wyniki są satysfakcjonujące — wtedy dopiero oblicz, czy inwestycja sprzętowa ma sens finansowy wobec alternatywy płatności per token. Jeśli potrzebujesz pomocy w zaprojektowaniu architektury lokalnego AI dla Twojej firmy — chętnie to przedyskutujemy.

§ Zaczynamy

Napisz. Odpiszemy.

Umów 30 minut →