← BlogBlog

Otwarte modele LLM 2026, na które warto patrzeć

Newsy o otwartych modelach LLM sypią się od grudnia 2025: Kimi K3 z 2,8 biliona parametrów, dwa odświeżenia DeepSeek V4, pierwsze od ponad roku otwarte wagi od Mety. Trudniejsze pytanie brzmi, czy licencja na dokładnie tym checkpoincie przejdzie przez dział prawny i czy wagi zmieszczą się w sprzęcie, który realnie wynajmiesz.

3 i 14Punktów do frontier, dwa rankingi
$0.03/MNajtańsze otwarte tokeny wejściowe
893 GBNajwiększy opisany tu checkpoint
2,8TParametrów w największym otwartym modelu

Aktualny stan otwartych modeli LLM

Otwarte wagi obejmują dziś całą skalę, od modelu 30B na jedną kartę w stacji roboczej po mieszankę ekspertów 2,8T. W najbardziej przychylnym pomiarze mają trzy punkty straty do najlepszego modelu zamkniętego, w trudniejszym czternaście. Oba odczyty były aktualne tego samego dnia.

Najszybciej rusza się cena. Na dole otwartej stawki przewaga nad frontierowym API to ponad stokrotność: 26 sierpnia 2026 gpt-oss-120b kosztował $0.03 za milion tokenów wejściowych, a DeepSeek V4 Flash $0.0679, wobec $5.00 za Claude Opus 5. Na szczycie przewaga paruje, bo Kimi K3 kosztuje mniej więcej połowę tego co Claude Opus 5, mając trzy punkty straty - to liczba do rachunku budowa kontra zakup.

Ceny za milion tokenów, OpenRouter, pobrane 26 sierpnia 2026. GLM-5.2 celowo pominięty: podane $0.4466 / $1.404 ma baner "68% taniej" u jedynego dostawcy, więc jest promocją, a nie stawką rynkową.
ModelWagiWejście $/MWyjście $/MKontekstDostawcy
gpt-oss-120bOtwarte0.030.17131K18
DeepSeek V4 FlashOtwarte0.06790.1681M17
MiniMax M3Otwarte0.230.961M13
Qwen3.8-27BOtwarte0.352.751M10
DeepSeek V4 ProOtwarte0.55591.1121M17
Kimi K3Otwarte2.5512.751,05M13
Claude Opus 5Zamknięte5.0025.001M-
To samo pytanie, cztery rankingi, cztery odpowiedziŹródła: Artificial Analysis v4.1.1 i llm-stats (pobrane 26 sie 2026), Mozilla State of Open Source AI v1.0.1 (lip 2026), Epoch Capabilities Index (29 maja 2026)
Artificial Analysis v4.1.1Kimi K3 60 wobec Claude Opus 5 63
3 punkty
Mozilla, State of Open Source AIKimi K3 57 wobec Claude Opus 5 61
4 punkty
Epoch Capabilities IndexKimi K2.6 151,60 wobec GPT-5.5 Pro 159,35
7,75 ECI
SWE-bench Verified, llm-stats0,806 wobec 0,950, strona z datą 25 sie 2026
14,4 punktu

Indeks Artificial Analysis uśrednia szeroki koszyk testów, a SWE-bench Verified mierzy jedną trudną rzecz: rozwiązywanie prawdziwych zgłoszeń z GitHuba. Praca agentów mieszka dokładnie w tym ogonie rozkładu, który uśrednianie chowa. Podawaj też wersję indeksu, bo Artificial Analysis przelicza wyniki przy jej zmianie.

DeepSeek-V4-Pro-Max, który trzyma czoło SWE-bench z 0,806, nie ma widocznego repozytorium w organizacji DeepSeeka na Hugging Face: to wynik z tablicy, a nie plik do pobrania.

Trzecia oś to licencje, które przestały podróżować razem z nazwą rodziny. Flagowy Qwen 2.4T ma własny ciąg qwen3.8-max, a wydany dwa dni później Qwen3.8-27B zwykłe Apache 2.0. Gemma 4 przeszła na Apache 2.0 zamiast dawnych Gemma Terms, a Llama 4 Community License wciąż wymaga osobnej licencji komercyjnej powyżej 700 milionów aktywnych użytkowników miesięcznie i włącza przez odesłanie politykę dopuszczalnego użycia. Czytaj plik, nie stronę rodziny.

Meta wypuściła Muse Glimmer 10 sierpnia na Apache 2.0, a rodzinę MobileMoE na urządzenia 26 sierpnia na licencji badawczej, niekomercyjnej. Ten sam producent, ten sam miesiąc, przeciwne warunki.

W polskiej firmie dochodzi drugie dno: otwarte wagi to także decyzja o tym, gdzie leżą dane. Model hostowany w Warszawie albo we Frankfurcie nie wysyła treści umów ani danych kadrowych poza twoją infrastrukturę, co przy RODO zdejmuje z biurka wątek transferu do państwa trzeciego. Obowiązki regulacyjne są rozpisane w tekście o AI Act.

Otwarte modele LLM warte uwagi

Cztery modele pokrywają większość tego, co zespół wziąłby dziś na krótką listę, każdy z dokładnym ciągiem licencji.

1. GLM-5.2. Z.ai opublikowało wagi 16 czerwca 2026: około 744B parametrów, z tego około 40B aktywnych, okno kontekstu 1M, licencja MIT. Z.ai zapowiedziało GLM-5.3 w połowie sierpnia, a na 26 sierpnia 2026, sprawdzone w organizacji Z.ai na Hugging Face, nie istnieje żadne repozytorium 5.3 i nie ogłoszono licencji.

2. MiniMax-M3. Premiera 1 czerwca 2026: 428B łącznie, 23B aktywnych, okno 1M i 80,5 w SWE-bench Verified według karty modelu. Ciąg licencji to `minimax-community`, ani Apache, ani MIT. Przy $0.23 za wejście i $0.96 za wyjście to jedna z najtańszych sensownych opcji na tablicy.

3. Kimi-K3. Flagowiec Moonshota, wagi z 26 lipca 2026: 2,8T łącznie, 104B aktywnych, 896 ekspertów, wagi MXFP4 trenowane z uwzględnieniem kwantyzacji. Karta modelu podaje GPQA-Diamond 93,5, a w indeksie Artificial Analysis model prowadzi otwartą kolumnę z wynikiem 60. Licencja to własna "Kimi K3 License" obejmująca kod i wagi razem, a przy $2.55 za wejście i $12.75 za wyjście kończy się otwarta przewaga cenowa.

4. DeepSeek-V4. Linia dzieli się na dwie części i ten podział jest całą praktyczną historią. V4 Pro 0813 jest na MIT, 1,6T łącznie z 49B aktywnymi, i ma 87,9 na Terminal Bench 2.1, ale jego checkpoint waży około 893 GB, więc MIT daje ci model, którego węzeł 8xH100 nie utrzyma. V4 Flash 0731, ta sama licencja, jest wersją realną: 284B łącznie, 13B aktywnych, 82,7 na Terminal Bench 2.1, a 26 sierpnia 2026 $0.0679 za wejście i $0.168 za wyjście.

Open Source LLM Tooling News Today: datowane newsy o narzędziach

Jeśli chcesz newsów o narzędziach na dziś, a nie kolejnej listy nazw, czytaj release notes, z wersjami, datami i liczbami.

Ollama dowiozła obsługę Muse Glimmer w dniu premiery 10 sierpnia razem ze wstępnym wsparciem MLX na Apple Silicon, a w v0.32.15 z 19 sierpnia skróciła czas do pierwszego tokena mniej więcej o połowę dzięki cache'owaniu metadanych modelu.

Changelog LM Studio czyta się tak samo: stabilne spekulatywne dekodowanie MTP w 0.4.14 z 22 maja, a w 0.4.21 z 12 sierpnia endpointy modeli w sieci wewnętrznej i klucze API lokalnego serwera.

llama.cpp dostał natywne NVFP4 pod Blackwella w PR zmerdżowanym 28 kwietnia 2026, a GGML_TYPE_NVFP4 = 40 siedzi dziś w tablicy typów ggml. Krążące wokół tego liczby o przepustowości pochodzą z forumowej arytmetyki, więc zmierz to sam.

Po stronie serwerowej większość newsów narzędziowych to praca nad funkcjami, a nie nagłówki, jak router świadomy podziału prefill/decode, który vLLM dodał w grudniu 2025. Po liczby, które starzeją się w tygodniach, SemiAnalysis prowadzi InferenceX z tygodniowymi migawkami.

Postępy w technikach inferencji

Wzrost wydajności. Większość newsów o otwartej inferencji dotyczy przepustowości. vLLM raportował 17 grudnia 2025 wynik 2200 tokenów wyjściowych na sekundę na jedno H200 przy serwowaniu DeepSeeka, a na GB200 NVL72 w lutym 2026 zmierzył 26,2 tys. tokenów prefillu i 10,1 tys. tokenów dekodowania na GPU na sekundę, czyli trzy do pięciu razy więcej niż H200.

Chunked pipeline parallelism w SGLang z 15 stycznia 2026 to lektura na długi kontekst: przepustowość prefillu w górę o 3,31x na sześciu węzłach po osiem H20 i czas do pierwszego tokena w dół o 67,9% na DeepSeek-V3.1. W tym samym wpisie prompt na milion tokenów dał pierwszy token po 420,91 sekundy, co czyni okno 1M funkcją do przetwarzania wsadowego, a nie do czatu.

Spekulatywne dekodowanie dowożą dziś same laboratoria: DeepSeek V4 Pro niesie moduł DSpark, a Unsloth zmierzył z nim 120 tokenów na sekundę na B200 wobec 60 bez niego.

Zgodność z tym, co już masz. Formaty spotykają się tu z twoim obecnym sprzętem i nie są darmowe. Badanie kwantyzacji potreningowej w formatach microscaling ze stycznia 2026 pokazało, że MXFP8 jest praktycznie bezstratny, a MXFP4 wyraźnie degraduje jakość, co waży tym więcej, że MXFP4 jest dziś tym, co kilka laboratoriów publikuje natywnie.

Zmierzone przez Unsloth buildy GGUF DeepSeek V4, pobrane 26 sierpnia 2026.
BuildRozmiarWierność wobec pełnej precyzji
UD-Q8_K_XL162 GBIdentyczny bitowo, dywergencja KL ~0, zgodność tokenów 100%
UD-Q4_K_XL155,1 GBDywergencja KL 0,0102, zgodność najlepszego tokena 96,28%
UD-IQ3_XXS103 GBPod maszyny ze 110-128 GB RAM

Unsloth publikuje zmierzone rozmiary i rozbieżności dla swoich buildów GGUF DeepSeek V4, a wynikają z nich dwie rzeczy. Build 4-bitowy jest ledwo mniejszy od 8-bitowego, bo eksperci są już natywnie w MXFP4 i przekwantyzowaniu podlegają tylko tensory spoza ekspertów. I 4 bity nie są darmowe: zgodność najlepszego tokena spada do 96,28%, czyli mniej więcej jeden token na 27 różni się od pełnej precyzji. W pojedynczej odpowiedzi tego nie widać, w czterdziestokrokowej pętli agenta widać bardzo, co jest osobnym problemem do zmierzenia.

Dalej arytmetyka, która rozstrzyga, czy to wszystko w ogóle cię dotyczy. Około 893 GB dla V4 Pro wobec 640 GB w węźle 8xH100 znaczy, że same wagi się nie mieszczą, jeszcze przed pierwszym tokenem KV cache. V4 Flash przy natywnym FP4 i FP8 wychodzi bliżej 170 GB, czyli dwa H200, albo około 90 do 100 GB przy społecznościowym INT4. gpt-oss-120b mieści się na jednym H100 80 GB.

Wkład społeczności i współpraca

Liczby pobrań pokazują, gdzie społeczność faktycznie poszła. Raport Hugging Face o otwartych modelach za 2026, opisany przez China Daily 16 sierpnia 2026, daje Qwenowi 2,045 miliarda pobrań w 2026 wobec 418 milionów dla Google i 227 milionów dla Mety, przy 151 448 modelach pochodnych od Qwena. Gemma ma ponad 400 milionów pobrań i ponad 100 000 wariantów społecznościowych.

OLMo 3 od Ai2 to inny rodzaj wkładu: w listopadzie 2025 wyszedł z danymi treningowymi, kodem i każdym pośrednim checkpointem obok wag, czyli z tym, co pozwala odtworzyć wynik, a nie tylko go powtórzyć.

Współpraca jest dziś także pozycją na liście przed premierą: wymienienie vLLM, SGLang albo llama.cpp na karcie modelu to zobowiązanie podjęte przed wydaniem, a jego brak jest realnym kosztem dla tego, kto wdraża pierwszy.

Najnowszy przykład współpracy to licencja, a nie model. Nemotron 3.5 Lightning od NVIDII i Laguna S 2.1 od Poolside, mieszanka ekspertów 118B wydana 21 lipca 2026, wychodzą oba na `openmdw-1.1`, licencji dystrybucji modeli od Linux Foundation, która zebrała właśnie drugiego i trzeciego adoptującego, podczas gdy pytanie o OSI zostaje otwarte.

Czego spodziewać się dalej po otwartych LLM

Epoch AI zamienia dystans na czas: od stycznia 2026 najmocniejsze modele z otwartymi wagami zostają za zamkniętym frontier średnio o cztery miesiące, czyli osiem punktów ECI. Epoch nie twierdzi, że luka się poszerza ani zawęża, i my też nie będziemy. Cztery miesiące to na tyle mało, że czekanie na wersję otwartą bywa realną opcją.

Najbliżej wydarzenia z datą jest GLM-5.3, zapowiedziany w połowie sierpnia z dużym skokiem we własnej tabeli Terminal-Bench Z.ai. Na 26 sierpnia 2026 brakuje i wag, i licencji, a to, czy się pojawią i na jakich warunkach, mówi o najbliższym półroczu więcej niż benchmark.

Przegląd bezpieczeństwa stał się zmienną w harmonogramie wydania. TechCrunch opisał 4 sierpnia 2026 ewaluację SaferAI, w której GLM-5.2 testowany przez publiczne API Z.ai nie odmówił żadnego z zadań ofensywnych, a Claude Opus 4.7 odmawiał tak konsekwentnie, że badania nie dało się dokończyć. Tnie to w obie strony: Far.ai prowadzi ranking uniwersalnych jailbreaków znalezionych w zamkniętych modelach frontier.

Sprzęt ma konkretną datę. Apple ogłosiło 25 sierpnia 2026 konfiguracje Mac Studio z M5 Max i M5 Ultra, do 512 GB pamięci zunifikowanej i 1,2 TB/s przepustowości, ze sprzedażą od 22 września. Apple nie podaje liczby parametrów dla "modeli klasy frontier z otwartymi wagami", które ta maszyna ma uruchamiać.

Naprawdę otwarte pytanie dotyczy tego, kto tych modeli używa. Menlo Ventures, po badaniu z listopada 2025 na 495 osobach decyzyjnych w amerykańskich firmach, podaje 11% firmowego użycia API LLM dla modeli open source, w dół z 19% rok wcześniej, bez aktualizacji za 2026. Raport Mozilli State of Open Source AI z lipca 2026 mówi coś przeciwnego: udział otwartych wag w tokenach OpenRoutera wzrósł z około jednej trzeciej pod koniec 2025 do większości w połowie 2026.

Oba wyniki są prawdziwe i nie liczą tych samych ludzi: Menlo liczy zakupy firmowe, a Mozilla ruch deweloperski. Pomost siedzi w liczbach samej Mozilli: 79% deweloperów dodających AI używa otwartych modeli, ale tylko 53% z nich dochodzi do produkcji, wobec 63% przy modelach zamkniętych.

Pięć rzeczy do sprawdzenia, zanim wybierzesz otwarty model

Mniej więcej tydzień pracy, bez żadnego dostawcy.

Otwórz plik LICENSE na dokładnie tym checkpoincie. Szukaj progu aktywnych użytkowników miesięcznie, ciągu atrybucyjnego do wyświetlania, zasady nazewnictwa modeli pochodnych i polityk włączonych przez odesłanie.

Wyceń prawdziwy tydzień ruchu i dopisz datę obok sumy. Tokeny wejściowe i wyjściowe osobno, po dzisiejszych stawkach, na trasie, z której skorzystasz. Ceny mają tu termin przydatności liczony w tygodniach.

Policz pamięć, zanim spojrzysz na benchmark. Parametry razy bajty na parametr, plus KV cache dla twojej długości kontekstu i współbieżności. Jeśli wynikiem jest klaster, benchmark nigdy nie był właściwym pytaniem.

Zmierz tę kwantyzację, którą wdrożysz, na własnych pytaniach. Sto do dwustu prawdziwych zapytań ze znanymi dobrymi odpowiedziami, na dokładnym buildzie i dokładnej długości kontekstu. Publikowane rozbieżności trzymają się w agregacie, a nie na twoich promptach.

Sprawdź, czy karta modelu wymienia twój silnik serwujący. Wsparcie w vLLM, SGLang albo llama.cpp w dniu premiery to różnica między dwudniowym a dwumiesięcznym wdrożeniem. Potem dodaj do zakładek żywe źródło: llm-stats aktualizuje się codziennie, InferenceX tygodniowo.

Jedna konkretna rzecz na ten tydzień: weź trzech głównych kandydatów, otwórz na każdym plik LICENSE i wyceń realny tydzień ruchu, z zapisaną datą. Model i tak rzadko bywa wąskim gardłem, a bezpieczne podłączenie go do własnych danych kosztuje zwykle więcej pracy niż wybór checkpointu. Jeśli wolisz, żeby ktoś przeliczył to na twoim obciążeniu, od tego jest bezpłatny audyt.

FAQ

Który otwarty model LLM jest teraz najlepszy?

To zależy od benchmarku, a uczciwa odpowiedź ma datę. W Artificial Analysis Intelligence Index v4.1.1, pobranym 26 sierpnia 2026, czołówka otwartych to Kimi K3 z 60 i Qwen3.8-2.4T-A95B z 58, wobec 63 dla Claude Opus 5. Jeśli musisz to zahostować u siebie, praktyczne odpowiedzi to DeepSeek V4 Flash i Qwen3.8-27B.

Czy Qwen jest na licencji Apache 2.0?

Częściowo. Qwen3.8-27B wydany 14 sierpnia 2026 ma Apache 2.0, a flagowy model 2.4T wydany dwa dni wcześniej własny ciąg licencji qwen3.8-max. Licencja należy do checkpointu, a nie do nazwy rodziny.

Czy da się uruchomić DeepSeek V4 lokalnie?

Wersji Pro nie, chyba że "lokalnie" znaczy klaster: checkpoint waży około 893 GB wobec 640 GB w węźle 8xH100, jeszcze przed KV cache. Realny jest V4 Flash, a zmierzone przez Unsloth buildy GGUF idą od 103 GB przy 3 bitach do 162 GB przy 8.

Czy otwarte modele są tańsze od zamkniętych API?

Na dole stawki dramatycznie: 26 sierpnia 2026 gpt-oss-120b kosztował $0.03 za milion tokenów wejściowych, a DeepSeek V4 Flash $0.0679, wobec $5.00 za Claude Opus 5. Na górze różnica schodzi do połowy, bo Kimi K3 kosztuje $2.55.

Historia zmian
  • 26 sierpnia 2026Ceny zaktualizowane na 26 sierpnia 2026. Dodany Poolside Laguna S 2.1 i zweryfikowana licencja Nemotron 3.5 Lightning.
  • 25 sierpnia 2026Publikacja.
Bezpłatny audyt procesów

Zobacz, jak wyglądałoby to w Twoich procesach.

Skontaktuj się

30 minut · wskazujemy 3 najlepsze obszary do automatyzacji · bez zobowiązań