Aktualny stan otwartych modeli LLM
Otwarte wagi obejmują dziś całą skalę, od modelu 30B na jedną kartę w stacji roboczej po mieszankę ekspertów 2,8T. W najbardziej przychylnym pomiarze mają trzy punkty straty do najlepszego modelu zamkniętego, w trudniejszym czternaście. Oba odczyty były aktualne tego samego dnia.
Najszybciej rusza się cena. Na dole otwartej stawki przewaga nad frontierowym API to ponad stokrotność: 26 sierpnia 2026 gpt-oss-120b kosztował $0.03 za milion tokenów wejściowych, a DeepSeek V4 Flash $0.0679, wobec $5.00 za Claude Opus 5. Na szczycie przewaga paruje, bo Kimi K3 kosztuje mniej więcej połowę tego co Claude Opus 5, mając trzy punkty straty - to liczba do rachunku budowa kontra zakup.
| Model | Wagi | Wejście $/M | Wyjście $/M | Kontekst | Dostawcy |
|---|---|---|---|---|---|
| gpt-oss-120b | Otwarte | 0.03 | 0.17 | 131K | 18 |
| DeepSeek V4 Flash | Otwarte | 0.0679 | 0.168 | 1M | 17 |
| MiniMax M3 | Otwarte | 0.23 | 0.96 | 1M | 13 |
| Qwen3.8-27B | Otwarte | 0.35 | 2.75 | 1M | 10 |
| DeepSeek V4 Pro | Otwarte | 0.5559 | 1.112 | 1M | 17 |
| Kimi K3 | Otwarte | 2.55 | 12.75 | 1,05M | 13 |
| Claude Opus 5 | Zamknięte | 5.00 | 25.00 | 1M | - |
Indeks Artificial Analysis uśrednia szeroki koszyk testów, a SWE-bench Verified mierzy jedną trudną rzecz: rozwiązywanie prawdziwych zgłoszeń z GitHuba. Praca agentów mieszka dokładnie w tym ogonie rozkładu, który uśrednianie chowa. Podawaj też wersję indeksu, bo Artificial Analysis przelicza wyniki przy jej zmianie.
DeepSeek-V4-Pro-Max, który trzyma czoło SWE-bench z 0,806, nie ma widocznego repozytorium w organizacji DeepSeeka na Hugging Face: to wynik z tablicy, a nie plik do pobrania.
Trzecia oś to licencje, które przestały podróżować razem z nazwą rodziny. Flagowy Qwen 2.4T ma własny ciąg qwen3.8-max, a wydany dwa dni później Qwen3.8-27B zwykłe Apache 2.0. Gemma 4 przeszła na Apache 2.0 zamiast dawnych Gemma Terms, a Llama 4 Community License wciąż wymaga osobnej licencji komercyjnej powyżej 700 milionów aktywnych użytkowników miesięcznie i włącza przez odesłanie politykę dopuszczalnego użycia. Czytaj plik, nie stronę rodziny.
Meta wypuściła Muse Glimmer 10 sierpnia na Apache 2.0, a rodzinę MobileMoE na urządzenia 26 sierpnia na licencji badawczej, niekomercyjnej. Ten sam producent, ten sam miesiąc, przeciwne warunki.
W polskiej firmie dochodzi drugie dno: otwarte wagi to także decyzja o tym, gdzie leżą dane. Model hostowany w Warszawie albo we Frankfurcie nie wysyła treści umów ani danych kadrowych poza twoją infrastrukturę, co przy RODO zdejmuje z biurka wątek transferu do państwa trzeciego. Obowiązki regulacyjne są rozpisane w tekście o AI Act.
Kluczowe trendy w newsach o otwartych LLM
Dwa trendy niosą większość newsów o otwartych modelach od grudnia 2025: modele urosły na górze i skurczyły się na dole jednocześnie, a stos serwujący przestał się spóźniać.
Najnowsze premiery modeli. To są premiery, które faktycznie coś zmieniły między grudniem 2025 a dziś. W kolumnie z datą jest moment publikacji wag, jeśli różni się od zapowiedzi, bo model, którego nie da się pobrać, nie jest jeszcze premierą.
| Model | Premiera | Łącznie / aktywne | Licencja | Benchmark |
|---|---|---|---|---|
| Mistral Large 3 | 2 gru 2025 | 675B / 41B MoE | Apache 2.0 | - |
| Gemma 4 | 2 kwi 2026 (zapowiedź) | 31B dense, 26B-A4B, 12B, E2B/E4B | Apache 2.0 | MMLU-Pro 85,2 (31B) |
| MiMo-V2.5-Pro | 22 kwi 2026 | 1,023T / 42B | MIT | AA Index 43 |
| DeepSeek V4 Pro Preview + V4 Flash | 24 kwi 2026 | 1,6T / 49B; 284B / 13B | MIT | Terminal Bench 2.1 72,1 |
| IBM Granite 4.1 | 29 kwi 2026 | 3B / 8B / 30B dense | Apache 2.0 | 5,33% WER (Speech 2B) |
| Cohere Command A+ | 20 maj 2026 | 218B / 25B | Apache 2.0 | - |
| MiniMax M3 | 1 cze 2026 | 428B / 23B | minimax-community | SWE-bench Verified 80,5 |
| NVIDIA Nemotron 3 Ultra | 4 cze 2026 | 550B MoE | Nemotron Open Model License | AA Index 38 |
| GLM-5.2 | wagi 16 cze 2026 | ~744B / ~40B | MIT | AA Index 51 |
| Inkling / Inkling-Small | 15 lip 2026 | 975B / 41B; 276B / 12B | Apache 2.0 | SWE-bench Verified 77,6 |
| Poolside Laguna S 2.1 | 21 lip 2026 | 118B / ~8B MoE | openmdw-1.1 | Terminal-Bench 2.1 70,2 |
| Kimi K3 | wagi 26 lip 2026 | 2,8T / 104B, 896 ekspertów | Kimi K3 License (własna) | GPQA-D 93,5 |
| DeepSeek V4 Flash 0731 | 31 lip 2026 | 284B / 13B | MIT | Terminal Bench 2.1 82,7 |
| Muse Glimmer (Meta) | 10 sie 2026 | 30B, destylowany | Apache 2.0 | - |
| Nemotron 3.5 Lightning | 11 sie 2026 | 30B / 3B | openmdw-1.1 | - |
| Qwen3.8-2.4T-A95B | 12 sie 2026 | 2,4T / 95B | qwen3.8-max (własna) | AA Index 58 |
| DeepSeek V4 Pro 0813 | 13 sie 2026 | 1,6T / 49B | MIT | AA Index 53 |
| Qwen3.8-27B | 14 sie 2026 | 27B dense, wizja | Apache 2.0 | AA Index 52 |
| GLM-5.3 | poł. sie 2026 (zapowiedź) | ~744B baza | Brak wag na 26 sie 2026 | - |
| gpt-oss-120b / 20b | 5 sie 2025 | 117B / 5,1B, MXFP4 | Apache 2.0 | AA Index 24 |
Qwen3.8-27B to gęsty model 27B z wynikiem 52 w indeksie Artificial Analysis, o punkt wyżej niż GLM-5.2 z około 744B parametrów, co jest najczystszym sygnałem, że liczba parametrów przestała przewidywać miejsce w rankingu. Brakuje za to Llamy: od kwietnia 2025 nie wyszły żadne nowe otwarte wagi Mety.
Nowości w narzędziach. Wsparcie silników przychodzi dziś razem z modelem, a nie miesiąc później. Karta Kimi K3 wymienia vLLM, SGLang i TokenSpeed, więc wsparcie w dniu premiery organizuje się przed wydaniem. Kwantyzacja poszła w tę samą stronę: laboratoria publikują wagi natywnie w MXFP4, a llama.cpp dostał w kwietniu kernele NVFP4 pod Blackwella.
Otwarte modele LLM warte uwagi
Cztery modele pokrywają większość tego, co zespół wziąłby dziś na krótką listę, każdy z dokładnym ciągiem licencji.
1. GLM-5.2. Z.ai opublikowało wagi 16 czerwca 2026: około 744B parametrów, z tego około 40B aktywnych, okno kontekstu 1M, licencja MIT. Z.ai zapowiedziało GLM-5.3 w połowie sierpnia, a na 26 sierpnia 2026, sprawdzone w organizacji Z.ai na Hugging Face, nie istnieje żadne repozytorium 5.3 i nie ogłoszono licencji.
2. MiniMax-M3. Premiera 1 czerwca 2026: 428B łącznie, 23B aktywnych, okno 1M i 80,5 w SWE-bench Verified według karty modelu. Ciąg licencji to `minimax-community`, ani Apache, ani MIT. Przy $0.23 za wejście i $0.96 za wyjście to jedna z najtańszych sensownych opcji na tablicy.
3. Kimi-K3. Flagowiec Moonshota, wagi z 26 lipca 2026: 2,8T łącznie, 104B aktywnych, 896 ekspertów, wagi MXFP4 trenowane z uwzględnieniem kwantyzacji. Karta modelu podaje GPQA-Diamond 93,5, a w indeksie Artificial Analysis model prowadzi otwartą kolumnę z wynikiem 60. Licencja to własna "Kimi K3 License" obejmująca kod i wagi razem, a przy $2.55 za wejście i $12.75 za wyjście kończy się otwarta przewaga cenowa.
4. DeepSeek-V4. Linia dzieli się na dwie części i ten podział jest całą praktyczną historią. V4 Pro 0813 jest na MIT, 1,6T łącznie z 49B aktywnymi, i ma 87,9 na Terminal Bench 2.1, ale jego checkpoint waży około 893 GB, więc MIT daje ci model, którego węzeł 8xH100 nie utrzyma. V4 Flash 0731, ta sama licencja, jest wersją realną: 284B łącznie, 13B aktywnych, 82,7 na Terminal Bench 2.1, a 26 sierpnia 2026 $0.0679 za wejście i $0.168 za wyjście.
Open Source LLM Tooling News Today: datowane newsy o narzędziach
Jeśli chcesz newsów o narzędziach na dziś, a nie kolejnej listy nazw, czytaj release notes, z wersjami, datami i liczbami.
Ollama dowiozła obsługę Muse Glimmer w dniu premiery 10 sierpnia razem ze wstępnym wsparciem MLX na Apple Silicon, a w v0.32.15 z 19 sierpnia skróciła czas do pierwszego tokena mniej więcej o połowę dzięki cache'owaniu metadanych modelu.
Changelog LM Studio czyta się tak samo: stabilne spekulatywne dekodowanie MTP w 0.4.14 z 22 maja, a w 0.4.21 z 12 sierpnia endpointy modeli w sieci wewnętrznej i klucze API lokalnego serwera.
llama.cpp dostał natywne NVFP4 pod Blackwella w PR zmerdżowanym 28 kwietnia 2026, a GGML_TYPE_NVFP4 = 40 siedzi dziś w tablicy typów ggml. Krążące wokół tego liczby o przepustowości pochodzą z forumowej arytmetyki, więc zmierz to sam.
Po stronie serwerowej większość newsów narzędziowych to praca nad funkcjami, a nie nagłówki, jak router świadomy podziału prefill/decode, który vLLM dodał w grudniu 2025. Po liczby, które starzeją się w tygodniach, SemiAnalysis prowadzi InferenceX z tygodniowymi migawkami.
Postępy w technikach inferencji
Wzrost wydajności. Większość newsów o otwartej inferencji dotyczy przepustowości. vLLM raportował 17 grudnia 2025 wynik 2200 tokenów wyjściowych na sekundę na jedno H200 przy serwowaniu DeepSeeka, a na GB200 NVL72 w lutym 2026 zmierzył 26,2 tys. tokenów prefillu i 10,1 tys. tokenów dekodowania na GPU na sekundę, czyli trzy do pięciu razy więcej niż H200.
Chunked pipeline parallelism w SGLang z 15 stycznia 2026 to lektura na długi kontekst: przepustowość prefillu w górę o 3,31x na sześciu węzłach po osiem H20 i czas do pierwszego tokena w dół o 67,9% na DeepSeek-V3.1. W tym samym wpisie prompt na milion tokenów dał pierwszy token po 420,91 sekundy, co czyni okno 1M funkcją do przetwarzania wsadowego, a nie do czatu.
Spekulatywne dekodowanie dowożą dziś same laboratoria: DeepSeek V4 Pro niesie moduł DSpark, a Unsloth zmierzył z nim 120 tokenów na sekundę na B200 wobec 60 bez niego.
Zgodność z tym, co już masz. Formaty spotykają się tu z twoim obecnym sprzętem i nie są darmowe. Badanie kwantyzacji potreningowej w formatach microscaling ze stycznia 2026 pokazało, że MXFP8 jest praktycznie bezstratny, a MXFP4 wyraźnie degraduje jakość, co waży tym więcej, że MXFP4 jest dziś tym, co kilka laboratoriów publikuje natywnie.
| Build | Rozmiar | Wierność wobec pełnej precyzji |
|---|---|---|
| UD-Q8_K_XL | 162 GB | Identyczny bitowo, dywergencja KL ~0, zgodność tokenów 100% |
| UD-Q4_K_XL | 155,1 GB | Dywergencja KL 0,0102, zgodność najlepszego tokena 96,28% |
| UD-IQ3_XXS | 103 GB | Pod maszyny ze 110-128 GB RAM |
Unsloth publikuje zmierzone rozmiary i rozbieżności dla swoich buildów GGUF DeepSeek V4, a wynikają z nich dwie rzeczy. Build 4-bitowy jest ledwo mniejszy od 8-bitowego, bo eksperci są już natywnie w MXFP4 i przekwantyzowaniu podlegają tylko tensory spoza ekspertów. I 4 bity nie są darmowe: zgodność najlepszego tokena spada do 96,28%, czyli mniej więcej jeden token na 27 różni się od pełnej precyzji. W pojedynczej odpowiedzi tego nie widać, w czterdziestokrokowej pętli agenta widać bardzo, co jest osobnym problemem do zmierzenia.
Dalej arytmetyka, która rozstrzyga, czy to wszystko w ogóle cię dotyczy. Około 893 GB dla V4 Pro wobec 640 GB w węźle 8xH100 znaczy, że same wagi się nie mieszczą, jeszcze przed pierwszym tokenem KV cache. V4 Flash przy natywnym FP4 i FP8 wychodzi bliżej 170 GB, czyli dwa H200, albo około 90 do 100 GB przy społecznościowym INT4. gpt-oss-120b mieści się na jednym H100 80 GB.
Wkład społeczności i współpraca
Liczby pobrań pokazują, gdzie społeczność faktycznie poszła. Raport Hugging Face o otwartych modelach za 2026, opisany przez China Daily 16 sierpnia 2026, daje Qwenowi 2,045 miliarda pobrań w 2026 wobec 418 milionów dla Google i 227 milionów dla Mety, przy 151 448 modelach pochodnych od Qwena. Gemma ma ponad 400 milionów pobrań i ponad 100 000 wariantów społecznościowych.
OLMo 3 od Ai2 to inny rodzaj wkładu: w listopadzie 2025 wyszedł z danymi treningowymi, kodem i każdym pośrednim checkpointem obok wag, czyli z tym, co pozwala odtworzyć wynik, a nie tylko go powtórzyć.
Współpraca jest dziś także pozycją na liście przed premierą: wymienienie vLLM, SGLang albo llama.cpp na karcie modelu to zobowiązanie podjęte przed wydaniem, a jego brak jest realnym kosztem dla tego, kto wdraża pierwszy.
Najnowszy przykład współpracy to licencja, a nie model. Nemotron 3.5 Lightning od NVIDII i Laguna S 2.1 od Poolside, mieszanka ekspertów 118B wydana 21 lipca 2026, wychodzą oba na `openmdw-1.1`, licencji dystrybucji modeli od Linux Foundation, która zebrała właśnie drugiego i trzeciego adoptującego, podczas gdy pytanie o OSI zostaje otwarte.
Czego spodziewać się dalej po otwartych LLM
Epoch AI zamienia dystans na czas: od stycznia 2026 najmocniejsze modele z otwartymi wagami zostają za zamkniętym frontier średnio o cztery miesiące, czyli osiem punktów ECI. Epoch nie twierdzi, że luka się poszerza ani zawęża, i my też nie będziemy. Cztery miesiące to na tyle mało, że czekanie na wersję otwartą bywa realną opcją.
Najbliżej wydarzenia z datą jest GLM-5.3, zapowiedziany w połowie sierpnia z dużym skokiem we własnej tabeli Terminal-Bench Z.ai. Na 26 sierpnia 2026 brakuje i wag, i licencji, a to, czy się pojawią i na jakich warunkach, mówi o najbliższym półroczu więcej niż benchmark.
Przegląd bezpieczeństwa stał się zmienną w harmonogramie wydania. TechCrunch opisał 4 sierpnia 2026 ewaluację SaferAI, w której GLM-5.2 testowany przez publiczne API Z.ai nie odmówił żadnego z zadań ofensywnych, a Claude Opus 4.7 odmawiał tak konsekwentnie, że badania nie dało się dokończyć. Tnie to w obie strony: Far.ai prowadzi ranking uniwersalnych jailbreaków znalezionych w zamkniętych modelach frontier.
Sprzęt ma konkretną datę. Apple ogłosiło 25 sierpnia 2026 konfiguracje Mac Studio z M5 Max i M5 Ultra, do 512 GB pamięci zunifikowanej i 1,2 TB/s przepustowości, ze sprzedażą od 22 września. Apple nie podaje liczby parametrów dla "modeli klasy frontier z otwartymi wagami", które ta maszyna ma uruchamiać.
Naprawdę otwarte pytanie dotyczy tego, kto tych modeli używa. Menlo Ventures, po badaniu z listopada 2025 na 495 osobach decyzyjnych w amerykańskich firmach, podaje 11% firmowego użycia API LLM dla modeli open source, w dół z 19% rok wcześniej, bez aktualizacji za 2026. Raport Mozilli State of Open Source AI z lipca 2026 mówi coś przeciwnego: udział otwartych wag w tokenach OpenRoutera wzrósł z około jednej trzeciej pod koniec 2025 do większości w połowie 2026.
Oba wyniki są prawdziwe i nie liczą tych samych ludzi: Menlo liczy zakupy firmowe, a Mozilla ruch deweloperski. Pomost siedzi w liczbach samej Mozilli: 79% deweloperów dodających AI używa otwartych modeli, ale tylko 53% z nich dochodzi do produkcji, wobec 63% przy modelach zamkniętych.
Pięć rzeczy do sprawdzenia, zanim wybierzesz otwarty model
Mniej więcej tydzień pracy, bez żadnego dostawcy.
Otwórz plik LICENSE na dokładnie tym checkpoincie. Szukaj progu aktywnych użytkowników miesięcznie, ciągu atrybucyjnego do wyświetlania, zasady nazewnictwa modeli pochodnych i polityk włączonych przez odesłanie.
Wyceń prawdziwy tydzień ruchu i dopisz datę obok sumy. Tokeny wejściowe i wyjściowe osobno, po dzisiejszych stawkach, na trasie, z której skorzystasz. Ceny mają tu termin przydatności liczony w tygodniach.
Policz pamięć, zanim spojrzysz na benchmark. Parametry razy bajty na parametr, plus KV cache dla twojej długości kontekstu i współbieżności. Jeśli wynikiem jest klaster, benchmark nigdy nie był właściwym pytaniem.
Zmierz tę kwantyzację, którą wdrożysz, na własnych pytaniach. Sto do dwustu prawdziwych zapytań ze znanymi dobrymi odpowiedziami, na dokładnym buildzie i dokładnej długości kontekstu. Publikowane rozbieżności trzymają się w agregacie, a nie na twoich promptach.
Sprawdź, czy karta modelu wymienia twój silnik serwujący. Wsparcie w vLLM, SGLang albo llama.cpp w dniu premiery to różnica między dwudniowym a dwumiesięcznym wdrożeniem. Potem dodaj do zakładek żywe źródło: llm-stats aktualizuje się codziennie, InferenceX tygodniowo.
Jedna konkretna rzecz na ten tydzień: weź trzech głównych kandydatów, otwórz na każdym plik LICENSE i wyceń realny tydzień ruchu, z zapisaną datą. Model i tak rzadko bywa wąskim gardłem, a bezpieczne podłączenie go do własnych danych kosztuje zwykle więcej pracy niż wybór checkpointu. Jeśli wolisz, żeby ktoś przeliczył to na twoim obciążeniu, od tego jest bezpłatny audyt.
FAQ
Który otwarty model LLM jest teraz najlepszy?
To zależy od benchmarku, a uczciwa odpowiedź ma datę. W Artificial Analysis Intelligence Index v4.1.1, pobranym 26 sierpnia 2026, czołówka otwartych to Kimi K3 z 60 i Qwen3.8-2.4T-A95B z 58, wobec 63 dla Claude Opus 5. Jeśli musisz to zahostować u siebie, praktyczne odpowiedzi to DeepSeek V4 Flash i Qwen3.8-27B.
Czy Qwen jest na licencji Apache 2.0?
Częściowo. Qwen3.8-27B wydany 14 sierpnia 2026 ma Apache 2.0, a flagowy model 2.4T wydany dwa dni wcześniej własny ciąg licencji qwen3.8-max. Licencja należy do checkpointu, a nie do nazwy rodziny.
Czy da się uruchomić DeepSeek V4 lokalnie?
Wersji Pro nie, chyba że "lokalnie" znaczy klaster: checkpoint waży około 893 GB wobec 640 GB w węźle 8xH100, jeszcze przed KV cache. Realny jest V4 Flash, a zmierzone przez Unsloth buildy GGUF idą od 103 GB przy 3 bitach do 162 GB przy 8.
Czy otwarte modele są tańsze od zamkniętych API?
Na dole stawki dramatycznie: 26 sierpnia 2026 gpt-oss-120b kosztował $0.03 za milion tokenów wejściowych, a DeepSeek V4 Flash $0.0679, wobec $5.00 za Claude Opus 5. Na górze różnica schodzi do połowy, bo Kimi K3 kosztuje $2.55.
- 26 sierpnia 2026Ceny zaktualizowane na 26 sierpnia 2026. Dodany Poolside Laguna S 2.1 i zweryfikowana licencja Nemotron 3.5 Lightning.
- 25 sierpnia 2026Publikacja.