← BlogBlog

Wdrożenia agentów AI w firmach - sześć znanych case studies i co z nich naprawdę wynika

Szukasz case study wdrożenia agenta AI w firmie i dostajesz komunikaty prasowe bez ciągu dalszego. Post o starcie wychodzi w pierwszym miesiącu z dużą liczbą na wierzchu. Sprostowanie pojawia się rok później w wywiadzie i nigdy nie stoi obok tamtej liczby. Poniżej sześć wdrożeń przepuszczonych przez te same pięć pytań, każde ze źródłem, które możesz otworzyć: co wdrożono, co ogłoszono, co jest faktycznie potwierdzone, co poszło nie tak później i co z tego przenosi się na twój własny projekt. Jedno z sześciu jest nasze i traktujemy je dokładnie tak samo jak resztę.

6Rozłożonych wdrożeń
2,3MCzatów Klarny w 1. miesiącu
245MInterakcji Fargo w 2024
58%Skuteczność w zadaniach CRM

Każde ogłoszenie o wdrożeniu agenta AI w firmie czytaj przez te same pięć pytań

Większość historii o wdrożeniach publikuje firma, która to wdrożenie robiła. To nie nieuczciwość, to kwestia momentu: post o starcie pisze marketing w pierwszym miesiącu, a zanim ktokolwiek zdąży ocenić, czy system się utrzymał, temat zdąży wygasnąć. Przydatny nawyk to więc oddzielanie deklaracji od potwierdzenia i szukanie tego, co stało się później.

Pięć pytań załatwia większość roboty. Co dokładnie wdrożono i na jakiej części biznesu? Co firma ogłosiła własnymi słowami? Co potwierdza ktoś inny niż ona sama? Co poszło nie tak po poście o starcie? I która część tego w ogóle dotyczy firmy, która nie jest tamtą firmą? Czwartego pytania komunikaty prasowe nie dotykają, a piąte jest jedynym, które zmienia to, co zrobisz w poniedziałek.

Warto też wiedzieć, ile dobry agent wyciąga, zanim dołoży się do tego twój proces. Zespół badawczy Salesforce opublikował CRMArena-Pro, benchmark dziewiętnastu zadań CRM zwalidowanych przez ekspertów, i czołowe modele zaliczały tam około 58% zadań jednoturowych oraz około 35%, gdy zadanie rozciągało się na kilka tur. Ta sama praca odnotowuje bliską zeru wrodzoną wrażliwość agentów na poufność i to, że wymuszanie jej promptem kosztuje skuteczność. To nie wyrok na żaden produkt, ale przydatna podłoga: kiedy dostawca mówi, że jego agent obsługuje 80% zgłoszeń, ciekawe jest to, co znaczy u niego „obsługuje”.

Ile wyciąga dobry agent, zanim dołożysz swój procesŹródło: CRMArena-Pro, Salesforce AI Research, arXiv:2505.18878 (pobrano 10 sie 2026)
Wykonanie workflow, jedna turanajwęższy typ zadania
ponad 83%
Wszystkie 19 zadań, jedna tura
~58%
Wszystkie 19 zadań, wiele turkształt, jaki ma realna obsługa klienta
~35%

Jeszcze jeden nawyk przed przypadkami. Wycofane wdrożenie nie dowodzi, że technologia nie działa, a wdrożenie wciąż działające nie dowodzi, że działa. Czytaj kierunek zmiany, nie nagłówek. Osobno rozłożyliśmy tryby awarii, które przeżywają zaliczone demo, i większość tego, co niżej, to te same tryby z nazwami firm.

Klarna: liczba była prawdziwa, wniosek już nie

Co wdrożono. Asystenta obsługi klienta na modelach OpenAI, uruchomionego na rynkach Klarny i wystawionego na główny kanał wsparcia, a nie schowanego w pilotażu. To wdrożenie, o które branża spiera się do dziś, więc tym bardziej warto przeczytać je ze źródła.

Co ogłoszono. Komunikat prasowy Klarny z lutego 2024 jest konkretny: 2,3 mln rozmów w pierwszym miesiącu, dwie trzecie wszystkich czatów obsługi, ponad 35 języków na 23 rynkach, sprawy załatwiane w niecałe 2 minuty wobec 11 minut wcześniej, spadek powtórnych zgłoszeń o 25% i szacowane 40 mln USD poprawy wyniku w 2024. Jest tam też zdanie o „pracy równoważnej 700 pełnoetatowym agentom”.

Co jest potwierdzone. Wolumen i daty, przez Klarnę. Cała reszta to Klarna mierząca Klarnę. Zwróć uwagę na sformułowanie przy tej najsłynniejszej liczbie: komunikat mówi o pracy równoważnej 700 agentom, a nie o zastąpieniu 700 osób. Wersja, która obiegła internet, nie jest tym, co firma napisała.

Co poszło nie tak. W maju 2025 prezes wycofywał się z tego publicznie. Klarna ponownie otworzyła rekrutację na stanowiska w obsłudze klienta, a Sebastian Siemiatkowski mówił, że koszt był „zbyt dominującym czynnikiem oceny” i że efektem była niższa jakość, deklarując przy tym, że klient, który chce człowieka, zawsze go dostanie. Jakości na trudnym ogonie spraw nikt wcześniej nie miał w liczbach.

Co się przenosi. Błędem nie było wdrożenie, tylko funkcja celu. Koszt kontaktu i jakość rozwiązania rozjeżdżają się na sprawach złożonych, a jeśli jedyny pomiar pochodzi z logów samego agenta, nie odróżnisz jednego od drugiego. Zanim cokolwiek skalujesz, wybierz metrykę rozwiązania, którą zweryfikujesz bez współpracy bota. Które metryki wsparcia wytrzymują kontakt z rzeczywistością, rozpisaliśmy w tekście o realnym ROI obsługi klienta na AI.

Air Canada: twój chatbot nie jest odrębnym podmiotem prawnym

Co wdrożono. Chatbota wsparcia na stronie linii lotniczej. Skromnie jak na 2026 rok i o to chodzi: zasada prawna, którą wygenerował, dotyczy wszystkiego, co stawiasz przed klientem, agentowego czy nie.

Co się stało. Pasażer kupujący bilet po śmierci w rodzinie usłyszał od bota, że o obniżoną stawkę żałobną może wystąpić wstecz, w ciągu 90 dni od wystawienia biletu. Rzeczywista polityka linii mówiła coś przeciwnego. Zapłacił pełną cenę, złożył wniosek później i dostał odmowę.

Co jest potwierdzone. Wszystko, bo jest opublikowane orzeczenie. W sprawie Moffatt v. Air Canada, 2024 BCCRT 149 trybunał Kolumbii Brytyjskiej stwierdził wprowadzenie w błąd przez zaniedbanie i zasądził różnicę między zapłaconą ceną a stawką żałobną. Obrona linii sprowadzała się do tezy, że firma nie odpowiada za informacje podane przez własnego chatbota. Trybunał odrzucił to wprost: chatbot ma element interaktywny, ale pozostaje częścią strony, i nie ma znaczenia, czy informacja pochodzi ze statycznej podstrony, czy z bota.

Co się przenosi. To, co mówi twój agent, jest oświadczeniem opublikowanym przez twoją firmę. To przestawia problem projektowy: odpowiedzi tworzące zobowiązanie to mały, wyliczalny zbiór i nie powinny w ogóle powstawać jako swobodna generacja. Ceny, zwroty, uprawnienia, terminy dostawy i warunki gwarancji wychodzą z pobranego, zatwierdzonego tekstu albo nie wychodzą wcale. Reszta może być rozmową. W Unii dochodzi druga warstwa, bo obowiązki informacyjne wobec osób rozmawiających z systemem AI już obowiązują, a RODO dokłada pytanie o podstawę przetwarzania tego, co bot zobaczył - bieżący stan rozpisaliśmy w kalendarzu zgodności z AI Act.

Drive-thru: jedna sieć odpuściła, druga zawęziła

Co wdrożono. Automatyczne przyjmowanie zamówień głosem w oknie drive-thru, przez dwie z największych sieci gastronomicznych świata, w najgłośniejszym i najbardziej wrażliwym na opóźnienie środowisku, w jakim ktokolwiek to próbował.

Co ogłoszono i co jest potwierdzone. McDonald's prowadził automatyczne przyjmowanie zamówień z IBM od 2021 i zakończył test w 2024, wyłączając technologię w uczestniczących restauracjach do 26 lipca tamtego roku. Publiczna linia firmy brzmiała, że test dał jej pewność, iż zamawianie głosem będzie częścią przyszłości restauracji, a żadnych danych o skuteczności, kosztach ani kryteriach oceny pilotażu nie opublikowano. Uczciwe podsumowanie brzmi więc: partnerstwo się skończyło, cel nie, a wirusowe filmiki z pomylonymi zamówieniami to anegdota, nie dane.

Co poszło nie tak u drugiej sieci. Yum poszedł w drugą stronę i trafił na tę samą ścianę od innej strony. Po wstawieniu głosowego AI do około 500 restauracji na początku 2025 wyhamował rozwój w sierpniu tego roku, po skargach klientów i fali celowego trollowania, w tym zamówieniu na 18 000 kubków wody. Publiczny wniosek ze strony technologicznej Yum nie brzmiał, że głosowe AI nie działa, tylko że w zatłoczonych lokalach zamówienie lepiej przyjmie człowiek.

Co się przenosi. Dwie rzeczy i żadna nie wymaga restauracji. Po pierwsze, wrogie wejście to przypadek obciążeniowy, a nie brzegowy. Od chwili, gdy system jest publiczny, część ruchu istnieje po to, żeby go zepsuć, a pole ilościowe bez górnego ograniczenia to najtańsza możliwa awaria. Po drugie, „gdzie tego nie wdrażamy” jest pełnoprawną odpowiedzią, której wdrożenia rzadko planują. Zakres lokal po lokalu albo kolejka po kolejce bije rozwiązanie zero-jedynkowe i przy okazji daje grupę kontrolną za darmo.

Commonwealth Bank zlikwidował 45 etatów, a potem je przywrócił

Co wdrożono. Generatywnego bota głosowego w contact center największego banku Australii, razem z decyzją o uznaniu 45 stanowisk obsługi klienta za zbędne na podstawie wolumenu połączeń, który bot miał przejąć.

Co poszło nie tak. Związek zawodowy sektora finansowego zakwestionował zwolnienia i samą przesłankę. Według relacji Australian Computer Society liczba połączeń przychodzących w rzeczywistości rosła, do tego stopnia, że bank oferował nadgodziny, a kierownicy zespołów sami odbierali telefony. W sierpniu 2025 CBA wycofał decyzję i przeprosił, stwierdzając, że pierwotna ocena, iż 45 etatów nie jest potrzebnych, „nie uwzględniała odpowiednio wszystkich istotnych okoliczności biznesowych, a ten błąd oznaczał, że stanowiska nie były zbędne”.

Co jest potwierdzone. Wycofanie decyzji i własne słowa banku, nietypowo bezpośrednie jak na spółkę publiczną. Nigdy nie ustalono natomiast wskaźnika odciążenia, na którym opierała się pierwotna decyzja.

Co się przenosi. Odciążenie to pomiar, nie prognoza, i bierze się je z całkowitego wolumenu kolejki w porównywalnym oknie, a nie z udziału sesji, które bot zamknął sam. Bot kończący 30% czatów przy wzroście kontaktów o 20% nie odciążył niczego. Najlepiej widzą to ludzie odbierający nadmiar, co jest argumentem, żeby zapytać ich przed decyzją kadrową, a nie po.

Wdrożenie, które się wyskalowało, trzymało model z dala od danych

Co wdrożono. Fargo, asystenta Wells Fargo wewnątrz aplikacji bankowej, obsługującego codzienne sprawy: salda, przelewy, wyszukiwanie transakcji, opłacanie rachunków. Zakres jest celowo wąski, a wolumen bardzo duży, i pewnie dlatego ten przypadek dostał ułamek uwagi, którą dostała Klarna.

Co ogłoszono. Wzrost z 21,3 mln interakcji w 2023 do 245,4 mln w 2024 i około 336 mln łącznie według relacji z kwietnia 2025. Dane banku, więc zastrzeżenie to samo co wszędzie na tej stronie.

Ciekawa jest nie liczba, tylko ścieżka danych. Mowa jest transkrybowana lokalnie, tekst czyszczony i tokenizowany wewnątrz stosu banku, mały model wykrywa dane osobowe, a na zewnątrz, do modelu językowego, wychodzą wyłącznie oczyszczone intencje i encje. Detokenizacja wraca do środka. CIO banku Chintan Mehta opisał to jako bycie filtrem przed modelem i za nim.

Co się przenosi. W takim układzie model językowy jest klasyfikatorem intencji przed deterministyczną warstwą wykonawczą, a pieniądze faktycznie przesuwa zwykły software ze zwykłymi kontrolami. To jednocześnie odpowiedź na niezawodność i na zgodność, dlatego ten wzorzec ciągle wraca we wdrożeniach regulowanych. Dla polskiego czytelnika najbliższym odpowiednikiem tej filozofii jest pierwszy agent AI w PKO Banku Polskim, który czyta i klasyfikuje maile klientów, a bank zapowiada skrócenie czasu odpowiedzi nawet o 70% przy zachowaniu zasady, że kluczowe decyzje zostają po stronie pracowników. To jest praktyczna wersja różnicy między agentem a workflow: większość tego, co nazywa się agentem, to stała ścieżka z modelem od warstwy językowej, i właśnie dlatego kosztuje mniej i rzadziej się psuje. Samo okablowanie, czyli jak model sięga do systemów na żywo bez trzymania ich kopii, to osobny temat.

Nasz wpis: agent głosowy z budżetem dwóch sekund

Co wdrożono. Głosowego inżyniera wyścigowego do sesji iRacing na żywo. Kierowca mówi przez push-to-talk, Whisper transkrybuje, agent OpenAI czyta telemetrię na żywo przez 19 narzędzi MCP w sześciu kategoriach, a odpowiedź wraca przez TTS w stylu radia z boksu.

Co zmierzono. Odpowiedzi w niecałe 2 sekundy, telemetria 64 aut, worker odpytujący symulator co 100 ms i zapisujący ukończone okrążenia do lokalnej bazy, którą agent odpytuje na żądanie. To nasze liczby z naszego builda, więc lądują w dokładnie tym samym koszyku danych własnych co wszystkie pozostałe na tej stronie.

Co poszło nie tak. Oczywista architektura, czyli trzymanie całego łańcucha wywołań narzędzi w historii rozmowy tak, jak chatbot trzyma transkrypt, zatruwała kolejną odpowiedź. Czas okrążenia sprzed 30 sekund jest już błędny, a model nie odróżni liczby nieaktualnej od świeżej, bo obie są dla niego po prostu tekstem w kontekście. Rozwiązaniem było przestać traktować historię jak magazyn: czterowiadomościowe okno przesuwne trzyma tylko pytanie i finalną odpowiedź, każde pośrednie wywołanie narzędzia startuje na świeżo w każdej turze i jest odrzucane, a stan na żywo żyje całkowicie poza modelem.

Czego to nie przenosi. To symulator, jeden kierowca naraz, żadnych danych osobowych, zero powierzchni regulacyjnej. Nie mówi nic użytecznego o kontrolach w banku ani o obsadzie contact center. Przenoszą się natomiast dwa ograniczenia: twardy budżet opóźnienia wymusza decyzję, co pobierasz w momencie pytania, zamiast pamiętać, a działania wysokiego ryzyka dostają bramkę. Odczyt telemetrii jest autonomiczny; komendy pit-stopu przechodzą przez potwierdzenie człowieka, zanim cokolwiek trafi do auta. Każde wdrożenie powyżej, które wpadło w kłopoty, miało ścieżkę działania bez takiej bramki.

Gdzie stoi każde z tych wdrożeń, stan na sierpień 2026

To jest ta jedna sekcja, która się starzeje, i starzeje się szybko. Wszystko poniżej sprawdziliśmy względem podlinkowanych źródeł 10 sierpnia 2026. Otwórz je, zanim cokolwiek zacytujesz, bo cały ten artykuł jest właśnie o tym, że ciąg dalszy przeżywa ogłoszenie.

Stan na 10 sierpnia 2026
WdrożenieStartGdzie stoiPotwierdza
Asystent AI Klarnyluty 2024Dwutorowo. AI na wolumenie rutynowym, wsparcie ludzkie odbudowane dla spraw złożonych i premium po korekcie z maja 2025komunikat Klarny; CX Dive (maj 2025); CX Today (lip 2026)
Chatbot wsparcia Air Canadaprzed 2023Rozstrzygnięte przeciwko przewoźnikowi; orzeczenie jest punktem odniesienia dla odpowiedzialności za chatbota*Moffatt v. Air Canada*, 2024 BCCRT 149
Zamówienia głosowe McDonald's (IBM)2021Partnerstwo z IBM zakończone, technologia wyłączona do 26 lip 2024; zamawianie głosem nadal deklarowane jako celRestaurant Dive (cze 2024)
Głosowe AI w drive-thru Yum2023Wyhamowane w sie 2025 po skargach i trollowaniu, potem rozwinięte z nowym dostawcą do ponad 890 restauracji w 38 stanachRestaurant Dive (lip 2026)
Bot głosowy contact center CommBankkoniec 202445 zwolnień wycofanych, przeprosiny w sie 2025; samego bota nie wycofanoInformation Age / ACS (sie 2025)
Wells Fargo Fargo2022Działa na skali; 245,4 mln interakcji raportowane za 2024, dane osobowe tokenizowane przed modelemAIM Media House (kwi 2025)

Dwa z sześciu miały publiczne wycofanie. Żadne z sześciu nie wyłączyło technologii i nie wróciło do stanu sprzed, a to szczegół, który zwykle ginie, gdy media opisują rollback. W jednym przypadku zmienił się dostawca, w drugim zakres zawęził się lokal po lokalu, a w Klarnie ludzie wrócili na trudniejszą warstwę spraw. Oprogramowanie przez cały ten czas zostało na produkcji.

Co naprawdę przenosi się na twoje wdrożenie

Nic z powyższego nie jest szablonem do skopiowania. Przenośny jest zestaw pytań, na które każde z tych wdrożeń odpowiedziało źle, a na swoje własne odpowiesz sobie w jedno popołudnie, bez żadnego dostawcy w pokoju. Jeśli któreś z pytań poniżej nie ma właściciela i nie ma liczby, to właśnie ta część twojego projektu najpewniej trafi kiedyś do cudzego artykułu.

Siedem pytań i wdrożenie, które pokazuje, po co każde z nich
PytanieJak na nie odpowiedziećGdzie się to ujawniło
Co u ciebie znaczy „obsłużone”?Wyciągnij 50 losowych zamkniętych sesji i je przeczytaj. Policz te, w których problem klienta faktycznie zniknął, a nie te, w których bot wysłał ostatnią wiadomość.Klarna
Które odpowiedzi tworzą zobowiązanie?Wypisz je: cena, zwrot, uprawnienie, termin, gwarancja. Podawaj je z pobranego, zatwierdzonego tekstu, nigdy ze swobodnej generacji.Air Canada
Co się dzieje przy wrogim wejściu?Poświęć godzinę na atakowanie własnego systemu: bełkot, wyzwiska, absurdalne ilości, akcent, którego nie słyszał. Ogranicz każde pole liczbowe.drive-thru Yum
Skąd bierze się liczba odciążenia?Z całkowitego wolumenu kolejki, to samo okno przed i po, brana z kolejki, a nie z dashboardu dostawcy.Commonwealth Bank
Co model faktycznie widzi?Narysuj ścieżkę danych od końca do końca. Przy każdej danej klienta docierającej do modelu zapytaj, czy musi tam trafić - RODO zada to pytanie za ciebie.Wells Fargo
Jaki jest budżet opóźnienia i co jest nieaktualne?Ustal liczbę, którą odpowiedź musi pobić, a potem zaznacz, które wejścia pobierasz na świeżo w każdej turze zamiast nieść je w kontekście.Race Engineer
Które działania mają bramkę?Wypisz nieodwracalne - płatności, anulowania, wszystko wysyłane do klienta - i postaw przed każdym potwierdzenie człowieka.wszystkie sześć

Jeden konkretny krok, jeśli ma być tylko jeden: weź zeszłomiesięczne realne logi rozmów, wylosuj pięćdziesiąt i oznacz każdą jako rozwiązaną, eskalowaną albo porzuconą, czytając ją, a nie ufając polu statusu. Ta liczba jest twoim faktycznym punktem odniesienia i z naszego doświadczenia rzadko zgadza się z dashboardem. O resztę planu wdrożenia łatwiej się spierać, kiedy ona już istnieje.

Budujemy takie systemy zawodowo, więc warto powiedzieć wprost, skąd bierze się nasze przechylenie: uważamy, że większość kłopotów powyżej to kwestia zakresu, a nie modelu. Jeśli chcesz drugie spojrzenie na to, gdzie konkretne wdrożenie najpewniej pęknie, krótki audyt daje ci dwa czy trzy najbardziej prawdopodobne tryby awarii przypięte do pytań z tabeli. Tabela działa też bez nas.

FAQ

Czy istnieje case study wdrożenia agenta AI z niezależnie zaudytowanymi liczbami?

Bardzo niewiele i żadne z tych głośnych. Prawie każda krążąca liczba pochodzi od firmy, która robiła wdrożenie, liczona na jej logach i publikowana wtedy, gdy chciała opowiedzieć tę historię. Wyjątkiem w tym zestawieniu jest Air Canada, gdzie fakty trafiły do publicznego rejestru przez orzeczenie trybunału, bo ktoś je zakwestionował. Traktuj tę asymetrię jako domyślną i tak czytaj ogłoszenia.

Czy Klarna naprawdę zastąpiła 700 osób sztuczną inteligencją?

Nie według własnego komunikatu, który mówi o pracy równoważnej 700 pełnoetatowym agentom. To porównanie obciążenia, a nie decyzja kadrowa, i różnica ma znaczenie, bo powielana wersja sugeruje zwolnienie, którego komunikat nie opisuje. Udokumentowana jest natomiast późniejsza korekta: w maju 2025 firma ponownie otworzyła rekrutację do wsparcia i przyznała, że koszt był zbyt dominującym czynnikiem w pierwotnym projekcie.

Jaki jest najczęstszy powód wycofywania takich wdrożeń?

Zdjęcie mocy przerobowych przed dowodem. Klarna i Commonwealth Bank działały na prognozowanej, a nie zmierzonej redukcji i obie musiały część tego cofnąć. W żadnym z tych przypadków to nie model był elementem, który zawiódł. Zawiodła liczba, której nie zweryfikowano na całkowitym wolumenie, zanim posłużyła do decyzji kadrowej.

Czy wycofanie oznacza, że technologia była złym wyborem?

Zwykle nie, sądząc po tym, co te firmy zrobiły dalej. McDonald's zakończył współpracę z dostawcą i zostawił zamawianie głosem jako cel. Yum wyhamował, zmienił dostawcę i wrócił z większym zasięgiem oraz z poglądem na to, którym lokalom to pasuje. Klarna zostawiła AI na wolumenie rutynowym i odbudowała ludzi na trudnej warstwie. Widoczny wzorzec to korekta zakresu, nie rezygnacja.

Historia zmian
  • 10 sierpnia 2026Publikacja.
Bezpłatny audyt procesów

Zobacz, jak wyglądałoby to w Twoich procesach.

Skontaktuj się

30 minut · wskazujemy 3 najlepsze obszary do automatyzacji · bez zobowiązań