
Data readiness - jak przygotować dane firmy pod AI, zanim wydasz złotówkę na wdrożenie
Firma produkcyjna ze Śląska podpisała w 2025 roku umowę na wdrożenie wewnętrznego asystenta AI, który miał odpowiadać pracownikom na pytania o procedury, specyfikacje produktów i historyczne decyzje projektowe - klasyczny RAG na firmowej wiedzy. Model działał technicznie bez zarzutu. Problem pojawił się miesiąc po starcie: asystent regularnie cytował nieaktualne wersje procedur BHP sprzed trzech lat, mylił specyfikacje dwóch podobnych produktów, bo dokumentacja obu leżała w tym samym folderze bez rozróżnienia w nazwie, i - najgorsze - w jednej odpowiedzi ujawnił dane z folderu HR osobie spoza działu kadr, bo uprawnienia z dysku sieciowego nigdy nie zostały przeniesione do indeksu, z którego korzystał model. Winny nie był model językowy. Winne były dane, które nikt nie przygotował, zanim ktokolwiek zaczął pisać choćby jedną linijkę integracji.
Gartner prognozuje, że do końca 2026 roku firmy porzucą 60% projektów AI właśnie dlatego, że nie miały danych gotowych pod AI - nie dlatego, że model był zły. Raport MIT NANDA z lipca 2025 poszedł dalej: przy 30-40 mld dolarów zainwestowanych przez firmy w generatywną AI, 95% pilotaży nie dało żadnego mierzalnego zwrotu. Wspólny mianownik w obu przypadkach nie jest technologiczny - to bałagan w danych, którego nikt nie posprzątał, zanim podpisano umowę z dostawcą. Pokazuję, jak zrobić audyt źródeł danych, ocenić ich jakość i zrobić porządek PRZED wdrożeniem, nie w trakcie gaszenia pożaru.
Ten wpis to brakujące pierwsze ogniwo lejka, który do tej pory budowałem od środka: od czego zacząć wdrażanie AI w firmie zakłada, że wiesz, co chcesz zrobić; budowa wewnętrznej bazy wiedzy RAG i zaawansowany RAG - chunking i hybrid search zakładają, że dane, które ładujesz do systemu, są w porządku. W praktyce to założenie zawodzi najczęściej - i to na etapie zero, zanim ktokolwiek dotknie modelu.
Dlaczego wdrożenia padają na danych, nie na modelach
/// DLACZEGO WDROŻENIA AI PADAJĄ
Skala problemu nie jest marginalna - to główna przyczyna porażek, nie jedna z wielu. Gartner w prognozie z lutego 2025 roku wprost przewiduje, że do końca 2026 roku organizacje porzucą 60% projektów AI, którym zabrakło danych gotowych pod AI. To nie jest problem odległej przyszłości - to już trwa. Raport MIT NANDA „The GenAI Divide: State of AI in Business 2025" z lipca 2025 roku, oparty na przeglądzie ponad 300 publicznie ujawnionych wdrożeń AI i wywiadach z 52 organizacjami, poszedł dalej: przy 30-40 miliardach dolarów zainwestowanych przez firmy w generatywną AI, 95% pilotaży nie wygenerowało żadnego mierzalnego wpływu na wynik finansowy. Tylko 5% wdrożeń wyciągnęło z tego realną wartość.
Ciekawy, praktyczny wniosek z tego samego raportu: zakup gotowego narzędzia od wyspecjalizowanego dostawcy i budowa partnerstwa kończy się sukcesem w ok. 67% przypadków, podczas gdy budowa własnego rozwiązania wewnętrznie - tylko w jednej trzeciej tylu przypadków. To nie znaczy, że nie warto budować własnych systemów - znaczy, że zespoły wewnętrzne systematycznie nie doceniają, ile pracy wymaga przygotowanie danych, zanim model zacznie działać poprawnie, a dostawcy zewnętrzni częściej wymuszają ten krok jako warunek wdrożenia.
Audyt źródeł - gdzie faktycznie leżą dane Twojej firmy
/// AUDYT ŹRÓDEŁ: GDZIE LEŻĄ DANE FIRMY
Zanim zaczniesz cokolwiek porządkować, potrzebujesz mapy. Większość firm, z którymi rozmawiam, nie ma jasnej odpowiedzi na pytanie „gdzie dokładnie leżą nasze dane" - a bez tej mapy nie da się ocenić, co jest gotowe, a co wymaga pracy.
| Źródło | Typowy stan w firmie bez porządków | Ryzyko przy użyciu w AI bez przygotowania |
|---|---|---|
| Dyski sieciowe / SharePoint | Foldery organizowane latami przez różne osoby, brak spójnej konwencji nazw, duplikaty wersji | Model cytuje nieaktualną wersję dokumentu jako aktualną; brak informacji, który plik jest „prawdą" |
| ERP / CRM | Dane ustrukturyzowane, ale często niespójne między systemami (ten sam klient pod różnymi nazwami) | Błędne odpowiedzi liczbowe, sprzeczne raporty w zależności od źródła zapytania |
| Skrzynki mailowe | Ogromna ilość kontekstu biznesowego, ale rozproszona, prywatna, częściowo nieaktualna | Ryzyko RODO (dane osobowe w treści maili) i „szumu" psującego trafność wyszukiwania |
| Wiki / Confluence / Notion | Zwykle najlepiej ustrukturyzowane, ale często częściowo porzucone - część stron nieaktualna od lat | Model traktuje starą stronę z tą samą pewnością co aktualizowaną w zeszłym tygodniu |
| Google Drive / Dysk firmowy | Mieszanka wszystkiego powyżej, z dodatkowym problemem uprawnień na poziomie pojedynczego pliku | Automatyczne skanowanie bez respektowania uprawnień to najczęstsza przyczyna wycieku danych po wdrożeniu |
Pełny proces automatycznego skanowania i kategoryzowania dokumentów z jednego z tych źródeł pokazuję już praktycznie w integracji AI z Google Drive - to dobry punkt startu dla samego audytu, zanim zdecydujesz, co dalej z danymi zrobić.
Macierz jakości danych - jak ocenić, co jest gotowe, a co nie
/// MACIERZ JAKOŚCI DANYCH: 5 KRYTERIÓW
* Dokument, który nie przechodzi kryterium 01 lub 02, nie powinien trafić do systemu w pierwszej kolejności.
Po zmapowaniu źródeł potrzebujesz sposobu, żeby ocenić każde z nich wg tych samych kryteriów, zamiast decydować „na oko":
- 1.Aktualność. Kiedy dokument był ostatnio zweryfikowany (nie: kiedy stworzony) - to kluczowa różnica, bo plik może mieć datę modyfikacji sprzed roku i wciąż być prawdziwy, albo być edytowany wczoraj i już nieaktualny merytorycznie.
- 2.Unikalność. Czy istnieje więcej niż jedna wersja tej samej informacji, i czy któraś jest oznaczona jako „ta prawdziwa" - sprzeczne źródła to najszybsza droga do halucynacji przy odpowiedzi generowanej z RAG.
- 3.Własność (ownership). Kto odpowiada za ten dokument merytorycznie - jeśli nikt nie potrafi odpowiedzieć na to pytanie w 30 sekund, to sygnał, że dokument prawdopodobnie jest porzucony.
- 4.Uprawnienia. Kto dziś ma dostęp do tego dokumentu w systemie źródłowym - i czy to ograniczenie da się przenieść do warstwy AI, czy trzeba je odtworzyć ręcznie.
- 5.Format i struktura. Czy dokument da się w ogóle sensownie podzielić na fragmenty (chunking) - skan bez warstwy tekstowej, tabela wklejona jako obrazek, czy PDF z łamaniem kolumn to inny poziom trudności niż czysty tekst.
Dokument, który nie przechodzi kryterium 1 lub 2, nie powinien trafić do systemu w pierwszej kolejności - żadna technika RAG, nawet najbardziej zaawansowana, nie naprawi sprzecznych lub nieaktualnych danych źródłowych. To dosłownie zasada „garbage in, garbage out" przeniesiona na grunt wyszukiwania semantycznego: model nie ocenia prawdziwości, tylko podobieństwa - jeśli w indeksie są dwie sprzeczne wersje faktu, oba wyglądają dla niego tak samo wiarygodnie.
Porządkowanie pod RAG - formaty, wersjonowanie, właściciele, uprawnienia
Gdy już wiesz, które źródła są gotowe, a które wymagają pracy, porządkowanie rozkłada się na cztery równoległe tory:
- Ujednolicenie formatu. Skany zamień na tekst przeszukiwalny (OCR), tabele wyodrębnij ze zrzutów ekranu, ujednolić strukturę nagłówków - to fundament, bez którego zaawansowane techniki chunkingu i hybrydowego wyszukiwania nie mają na czym pracować.
- Wersjonowanie i oznaczanie „źródła prawdy". Każdy dokument, który ma wiele wersji, potrzebuje jasnego oznaczenia, która jest aktualna - najlepiej wymuszonego strukturalnie (jedna lokalizacja, reszta zarchiwizowana), nie tylko opisowo.
- Przypisanie właścicieli. Każdy dokument lub kategoria dokumentów potrzebuje osoby odpowiedzialnej za jego aktualność - bez tego uporządkowane dziś dane znów staną się bałaganem za sześć miesięcy.
- Uprawnienia jako warstwa techniczna, nie deklaracja. To najczęściej pomijany krok, a jednocześnie najbardziej ryzykowny do pominięcia: jeśli dokument nie jest widoczny dla danego użytkownika w SharePoincie, Confluence czy systemie źródłowym, musi być tak samo niewidoczny dla mechanizmu wyszukiwania AI - nawet jeśli semantycznie idealnie pasuje do zapytania. Kontrola dostępu musi być egzekwowana PRZED zwróceniem wyniku, nie po. Wybór samej bazy wektorowej wpływa na to, jak łatwo to wdrożyć - porównanie opcji pod kątem RAG i pamięci AI rozkładam w bazach wektorowych: pgvector, Pinecone, Qdrant czy Weaviate.
Dane strukturalne vs nieustrukturyzowane - różne ścieżki przygotowania
Te dwie kategorie danych wymagają zupełnie innej pracy, więc traktowanie ich tym samym procesem porządkowania to częsty błąd:
| Typ danych | Typowy problem | Co naprawić przed wdrożeniem |
|---|---|---|
| Strukturalne (ERP, CRM, bazy SQL) | Ten sam byt (klient, produkt) zapisany inaczej w różnych systemach | Ujednolicenie identyfikatorów, deduplikacja rekordów, jedna „złota kopia" per encja |
| Nieustrukturyzowane (dokumenty, maile, wiki) | Brak spójnej struktury, sprzeczne wersje, brak metadanych o aktualności | Ujednolicenie formatu, tagowanie źródła i daty weryfikacji, usunięcie duplikatów |
Dane strukturalne rozwiązuje się głównie na poziomie integracji i deduplikacji (klasyczna praca inżynierska), dane nieustrukturyzowane wymagają dodatkowo decyzji redakcyjnych - kto ocenia, że dokument jest aktualny i wartościowy. To drugie zadanie trudniej zautomatyzować i częściej jest pomijane, dlatego zwykle to ono odpowiada za większość porażek wdrożeń opartych na RAG.
Quick winy przed wdrożeniem - co zrobić w pierwszym tygodniu, zanim zapłacisz komukolwiek
Nie trzeba czekać na pełny audyt, żeby zacząć. Te kroki kosztują czas zespołu, nie budżet na narzędzia, i realnie zmniejszają ryzyko porażki wdrożenia:
- 1.Wybierz jeden, wąski obszar na pilota - jedną kategorię dokumentów (np. procedury jednego działu), nie „całą wiedzę firmy" naraz. Węższy zakres to mniej źródeł do sprawdzenia i szybsza informacja zwrotna, czy podejście działa.
- 2.Zrób listę dokumentów, które na pewno są nieaktualne, i je usuń lub zarchiwizuj - to najtańsza czynność w całym procesie, a eliminuje największe źródło sprzecznych odpowiedzi.
- 3.Wyznacz właściciela dla każdej kategorii dokumentów w pilotażowym obszarze - jedna osoba, jedno imię i nazwisko, nie „dział X" jako abstrakcyjny właściciel.
- 4.Sprawdź, czy uprawnienia w systemie źródłowym w ogóle dają się odczytać programowo - jeśli dostawca AI, z którym rozmawiasz, nie potrafi odpowiedzieć, jak zamierza je respektować, to sygnał ostrzegawczy, zanim podpiszesz umowę.
- 5.Policz, ile realnie dokumentów wchodzi w zakres pilota - jeśli liczba przekracza kilkaset stron przy pierwszym podejściu, zakres jest za szeroki na start.
Bezpieczeństwo i uprawnienia jako część data readiness, nie osobny temat
Data readiness i bezpieczeństwo danych to w praktyce ten sam projekt widziany z dwóch stron - porządkowanie danych pod AI bez jednoczesnego przemyślenia, kto powinien mieć do nich dostęp po wdrożeniu, tworzy system, który jest technicznie gotowy i jednocześnie ryzykowny prawnie. Scenariusz z początku tego wpisu - wyciek danych HR przez niewłaściwie przeniesione uprawnienia - to nie odosobniony przypadek, tylko najczęstszy błąd przy pierwszych wdrożeniach RAG na dokumentach wewnętrznych. Szerzej o tym, jak nie oddać tajemnic firmy przy wdrożeniu AI, piszę w bezpieczeństwie danych przy wdrożeniu AI - ten wpis warto przeczytać równolegle z porządkowaniem danych, nie po nim.
Checklist data readiness - zanim podpiszesz umowę z dostawcą
- 1.Masz mapę źródeł danych - wiesz, gdzie fizycznie leżą wszystkie kategorie danych, które chcesz wykorzystać.
- 2.Oceniłeś każde źródło wg tych samych kryteriów - aktualność, unikalność, własność, uprawnienia, format.
- 3.Usunąłeś lub zarchiwizowałeś dokumenty na pewno nieaktualne - najtańszy krok o największym wpływie na jakość odpowiedzi.
- 4.Każda kategoria dokumentów ma przypisanego właściciela - konkretną osobę, nie dział.
- 5.Wiesz, jak uprawnienia z systemu źródłowego przełożą się na warstwę AI - i masz to potwierdzone przez dostawcę, nie tylko obiecane.
- 6.Zakres pilota jest wąski i policzony - jedna kategoria dokumentów, nie cała wiedza firmy naraz.
- 7.Masz plan na utrzymanie porządku po wdrożeniu - właściciele danych, cykl przeglądu, nie jednorazowe sprzątanie.
---
Pomagam firmom zrobić audyt danych i przygotować je pod wdrożenie AI, zanim zapłacą za integrację, która i tak nie zadziała na bałaganie - mapę źródeł, ocenę jakości, plan porządkowania i architekturę uprawnień w jednym. Robię to w ramach konsultingu AI i wdrożeń automatyzacji AI. Napisz do mnie - zacznę od szybkiego audytu Twoich głównych źródeł danych i wskażę, gdzie jest największe ryzyko.
Warto przeczytać dalej:
/// RELATED_SERVICES
Potrzebujesz wdrożenia tych koncepcji? Zobacz usługi powiązane z tym tematem.
Doradztwo AI
Niezależny konsultant sztucznej inteligencji dla firm. Audyt gotowości na AI, strategia wdrożenia i doradztwo dla zarządów — zanim zaangażujesz wykonawców.
Zobacz usługęUsługaAI & Automatyzacja
Agenci AI 24/7, automatyzacja procesów z n8n i Make, chatboty, RAG z Twoimi danymi i custom LLM. Buduję systemy AI, które redukują ręczną pracę i zwiększają efektywność.
Zobacz usługę/// ŹRÓDŁA
- 01Gartner - Lack of AI-Ready Data Puts AI Projects at Risk
- 02Fortune - MIT report: 95% of generative AI pilots at companies are failing
- 03Truto - Document-Level RBAC for RAG Pipelines: The 2026 Enterprise Architecture Guide
- 04Engineer Up - Data Governance Before RAG and AI Agents
- 05OvalEdge - Data Governance for RAG Systems
/// RELATED_RECORDS
Copilot, Gemini czy ChatGPT Business - który pakiet AI dla firmy wybrać (porównanie 2026)
Microsoft 365 Copilot to realnie 69-90 zł-nie, dolarów per stanowisko miesięcznie po doliczeniu wymaganej licencji bazowej, nie 30 dolarów z reklamy. ChatGPT Business kosztuje dziś 20 dolarów - o 5 mniej niż jeszcze na początku roku. Claude Enterprise zeszło z pułapu 40-200 dolarów do płaskich 20 dolarów za stanowisko. Ceny same w sobie już wystarczą, żeby zgubić się w wyborze - a to dopiero jedna z czterech zmiennych, które naprawdę powinny zdecydować, który pakiet trafi do całej firmy. Rozkładam trzy ekosystemy na czynniki pierwsze: cenę rzeczywistą, ochronę danych, administrację i integracje - i pokazuję, jak zaprojektować pilotaż, zanim podpiszesz umowę na 300 stanowisk.
AI w księgowości i biurze rachunkowym - od faktur po deklaracje: co automatyzować w 2026
73% biur rachunkowych na świecie ma już wdrożoną jakąś formę automatyzacji AI, a wśród firm doradztwa podatkowego udział ten skoczył z 9% w 2024 do 41% w 2025 roku. Jednocześnie od 1 lutego 2026 każda firma w Polsce musi umieć odbierać faktury przez KSeF, a od kwietnia - także je wystawiać. To nie zbieg okoliczności: obowiązkowy KSeF i automatyzacja AI napędzają się nawzajem, tylko nie tak, jak większość biur to sobie wyobraża. Pokazuję mapę procesu biura rachunkowego, co realnie automatyzuje AI dziś, co musi zostać przy księgowym z podpisem pod deklaracją, i jak policzyć ROI, zanim podpiszesz umowę z dostawcą.
Vibe Coding: kompletny przewodnik po narzędziach AI do kodowania 2026
Claude Code, Cursor, GitHub Copilot, Codex CLI, Gemini CLI, Lovable, Bolt.new - 60% nowego kodu na świecie jest już generowane przez AI (Gartner, 2026). Kompletna mapa 11 narzędzi vibe codingu podzielona na 3 kategorie, z cenami, przypadkami użycia i przewodnikiem wyboru dla firm.
Signal received?
Przerwij
Ciszę
Zainicjuj protokół. Nawiąż połączenie. Zbudujmy coś głośnego.
