SEO obrazów w erze AI - Google Lens, wyszukiwanie wizualne i grafiki, które cytują modele
POWRÓT_DO_BLOGA
AI & SEO 14 min

SEO obrazów w erze AI - Google Lens, wyszukiwanie wizualne i grafiki, które cytują modele

Paweł Wiszniewski
Paweł Wiszniewski
Specjalista SEO & GEO · AI Engineer

Google Lens przetwarza dziś blisko 20 miliardów wyszukiwań wizualnych miesięcznie - Google ogłosił tę skalę już w październiku 2024 roku, a od tego czasu liczba tylko rosła. Circle to Search, funkcja pozwalająca zakreślić dowolny fragment ekranu i wyszukać go bez zmiany aplikacji, działa według komentarza CEO Alphabetu z lutego 2026 roku na ponad 580 milionach urządzeń z Androidem. To nie jest już niszowy dodatek do klasycznego wyszukiwania tekstowego - to osobna, masowa powierzchnia wyszukiwania, z własnymi regułami rankingowymi, własnym formatem cytowań i własnymi błędami, które kosztują widoczność.

Google Lens przetwarza dziś blisko 20 miliardów wyszukiwań wizualnych miesięcznie, a Circle to Search działa na ponad 580 milionach urządzeń z Androidem - obraz przestał być dodatkiem do tekstu i stał się osobną powierzchnią wyszukiwania z własnymi regułami. Pokazuję, co faktycznie robi alt text (i czego nie robi), jak wpiąć obrazy w dane strukturalne ImageObject, dlaczego infografika zbudowana jako HTML bije infografikę-obrazek pod kątem cytowalności przez modele, który format pliku wybrać w 2026 roku i co unijny AI Act mówi o oznaczaniu grafik generowanych przez AI.

Problem w tym, że większość poradników SEO traktuje obrazy jak temat poboczny: "dodaj alt text, skompresuj plik, gotowe". To wystarczało dekadę temu. Dziś obraz może być samodzielnym punktem wejścia do Twojej marki (Lens, Circle to Search), elementem ocenianym osobno przez AI Overviews, formatem danych strukturalnych z własną schemą (ImageObject) i - jeśli jest generowany przez AI - przedmiotem regulacji prawnej dotyczącej oznaczania treści syntetycznych. Rozkładam to na czynniki pierwsze.

Wyszukiwanie wizualne rośnie szybciej niż tekstowe

/// SKALA WYSZUKIWANIA WIZUALNEGO

~20 mld
wyszukiwań wizualnych miesięcznie w Google Lens
Google, październik 2024
580 mln+
urządzeń z Androidem z aktywnym Circle to Search
Alphabet, luty 2026
~20%
zapytań w Lens dotyczy zakupów i produktów
Google
rosnąco
coraz większy udział zapytań łączących zdjęcie z tekstem naraz
trend 2024-2026

Skala nie jest przypadkowa - to efekt trzech rzeczy naraz: kamery smartfonów stały się wystarczająco dobre, modele multimodalne (Gemini) nauczyły się rozpoznawać obiekty z dokładnością bliską ludzkiej, a Google aktywnie wpycha Lens i Circle to Search w każdy możliwy punkt styku (pasek adresu, przycisk home, aplikacja Google). Największym motorem wzrostu jest odkrywanie produktów i lokalnych miejsc - użytkownik robi zdjęcie butów na czyichś nogach albo fasady restauracji i chce wiedzieć, gdzie to kupić lub zjeść. Coraz większa część takich zapytań jest też multimodalna: zdjęcie plus dopisany tekst ("znajdź to w rozmiarze 39").

Praktyczna konsekwencja: jeśli sprzedajesz cokolwiek fizycznego albo prowadzisz biznes z lokalizacją, obraz produktu lub witryny lokalu jest dziś osobnym kanałem odkrycia, niezależnym od tego, czy strona rankuje wysoko w klasycznym wyszukiwaniu tekstowym.

Co faktycznie robi alt text (i czego nie robi)

/// TRZY WARSTWY, KTÓRE FAKTYCZNIE SIĘ LICZĄ

Alt text nie podnosi pozycji strony w wyszukiwaniu tekstowym - to potwierdzony mit

01
ALT TEXT
Ranking w Google Image Search i dostępność - NIE w klasycznym wyszukiwaniu tekstowym strony
02
NAZWA PLIKU
Sygnał kontekstowy dla wyszukiwarki obrazów i modeli czytających stronę
03
SĄSIEDZTWO TEKSTOWE
Obraz obok akapitu, który go opisuje, wzmacnia oba sygnały naraz

To jeden z najczęściej powtarzanych mitów w SEO: alt text rzekomo podnosi pozycję strony w wynikach tekstowych Google. Nie podnosi. Google wprost potwierdził (John Mueller, Google Search Central), że alt text jest czynnikiem rankingowym wyłącznie dla Google Image Search - w klasycznym wyszukiwaniu tekstowym strony jest traktowany jak zwykły tekst na stronie, bez dodatkowej wagi. To nie znaczy, że nie warto go pisać - oznacza tylko, że trzeba go pisać z właściwego powodu: dostępności dla czytników ekranu i widoczności w wyszukiwarce obrazów oraz w Lens, a nie jako sposób na "wepchnięcie" dodatkowych słów kluczowych pod stronę tekstową.

Trzy warstwy, które faktycznie się liczą, ale każda gdzie indziej: alt text (opisowy, zgodny z kontekstem akapitu, bez upychania fraz) dla dostępności i wyszukiwarki obrazów; nazwa pliku (opisowy-produkt-czerwony-but.jpg zamiast IMG_4821.jpg) jako dodatkowy sygnał kontekstowy czytelny zarówno dla wyszukiwarki, jak i dla modeli przetwarzających stronę; oraz sąsiedztwo tekstowe - obraz umieszczony obok akapitu, który go faktycznie opisuje, wzmacnia oba sygnały naraz, bo wyszukiwarka i model widzą zgodność między tym, co obraz pokazuje, a tym, co strona twierdzi.

Dane strukturalne ImageObject - jak połączyć obraz z resztą strony

Schema.org definiuje ImageObject jako osobny typ z właściwościami opisującymi obraz wprost: contentUrl (adres pliku), caption (podpis), creator (autor), license (licencja) oraz representativeOfPage (czy to główne zdjęcie reprezentujące całą stronę). W praktyce najczęściej nie dodaje się go osobno, tylko jako tablicę w polu image wewnątrz schemy Article czy Product - to mówi wyszukiwarce wprost, które zdjęcie jest główne, a które dodatkowe, i pozwala wybrać właściwy kadr do wyników z obrazkiem czy Google Discover.

ElementCo robiPraktyka
Alt textRanking w Google Image Search, nie w klasycznym wyszukiwaniu tekstowym stronyOpisowy, zgodny z kontekstem akapitu, bez upychania słów kluczowych
Nazwa plikuSygnał kontekstowy dla wyszukiwarki obrazów i modeli czytających stronęopisowy-produkt.jpg zamiast IMG_4821.jpg
Dane strukturalne ImageObjectKwalifikacja do wyników z obrazkiem i wybór właściwego kadru przez wyszukiwarkęcontentUrl, caption, creator, license, representativeOfPage
Format pliku (AVIF/WebP)Nie wpływa wprost na ranking, ale na Core Web Vitals (LCP)Kaskada: AVIF jako pierwszy wybór, WebP jako fallback, JPEG jako siatka bezpieczeństwa
Oznaczenie C2PA/SynthIDWymóg prawny dla treści syntetycznych w UE (AI Act, art. 50, od 2 sierpnia 2026)Zachowaj metadane provenance przy publikacji obrazów generowanych przez AI

Infografiki, które modele faktycznie cytują - nasz własny case

Tu wchodzi coś, czego większość poradników nie porusza: modele wizyjne (m.in. te stojące za AI Overviews) potrafią dziś "odczytać" dane z obrazu infografiki i zestawić je z tekstem strony wokół - a im większa zgodność semantyczna między tym, co pokazuje grafika, a tym, co mówi otaczający tekst, tym większa szansa na cytowanie. Problem: to wciąż jest odczyt wizyjny, czyli w praktyce OCR i rozpoznawanie kształtów na obrazku rastrowym - z możliwością błędu, dodatkowym kosztem obliczeniowym po stronie modelu i zależnością od jakości renderu (kompresja, rozdzielczość, kontrast tekstu na tle).

Infografiki na tym blogu - te same bloki statystyk i list numerowanych, które widzisz w tym i w każdym innym wpisie - są z rozmysłu zbudowane inaczej: to nie są obrazy, tylko komponenty HTML/CSS renderowane po stronie serwera. Liczby, etykiety i opisy istnieją jako zwykły tekst w DOM-ie strony, nie jako piksele do odczytania. Efekt: zero zależności od OCR, zero utraty jakości przy kompresji, dane w 100% dostępne dla każdego crawlera i modelu bez etapu rozpoznawania obrazu - a jednocześnie ten sam punkt danych pojawia się też w zdaniu tekstowym tuż obok, więc nawet system, który zignoruje warstwę wizualną strony, wciąż dostaje informację. Jeśli Twoja strona operuje głównie infografikami-obrazkami, warto rozważyć dokładnie ten kompromis: obraz jest bardziej "designerski" i uniwersalny wizualnie, ale komponent HTML jest tańszy do wygenerowania, lżejszy i pewniejszy do zacytowania.

Formaty plików i wydajność - most do Core Web Vitals

Wybór formatu obrazu nie jest bezpośrednim czynnikiem rankingowym, ale przekłada się na Core Web Vitals - a te już tak, zwłaszcza na Largest Contentful Paint (LCP), który opisuję osobno w przewodniku po Core Web Vitals. AVIF daje pliki średnio o 20-30% mniejsze niż WebP przy tej samej jakości wizualnej i nawet 50% mniejsze niż JPEG, ale koduje się wolniej - kompresja obrazu, która w WebP trwa poniżej sekundy, w AVIF może zająć 10-40 sekund, co ma znaczenie przy generowaniu tysięcy plików w pipeline'ie. WebP z kolei dekoduje się szybciej i taniej po stronie urządzenia, co ma znaczenie na słabszych telefonach. Praktyczna rekomendacja na 2026 rok, zgodna z wytycznymi Google: serwuj AVIF jako pierwszy wybór, WebP jako fallback dla przeglądarek bez wsparcia AVIF, JPEG jako ostatnia siatka bezpieczeństwa - większość nowoczesnych CDN-ów i frameworków (w tym Next.js) robi to automatycznie przez znacznik picture lub własny image loader.

Obrazy generowane przez AI i obowiązek ich oznaczania

Od 2 sierpnia 2026 roku artykuł 50 unijnego AI Act nakłada na dostawców systemów generujących treści syntetyczne obowiązek znakowania ich w sposób czytelny maszynowo, wykrywalny automatycznie - z okresem przejściowym do 2 grudnia 2026 dla systemów, które były już na rynku przed sierpniem. W praktyce oznacza to najczęściej metadane C2PA (Coalition for Content Provenance and Authenticity) - swego rodzaju cyfrowy paszport pliku pokazujący, czym został wygenerowany i jakie przeszedł edycje - często uzupełnione niewidocznym znakiem wodnym w pikselach, takim jak SynthID od Google DeepMind, który przetrwa kompresję i przycięcie, w przeciwieństwie do samych metadanych, które da się usunąć zapisem w innym formacie. OpenAI ogłosiło w maju 2026 roku dołączenie do C2PA jako "Conforming Generator" i wbudowanie SynthID w każdy obraz generowany przez ChatGPT, API i Codex - podejście dwuwarstwowe, gdzie metadane i znak wodny się uzupełniają, a nie zastępują.

Dla właściciela strony publikującej grafiki wygenerowane przez AI (okładki, ilustracje, grafiki produktowe) praktyczny wniosek jest prosty: jeśli narzędzie, którego używasz, już wbudowuje C2PA i SynthID (jak ChatGPT od maja 2026), Twoim zadaniem jest tylko nie usuwać tych metadanych przy dalszej obróbce pliku - a nie dodawać je ręcznie. Jeśli tworzysz grafiki proceduralnie (np. wykresy czy ilustracje generowane kodem, a nie modelem dyfuzyjnym) - jak infografiki i okładki na tym blogu - nie wchodzisz w zakres regulacji dotyczącej treści syntetycznych generowanych przez modele AI, ale warto to rozróżnienie rozumieć, zanim ktoś zapyta.

Jak wybrać - cztery scenariusze

  1. 1.Sklep lub biznes lokalny → priorytet na zdjęcia produktowe/witrynowe wysokiej jakości, opisowe nazwy plików i alt text, ImageObject w schemie Product - to bezpośredni kanał z Lens i Circle to Search.
  2. 2.Blog lub content marketingowy z danymi → rozważ infografiki jako komponenty HTML zamiast obrazów wszędzie tam, gdzie to możliwe - taniej wygenerować, pewniej zacytować.
  3. 3.Duży katalog obrazów, cel: wydajność → wdróż kaskadę AVIF → WebP → JPEG i zmierz wpływ na LCP przed i po.
  4. 4.Publikujesz grafiki generowane przez AI → sprawdź, czy narzędzie już wbudowuje C2PA/SynthID; jeśli tak, pilnuj tylko, żeby dalsza obróbka pliku tych metadanych nie usuwała.

Plan wdrożenia krok po kroku

  1. 1.Zrób audyt obrazów na kluczowych stronach: brakujący alt text, nazwy plików typu IMG_XXXX, brak ImageObject w schemie.
  2. 2.Popraw alt text i nazwy plików tam, gdzie mają znaczenie dla wyszukiwarki obrazów i Lens - zacznij od stron produktowych i lokalnych.
  3. 3.Dodaj ImageObject (lub tablicę image) do istniejącej schemy Article/Product zamiast tworzyć osobny, oderwany blok danych strukturalnych.
  4. 4.Tam, gdzie publikujesz dane liczbowe, rozważ komponent HTML zamiast infografiki-obrazka - policz różnicę w czasie generowania i wadze strony.
  5. 5.Wdróż nowoczesne formaty plików kaskadowo (AVIF/WebP/JPEG) i zmierz wpływ na LCP w realnych warunkach, nie tylko w laboratorium.
  6. 6.Jeśli publikujesz grafiki generowane przez AI, sprawdź politykę narzędzia wobec C2PA/SynthID i upewnij się, że pipeline publikacji nie usuwa tych metadanych.
  7. 7.Zmierz efekt po kwartale w Google Search Console (zakładka Obrazy) i w danych o ruchu z Lens, jeśli je zbierasz.

---

Audytuję i optymalizuję warstwę obrazów pod widoczność w Google Image Search, Lens i AI Overviews - od alt textu i danych strukturalnych, przez wybór formatu, po decyzję obraz kontra komponent HTML dla treści z danymi. Robię to w ramach technicznego SEO i content marketingu SEO. Uczę tego w kursie SEO & GEO. Napisz do mnie - zacznę od audytu obrazów na Twoich najważniejszych stronach.

Warto przeczytać dalej:

/// RELATED_RECORDS

AI & SEO

Bing, Microsoft Copilot i IndexNow - zapomniany ekosystem, który zasila odpowiedzi AI

1 lipca 2026 Fabrice Canel, wieloletni szef zespołu crawlowania i indeksowania w Bingu i główny architekt protokołu IndexNow, przeszedł na emeryturę z Microsoftu. To dobry moment, żeby zauważyć, jak duża część odpowiedzi AI faktycznie stoi na infrastrukturze, którą zbudował. Cały świat SEO dyskutuje o Google AI Overviews, a tymczasem Microsoft Copilot w całości i ChatGPT w istotnej części pobierają źródła z indeksu Bing - i od lutego 2026 Bing sam pokazuje, kiedy Cię cytuje. Pokazuję, jak działa ten ekosystem, jak go skonfigurować i ile realnie daje ruchu.

13 min
AI & SEO

Marka osobista eksperta w erze AI - jak zostać osobą, którą cytują modele

Zapytaj ChatGPT „kogo polecacie na specjalistę od X w Polsce” - model odpowie nazwiskami, nie tylko nazwami firm. Jeśli Twoje nazwisko nie istnieje jako jednoznaczna encja połączona z dowodami ekspertyzy, jesteś niewidzialny, nawet gdy firma ma świetne SEO. Google od lat mówi wprost, że autorstwo liczy się tam, gdzie czytelnik go oczekuje - a modele AI idą o krok dalej: sprawdzają, czy ten sam człowiek stoi za tekstem, profilem LinkedIn i wpisem w Wikidata. Jak zbudować siebie jako encję, którą da się zweryfikować i zacytować - na przykładzie własnego rekordu, który już raz pokazałem na tym blogu.

14 min
AI & SEO

YouTube i wideo w strategii widoczności AI - najsilniejszy sygnał, którego nie używasz

Ahrefs przebadał 75 000 marek i znalazł jeden sygnał silniej skorelowany z widocznością w ChatGPT, AI Mode i AI Overviews niż cokolwiek innego - mocniej niż domain rating, mocniej niż linki, mocniej niż liczba stron na blogu. To wzmianki na YouTube. Korelacja rzędu 0,737 wobec ~0,19 dla objętości treści na stronie. AI Overviews już dziś cytuje transkrypcje wideo wprost, a rozdziały działają jak znaczniki tematyczne dla modelu. Jak zbudować minimalny, powtarzalny warsztat wideo bez studia telewizyjnego - i jak z jednego nagrania zrobić wpis, film, shorty i cytowania naraz.

14 min
/// AUTHOR
Paweł Wiszniewski – AI & Web Engineer

Paweł Wiszniewski

SEO & GEO Specialist & AI Engineer

Specjalista SEO/GEO (10 lat) i AI engineer (3 lata). Buduję widoczność w wyszukiwarkach, systemy AI i automatyzacje, które redukują koszty i zwiększają efektywność operacyjną firm.

Signal received?

Przerwij
Ciszę

Zainicjuj protokół. Nawiąż połączenie. Zbudujmy coś głośnego.

> OCZEKIWANIE_NA_SYGNAŁ...