
SEO obrazów w erze AI - Google Lens, wyszukiwanie wizualne i grafiki, które cytują modele
Google Lens przetwarza dziś blisko 20 miliardów wyszukiwań wizualnych miesięcznie - Google ogłosił tę skalę już w październiku 2024 roku, a od tego czasu liczba tylko rosła. Circle to Search, funkcja pozwalająca zakreślić dowolny fragment ekranu i wyszukać go bez zmiany aplikacji, działa według komentarza CEO Alphabetu z lutego 2026 roku na ponad 580 milionach urządzeń z Androidem. To nie jest już niszowy dodatek do klasycznego wyszukiwania tekstowego - to osobna, masowa powierzchnia wyszukiwania, z własnymi regułami rankingowymi, własnym formatem cytowań i własnymi błędami, które kosztują widoczność.
Google Lens przetwarza dziś blisko 20 miliardów wyszukiwań wizualnych miesięcznie, a Circle to Search działa na ponad 580 milionach urządzeń z Androidem - obraz przestał być dodatkiem do tekstu i stał się osobną powierzchnią wyszukiwania z własnymi regułami. Pokazuję, co faktycznie robi alt text (i czego nie robi), jak wpiąć obrazy w dane strukturalne ImageObject, dlaczego infografika zbudowana jako HTML bije infografikę-obrazek pod kątem cytowalności przez modele, który format pliku wybrać w 2026 roku i co unijny AI Act mówi o oznaczaniu grafik generowanych przez AI.
Problem w tym, że większość poradników SEO traktuje obrazy jak temat poboczny: "dodaj alt text, skompresuj plik, gotowe". To wystarczało dekadę temu. Dziś obraz może być samodzielnym punktem wejścia do Twojej marki (Lens, Circle to Search), elementem ocenianym osobno przez AI Overviews, formatem danych strukturalnych z własną schemą (ImageObject) i - jeśli jest generowany przez AI - przedmiotem regulacji prawnej dotyczącej oznaczania treści syntetycznych. Rozkładam to na czynniki pierwsze.
Wyszukiwanie wizualne rośnie szybciej niż tekstowe
/// SKALA WYSZUKIWANIA WIZUALNEGO
Skala nie jest przypadkowa - to efekt trzech rzeczy naraz: kamery smartfonów stały się wystarczająco dobre, modele multimodalne (Gemini) nauczyły się rozpoznawać obiekty z dokładnością bliską ludzkiej, a Google aktywnie wpycha Lens i Circle to Search w każdy możliwy punkt styku (pasek adresu, przycisk home, aplikacja Google). Największym motorem wzrostu jest odkrywanie produktów i lokalnych miejsc - użytkownik robi zdjęcie butów na czyichś nogach albo fasady restauracji i chce wiedzieć, gdzie to kupić lub zjeść. Coraz większa część takich zapytań jest też multimodalna: zdjęcie plus dopisany tekst ("znajdź to w rozmiarze 39").
Praktyczna konsekwencja: jeśli sprzedajesz cokolwiek fizycznego albo prowadzisz biznes z lokalizacją, obraz produktu lub witryny lokalu jest dziś osobnym kanałem odkrycia, niezależnym od tego, czy strona rankuje wysoko w klasycznym wyszukiwaniu tekstowym.
Co faktycznie robi alt text (i czego nie robi)
/// TRZY WARSTWY, KTÓRE FAKTYCZNIE SIĘ LICZĄ
Alt text nie podnosi pozycji strony w wyszukiwaniu tekstowym - to potwierdzony mit
To jeden z najczęściej powtarzanych mitów w SEO: alt text rzekomo podnosi pozycję strony w wynikach tekstowych Google. Nie podnosi. Google wprost potwierdził (John Mueller, Google Search Central), że alt text jest czynnikiem rankingowym wyłącznie dla Google Image Search - w klasycznym wyszukiwaniu tekstowym strony jest traktowany jak zwykły tekst na stronie, bez dodatkowej wagi. To nie znaczy, że nie warto go pisać - oznacza tylko, że trzeba go pisać z właściwego powodu: dostępności dla czytników ekranu i widoczności w wyszukiwarce obrazów oraz w Lens, a nie jako sposób na "wepchnięcie" dodatkowych słów kluczowych pod stronę tekstową.
Trzy warstwy, które faktycznie się liczą, ale każda gdzie indziej: alt text (opisowy, zgodny z kontekstem akapitu, bez upychania fraz) dla dostępności i wyszukiwarki obrazów; nazwa pliku (opisowy-produkt-czerwony-but.jpg zamiast IMG_4821.jpg) jako dodatkowy sygnał kontekstowy czytelny zarówno dla wyszukiwarki, jak i dla modeli przetwarzających stronę; oraz sąsiedztwo tekstowe - obraz umieszczony obok akapitu, który go faktycznie opisuje, wzmacnia oba sygnały naraz, bo wyszukiwarka i model widzą zgodność między tym, co obraz pokazuje, a tym, co strona twierdzi.
Dane strukturalne ImageObject - jak połączyć obraz z resztą strony
Schema.org definiuje ImageObject jako osobny typ z właściwościami opisującymi obraz wprost: contentUrl (adres pliku), caption (podpis), creator (autor), license (licencja) oraz representativeOfPage (czy to główne zdjęcie reprezentujące całą stronę). W praktyce najczęściej nie dodaje się go osobno, tylko jako tablicę w polu image wewnątrz schemy Article czy Product - to mówi wyszukiwarce wprost, które zdjęcie jest główne, a które dodatkowe, i pozwala wybrać właściwy kadr do wyników z obrazkiem czy Google Discover.
| Element | Co robi | Praktyka |
|---|---|---|
| Alt text | Ranking w Google Image Search, nie w klasycznym wyszukiwaniu tekstowym strony | Opisowy, zgodny z kontekstem akapitu, bez upychania słów kluczowych |
| Nazwa pliku | Sygnał kontekstowy dla wyszukiwarki obrazów i modeli czytających stronę | opisowy-produkt.jpg zamiast IMG_4821.jpg |
| Dane strukturalne ImageObject | Kwalifikacja do wyników z obrazkiem i wybór właściwego kadru przez wyszukiwarkę | contentUrl, caption, creator, license, representativeOfPage |
| Format pliku (AVIF/WebP) | Nie wpływa wprost na ranking, ale na Core Web Vitals (LCP) | Kaskada: AVIF jako pierwszy wybór, WebP jako fallback, JPEG jako siatka bezpieczeństwa |
| Oznaczenie C2PA/SynthID | Wymóg prawny dla treści syntetycznych w UE (AI Act, art. 50, od 2 sierpnia 2026) | Zachowaj metadane provenance przy publikacji obrazów generowanych przez AI |
Infografiki, które modele faktycznie cytują - nasz własny case
Tu wchodzi coś, czego większość poradników nie porusza: modele wizyjne (m.in. te stojące za AI Overviews) potrafią dziś "odczytać" dane z obrazu infografiki i zestawić je z tekstem strony wokół - a im większa zgodność semantyczna między tym, co pokazuje grafika, a tym, co mówi otaczający tekst, tym większa szansa na cytowanie. Problem: to wciąż jest odczyt wizyjny, czyli w praktyce OCR i rozpoznawanie kształtów na obrazku rastrowym - z możliwością błędu, dodatkowym kosztem obliczeniowym po stronie modelu i zależnością od jakości renderu (kompresja, rozdzielczość, kontrast tekstu na tle).
Infografiki na tym blogu - te same bloki statystyk i list numerowanych, które widzisz w tym i w każdym innym wpisie - są z rozmysłu zbudowane inaczej: to nie są obrazy, tylko komponenty HTML/CSS renderowane po stronie serwera. Liczby, etykiety i opisy istnieją jako zwykły tekst w DOM-ie strony, nie jako piksele do odczytania. Efekt: zero zależności od OCR, zero utraty jakości przy kompresji, dane w 100% dostępne dla każdego crawlera i modelu bez etapu rozpoznawania obrazu - a jednocześnie ten sam punkt danych pojawia się też w zdaniu tekstowym tuż obok, więc nawet system, który zignoruje warstwę wizualną strony, wciąż dostaje informację. Jeśli Twoja strona operuje głównie infografikami-obrazkami, warto rozważyć dokładnie ten kompromis: obraz jest bardziej "designerski" i uniwersalny wizualnie, ale komponent HTML jest tańszy do wygenerowania, lżejszy i pewniejszy do zacytowania.
Formaty plików i wydajność - most do Core Web Vitals
Wybór formatu obrazu nie jest bezpośrednim czynnikiem rankingowym, ale przekłada się na Core Web Vitals - a te już tak, zwłaszcza na Largest Contentful Paint (LCP), który opisuję osobno w przewodniku po Core Web Vitals. AVIF daje pliki średnio o 20-30% mniejsze niż WebP przy tej samej jakości wizualnej i nawet 50% mniejsze niż JPEG, ale koduje się wolniej - kompresja obrazu, która w WebP trwa poniżej sekundy, w AVIF może zająć 10-40 sekund, co ma znaczenie przy generowaniu tysięcy plików w pipeline'ie. WebP z kolei dekoduje się szybciej i taniej po stronie urządzenia, co ma znaczenie na słabszych telefonach. Praktyczna rekomendacja na 2026 rok, zgodna z wytycznymi Google: serwuj AVIF jako pierwszy wybór, WebP jako fallback dla przeglądarek bez wsparcia AVIF, JPEG jako ostatnia siatka bezpieczeństwa - większość nowoczesnych CDN-ów i frameworków (w tym Next.js) robi to automatycznie przez znacznik picture lub własny image loader.
Obrazy generowane przez AI i obowiązek ich oznaczania
Od 2 sierpnia 2026 roku artykuł 50 unijnego AI Act nakłada na dostawców systemów generujących treści syntetyczne obowiązek znakowania ich w sposób czytelny maszynowo, wykrywalny automatycznie - z okresem przejściowym do 2 grudnia 2026 dla systemów, które były już na rynku przed sierpniem. W praktyce oznacza to najczęściej metadane C2PA (Coalition for Content Provenance and Authenticity) - swego rodzaju cyfrowy paszport pliku pokazujący, czym został wygenerowany i jakie przeszedł edycje - często uzupełnione niewidocznym znakiem wodnym w pikselach, takim jak SynthID od Google DeepMind, który przetrwa kompresję i przycięcie, w przeciwieństwie do samych metadanych, które da się usunąć zapisem w innym formacie. OpenAI ogłosiło w maju 2026 roku dołączenie do C2PA jako "Conforming Generator" i wbudowanie SynthID w każdy obraz generowany przez ChatGPT, API i Codex - podejście dwuwarstwowe, gdzie metadane i znak wodny się uzupełniają, a nie zastępują.
Dla właściciela strony publikującej grafiki wygenerowane przez AI (okładki, ilustracje, grafiki produktowe) praktyczny wniosek jest prosty: jeśli narzędzie, którego używasz, już wbudowuje C2PA i SynthID (jak ChatGPT od maja 2026), Twoim zadaniem jest tylko nie usuwać tych metadanych przy dalszej obróbce pliku - a nie dodawać je ręcznie. Jeśli tworzysz grafiki proceduralnie (np. wykresy czy ilustracje generowane kodem, a nie modelem dyfuzyjnym) - jak infografiki i okładki na tym blogu - nie wchodzisz w zakres regulacji dotyczącej treści syntetycznych generowanych przez modele AI, ale warto to rozróżnienie rozumieć, zanim ktoś zapyta.
Jak wybrać - cztery scenariusze
- 1.Sklep lub biznes lokalny → priorytet na zdjęcia produktowe/witrynowe wysokiej jakości, opisowe nazwy plików i alt text, ImageObject w schemie Product - to bezpośredni kanał z Lens i Circle to Search.
- 2.Blog lub content marketingowy z danymi → rozważ infografiki jako komponenty HTML zamiast obrazów wszędzie tam, gdzie to możliwe - taniej wygenerować, pewniej zacytować.
- 3.Duży katalog obrazów, cel: wydajność → wdróż kaskadę AVIF → WebP → JPEG i zmierz wpływ na LCP przed i po.
- 4.Publikujesz grafiki generowane przez AI → sprawdź, czy narzędzie już wbudowuje C2PA/SynthID; jeśli tak, pilnuj tylko, żeby dalsza obróbka pliku tych metadanych nie usuwała.
Plan wdrożenia krok po kroku
- 1.Zrób audyt obrazów na kluczowych stronach: brakujący alt text, nazwy plików typu IMG_XXXX, brak ImageObject w schemie.
- 2.Popraw alt text i nazwy plików tam, gdzie mają znaczenie dla wyszukiwarki obrazów i Lens - zacznij od stron produktowych i lokalnych.
- 3.Dodaj ImageObject (lub tablicę image) do istniejącej schemy Article/Product zamiast tworzyć osobny, oderwany blok danych strukturalnych.
- 4.Tam, gdzie publikujesz dane liczbowe, rozważ komponent HTML zamiast infografiki-obrazka - policz różnicę w czasie generowania i wadze strony.
- 5.Wdróż nowoczesne formaty plików kaskadowo (AVIF/WebP/JPEG) i zmierz wpływ na LCP w realnych warunkach, nie tylko w laboratorium.
- 6.Jeśli publikujesz grafiki generowane przez AI, sprawdź politykę narzędzia wobec C2PA/SynthID i upewnij się, że pipeline publikacji nie usuwa tych metadanych.
- 7.Zmierz efekt po kwartale w Google Search Console (zakładka Obrazy) i w danych o ruchu z Lens, jeśli je zbierasz.
---
Audytuję i optymalizuję warstwę obrazów pod widoczność w Google Image Search, Lens i AI Overviews - od alt textu i danych strukturalnych, przez wybór formatu, po decyzję obraz kontra komponent HTML dla treści z danymi. Robię to w ramach technicznego SEO i content marketingu SEO. Uczę tego w kursie SEO & GEO. Napisz do mnie - zacznę od audytu obrazów na Twoich najważniejszych stronach.
Warto przeczytać dalej:
/// RELATED_SERVICES
Potrzebujesz wdrożenia tych koncepcji? Zobacz usługi powiązane z tym tematem.
/// ŹRÓDŁA
- 01Google Blog - Google updates: AI-Organized Search, Google Lens, and more
- 02Google Blog - Alphabet earnings, Q4 2025: CEO's remarks
- 03web.dev - Image formats: AVIF
- 04Schema.org - ImageObject
- 05EU Artificial Intelligence Act - Article 50: Transparency Obligations
- 06OpenAI - Advancing content provenance for a safer, more transparent AI ecosystem
/// RELATED_RECORDS
Bing, Microsoft Copilot i IndexNow - zapomniany ekosystem, który zasila odpowiedzi AI
1 lipca 2026 Fabrice Canel, wieloletni szef zespołu crawlowania i indeksowania w Bingu i główny architekt protokołu IndexNow, przeszedł na emeryturę z Microsoftu. To dobry moment, żeby zauważyć, jak duża część odpowiedzi AI faktycznie stoi na infrastrukturze, którą zbudował. Cały świat SEO dyskutuje o Google AI Overviews, a tymczasem Microsoft Copilot w całości i ChatGPT w istotnej części pobierają źródła z indeksu Bing - i od lutego 2026 Bing sam pokazuje, kiedy Cię cytuje. Pokazuję, jak działa ten ekosystem, jak go skonfigurować i ile realnie daje ruchu.
Marka osobista eksperta w erze AI - jak zostać osobą, którą cytują modele
Zapytaj ChatGPT „kogo polecacie na specjalistę od X w Polsce” - model odpowie nazwiskami, nie tylko nazwami firm. Jeśli Twoje nazwisko nie istnieje jako jednoznaczna encja połączona z dowodami ekspertyzy, jesteś niewidzialny, nawet gdy firma ma świetne SEO. Google od lat mówi wprost, że autorstwo liczy się tam, gdzie czytelnik go oczekuje - a modele AI idą o krok dalej: sprawdzają, czy ten sam człowiek stoi za tekstem, profilem LinkedIn i wpisem w Wikidata. Jak zbudować siebie jako encję, którą da się zweryfikować i zacytować - na przykładzie własnego rekordu, który już raz pokazałem na tym blogu.
YouTube i wideo w strategii widoczności AI - najsilniejszy sygnał, którego nie używasz
Ahrefs przebadał 75 000 marek i znalazł jeden sygnał silniej skorelowany z widocznością w ChatGPT, AI Mode i AI Overviews niż cokolwiek innego - mocniej niż domain rating, mocniej niż linki, mocniej niż liczba stron na blogu. To wzmianki na YouTube. Korelacja rzędu 0,737 wobec ~0,19 dla objętości treści na stronie. AI Overviews już dziś cytuje transkrypcje wideo wprost, a rozdziały działają jak znaczniki tematyczne dla modelu. Jak zbudować minimalny, powtarzalny warsztat wideo bez studia telewizyjnego - i jak z jednego nagrania zrobić wpis, film, shorty i cytowania naraz.
Signal received?
Przerwij
Ciszę
Zainicjuj protokół. Nawiąż połączenie. Zbudujmy coś głośnego.
