SuperRank
PoradnikBorys Kuśmirek

Monitoring widoczności w AI dla agencji — jak raportować klientom

Stojak z trzema identycznymi kartami raportów klientów połączonymi cienkimi liniami z jednym wskaźnikiem — metafora pulpitu agencji.

Pytanie „czy ChatGPT nas poleca?” pada dziś na statusie równie często jak pytanie o pozycje w Google. Różnica polega na tym, że na to drugie agencja ma gotowy proces — narzędzie, definicje, wykres — a na pierwsze zwykle odpowiada zrzutem ekranu z czata. To nie skaluje się i nie broni w rozmowie o budżecie. Poniżej opisujemy warsztat, który da się powtórzyć: co mierzyć, jak to raportować, jak tłumaczyć wahania i czego nie wolno obiecywać.

1. Cztery liczby, które wchodzą do raportu

Raport widoczności w AI nie potrzebuje dwudziestu wskaźników. Potrzebuje czterech, z których każdy ma jawny mianownik:

  • Udział odpowiedzi ze wzmianką — ile odpowiedzi silnika w danym oknie zawierało nazwę marki, podzielone przez liczbę udanych odpowiedzi. Nigdy „widoczność 80%” bez informacji, z ilu odpowiedzi.
  • Średnia pozycja marki — liczona wyłącznie tam, gdzie marka w ogóle padła. Wliczanie braków zaniża średnią i miesza dwa różne zjawiska: „nie ma nas” i „jesteśmy, ale na końcu listy”.
  • Udział w odpowiedziach na tle konkurencji (share of voice) — wzmianki marki wobec wzmianek wszystkich wykrytych marek. To liczba, która najlepiej tłumaczy klientowi, że rynek jest grą o miejsce w krótkiej liście, a nie o obecność w indeksie.
  • Cytowane domeny — z jakich źródeł silnik zbudował odpowiedź. To jedyna metryka, która od razu podpowiada działanie: jeśli w Twojej kategorii silniki cytują trzy rankingi branżowe, wiadomo, gdzie marki nie ma.

Piątą pozycją w raporcie nie jest liczba, tylko zdanie: ile odpowiedzi złożyło się na te wyniki i co zmieniło się w metodzie. Zmiana zestawu promptów albo wersji modelu potrafi ruszyć wykres bardziej niż praca contentowa — jeśli nie jest opisana, klient odczyta ją jako efekt Waszych działań. W obie strony.

2. Prompty: jednostka, na której stoi cały raport

W SEO jednostką jest fraza. Tutaj jest nią pytanie, które klient naprawdę zadaje asystentowi. Trzy zasady, które ratują raport przed podważeniem:

  1. Pytanie nie może wymieniać marki. „Czy X to dobry bank?” zmierzy echo Twojego pytania, nie widoczność. Pytamy „gdzie najlepiej założyć konto osobiste?”.
  2. Lista jest jawna i zamrożona na okres rozliczeniowy. Klient powinien widzieć dokładnie te same pytania co miesiąc temu. Każdą zmianę zaznacza się na wykresie jako adnotację.
  3. Lepiej mniej pytań mierzonych częściej. Osiem do dwudziestu pytań na markę, mierzonych codziennie, daje serię, którą da się interpretować. Sześćdziesiąt pytań raz w miesiącu daje dwanaście punktów rocznie i zero podstaw do wniosków.

3. Jak tłumaczyć wahania — językiem, który klient przyjmie

Największe ryzyko w tej usłudze to nie spadek widoczności, tylko niewytłumaczone wahanie. Warto mieć trzy fakty pod ręką.

Po pierwsze: modele są losowe z natury. OpenAI w dokumentacji parametru „seed” pisze wprost, że „determinism is not guaranteed”, a nawet przy identycznych parametrach i tym samym odcisku backendu odpowiedzi mogą się różnić „due to the inherent non-determinism of our models”. To nie jest usterka narzędzia pomiarowego — to właściwość mierzonego zjawiska.

Po drugie: Google sam zapowiada zmienność. W dokumentacji funkcji AI czytamy, że AI Mode i AI Overviews „may use different models and techniques, so the set of responses and links they show will vary”, a odpowiedzi budowane są techniką query fan-out, czyli rozbicia jednego pytania na wiele zapytań pobocznych.

Po trzecie: mamy na to liczbę. W naszej edycji rankingów (lipiec 2026) zadaliśmy 60 pytań zakupowych trzem silnikom po 2 razy, tego samego dnia, przez oficjalne API i bez żadnej personalizacji. Spośród 683 przypadków, w których marka pojawiła się w odpowiedzi na dane pytanie, tylko 444 (65,0%) powtórzyło się w obu przebiegach. Reszta — 239 przypadków — to wzmianki, które wystąpiły w jednym przebiegu i zniknęły w drugim. Rozkład per silnik był bardzo różny: ChatGPT 49,1%, Perplexity 68,8%, Gemini 71,1%.

Zdanie, które warto powiedzieć klientowi na pierwszym statusie: jedna odpowiedź to anegdota, dopiero seria odpowiedzi to pomiar. Raportujemy serie.

4. Czego nie wolno obiecywać

Rynek usług „pozycjonowania w ChatGPT” już produkuje obietnice, których nie da się dotrzymać. Dwa cytaty, które warto trzymać w ofercie i w umowie:

  • Google od lat pisze o SEO: „No one can guarantee a #1 ranking on Google. Beware of SEOs that claim to guarantee rankings”. Ta sama logika dotyczy odpowiedzi generowanych — tylko z większą losowością.
  • O funkcjach AI Google mówi jeszcze mocniej: „There are no additional requirements to appear in AI Overviews or AI Mode, nor other special optimizations necessary”, oraz „You don't need to create new machine readable files, AI text files, or markup to appear in these features”. Sprzedawanie „specjalnego pliku dla AI” jako gwarancji obecności jest więc sprzeczne z oficjalnym stanowiskiem wyszukiwarki.

Uczciwy zakres usługi wygląda tak: mierzymy widoczność w powtarzalny sposób, pokazujemy, z jakich źródeł silniki budują odpowiedzi w Twojej kategorii, pracujemy nad tym, żeby marka była obecna w tych źródłach, i raportujemy kierunek zmian. Nie gwarantujemy wystąpienia w konkretnej odpowiedzi konkretnego silnika w konkretnym dniu.

5. Rytm pomiaru i progi, poniżej których nie ma o czym mówić

Zanim wyślesz pierwszy raport, ustal z klientem dwie rzeczy: jak często mierzycie i od jakiego momentu wolno wyciągać wnioski. Nasze progi (opisane w całości w metodologii) można wziąć jako punkt wyjścia dla dowolnego narzędzia:

  • poniżej 10 obserwacji — wynik oznaczony jako wstępny;
  • od 10 do 29 obserwacji — etykieta „mało danych”;
  • trend pokazujemy dopiero przy co najmniej 5 dniach pomiarów w obu porównywanych oknach;
  • żadnych etykiet w rodzaju „lider kategorii” poniżej 30 obserwacji;
  • awaria silnika nie jest zerem — wypada z mianownika, bo policzona jako zero produkuje fałszywy spadek na wykresie klienta.

Praktyczna arytmetyka: 15 pytań mierzonych codziennie w trzech silnikach daje 45 odpowiedzi dziennie i ponad 300 tygodniowo — po dwóch tygodniach masz podstawę do rozmowy o trendzie. Te same 15 pytań mierzone raz w tygodniu daje 45 odpowiedzi tygodniowo i pierwszy sensowny wniosek dopiero po miesiącu.

6. Szablon sekcji „widoczność w AI” w raporcie miesięcznym

Sześć punktów, które wystarczą i które da się obronić przy każdym pytaniu klienta:

  1. Zakres pomiaru — liczba pytań, silniki, częstotliwość, łączna liczba odpowiedzi w okresie.
  2. Wynik — cztery metryki z punktu 1, każda z mianownikiem, per silnik i łącznie.
  3. Zmiana — porównanie z poprzednim oknem tej samej długości, nie z pojedynczym dniem.
  4. Interpretacja — co z tego wynika: gdzie marka rośnie, gdzie konkurent zajmuje jej miejsce, które źródła się zmieniły.
  5. Czego nie wiemy — jawna sekcja o ograniczeniach: losowość odpowiedzi, brak geolokalizacji w części silników, zmiany wersji modeli w okresie.
  6. Działania na kolejny okres — z rozróżnieniem na to, co jest w Waszych rękach (treść, obecność w cytowanych źródłach, spójność danych o marce), i to, co nie jest.

7. Strona operacyjna: jedno narzędzie, wielu klientów

Agencja ma inny problem niż pojedyncza marka: nie „ile promptów”, tylko „jak rozdzielić pulę między dziesięciu klientów i nie mnożyć subskrypcji”. W naszym planie Agencja to 150 promptów w jednej puli organizacji i do 10 marek klientów za 799 zł netto miesięcznie, z użytkownikami bez limitu (fair use) i fakturą VAT wystawianą automatycznie z numerem KSeF. Eksporty CSV działają w każdym planie, także w trialu — raport do klienta nie może być zakładnikiem cennika. Uczciwie: raporty PDF w białej etykiecie są u nas oznaczone jako „wkrótce”, dziś klientom przekazuje się eksporty i cotygodniowy digest. Szczegóły zebraliśmy na stronie dla agencji, a pełne porównanie planów znajdziesz w cenniku.

8. Pięć błędów, które podważają raport

  • Procent bez mianownika. „Widoczność 87%” z siedmiu odpowiedzi to nie wynik, to zaokrąglenie przypadku.
  • Zrzut ekranu z własnego czata jako dowód. Twoje konto ma historię rozmów, pamięć i personalizację — klient nie zobaczy tego samego.
  • Zmiana promptów w trakcie okresu bez adnotacji. Najczęstsza przyczyna „cudownej poprawy”, której nikt nie umie potem powtórzyć.
  • Uśrednianie silników do jednej liczby. Wyniki potrafią się rozjeżdżać wielokrotnie — w naszej edycji rankingów marka Apteka Gemini miała 8,3% udziału w silniku Perplexity i 87,5% w silniku Gemini. Średnia z tego nie opisuje niczego.
  • Obiecanie efektu w konkretnym terminie. Patrz punkt 4.

Najczęstsze pytania

Co dokładnie wpisać do raportu dla klienta?

Cztery liczby zawsze z mianownikiem: udział odpowiedzi ze wzmianką marki, średnią pozycję marki liczoną tylko tam, gdzie marka padła, udział w odpowiedziach na tle konkurentów oraz listę domen cytowanych przez silniki. Do tego jedno zdanie o tym, ile odpowiedzi złożyło się na te liczby i czy w okresie zmieniały się prompty albo wersje modeli.

Jak wytłumaczyć klientowi, że wynik skacze z tygodnia na tydzień?

Bo silniki nie są deterministyczne. OpenAI wprost pisze o „inherent non-determinism” swoich modeli, a Google zaznacza, że AI Overviews i AI Mode używają różnych modeli i technik, więc zestaw odpowiedzi i linków będzie się różnił. W naszej edycji rankingów (lipiec 2026) dwa identyczne przebiegi tego samego dnia dały tę samą wzmiankę marki tylko w 65,0% przypadków (444 z 683). Wniosek dla raportu: pojedyncza odpowiedź to anegdota, dopiero seria to pomiar.

Czy mogę obiecać klientowi, że po optymalizacji ChatGPT będzie go polecał?

Nie. Google od lat ostrzega przed wykonawcami, którzy gwarantują pozycję numer jeden, a o funkcjach AI mówi wprost, że nie ma żadnych dodatkowych wymagań ani specjalnych optymalizacji, dzięki którym strona się w nich pojawi. Bezpieczny zapis w ofercie brzmi: mierzymy, raportujemy i pracujemy nad przyczynami, ale nie gwarantujemy obecności w konkretnej odpowiedzi konkretnego silnika.

Ile promptów na klienta ma sens w praktyce agencyjnej?

Zwykle od 8 do 20 pytań zakupowych na markę — tyle, ile realnie opisuje ścieżkę wyboru w danej kategorii. Lepiej mieć 10 pytań mierzonych codziennie przez kwartał niż 60 pytań mierzonych raz w miesiącu: seria pomiarowa jest tu ważniejsza niż szerokość listy.

Źródła

  1. Google Search Central — Do you need an SEO? (ostrzeżenie przed gwarancjami pozycji)
  2. Google Search Central — AI features and your website (brak dodatkowych wymagań, zmienność odpowiedzi)
  3. OpenAI Cookbook — Reproducible outputs with the seed parameter („determinism is not guaranteed”)
  4. SuperRank — Rankingi widoczności w AI, edycja lipiec 2026 (dane o powtarzalności wzmianek)
  5. SuperRank — metodologia pomiaru i progi „mało danych”