Ten sam prompt, ta sama minuta, inna odpowiedź
Zanim uznasz, że spadłeś, warto wiedzieć, o ile odpowiedź rusza się sama z siebie. Zadaliśmy 60 pytań zakupowych po dwa razy w trzech silnikach — 360 odpowiedzi zebranych między 2026-07-26 a 2026-07-27. Poniżej jest wszystko, co z nich wynika.
Uwaga na to, czym ta liczba JEST: oba przebiegi szły jeden po drugim, w odstępie mediany 13 sekund (od 4 do 174). Nie mierzymy więc zmienności z dnia na dzień, tylko podłogę szumu — o ile różni się odpowiedź, gdy rynek na pewno się nie zmienił, bo nie minął żaden czas. To inna liczba niż publikowana przez Ahrefs zmienność AI Overviews i celowo jej z nią nie mieszamy.
par, w których druga odpowiedź była dosłownie taka sama jak pierwsza
par ze zmianą zestawu wymienionych marek — liczone z 161 par, w których padła jakakolwiek śledzona marka
cytowań w drugiej odpowiedzi prowadziło do domeny, której nie było w pierwszej — z 1502 cytowań
Silnik po silniku
Różnice między silnikami są większe niż różnice między branżami i to jest praktyczny wniosek tej strony. Perplexity wraca po te same źródła; ChatGPT za drugim razem cytuje w połowie coś innego.
| Silnik | Pary | Identyczne | Zmiana zestawu marek | Zmiana marki nr 1 | Nowe domeny | Pokrycie źródeł |
|---|---|---|---|---|---|---|
| ChatGPT | 60 | 0 z 60 | 80,8% | 58,1% | 51,8% | 34,8% |
| Perplexity | 60 | 0 z 60 | 72,0% | 32,6% | 14,4% | 76,9% |
| Gemini | 60 | 0 z 60 | 74,6% | 28,1% | 49,9% | 34,4% |
| Razem | 180 | 0 z 180 | 75,8% | 38,4% | 34,5% | 48,8% |
Mianowniki, żeby nie trzeba było zgadywać: zmianę zestawu marek liczymy z 161 par, w których przynajmniej jedna z dwóch odpowiedzi wymieniła którąś ze śledzonych marek; zmianę marki nr 1 z 146 par, w których zrobiły to obie; wszystkich par jest 180. Marki rozpoznajemy z zamkniętej listy danej branży — odpowiedź mogła wymienić też firmę spoza listy i tego tu nie widać.
Czego z tej próby NIE da się powiedzieć
Zmienności z dnia na dzień. Żeby ją policzyć, potrzebne są pary odpowiedzi na to samo pytanie zebrane w RÓŻNYCH dniach, a nasza próba nie ma takich par ani jednej — obie serie poszły tego samego wieczoru. Wstawienie tu cudzej liczby albo własnego oszacowania byłoby dokładnie tym, przed czym ta strona ostrzega.
- Pary z różnych dni, które mamy
- —
- Pary potrzebne na wiarygodną liczbę
- 30
- Brakuje
- 30
Liczba pojawi się tutaj po pierwszej edycji rankingów powtórzonej w innym dniu: ten sam zestaw pytań, te same silniki, przebieg rozłożony na dwa dni. Potrzeba na to 30 par i jednego uruchomienia gotowego już potoku — nie brakuje kodu, brakuje przebiegu.
Jak to policzyliśmy
- 1.Źródło: przebiegi rankingów widoczności — pytania zakupowe napisane tak, jak pyta klient, żadne nie wymienia marki.
- 2.Każde pytanie zadane dwa razy pod rząd w tym samym silniku, z tą samą lokalizacją (Polska) i bez zmiany jakiegokolwiek parametru.
- 3.Marki wykrywamy tym samym skanem aliasów co w rankingach — dopasowanie po granicy słowa, zero modelu językowego w tym kroku.
- 4.Domenę źródła bierzemy z cytowania; przekierowania groundingu Gemini rozwiązujemy po tytule fragmentu, dokładnie tak jak w rankingach.
- 5.Nowe domeny to udział cytowań z drugiej odpowiedzi prowadzących do domen nieobecnych w pierwszej. Pokrycie źródeł to średni współczynnik Jaccarda obu zbiorów domen.
Korpus: 5 branż, 60 pytań, 360 odpowiedzi silników, edycja lipiec 2026. Strona nie uruchamia żadnego zapytania do silnika — liczy wyłącznie z odpowiedzi już zebranych.
Co z tego wynika
Czy to znaczy, że monitoring widoczności nie ma sensu?
Odwrotnie: znaczy, że pojedyncza odpowiedź nie jest pomiarem. Skoro odpowiedź rusza się sama, wniosek można wyciągać tylko z serii — i dlatego przy każdej metryce podajemy wielkość próby oraz najmniejszą zmianę, którą przy tej próbie w ogóle widać.
Dlaczego nie podajecie zmienności z dnia na dzień?
Bo jej nie zmierzyliśmy. Nasze dwa przebiegi dzieliły sekundy, więc mówią o powtarzalności, a nie o dryfie rynku. Ta liczba pojawi się tu dopiero z danych, które będą do niej pasowały.
Czy wszystkie silniki są równie niestabilne?
Nie. W naszej próbie Perplexity wraca po te same źródła zdecydowanie częściej niż ChatGPT i Gemini — tabela wyżej podaje dokładne liczby razem z mianownikami.
Skąd wiadomo, że to nie błąd pomiaru?
Bo porównujemy dokładnie dwa wywołania różniące się jedną rzeczą: momentem wysłania. Ten sam prompt, ten sam silnik, ta sama lokalizacja, ten sam dzień, te same parametry.
Sprawdź, jak Twoja marka wypada w tym szumie
Bezpłatne sprawdzenie pokazuje, czy silniki wymieniają Twoją markę i na jakich źródłach opierają odpowiedź. Bez konta i bez karty.