Dlaczego AI za każdym razem odpowiada inaczej i co to oznacza dla pomiaru
AI za każdym razem odpowiada inaczej, bo generuje tekst z elementem losowości, przy każdym uruchomieniu może wyszukać inne źródła, a wynik zależy też od konta, lokalizacji i wersji modelu. Skala jest duża: w badaniu SparkToro i Gumshoe.ai ChatGPT i AI w Google zwracały tę samą listę marek w mniej niż 1 na 100 powtórzeń tego samego pytania. Stabilniejsze jest to, jak często marka pojawia się w wielu odpowiedziach, i właśnie ten wskaźnik trzeba mierzyć.

Ten tekst należy do przewodnika Widoczność marki w AI: jak działa i jak ją mierzyć.
Jak bardzo różnią się odpowiedzi na to samo pytanie?
Bardziej, niż zakłada większość marketerów. Badanie SparkToro i Gumshoe.ai z początku 2026 roku objęło 600 ochotników, 12 pytań i 2961 uruchomień w ChatGPT, Claude i AI w wyszukiwarce Google. Pytania dotyczyły m.in. noży kuchennych, słuchawek, szpitali onkologicznych i konsultantów marketingowych (omówienie w Search Engine Land).
Wyniki:
- szansa, że ChatGPT albo AI w Google poda tę samą listę marek w dwóch odpowiedziach, była mniejsza niż 1 na 100,
- ta sama lista w tej samej kolejności pojawiała się mniej więcej raz na 1000 prób,
- długość listy też się zmieniała: czasem model podawał 2-3 marki, równie często 10 i więcej,
- Claude nieco częściej powtarzał ten sam zestaw marek, ale jeszcze rzadziej w tej samej kolejności.
- 1 na 100ta sama lista marek
- 1 na 1000ta sama lista w tej samej kolejności
- 2 do 10+tyle marek podaje raz jedną, raz drugą odpowiedź
Skąd bierze się ta zmienność?
Losowanie przy generowaniu tekstu
Model pisze odpowiedź słowo po słowie, wybierając kolejne z rozkładu prawdopodobieństwa. W czatach ten wybór zawiera element losowy, dzięki któremu tekst brzmi naturalnie. Skutek uboczny: przy dwóch równie prawdopodobnych markach raz wygrywa jedna, raz druga.
Inne wyszukiwania przy każdym uruchomieniu
Gdy czat korzysta z sieci, rozbija pytanie na zapytania pomocnicze. Przy kolejnym uruchomieniu może wygenerować inne zapytania, dostać inne strony i zacytować inne źródła. W badaniu AirOps ChatGPT cytował tylko 15% stron, które pobrał, więc sam dobór źródeł do odpowiedzi też jest selekcją. Mechanizm opisuje tekst Jak czaty AI wybierają marki, które polecają.
Różne funkcje tej samej platformy
Tryb AI i AI Overviews w Google to dwa różne produkty. Google zaznacza w dokumentacji Search Central, że mogą korzystać z różnych modeli i technik, więc pokazują różne odpowiedzi i linki. Według danych Ahrefs z grudnia 2025 roku przy tym samym zapytaniu cytują różne źródła w 87% przypadków (omówienie w Search Engine Journal).
Konto, pamięć i lokalizacja
Zalogowany użytkownik z historią rozmów, pamięcią ChatGPT i ustawioną lokalizacją dostaje inną odpowiedź niż ktoś w czacie tymczasowym. Przy usługach lokalnych różnica bywa zasadnicza, dlatego firmy działające w jednym mieście powinny sprawdzać pytania z nazwą miejscowości (więcej na stronie Aelo dla małych firm).
Aktualizacje modeli i indeksów
Dostawcy zmieniają modele i sposób wyszukiwania bez zapowiedzi, a indeksy stron odświeżają się codziennie. Lily Ray opisuje, jak w 2026 roku zmieniały się zapytania pomocnicze ChatGPT i źródła, z których korzysta. Wynik sprzed miesiąca może dziś wyglądać inaczej, choć na Twojej stronie nic się nie zmieniło.
Co w odpowiedziach AI pozostaje stałe?
Pula marek, z której model wybiera. W badaniu SparkToro czołowe marki w kategorii słuchawek pojawiały się w 55-77% odpowiedzi, mimo że kolejność i skład list zmieniały się niemal za każdym razem. W wąskich kategoriach, np. dostawcy chmury obliczeniowej, najwięksi gracze występowali w większości odpowiedzi. W szerokich, np. powieści science fiction, wyniki były znacznie bardziej rozproszone.
Zmienne są też same pytania. Gdy 142 uczestników badania napisało własne pytania o słuchawki, ich podobieństwo semantyczne wyniosło zaledwie 0,081. Klienci pytają o to samo na bardzo różne sposoby.
Co to oznacza dla pomiaru widoczności marki?
Skoro AI za każdym razem odpowiada inaczej, pozycja na liście nie jest wskaźnikiem. Marka „trzecia w ChatGPT” przy kolejnym uruchomieniu może być siódma albo zniknąć. Sensowny pomiar opiera się na:
- odsetku odpowiedzi, w których marka występuje,
- kilku wariantach każdego pytania, bo klienci formułują je różnie,
- wielu uruchomieniach w kilku modelach, a nie jednej próbie w jednym czacie,
- stałym zestawie zapytań i trendzie porównywanym tygodniami lub miesiącami.
- 3 miejsce
- 7 miejsce
- poza listą
Zrzut ekranu od klienta albo szefa z podpisem „nie ma nas w ChatGPT” to jedna próbka. Nie dowodzi ani problemu, ani jego braku. Jak zrobić ręczny test, który coś mówi, opisuje tekst Jak sprawdzić, czy AI poleca Twoją markę. Jak wygląda pomiar powtarzany na tym samym zestawie zapytań, pokazuje case producenta wapna.
Czy da się wyłączyć losowość odpowiedzi?
Użytkownik aplikacji nie ma na to wpływu. W API części modeli można obniżyć parametr temperatury, co zmniejsza zmienność tekstu, ale nie usuwa różnic wynikających z wyszukiwania. Odpowiedź z API może się też różnić od tej, którą klient widzi w aplikacji. Dla oceny widoczności liczy się to, co widzą użytkownicy, sprawdzone w wielu próbach.
Jak mierzyć widoczność mimo zmienności?
Regularnie i na tych samych zapytaniach. W Aelo robimy to w module Widoczność: zadajemy zestaw zapytań w czterech modelach (ChatGPT, Claude, Gemini, Perplexity) w stałych odstępach czasu i pokazujemy, jak zmienia się obecność marki w czasie i na tle konkurencji. Wyniki trafiają do grafu wiedzy Synapsis, a na ich podstawie przygotowujemy konkretne działania w Tickets. Co z tego wdrożysz, decydujesz Ty.
Agencje, które muszą wytłumaczyć klientom, dlaczego wynik z jednego dnia nie jest miarodajny, znajdą więcej na stronie Aelo dla agencji. Czym ten pomiar różni się od śledzenia pozycji w Google, wyjaśnia tekst Widoczność w AI a SEO.
Pomiar możesz zacząć na darmowym koncie Free. Zarejestruj się
FAQ
Nie. W badaniu SparkToro i Gumshoe.ai ChatGPT podawał tę samą listę marek w mniej niż 1 na 100 prób. Przy identycznym pytaniu zmieniają się skład listy, kolejność marek i jej długość.
W badaniu SparkToro każde pytanie uruchamiano 60-100 razy na platformę. W ręcznym teście 5-10 powtórzeń w każdym modelu wystarczy, żeby zobaczyć, czy marka pojawia się regularnie, sporadycznie, czy wcale.
Tak, jeśli mierzysz odsetek odpowiedzi z marką na stałym zestawie zapytań, a nie jej pozycję. Pula marek, z której model wybiera, jest stabilna: czołowe marki w badanej kategorii pojawiały się w 55-77% odpowiedzi.
Zmienność to wahania między uruchomieniami tego samego pytania, gdy nic się nie zmieniło. Realna zmiana to przesunięcie odsetka odpowiedzi z marką w kolejnych pomiarach na tym samym zestawie zapytań. Jeśli zestaw zapytań się zmienia, wyników z różnych dni nie da się porównać.
Źródła
- SparkToro i Gumshoe.ai, badanie spójności rekomendacji marek w AI (styczeń 2026): https://sparktoro.com/blog/new-research-ais-are-highly-inconsistent-when-recommending-brands-or-products-marketers-should-take-care-when-tracking-ai-visibility/
- Search Engine Land, omówienie badania SparkToro (styczeń 2026): https://searchengineland.com/ai-recommendation-lists-rarely-repeat-study-468076
- Search Engine Journal, omówienie badania SparkToro i danych Ahrefs o trybie AI i AI Overviews (styczeń 2026): https://www.searchenginejournal.com/ai-recommendations-change-with-nearly-every-query-sparktoro/566242/
- AirOps, raport o wyszukiwaniu, zapytaniach pomocniczych i cytowaniach w ChatGPT (marzec 2026): https://www.airops.com/report/influence-of-retrieval-fanout-and-google-serps-in-chatgpt
- Google Search Central, funkcje AI a Twoja strona: https://developers.google.com/search/docs/appearance/ai-features
- OpenAI, pamięć w ChatGPT: https://help.openai.com/en/articles/8590148-memory-faq
- OpenAI, czat tymczasowy: https://help.openai.com/en/articles/8914046-temporary-chat-faq


