Przewaga własnego boiska w piłce nożnej — statystyki z 11 000 meczów
Każdy powtarza, że gra u siebie pomaga. Sprawdziliśmy na blisko jedenastu tysiącach meczów, ile ta przewaga wynosi, czy faktycznie różni się między rozgrywkami i co ją tłumaczy. Część popularnych przekonań nie wytrzymuje zderzenia z przedziałami ufności.
Przewaga własnego boiska to jedno z najstarszych przekonań w piłce i jeden z nielicznych efektów, które bukmacher wycenia otwarcie. Rzadziej pada pytanie o to, ile ta przewaga wynosi liczbowo, czy różni się między rozgrywkami i co ją napędza.
Postawiliśmy trzy pytania i sprawdziliśmy je na własnej bazie wyników. Trzecie okazało się najciekawsze, bo odpowiedź jest odwrotna do intuicji.
Pytanie 1: ile wynosi przewaga
Na 15258 meczach rozegranych w ostatnich dwunastu miesiącach w 41 rozgrywkach wyniki rozłożyły się następująco:
- gospodarz wygrał w 44.5% spotkań
- remisem zakończyło się 23.5%
- gość wygrał w 32.0%
Gospodarz wygrywa więc o kilkanaście punktów procentowych częściej niż gość. To jest ta przewaga w najprostszym ujęciu — i na tym poziomie ogólności zgadza się z tym, co mówi każdy komentator.
Ale średnia po wszystkich rozgrywkach to zawsze uproszczenie. Pytanie, czy pod nią kryje się jednorodne zjawisko, czy zlepek bardzo różnych sytuacji.
Pytanie 2: czy przewaga różni się między ligami
Tu zaczyna się część, w której łatwo o błąd — i którą większość zestawień w internecie robi źle.
Jeśli policzyć odsetek zwycięstw gospodarza osobno dla każdej ligi, rozpiętość wygląda imponująco: od niecałych 36% do ponad 52%. Kusi, żeby ogłosić, że w jednych rozgrywkach własny stadion daje ogromną przewagę, a w innych prawie żadnej.
Problem w tym, że każda z tych liczb pochodzi z próby liczącej dwieście–kilkaset meczów, a proporcja policzona na takiej próbie ma swój margines błędu. Poniżej te same ligi, ale z 95-procentowymi przedziałami ufności — kropka to wartość zmierzona, kreska to zakres, w którym z dużym prawdopodobieństwem leży wartość prawdziwa.
Przedziały są szerokie: średnio ±6.0 punktu procentowego. A to prowadzi do wniosku, którego nie zobaczy się w rankingach „lig z największą przewagą gospodarzy":
Spośród 435 par lig w naszym zestawieniu tylko 18 da się od siebie statystycznie odróżnić. To niecałe cztery procent.
Innymi słowy: dla zdecydowanej większości par nie mamy podstaw twierdzić, że przewaga gospodarzy jest w jednej lidze inna niż w drugiej. Różnice, które widać w tabeli, mieszczą się w granicach przypadku przy tej wielkości próby.
Nie znaczy to, że wszystkie ligi są takie same. Znaczy, że jeden sezon to za mało, żeby to rozstrzygnąć — a ranking zbudowany na jednym sezonie opisuje głównie szum.
Miara stabilniejsza niż odsetek zwycięstw
Odsetek zwycięstw ma wadę: sprowadza mecz do trzech kategorii i wyrzuca informację o tym, jak duża była różnica. Wynik 1:0 i 5:0 liczą się tak samo.
Dlatego drugą miarą przewagi jest różnica bramek — średnia liczba goli gospodarza minus średnia goli gościa. Korzysta z każdego meczu i z całej skali wyniku, więc jest mniej wrażliwa na przypadek. W naszym zbiorze waha się od około 0,06 do 0,61 bramki na mecz. Skrajne wartości utrzymują kolejność z poprzedniego zestawienia, ale środek stawki układa się inaczej — co samo w sobie jest sygnałem, że część kolejności w rankingu odsetkowym była przypadkowa.
Pytanie 3: co tłumaczy różnice
Skoro część różnic jest prawdziwa, warto zapytać, od czego zależą. Najczęściej powtarzane wyjaśnienia to podróż, publiczność i sędziowie. Żadnego z nich nie mamy w danych bezpośrednio, ale mamy coś innego: rozrzut siły drużyn w lidze, mierzony odchyleniem standardowym rankingu Elo.
Hipoteza brzmiała: w ligach zdominowanych przez kilka klubów przewaga gospodarzy powinna być mniejsza, bo faworyt wygrywa wszędzie — również na wyjeździe — i to jego siła, a nie boisko, decyduje o wyniku.
Współczynnik korelacji wynosi r = -0.251 przy 25 ligach. Kierunek zgadza się z hipotezą: im większy rozrzut siły w lidze, tym słabiej widać przewagę własnego boiska. Siła związku jest umiarkowana — wyjaśnia niewielką część zmienności, więc to jeden z czynników, a nie mechanizm rządzący całością.
Trzy zastrzeżenia, bez których ta liczba byłaby nadużyciem:
- Korelacja nie jest przyczynowością. Możliwe, że oba zjawiska mają wspólną przyczynę — na przykład poziom rozgrywek, który wpływa i na rozpiętość, i na warunki wyjazdowe.
- Trzydzieści lig to mała próba dla współczynnika korelacji. Gdyby wypadły z niej dwie–trzy skrajne pozycje, wartość zauważalnie by się zmieniła.
- Rozgrywki pucharowe zaburzają miarę rozrzutu, bo grają w nich drużyny z różnych lig, a ich Elo liczy się w innym kontekście.
Czego ta analiza nie rozstrzyga
Uczciwy wynik to taki, przy którym wiadomo, czego nie pokazuje:
- Jeden sezon. Żeby oddzielić trwałą charakterystykę ligi od sezonowego przypadku, potrzeba trzech–pięciu sezonów na ligę.
- Brak danych o frekwencji. Badania nad meczami przy pustych trybunach podczas pandemii wskazują, że publiczność realnie wpływa na decyzje sędziów. Nie mamy frekwencji, więc nie możemy tego sprawdzić na naszym zbiorze.
- Brak odległości podróży. Intuicja mówi, że wyjazd przez pół kraju kosztuje więcej niż na drugi koniec miasta. To dałoby się policzyć ze współrzędnych stadionów — i będzie tematem osobnego tekstu.
- Format rozgrywek. W dwumeczach pucharowych zaliczka z pierwszego spotkania zmienia nastawienie w rewanżu, co miesza się z efektem gospodarza.
Co z tego wynika praktycznie
- Nie przenoś rankingów przewagi gospodarzy z jednego sezonu na następny. Cztery procent par rozróżnialnych statystycznie to znaczy, że większość takiej tabeli opisuje szum.
- Patrz na różnicę bramek, nie tylko na odsetek zwycięstw. Jest stabilniejsza, bo korzysta z pełnej informacji o wyniku.
- Uwzględniaj strukturę ligi. W rozgrywkach zdominowanych przez kilka klubów wyjazdowe zwycięstwo faworyta jest czymś zwyczajnym, a nie niespodzianką.
- Traktuj mecze pucharowe osobno. Inny format, inne stawki, inna logika.
Metoda
- 15258 meczów rozegranych w ostatnich 12 miesiącach, wyniki w regulaminowym czasie gry
- do zestawień ligowych weszły rozgrywki z co najmniej 150 meczami w tym okresie — przy mniejszych próbach przedziały ufności robią się tak szerokie, że porównanie przestaje mieć sens
- przedziały ufności liczone metodą Wilsona, właściwą dla proporcji przy skończonej próbie; przy tych wielkościach daje węższe i uczciwsze przedziały niż przybliżenie normalne
- rozrzut siły drużyn to odchylenie standardowe rankingu Elo w obrębie ligi, liczone tylko dla drużyn z co najmniej pięcioma rozegranymi meczami
- korelacja Pearsona między odsetkiem zwycięstw gospodarza a rozrzutem Elo, na poziomie lig
- dane pochodzą z tej samej bazy, na której pracują nasze modele — te same wyniki, te same mecze
Terminarz i zapowiedzi dzisiejszych meczów są jawne bez logowania, razem z formą drużyn i bilansem bezpośrednich spotkań. Jeśli interesuje cię, jak te dane trafiają do modelu, opisaliśmy to w przewodniku po naszym bocie.