Kalkulator skośności
Oblicz kierunek i siłę asymetrii danych, wybierając między momentowym g₁ a skorygowanym współczynnikiem próbki G₁.
Oblicz skośność rozkładu
Od danych do świadomej decyzji
- Dane
- Obliczenie
- Wykres
- Decyzja
Skorygowana skośność przykładowej próby wynosi 1,9451
Wartość 9 wydłuża prawy ogon danych
Po uporządkowaniu otrzymujemy 1, 2, 2, 3, 3, 4, 9. Większość obserwacji mieści się między 1 i 4, natomiast 9 leży wyraźnie dalej po prawej stronie. Już sam wykres sugeruje asymetrię prawostronną.
Mediana jest czwartą wartością i wynosi 3. Średnia to 24/7≈3,4286, ponieważ odległa dziewiątka ciągnie sumę w górę. Relacja średnia>mediana jest zgodna z prawym ogonem w tym przykładzie, choć nie stanowi uniwersalnego dowodu.
Skośność nie liczy po prostu różnicy między maksimum i medianą. Uwzględnia wszystkie odchylenia od średniej, ich znaki i skalę rozproszenia, dlatego dwie listy z tym samym maksimum mogą dać inne wyniki.
Trzecia potęga zachowuje kierunek odchylenia
Dla każdej obserwacji obliczamy xᵢ−średnia. Ujemne odchylenia po podniesieniu do trzeciej potęgi pozostają ujemne, a dodatnie pozostają dodatnie. Wartości po prawej i lewej stronie mogą się wzajemnie równoważyć.
Odległość działa bardzo silnie: odchylenie dwa razy większe ma wkład osiem razy większy. Dziewiątka leży około 5,57 ponad średnią, więc jej dodatnia trzecia potęga przeważa nad kilkoma mniejszymi ujemnymi wkładami.
Średni trzeci moment centralny m₃ wynosi około 21,8309. Sam ma jednostkę danych podniesioną do trzeciej potęgi, więc nie nadaje się jeszcze do porównywania zbiorów o innych skalach.
Standaryzacja daje g₁ = 1,5007, a korekta próbki G₁ = 1,9451
Drugi moment centralny m₂ wynosi około 5,9592. Dzielimy m₃ przez m₂^(3/2), otrzymując bezwymiarowy momentowy współczynnik g₁≈1,5007.
Dla próbki wybranej z większej populacji popularna korekta Fishera–Pearsona mnoży g₁ przez √[n(n−1)]/(n−2). Przy n=7 mnożnik wynosi około 1,2961, dlatego skorygowany wynik rośnie do 1,9451.
Domyślnie kalkulator pokazuje wariant skorygowany, a w metrykach również g₁. Jeśli wpisujesz całą skończoną populację lub chcesz dokładnie odtworzyć momenty tej listy, wybierz wariant populacyjny.
Znak wskazuje dłuższy ogon, a nie stronę, po której leży większość obserwacji
Wynik dodatni oznacza asymetrię prawostronną
Dodatnia skośność wskazuje, że skrajne odchylenia po prawej stronie mają większy łączny wpływ niż odchylenia po lewej. W przykładowej liście odpowiada za to przede wszystkim wartość 9.
Określenie „prawostronna” odnosi się do ogona, nie do miejsca, gdzie znajduje się większość danych. W prawoskośnym rozkładzie główne skupienie często leży po lewej, a rzadsze duże wartości tworzą ogon w prawo.
Czasy napraw, dochody i dodatnie koszty często mają dolną granicę oraz możliwość bardzo dużych wartości. Taki mechanizm może prowadzić do dodatniej skośności, ale znak trzeba sprawdzić w danych, nie zakładać na podstawie nazwy zmiennej.
Wynik ujemny oznacza dłuższy lub cięższy lewy ogon
Jeśli odbijemy listę wokół środka, na przykład zamienimy 9 na odległą niską wartość przy skupieniu wyżej, trzeci moment może stać się ujemny. Wtedy mówimy o skośności lewostronnej.
Oceny z trudnego testu mogą skupiać się nisko i mieć prawy ogon, a z bardzo łatwego — skupiać wysoko z ogonem w lewo. Znak opisuje geometrię rozkładu, nie to, czy wynik jest dobry lub zły.
Zmiana znaku zmiennej, y=−x, odwraca znak skośności. Dodanie stałej albo pomnożenie przez dodatnią stałą nie zmienia jej wartości, bo standaryzacja usuwa przesunięcie i skalę.
Skośność bliska zeru nie dowodzi pełnej symetrii ani normalności
Rozkład idealnie symetryczny ma trzeci moment równy zero, o ile moment istnieje. Odwrotne stwierdzenie nie jest jednak pewne: asymetryczne elementy rozkładu mogą dać znoszące się wkłady i wynik bliski zeru.
Dane mogą być dwumodalne, mieć nietypowe ogony albo luki, a mimo to momentowa skośność będzie mała. NIST zaleca histogram jako bezpośredni sposób oglądania asymetrii i kształtu.
Zero nie jest również testem normalności. Rozkład jednostajny jest symetryczny i ma skośność zero, lecz nie ma kształtu dzwonu. Do oceny normalności potrzebne są wykres Q–Q, diagnostyka ogonów i odpowiedni test.
Wariant populacyjny i korekta próbki odpowiadają na nieco inne pytania
Momentowy g₁ opisuje bezpośrednio wpisany zbiór
Wariant populacyjny używa m₂ i m₃ z dzielnikiem n, a następnie tworzy g₁=m₃/m₂^(3/2). Jest naturalny, gdy lista obejmuje całą interesującą populację albo chcemy opisać empiryczny kształt dokładnie tych rekordów.
W małej próbie g₁ jest obciążonym estymatorem parametru populacji. Oznacza to systematyczną różnicę średniej wartości estymatora w powtarzanych próbach, a nie błąd konkretnego rachunku.
Dwa programy mogą więc zwrócić 1,5007 i 1,9451 dla tej samej listy. Zanim uznasz wyniki za sprzeczne, sprawdź opcję bias lub adjusted oraz definicję momentów.
Skorygowany G₁ wymaga co najmniej trzech obserwacji
Wzór zawiera n−2 w mianowniku, dlatego dla n<3 nie jest określony. Przy trzech lub kilku obserwacjach może jednak być bardzo niestabilny i silnie zależeć od pojedynczego punktu.
Korekta usuwa określone obciążenie estymatora Fishera–Pearsona, ale nie sprawia, że mała próba staje się precyzyjna. Liczbę 1,9451 należy czytać razem z n=7 i wykresem, nie jako dokładnie znany parametr populacji.
SciPy rozdziela wybór korekty parametrem bias. W raporcie warto napisać „skorygowany współczynnik Fishera–Pearsona G₁”, zamiast używać samego słowa „skośność”.
Współczynniki kwartylowe są odporniejszą alternatywą
NIST wymienia między innymi kwartylowy współczynnik Bowleya: (Q1+Q3−2·mediana)/(Q3−Q1). Korzysta on z centrum danych i jest mniej wrażliwy na pojedynczą ekstremalną wartość niż trzeci moment.
Współczynnik Pearsona drugiego rodzaju 3(średnia−mediana)/s także mierzy kierunek asymetrii, ale nie jest równy g₁ ani G₁. Różne definicje mogą mieć inne skale i nie powinny być porównywane bez nazwy.
Momentowy wynik dobrze współpracuje z teorią rozkładów, a miara kwartylowa bywa użyteczna w danych z odstającymi punktami. Najlepszy wybór zależy od celu i powinien zostać ustalony przed oglądaniem korzystniejszej liczby.
| Miara | Podstawa | Wrażliwość na skrajności |
|---|---|---|
| g₁ / G₁ | trzeci moment centralny | wysoka |
| Bowley | Q1, mediana i Q3 | niższa |
| Pearson 2 | średnia, mediana i odchylenie | pośrednia |
Obserwacje skrajne, transformacje i kontekst decydują o praktycznej interpretacji
Najpierw sprawdzamy dziewiątkę, ale nie usuwamy jej za sam wpływ
Wartość 9 może być prawdziwym rzadkim wynikiem, inną podgrupą albo błędem wpisu. Skośność nie rozpoznaje przyczyny. Pokazuje tylko, że punkt ma duży dodatni wkład do trzeciego momentu.
Usunięcie dziewiątki radykalnie zmniejszy wynik, ale nie wolno robić tego tylko po to, aby rozkład wyglądał symetrycznie. Sprawdź rekord źródłowy, jednostkę, zakres przyrządu i reguły włączenia.
Jeśli punkt jest poprawny, pokaż wynik z pełnymi danymi. Analiza wrażliwości bez punktu może być dodatkiem, pod warunkiem że obie wersje i uzasadnienie są jawne.
Logarytm może skrócić prawy ogon, lecz zmienia znaczenie skali
Dla dodatnich danych o charakterze multiplikatywnym transformacja logarytmiczna często zmniejsza prawą skośność. Różnice na skali log odpowiadają ilorazom na skali pierwotnej.
Nie stosuj logarytmu mechanicznie do wartości zerowych lub ujemnych. Dodanie stałej tylko w celu umożliwienia transformacji zmienia interpretację i może arbitralnie wpływać na kształt.
Po dopasowaniu modelu na skali logarytmicznej odwrotna transformacja średniej wymaga ostrożności. Skośność jest wskazówką do poznania procesu, a nie automatycznym poleceniem transformacji.
Raport łączy współczynnik z wykresem, liczebnością i definicją
Czytelny zapis może brzmieć: „dla n=7 skorygowany współczynnik Fishera–Pearsona wyniósł G₁=1,945, co odpowiada wyraźnej prawej asymetrii widocznej na histogramie”.
Dodaj medianę, średnią, IQR lub odchylenie standardowe zależnie od zastosowania. Sam znak nie pokazuje szerokości rozkładu, a sama wartość nie ujawnia wielu szczytów.
Porównując grupy, zachowaj tę samą definicję, obsługę braków i jednostkę. Różnica skośności może wynikać z różnej liczebności, cenzurowania, zaokrąglenia lub mieszania populacji, a nie tylko z właściwości badanego zjawiska.
Najczęstsze pytania
Ile wynosi momentowy współczynnik g₁?
Dla listy przykładowej wynosi około 1,5007.
Czy dodatnia skośność oznacza, że większość danych jest po prawej?
Nie. Znak wskazuje kierunek dłuższego ogona; główne skupienie często leży po przeciwnej stronie.
Czy skośność zero dowodzi symetrii?
Nie zawsze. Asymetryczne wkłady mogą się znieść, a rozkład może mieć nietypowy lub wielomodalny kształt.
Czy średnia większa od mediany zawsze oznacza prawą skośność?
To częsta wskazówka w prostym rozkładzie jednomodalnym, ale nie uniwersalne twierdzenie.
Który wariant wybrać dla próbki?
Zwykle skorygowany G₁, jeśli obserwacje są próbą z większej populacji. Podaj jednak definicję i n.
Dlaczego stała lista nie ma skośności?
Jej wariancja wynosi zero, więc wzór wymagałby dzielenia przez zero.
Czy wartość odstającą należy usunąć przed obliczeniem?
Nie automatycznie. Najpierw sprawdź, czy jest błędem, inną populacją czy prawdziwym rzadkim wynikiem.
Jak raportować skośność?
Podaj wartość, definicję estymatora, liczebność oraz wykres i odpowiednie miary położenia i rozproszenia.
Źródła i dalsza lektura
- NIST/SEMATECH. (n.d.). Measures of Skewness and Kurtosis.
- SciPy. (n.d.). scipy.stats.skew.
- NIST/SEMATECH. (n.d.). e-Handbook of Statistical Methods.