Testy post-hoc wykonujemy po jednoczynnikowej analizie wariancji (ANOVA) wtedy, gdy: • wynik ANOVA jest istotny statystycznie, • czyli wiemy, że co najmniej dwie grupy różnią się między sobą, • ale nie wiemy jeszcze które dokładnie. 👉 Testy post-hoc (np. Tukeya, Bonferroniego) służą właśnie do porównań par grup, aby wskazać, gdzie dokładnie leżą różnice. Dalej
W analizie regresji: • zmienna zależna (Y) → to zmienna przewidywana / wyjaśniana, • zmienne niezależne (X) → to predyktory, czyli zmienne służące do przewidywania wartości Y. 📌 Przykład: Regresja poziomu lęku (Y) na podstawie samooceny i stresu (X) → samoocena i stres = predyktory Dalej
Test chi-kwadrat (χ²) służy do porównywania liczebności obserwowanych (O) z liczebnościami oczekiwanymi (E), które wynikają z założeń teoretycznych lub modelu niezależności. 📌 Stosujemy go m.in. gdy: • dane są kategoryczne (liczebności, częstości), • chcemy sprawdzić zgodność z rozkładem lub zależność między zmiennymi jakościowymi. Dalej
Regresja do średniej występuje tylko wtedy, gdy korelacja między zmienna zależną, a niezależną:
Regresja do średniej występuje wtedy, gdy korelacja między zmiennymi nie jest doskonała, czyli: • r ≠ ±1 Gdy korelacja jest nieidealna, wartości skrajne jednej zmiennej mają tendencję, by przy kolejnym pomiarze zbliżać się do średniej drugiej zmiennej. Dalej
W analizie regresji liniowej predyktory mogą być: • zmiennymi ciągłymi (np. wiek, poziom stresu, wynik testu), • zmiennymi kategorialnymi, o ile są zakodowane liczbowo – najczęściej jako zmienne dychotomiczne (0–1), tzw. dummy variables. 📌 Przykład: • wzrost (cm) → zmienna ciągła • płeć (0 = kobieta, 1 = mężczyzna) → zmienna kategorialna zakodowana dychotomicznie Obie mogą być jednocześnie predyktorami w jednym modelu regresji. Dalej
Zmienne ilościowe (metryczne) to takie, które: • mają sensowną skalę liczbową, • umożliwiają wykonywanie działań matematycznych (średnia, odchylenie standardowe). Do zmiennych ilościowych zaliczamy: • skalę interwałową (np. temperatura w °C, iloraz inteligencji), • skalę ilorazową (np. wiek, czas reakcji, liczba błędów). Dalej
Jeśli przeliczymy wyniki surowe że średnia równa M i odchyleniem standardowym równym S na wyniki standaryzowane (z), to po przeliczeniu zawsze:
Standaryzacja wyników (z-score) polega na przeliczeniu wyników surowych według wzoru: z = {X - M}/{S} Po takim przeliczeniu zawsze: • średnia rozkładu z = 0, • odchylenie standardowe = 1. Dzieje się tak niezależnie od tego, jakie były: • pierwotna średnia (M), • pierwotne odchylenie standardowe (S). Dalej
W analizie regresji liniowej zakładamy m.in.: • liniowość związku między predyktorami a zmienną zależną, • jednorodność wariancji reszt (homoskedastyczność), • niezależność reszt (brak autokorelacji). ❗ Nie zakładamy natomiast braku korelacji między predyktorami a zmienną zależną – wręcz przeciwnie: regresja ma sens tylko wtedy, gdy istnieje związek (korelacja) między X a Y. Dlaczego pozostałe odpowiedzi są poprawnymi założeniami? • a) ✔ homoskedastyczność – klasyczne założenie regresji • b) ✔ liniowość – kluczowe założenie modelu liniowego • d) ✔ niezależność reszt – warunek poprawnych estymacji Dalej
Mediana to taka wartość, która: • dzieli uporządkowany zbiór danych na dwie równe części, • połowa wyników jest mniejsza lub równa, a połowa większa lub równa medianie. 📌 Kluczowe jest uporządkowanie danych (rosnąco lub malejąco). Dalej
W teście Shapiro–Wilka: • hipoteza zerowa (H₀): rozkład danych jest normalny, • wynik istotny statystycznie (p < α) → odrzucamy H₀. 👉 To oznacza, że rozkład badanej zmiennej istotnie odbiega od rozkładu normalnego. Dalej
Żeby stwierdzić, że wynik testu statystycznego jest statystycznie istotny przy poziomie istotności alfa=0.05, musimy upewnić się, że:
Poziom istotności α = 0.05 oznacza granicę, z którą porównujemy wartość p: • jeśli p < α (0.05) → wynik jest istotny statystycznie → odrzucamy H₀, • jeśli p ≥ α (0.05) → wynik nieistotny statystycznie. Dalej
Test t-Welcha jest modyfikacją testu t-Studenta dla prób niezależnych, która: • nie wymaga założenia równości wariancji w porównywanych grupach, • stosuje skorygowane stopnie swobody. 👉 Dlatego używamy go, gdy wariancje w grupach są nierówne. Dalej
Główna różnica między skalą nominalną a porządkową polega na tym, że: • zmienna nominalna • ma odrębne kategorie, • nie da się ich uporządkować (np. płeć, kolor oczu, kierunek studiów), • zmienna porządkowa • ma odrębne kategorie, • można je uszeregować / nadać im rangi, • ale nie znamy dokładnych odległości między kategoriami (np. niski–średni–wysoki). Dalej
Jesli dla danej zmiennej jestesmy w stanie podać jednostkę pomiaru (np. 1 cm, 1 godzina), to znaczy, że jest to CO NAJMNIEJ) zmienna:
Jeżeli dla zmiennej możemy podać jednostkę pomiaru (np. 1 cm, 1 godzina, 1 punkt), to oznacza, że: • odległości między wartościami są równe i sensowne, • możemy liczyć różnice między wynikami. To spełnia warunki co najmniej skali interwałowej. 👉 Skala ilorazowa też ma jednostkę, ale dodatkowo wymaga absolutnego zera – a tego w pytaniu nie zagwarantowano. Dalej
Test U Manna–Whitneya jest: • nieparametrycznym odpowiednikiem testu t-Studenta dla prób niezależnych, • stosowanym, gdy: • dane nie spełniają założenia normalności, • skala jest co najmniej porządkowa, • porównujemy dwie niezależne grupy. 📌 Porównuje rozkłady / rangi, a nie średnie. Dalej
Jeśli wynik testu jednoczynnikowej analizy wariancji (test F) okazał się istotny (p <0.05), natomiast przy sprawdzeniu założenia normalności za pomocą testu Shapiro-Wilka uzyskano również wynik istotny statystycznie (p < 0.05), to możemy:
Mamy sytuację, w której: • ANOVA (test F) → wynik istotny (p < 0.05), • test Shapiro–Wilka → wynik istotny (p < 0.05), czyli naruszone założenie normalności. 👉 Jednoczynnikowa ANOVA jest testem parametrycznym, który zakłada (w klasycznym ujęciu) normalność rozkładu reszt. Jeśli to założenie jest wyraźnie naruszone, bezpieczniejszym rozwiązaniem jest użycie nieparametrycznego odpowiednika ANOVA, czyli testu Kruskala–Wallisa. Dalej
Czterdzieści osób losowo przydzielono do dwóch grup, z których jedna przyjmowała specyfik polepsząjacy pamięć, a druga placebo. Aby sprawdzić czy średnie dla liczby zapamiętanych bezsensownych sylab istotnie różnią się pomiędzy grupami można użyć:
• Dwie grupy: specyfik vs placebo • Losowy przydział → grupy niezależne • Zmienna zależna ilościowa: liczba zapamiętanych sylab • Porównujemy średnie między dwiema grupami 👉 To dokładnie warunki zastosowania testu t-Studenta dla prób niezależnych. Dlaczego pozostałe odpowiedzi są błędne? • a) ❌ test dla pomiarów zależnych → ten sam uczestnik mierzony dwukrotnie / pary • b) ❌ chi-kwadrat niezależności → zmienne kategorialne, nie średnie • d) ❌ chi-kwadrat zgodności → porównuje liczebności, nie średnie Dalej
Ile % wyników mieści się między -3 a +3 odchyleniem standardowym od średniej w rozkładzie normalnym:
Zgodnie z regułą 68–95–99,7 dla rozkładu normalnego: • ±1 SD → ok. 68,3% wyników • ±2 SD → ok. 95,4% wyników • ±3 SD → ok. 99,7% wyników 👉 Pytanie dotyczy zakresu od −3 do +3 odchyleń standardowych, więc właściwa odpowiedź to 99,7%. Dalej
Na wykresie pudełkowym (boxplot) standardowo zaznaczone są: • mediana (linia wewnątrz pudełka), • dolny kwartyl (Q1), • górny kwartyl (Q3), • „wąsy” (zasięg danych bez wartości odstających), • wartości odstające – jeśli występują (poza wąsami). Dalej
Przy wpisywaniu danych do arkusza kalkulacyjnego / programu statystycznego stosujemy zasadę, wg której:
W arkuszach kalkulacyjnych i programach statystycznych (np. SPSS, R, Excel): • wiersz = jeden badany (jedna obserwacja), • kolumna = jedna zmienna. To podstawowa i uniwersalna zasada poprawnego wprowadzania danych. Dalej
We wzorze na odchylenie standardowe, które jest oszacowaniem odchylenia standardowego w populacji na podstawie danych z próby, w mianowniku ułamka pod pierwiastkiem znajduje się:
Gdy szacujemy odchylenie standardowe populacji na podstawie próby, stosujemy tzw. poprawkę Bessela. Wzór ma w mianowniku: n - 1 czyli liczebność próby pomniejszoną o 1. 👉 Dzięki temu wariancja i odchylenie standardowe nie są zaniżone i stanowią nieobciążone estymatory parametrów populacyjnych. Dalej
Test Kruskala–Wallisa jest: • nieparametrycznym odpowiednikiem jednoczynnikowej analizy wariancji (ANOVA), • stosowanym, gdy: • dane nie spełniają założeń normalności, • porównujemy więcej niż dwie niezależne grupy, • skala jest co najmniej porządkowa. Dalej
Tabela krzyżowa to inaczej tabela kontyngencji – służy do: • przedstawiania wspólnych liczebności dla dwóch (lub więcej) zmiennych jakościowych, • analizy zależności / niezależności między zmiennymi (np. test chi-kwadrat). Dlaczego pozostałe odpowiedzi są błędne? • a) szereg rozdzielczy ❌ – dotyczy jednej zmiennej • c) diagram rozrzutu ❌ – wykres dla zmiennych ilościowych • d) tabela rozkładu ❌ – opisuje rozkład jednej zmiennej Dalej
W analizie regresji: • zmienne niezależne (X) nazywamy predyktorami, • zmienna zależna (Y) to zmienna przewidywana / objaśniana. Predyktory służą do przewidywania wartości zmiennej zależnej. Dalej
Centralne Twierdzenie Graniczne (CTG) mówi, że: • rozkład statystyki z próby (np. średniej) • dąży do rozkładu normalnego, • wraz ze wzrostem liczebności próby (n) – i to coraz szybciej / coraz lepiej. Dzieje się tak niezależnie od kształtu rozkładu w populacji (przy spełnieniu ogólnych warunków). Dalej
Równanie regresji liniowej wyznacza się za pomocą metody najmniejszych kwadratów (MNK), która polega na: • takim doborze parametrów regresji (współczynników), • aby suma kwadratów reszt (różnic między wartościami obserwowanymi a przewidywanymi przez model) była jak najmniejsza. 👉 Dzięki temu linia regresji najlepiej dopasowuje się do danych. Dalej
W analizie regresji liniowej zakładamy m.in.: • liniowość związku między predyktorami a zmienną zależną, • jednorodność wariancji reszt (homoskedastyczność), • niezależność reszt. ❗ Nie zakładamy braku korelacji między predyktorami a zmienną zależną — wręcz przeciwnie: Dalej
Współczynnik korelacji Pearsona (r) stosujemy dla zmiennych: • co najmniej na skali interwałowej, • a więc interwałowych lub ilorazowych, • przy założeniu liniowej zależności i (klasycznie) normalności rozkładu. 👉 Skala interwałowa jest więc minimalnym poziomem pomiaru, który spełnia warunki Pearsona. Dlaczego pozostałe odpowiedzi są błędne? • a) nominalnych ❌ – brak sensu liczbowego i odległości • d) porządkowych ❌ – brak równych odstępów (tu stosujemy korelację Spearmana) • c) ilorazowych ❌ – to prawda, ale pytanie brzmi „co najmniej”, więc poprawna jest interwałowa Dalej
Jeśli chcemy oszacować średni wskaźnik masy ciała (BMI) studentów Akademii i do tego celu wybieramy 10% całej populacji studentów:
Pojęcia liczebności obserwowane (O) i liczebności oczekiwane (E) występują w teście chi-kwadrat, który służy do: • porównywania częstości zaobserwowanych z częstościami oczekiwanymi, • badania zgodności rozkładu lub niezależności zmiennych jakościowych (tabele kontyngencji). 📌 Stosowany m.in. przy danych kategorialnych. Dalej
Błąd predykcji (standardowy błąd oszacowania) związany z danym modelem regresji jest, między innymi, tym większy:
Błąd predykcji (standaryzowany błąd oszacowania) w regresji: • rośnie, gdy słabnie związek (korelacja) między predyktorami (X) a zmienną zależną (Y), • bo model gorzej przewiduje wartości Y, • więcej zmienności pozostaje w resztach. 👉 Im słabsza korelacja X–Y → tym większy błąd predykcji. Dalej
O korelacji idealnej mówimy wtedy, gdy: • r = 1 → idealna korelacja dodatnia • r = −1 → idealna korelacja ujemna W obu przypadkach: • zależność jest doskonale liniowa, • wszystkie punkty leżą dokładnie na jednej prostej, • brak rozrzutu danych. Dalej
Czterdzieści kobiet i czterdziestu mężczyzn spytano o to który napój gazowany preferują: Coca-cola, Pepsi, Coca-cola Zero, czy Pepsi Max. Aby sprawdzić czy występuje związek pomiędzy preferowanym napojem a płcią, należałoby użyć:
W tym zadaniu: • mamy dwie zmienne jakościowe (nominalne): • płeć (kobieta, mężczyzna), • preferowany napój (4 kategorie), • interesuje nas, czy istnieje związek między tymi zmiennymi, • dane można zapisać w tabeli krzyżowej (kontyngencji). 👉 To dokładnie sytuacja dla testu chi-kwadrat niezależności, który sprawdza, czy dwie zmienne kategorialne są od siebie niezależne, czy powiązane. Dalej
Przedział ufności dla danej średniej to przewidywany na podstawie danych z próby zakres wartości tej średniej, który na wybranym poziomie ufności
Wyjaśnienie: Przedział ufności dla średniej to zakres wartości wyznaczony na podstawie danych z próby, który: • na zadanym poziomie ufności (np. 95%), • zawiera prawdziwą wartość średniej populacyjnej. 👉 Oznacza to, że gdybyśmy wielokrotnie losowali próby i wyznaczali przedziały ufności, to ok. 95% z nich zawierałoby prawdziwą średnią populacji (dla poziomu ufności 95%). Dalej
Rozstęp międzykwartylowy (IQR) to różnica między: • trzecim kwartylem (Q3) a • pierwszym kwartylem (Q1) \text{IQR} = Q3 - Q1 Ten przedział: • zawiera medianę, • obejmuje środkowe 50% wyników, • jest odporny na wartości odstające. Dalej
Jeśli wynik testu jednoczynnikowej analizy wariancji (test F) okazał się istotny (p <0.05), natomiast przy sprawdzeniu założenia normalności za pomocą testu Shapiro-Wilka uzyskano również wynik istotny statystycznie (p < 0.05), to możemy:
• Test F (ANOVA) istotny → sugeruje różnice między grupami, • Test Shapiro–Wilka istotny (p < 0,05) → naruszone założenie normalności, • ANOVA jest testem parametrycznym, wrażliwym na brak normalności (zwłaszcza przy mniejszych próbach). 👉 W takiej sytuacji należy zastosować nieparametryczny odpowiednik ANOVA, czyli test Kruskala–Wallisa. Dalej
prawdopodobieństwo uzyskania takich wyników jak w badanej próbie przy założeniu że hipoteza alternatywna jest prawdziwa
prawdopodobieństwo że hipoteza zerowa jest prawdziwa przy uzyskaniu takich wyników jak w badanej próbie
prawdopodobieństwo uzyskania takich wyników jak w badanej próbie przy założeniu że hipoteza alternatywna jest prawdziwa
prawdopodobieństwo uzyskania takich wyników jak w badanej próbie przy założeniu że hipoteza zerowa jest prawdziwa
Poziom p (p-value) to: prawdopodobieństwo otrzymania takiego samego lub bardziej ekstremalnego wyniku, jeśli hipoteza zerowa (H₀) jest prawdziwa. Czyli: • zakładamy, że H₀ jest prawdziwa, • sprawdzamy, jak mało prawdopodobne są nasze dane. Im mniejsze p, tym mniej wiarygodna H₀. Dalej
Procent zmienności zmiennej zależnej wyjaśniony przez dany model regresji oceniamy na podstawie wartości:
R² (współczynnik determinacji) informuje, jaki procent zmienności zmiennej zależnej (Y) jest wyjaśniany przez model regresji. 📌 Przykład: • R² = 0,40 → model wyjaśnia 40% zmienności Y, • pozostałe 60% to zmienność niewyjaśniona (reszty). Dalej
Do prezentacji korelacji między dwiema zmiennymi ilościowymi najlepiej nadaje się diagram rozrzutu (scatterplot), ponieważ: • pokazuje każdą parę obserwacji (X, Y), • pozwala ocenić kierunek (dodatni/ujemny), • siłę związku, • oraz liniowość relacji. Dlaczego pozostałe odpowiedzi są błędne? • A – żadne z powyższych ❌ – diagram rozrzutu jest właściwy • B – wykres słupkowy ❌ – służy do porównań kategorii / średnich, nie korelacji • D – histogram ❌ – pokazuje rozkład jednej zmiennej Dalej
Gdy Anova wychodzi istotna statystycznie (bo nie wiemy, które średnie, w których grupach się różnią, a post hoc to sprawdzą)
ANOVA mówi nam tylko, że: • istnieje co najmniej jedna różnica między średnimi, ale nie wskazuje, między którymi konkretnie grupami te różnice występują. 👉 Testy post hoc (np. Tukeya, Bonferroniego, Gamesa-Howella): • porównują pary grup, • wskazują dokładnie które średnie różnią się istotnie. Jednozdaniowa wersja „pod egzamin”: Testy post hoc wykonujemy po uzyskaniu istotnego wyniku ANOVA, aby określić, między którymi grupami występują różnice średnich. 🧠 Ściąga: ANOVA istotna → post hoc Dalej
Jeśli chcemy sprawdzić, czy kategorie pewnej zmiennej istotnie różnią się częstością występowania od jakiegoś hipotetycznego rozkładu częstości (np. równomiernego), to testem, który zastosujemy będzie:
Predyktory mogą być: • ciągłe (np. wiek, stres), • kategorialne, jeśli są zakodowane liczbowo (np. 0–1). Dalej
Przedział ufności dla danej średniej to przewidywany na podstawie danych z próby zakres wartości tej średniej, który na wybranym poziomie ufności
W rozkładzie normalnym obowiązuje reguła 68–95–99,7: • ±1 SD → ok. 68,3% wyników • ±2 SD → ok. 95,4% wyników • ±3 SD → ok. 99,7% wyników Dalej