Statystyka matematyczna

Rachunek prawdopodobieństwa pyta: „znam rozkład, jak zachowa się próba?”. Statystyka odwraca pytanie: „mam próbę, co mogę powiedzieć o rozkładzie?”. Cała trudność w tym, że odpowiedź jest sama losowa — i dlatego każde pojęcie tego modułu jest tu pokazane jako symulacja wielu prób naraz, a nie jako pojedynczy rachunek. Kwantyle rozkładów t i normalnego są liczone z niekompletnej funkcji beta, nie odczytywane z tablicy.

E[θ̂] = θ ?

Estymacja punktowa

Dlaczego w wariancji dzieli się przez n−1, a nie przez n — widać to na 20 000 prób

s² = Σ(xᵢ−x̄)²/(n−1)
95%

Przedziały ufności

100 przedziałów ze 100 różnych prób — ile faktycznie trafia w prawdziwe μ

x̄ ± t·s/√n
α, β, 1−β

Testowanie hipotez

Obszar krytyczny, błąd I i II rodzaju na jednym obrazku, krzywa mocy

P(odrzucam H₀ | H₀) = α
ŷ = b₀ + b₁x

Regresja liniowa

Nie tylko prosta: błędy standardowe, statystyka t, R² i wykres reszt

R² = 1 − SSE/SST
χ² i SIMPSON

Dane kategorialne

Tabela wielodzielcza jako mozaika z zaznaczonym podziałem przy niezależności, test χ², oraz paradoks Simpsona pokazany jako składanie wektorów

χ² = Σ (O − E)²/E
ZADANIA

Przykłady krok po kroku

Przedział ufności dla μ, test t, interpretacja R² i współczynnika

3 rozwiązane zadania

Estymacja punktowa i nieobciążoność

Estymator jest nieobciążony, gdy jego wartość oczekiwana równa się szacowanemu parametrowi — czyli gdy „średnio nie myli się w żadną stronę”.
E[x̄] = μ  (zawsze)
E[SS/n] = σ²·(n−1)/n  (obciążony!)
E[SS/(n−1)] = σ²  (nieobciążony)
gdzie SS = Σ(xᵢ − x̄)².
prawdziwa σ²–
średnia z SS/n–
teoria: σ²(n−1)/n–
średnia z SS/(n−1)–
obciążenie estymatora 1/n–
wariancja x̄ (teoria σ²/n)–
rozkład obu estymatorów wariancji na M próbach
E[estymator] w funkcji n

Przedziały ufności i pokrycie

Poziom ufności 95% nie znaczy „μ leży tu z prawdopodobieństwem 0,95”. Znaczy: gdyby powtórzyć badanie wiele razy, ok. 95% wyliczonych przedziałów zawierałoby prawdziwe μ. Prawy panel liczy dokładnie ten odsetek.
x̄ ± t1−α/2, n−1 · s/√n
użyty kwantyl–
trafień wśród 100 przedziałów–
pokrycie na 20 000 prób–
nominalne–
średnia szerokość przedziału–
100 przedziałów ze 100 różnych prób
pokrycie w funkcji n: t kontra normalny

Testowanie hipotez, błędy I i II rodzaju

Test to reguła: „odrzuć H₀, jeśli statystyka wpadnie do obszaru krytycznego”. α to prawdopodobieństwo odrzucenia prawdziwej H₀ (błąd I rodzaju), β — nieodrzucenia fałszywej (błąd II rodzaju).
H₀: μ = μ₀ H₁: μ = μ₁
moc = 1 − β
Obniżanie α zawsze podnosi β — jedynym sposobem na poprawę obu naraz jest większe n.
wartość krytyczna–
α — błąd I rodzaju–
β — błąd II rodzaju–
moc testu 1 − β–
n potrzebne dla mocy 0,80–
rozkład statystyki przy H₀ i przy H₁
krzywa mocy w funkcji wielkości efektu

Regresja liniowa z aparatem statystycznym

Metoda najmniejszych kwadratów daje prostą zawsze — nawet dla czystego szumu. Dopiero błąd standardowy nachylenia i wynikająca z niego statystyka t mówią, czy zależność jest odróżnialna od przypadku.
b₁ = Σ(xᵢ−x̄)(yᵢ−ȳ) / Σ(xᵢ−x̄)²
SE(b₁) = s / √Σ(xᵢ−x̄)²
t = b₁ / SE(b₁), df = n − 2
b₀ (wyraz wolny)–
b₁ ± SE–
t = b₁/SE, df = n−2–
p-wartość (H₀: β₁ = 0)–
R²–
s (odchylenie reszt)–
dane, prosta MNK i pas ufności dla wartości średniej
reszty w funkcji wartości dopasowanej

Dane kategorialne

Tabela wielodzielcza zestawia dwie cechy jakościowe. Gdyby były niezależne, liczebność każdej kratki wynosiłaby E = (suma wiersza · suma kolumny)/n. Test χ² mierzy, jak daleko obserwacje odbiegają od tego wzorca.
χ² = Σ (O − E)²/E, df = 1

Przykład 1 — przedział ufności dla μ przy nieznanym σ

W próbie n = 16 pomiarów otrzymano x̄ = 24,3 oraz s = 3,2. Wyznacz 95% przedział ufności dla wartości oczekiwanej.

1. σ jest nieznane, więc zamiast kwantyla normalnego bierzemy t-Studenta o df = n − 1 = 15 stopniach swobody.
2. Dla poziomu 95% szukamy t0,975; 15. Z tablic (albo z zakładki „Przedziały ufności”, gdzie kwantyl jest liczony numerycznie): t = 2,1314.
3. Błąd standardowy średniej: SE = s/√n = 3,2/√16 = 3,2/4 = 0,80.
4. Margines błędu: t · SE = 2,1314 · 0,80 = 1,705.
5. Przedział: 24,3 ± 1,705, czyli [22,595 ; 26,005].
6. Interpretacja — ta, która najczęściej jest przekręcana. Nie wolno powiedzieć „μ leży w tym przedziale z prawdopodobieństwem 0,95”: μ jest ustaloną liczbą, albo leży, albo nie. Poprawnie: procedura, która wyprodukowała ten przedział, trafia w prawdziwe μ w ok. 95% powtórzeń badania.
7. Gdyby ktoś użył kwantyla normalnego z = 1,96 zamiast t, margines wyszedłby 1,568 — przedział za wąski, a rzeczywiste pokrycie spadłoby poniżej 95%. Przełącznik „normalny (błąd!)” na zakładce „Przedziały ufności” pokazuje, o ile.

Przykład 2 — test t dla jednej próby i błąd II rodzaju

Producent twierdzi, że średnia zawartość substancji wynosi μ₀ = 50 mg. Próba n = 25 dała x̄ = 51,8 przy s = 4,0. Testuj H₀: μ = 50 przeciw H₁: μ ≠ 50 na poziomie α = 0,05.

1. Statystyka testowa: t = (x̄ − μ₀)/(s/√n) = (51,8 − 50)/(4,0/5) = 1,8/0,8 = 2,25.
2. Stopnie swobody: df = n − 1 = 24. Wartość krytyczna dwustronna: t0,975; 24 = 2,0639.
3. |2,25| > 2,0639, więc odrzucamy H₀ na poziomie 0,05.
4. p-wartość: 2·P(T₂₄ > 2,25) ≈ 0,0338. Jest mniejsza od 0,05 — ten sam wniosek, wyrażony liczbowo zamiast przez próg.
5. Co to nie znaczy: p = 0,0338 to nie jest prawdopodobieństwo, że H₀ jest prawdziwa. To prawdopodobieństwo zaobserwowania wyniku co najmniej tak skrajnego, zakładając, że H₀ jest prawdziwa.
6. Błąd II rodzaju. Załóżmy, że prawdziwe μ = 51,8 (efekt d = 1,8/4,0 = 0,45 σ). Wtedy statystyka przesuwa się o λ = d·√n = 0,45·√25 = 2,25, a moc wynosi 1 − Φ(1,96 − 2,25) = 1 − Φ(−0,29) = 1 − 0,3859 = 0,614, czyli β ≈ 0,386. Gdyby więc efekt naprawdę istniał, ten test przeoczyłby go w ok. 39% powtórzeń.
7. Żeby osiągnąć moc 0,80 przy tym efekcie, potrzeba λ ≥ z0,975 + z0,80 = 1,960 + 0,842 = 2,802, czyli n ≥ (2,802/0,45)² = 38,8 — w praktyce n = 39. Ustaw d = 0,45, n = 25 i α = 0,05 na zakładce „Testowanie hipotez”: aplikacja liczy moc i wymagane n niezależnie (bisekcja po n) i powinna podać dokładnie 0,614 oraz 39.

Przykład 3 — co R² mówi, a czego nie

W regresji na n = 30 punktach otrzymano b₁ = 1,15, SE(b₁) = 0,21, R² = 0,52. Oceń wynik.

1. Statystyka t dla H₀: β₁ = 0 wynosi t = b₁/SE = 1,15/0,21 = 5,48 przy df = n − 2 = 28.
2. Wartość krytyczna t0,975; 28 = 2,048; |5,48| ≫ 2,048, p < 0,0001 — nachylenie jest istotnie różne od zera.
3. R² = 0,52 znaczy: model wyjaśnia 52% zmienności y (SST − SSE = 0,52·SST). Pozostałe 48% to reszty.
4. Czego R² nie mówi:
   • nie mówi, że związek jest przyczynowy;
   • nie mówi, że model liniowy jest właściwy — wysokie R² bywa przy wyraźnej krzywoliniowości (widać ją dopiero na wykresie reszt);
   • przy jednej zmiennej objaśniającej R² = r², więc jest to po prostu kwadrat współczynnika korelacji.
5. Istotność a wielkość efektu to dwie różne rzeczy. Przy n = 200 i czystym szumie (β₁ = 0) czasem wypadnie „istotny” wynik — dokładnie w ok. 5% ziaren losowych, bo taki jest α. Przycisk „czysty szum, n = 200” na zakładce „Regresja liniowa” pozwala przeklikać ziarna i zobaczyć, jak co którymś razem p spada poniżej 0,05 mimo braku jakiegokolwiek związku.
6. Wykres reszt jest ważniejszy niż R². Jeśli reszty układają się w łuk albo ich rozrzut rośnie z wartością dopasowaną (heteroskedastyczność), model jest źle dobrany niezależnie od tego, jak wysokie jest R².