PS
Verstehen
Verstehen · Statistik

Konfidenzintervalle, gefühlt.

Ein 95%-Konfidenzintervall ist keine 95%-Wahrscheinlichkeit. Sieben Sektionen von der einzelnen Stichprobe über Cummings Tanz der CIs, den 1/√N-Preis der Präzision, die historische Herkunft der 95%, das Bayes-Gegenstück, das wirklich meint, was die meisten meinen, bis zu den Fehldeutungen, die unter Forschenden überleben.

01 · Eine Stichprobe

Eine Stichprobe, ein Intervall.

Zieh N Werte aus einer Normal(0, 1)-Verteilung. Der Stichprobenmittelwert und das 95%-Intervall x̄ ± 1.96 · σ/√N. Schieb N — das Intervall schrumpft, der Mittelwert wandert.

Stichprobengrösse N30
Mittelwert x̄
-0.001
SE
0.183
Halbweite
±0.358
95%-CI
[-0.36, 0.36]
02 · Der Tanz der CIs

Schau, wie die Intervalle tanzen.

Jede Sekunde wird eine neue Stichprobe der Grösse N gezogen und ihr 95%-Intervall oben eingefügt. Treffer behalten den Akzent, Verfehler werden glutrot. Was Zeile für Zeile chaotisch aussieht, pendelt sich über viele Runs bei 95% ein — so fühlt sich nominale Überdeckung wirklich an. (Nach Cumming 2014.)

N30
Runs
0
Treffer
0 / 0
Empirische Rate
03 · Sechzig Replikationen

Das Experiment sechzigmal wiederholen.

Jede Zeile ist ein Experiment der Grösse N mit eigenem 95%-Intervall. Die nominale Rate ist 95%, also sollten bei richtigem Modell rund 57 von 60 μ enthalten und etwa 3 verfehlen. Die empirische Trefferquote schwankt um diese Zahl.

Stichprobengrösse N30
Treffer
57 / 60
Empirische Rate
95.0%
Nominal
95.0%
04 · Halbweite vs. N

Warum doppelt so viele Daten das Intervall nicht halbieren.

Die CI-Halbweite skaliert mit 1/√N. Um sie zu halbieren, brauchst du viermal so viele Beobachtungen. Die Kurve macht den Preis der Präzision sichtbar.

N50
05 · Warum 95?

Die 95 ist eine Konvention, kein Gesetz.

Zieh am Konfidenzlevel — z dehnt sich, die Halbweite mit, der Preis für Gewissheit wird sichtbar. Der eingefärbte Bauch der Glocke ist die gewählte Überdeckung; die dünnen Schwänze sind das, was du in Kauf nehmen willst, wenn es schief geht.

Konfidenz95.0%
z
1.9600
Halbweite
±0.358
vs. 95%
100%
Woher die 95 kommt

Fisher fixierte den Schwellenwert 1925 in seinem Lehrbuch 'Statistical Methods for Research Workers' auf 5%. Eine editoriale Entscheidung, getrieben von Tabellenformat und Druckkosten, keine Herleitung. Cowles und Davis haben es 1982 nachgezeichnet, Hurlbert und Lombardi 2009 wieder aufgemacht. Jedes CI, das wir heute zeichnen, erbt diese Wahl. Disziplinen sind leise auseinandergerückt: klinische Studien halten an 95% fest, Teilchenphysik verlangt 99.99994% (5σ), Epidemiologie meldet oft 90% und 95% nebeneinander. Die Zahl sagt mehr über die Risikotoleranz eines Fachs als über die Natur.

06 · Frequenz und Glaube

Zwei Intervalle, die gleich aussehen. Nur eines sagt, was die meisten meinen.

Gleiche Daten, gleiches N. Der gestrichelte Balken ist das frequentistische 95%-CI — eine Eigenschaft des Verfahrens. Der solide Balken ist das 95%-Glaubwürdigkeitsintervall aus dem Bayes-Posterior — eine Wahrscheinlichkeitsaussage über μ gegeben einen Prior. Schieb die Prior-Präzision τ₀ von breit zu eng und sieh, wie der Posterior gegen null gezogen wird.

Prior-Präzision (τ₀)τ₀ = 2.00
0.356
μ_post
0.351
95%-CI
[-0.08, 0.79]
95%-Glaubwürdig
[-0.08, 0.79]
Worum es geht

Die Lesart 'die Wahrscheinlichkeit, dass μ im Intervall liegt, beträgt 95%' ist korrekt — aber nur für das Bayes-Glaubwürdigkeitsintervall, und nur gegeben den verwendeten Prior. Das frequentistische CI macht diese Aussage nicht über dieses Intervall; es macht sie über das Langzeit-Verhalten des Verfahrens. Bei einem flachen Prior und vielen Daten konvergieren beide Intervalle — deshalb überlebt die Verwechslung. Bei engem Prior oder kleinem N driften sie auseinander, und genau dann wird der Unterschied wichtig.

07 · Häufige Fehldeutungen

Was 95% nicht heisst.

Hoekstra et al. (2014) zeigten, dass die häufigsten Lesarten eines Konfidenzintervalls falsch sind, selbst unter Forschenden. Drei davon nebeneinander mit der sorgfältigen Lesart.

Fehldeutung

Die Wahrscheinlichkeit, dass der wahre Mittelwert in diesem Intervall liegt, beträgt 95%.

Sorgfältig

Entweder enthält das Intervall μ, oder nicht. Die 95% ist die langfristige Rate, mit der das Verfahren Intervalle erzeugt, die μ überdecken — keine Wahrscheinlichkeit über dieses eine Intervall.

Fehldeutung

Wir sind zu 95% sicher, dass der wahre Mittelwert zwischen den Grenzen liegt.

Sorgfältig

Konfidenz ist eine Eigenschaft des Verfahrens, nicht der vorliegenden Daten. Würde man die Studie wiederholen, deckten 95% der konstruierten Intervalle μ ab.

Fehldeutung

Ein engeres Intervall bedeutet eine präzisere Schätzung von μ.

Sorgfältig

Ein engeres Intervall heisst mehr Daten, nicht mehr Wahrheit. Verzerrung sieht das CI nicht — ein verzerrter Schätzer mit engen Grenzen ist präzise falsch.

Wie die Visualisierung funktioniert

Werte werden via Box-Muller aus N(μ=0, σ=1) gezogen mit σ als bekannt angenommen, also gilt das 95%-z-Intervall x̄ ± 1.959964 · σ/√N. Bei unbekanntem σ wäre die Studentsche t-Verteilung korrekt. Für N ≥ 30 ist der Unterschied gering. Die Tanz-Schleife fügt sekündlich eine neue Stichprobe ein, die älteste fällt raus; die laufende Rate pendelt sich erst über viele Runs bei den nominalen 95% ein. Der Konfidenzlevel-Slider nutzt die Beasley-Springer/Moro-Approximation der inversen Normal-CDF (≈5 Dezimalen genau). Die Bayes-Sektion setzt Normal-Normal-Konjugation voraus mit Prior-Mittelwert 0 und Prior-Präzision 1/τ₀²; der versteckte wahre Mittelwert ist μ=0.4, damit die Daten leicht gegen den Prior informativ sind und die Posterior-Verschiebung sichtbar wird.

Quellen