Ist der Unterschied echt?
Rechenbeispiel: Wandstärke von je 12 Schlauchabschnitten zweier Lieferanten
So lesen Sie das Bild: Oben die Messwerte: blau Lieferant A, gelb Lieferant B, die senkrechten Striche sind die Mittelwerte. Dann werden die Etiketten immer wieder zufällig neu verteilt, als gäbe es keinen Unterschied zwischen den Lieferanten; die Punkte springen zwischen den Reihen. Jede Mischung ergibt einen Unterschied, der nur vom Zufall kommt, und wird unten ins Histogramm eingetragen. Die braunroten gestrichelten Linien markieren den tatsächlichen Unterschied nach beiden Seiten; braunrote Säulen sind Mischungen, die mindestens so weit weg liegen. Ihr Anteil ist der p-Wert.
Aylin vergleicht die Wandstärke von Schläuchen aus dem Granulat zweier Lieferanten. Lieferant B liegt im Mittel 18 µm höher. Bernd zuckt mit den Schultern: „Das schwankt doch sowieso.“ Katrin will wissen, ob man den Lieferanten darauf ansprechen soll. Die Frage dahinter ist die Frage jedes Hypothesentests: Ist der Unterschied echt, oder hätte ihn der Zufall auch allein erzeugen können?
Dieser Beitrag zeigt, was in einem Test passiert, warum zwei Arten von Fehlern möglich sind, wie der t-Test Signal und Rauschen vergleicht, wann man eine Varianzanalyse braucht und warum „signifikant“ nicht „wichtig“ heißt. Welcher Test zu welcher Frage passt, zeigt der Wegweiser im Kapitel Auswerten der Übersicht. Alle Zahlen sind Rechenbeispiele und lassen sich nachrechnen.
Die Logik eines TestsWas prüft ein Test eigentlich?
Ein Test beginnt mit einer Annahme, die man widerlegen möchte: Es gibt keinen Unterschied. Sie heißt Nullhypothese. Dann fragt man, wie wahrscheinlich ein Ergebnis wie das beobachtete wäre, wenn diese Annahme stimmte. Diese Wahrscheinlichkeit ist der p-Wert. Ist er kleiner als eine vorher festgelegte Grenze, meist 5 Prozent, verwirft man die Annahme und spricht von einem belegten Unterschied.
Das Mischen der Etiketten im Auftakt macht genau das sichtbar: Wenn es keinen Unterschied gäbe, wäre es gleichgültig, welcher Schlauch welchem Lieferanten zugeordnet ist. In nur etwa 3 Prozent der Mischungen entsteht ein Unterschied wie der tatsächliche. Der t-Test, den die Seite sonst verwendet, kommt mit einer Formel auf fast denselben Wert, p = 0,027.
Dabei sind zwei Fehler möglich. Man kann einen Unterschied für echt halten, den es nicht gibt, ein falscher Alarm. Und man kann einen echten Unterschied übersehen, weil die Daten nicht reichen. Den ersten begrenzt die 5-Prozent-Grenze. Den zweiten nur eine ausreichend große Stichprobe.
Zwei Fehler, und was die Stichprobe ändert
Rechenbeispiel: echter Unterschied 18 µm, Streuung 20 µm, 5, 12 und 30 Teile je Gruppe
So lesen Sie das Bild: Die schwarze Glocke zeigt, welche Unterschiede der Zufall erzeugt, wenn es keinen echten gibt; ihre Ränder jenseits der braunroten Linie sind die 5 Prozent falscher Alarm. Die purpurne Glocke zeigt die Ergebnisse, wenn es den echten Unterschied von 18 µm gibt; ihr Teil links der Linie wird übersehen. Mit mehr Teilen werden beide Glocken schmaler: Der falsche Alarm bleibt bei 5 Prozent, das Übersehen schrumpft.
Mit 12 Schläuchen je Lieferant hätte Aylin einen echten Unterschied von 18 µm in etwa 40 Prozent der Fälle übersehen, mit 30 nur noch in 6 Prozent. Wie viele Teile man braucht, sollte man deshalb vor dem Versuch überlegen, nicht danach.
t-Test: Signal gegen RauschenWann ist ein Unterschied groß genug?
Der t-Test vergleicht zwei Mittelwerte. Er setzt den Unterschied ins Verhältnis zu seiner Unsicherheit: Der t-Wert ist das Signal, also der Unterschied, geteilt durch das Rauschen, den Standardfehler. Der Standardfehler sinkt mit der Wurzel aus der Zahl der Teile. Deshalb kann derselbe Unterschied bei wenigen Teilen im Rauschen untergehen und bei vielen klar belegt sein.
Derselbe Unterschied, dreimal
Rechenbeispiel: Unterschied 18 µm, Streuung 20 µm, 5, 20 und 80 Teile je Gruppe
So lesen Sie das Bild: Drei Felder, jeweils zwei Gruppen A und B. Der Punkt ist der Mittelwert, der Strich reicht zwei Standardfehler nach beiden Seiten. Von links nach rechts steigt die Zahl der Teile; der Unterschied bleibt gleich, die Striche werden kürzer. Darunter stehen t-Wert und p-Wert, grün, wenn der Unterschied belegt ist.
Bei 5 Teilen je Gruppe liegt p bei 0,19, der Unterschied kann Zufall sein. Bei 20 Teilen liegt er bei 0,007, bei 80 weit darunter. Am Unterschied selbst hat sich nichts geändert, nur an der Sicherheit, mit der man ihn kennt.
Im WerkzeugkastenGruppen vergleichen – t-Test nach Welch und Varianzanalyse mit eigenen Werten oder einem Beispiel.
Varianzanalyse: mehr als zwei GruppenWas tun bei drei Schichten statt zwei Lieferanten?
Katrin möchte wissen, ob sich die drei Schichten in der Wandstärke unterscheiden. Für mehr als zwei Gruppen gibt es die Varianzanalyse, kurz ANOVA. Sie vergleicht, wie stark sich die Gruppen voneinander unterscheiden, mit der Streuung innerhalb der Gruppen. Ist die erste deutlich größer, als die zweite erklären kann, unterscheiden sich die Gruppen.
Zwischen und innerhalb
Rechenbeispiel: Wandstärke der Früh-, Spät- und Nachtschicht, je 10 Messungen
So lesen Sie das Bild: Links ordnen sich die Messungen in drei Gruppen, die farbigen Striche sind die Mittelwerte der Schichten, der gestrichelte der Gesamtmittelwert. Rechts beziehungsweise unten zwei Balken: wie stark sich die Schichten untereinander unterscheiden und wie stark die Werte innerhalb einer Schicht streuen, jeweils als mittleres Quadrat. Ihr Verhältnis ist der F-Wert.
Im Beispiel ist das Verhältnis F = 9,5, der p-Wert liegt unter 0,001: Die Schichten unterscheiden sich. Welche genau, klären danach gezielte Vergleiche. Naheliegend wäre, gleich drei t-Tests zu rechnen, Früh gegen Spät, Früh gegen Nacht, Spät gegen Nacht. Das ist eine Falle.
Viele Tests, viele Fehlalarme
Wahrscheinlichkeit für mindestens einen falschen Alarm bei 1 bis 10 Tests
So lesen Sie das Bild: Jede Säule zeigt, wie wahrscheinlich mindestens ein falscher Alarm ist, wenn man so viele unabhängige Tests mit je 5 Prozent Fehlalarm rechnet. Bei einem Test sind es 5 Prozent, bei drei schon gut 14, bei zehn rund 40.
Jeder Test hat seine 5 Prozent Fehlalarm, und sie addieren sich. Die Varianzanalyse prüft alle Gruppen in einem Schritt; für die anschließenden Einzelvergleiche gibt es Verfahren, die den Fehlalarm im Ganzen begrenzen.
Signifikant ist nicht wichtigWas sagt ein kleiner p-Wert, und was nicht?
Ein Beispiel aus dem Büro. Zwei Teams beantworten Reklamationen; über ein Jahr sind es je 1.000 Antworten. Team Süd ist im Mittel eine Stunde schneller, bei fünf Arbeitstagen Bearbeitungszeit. Der Test ist eindeutig, p liegt unter 0,001. Trotzdem ist der Unterschied für die Praxis bedeutungslos. Bei sehr vielen Daten wird jeder noch so kleine Unterschied signifikant.
Wie groß, nicht nur ob
Rechenbeispiel: drei Vergleiche der Bearbeitungszeit, mit 95-%-Konfidenzintervall
So lesen Sie das Bild: Jede Zeile ist ein Vergleich, der Punkt ist der gemessene Unterschied in Arbeitstagen, der Strich das 95-%-Konfidenzintervall: der Bereich, in dem der wahre Unterschied mit großer Sicherheit liegt. Die senkrechte schwarze Linie heißt kein Unterschied, der grüne Bereich beginnt dort, wo ein Unterschied praktisch bedeutsam wäre, hier ab einem halben Tag. Darunter steht jeweils, was daraus folgt.
Das Konfidenzintervall zeigt mehr als der p-Wert. Der Vergleich der Teams ist belegt, aber das ganze Intervall liegt weit unter einem halben Tag: unbedeutend. Die neue Antwortvorlage spart im Mittel 1,4 Tage, und selbst die vorsichtige Grenze des Intervalls liegt noch über einem halben Tag: belegt und bedeutsam. Die Pilotgruppe ist nicht belegt, aber das Intervall reicht bis über zwei Tage: Hier fehlt kein Effekt, sondern Daten.
„Dann fragen wir künftig nicht mehr „ist das signifikant?“, sondern „wie viel bringt es?““Katrin, Produktionsleiterin
Typische FallenWie täuscht man sich mit Tests selbst?
Drei Fallen begegnen in der Praxis besonders oft. Die erste: so lange weitere Daten sammeln und nachtesten, bis der p-Wert endlich unter 0,05 fällt. Das erhöht den Fehlalarm genauso wie viele Tests. Stichprobengröße und Auswertung legt man vorher fest.
Die zweite: Werte als unabhängig zählen, die es nicht sind. Wer denselben Schlauch zehnmal misst, hat einen Schlauch, nicht zehn. Wiederholmessungen beschreiben das Messsystem, wie der Beitrag Messsystemanalyse zeigt, nicht den Prozess.
Die dritte: einen t-Test auf Daten anwenden, die deutlich schief sind oder Ausreißer haben, etwa Bearbeitungszeiten mit wenigen sehr langen Fällen. Bei großen Stichproben ist der t-Test robust, bei kleinen nicht. Dann helfen Rangtests, die nur die Reihenfolge der Werte nutzen; welcher passt, zeigt der Test-Wegweiser.
In der Fallstudie am Mittwoch prüft das Team zwei Vermutungen auf diese Weise: Der Unterschied des Lieferanten ist belegt, der der Frühschicht nicht. Und in der Versuchsplanung liefert derselbe Gedanke die Grenze, ab der eine Wirkung als belegt gilt.
Kurz gesagt
- Logik: Der p-Wert sagt, wie oft der Zufall allein einen so großen Unterschied erzeugen würde. Unter 5 Prozent gilt ein Unterschied meist als belegt.
- Zwei Fehler: Falscher Alarm und Übersehen. Den falschen Alarm begrenzt die Grenze, das Übersehen nur eine ausreichende Stichprobe.
- t-Test: Signal geteilt durch Rauschen. Mehr Teile verkleinern das Rauschen.
- Varianzanalyse: Für mehr als zwei Gruppen in einem Schritt, statt vieler Einzeltests mit wachsendem Fehlalarm.
- Bedeutsam: Signifikant ist nicht wichtig. Das Konfidenzintervall zeigt, wie groß ein Unterschied sein kann.
- Fallen: Nicht nachtesten, bis es passt; Wiederholmessungen nicht als unabhängig zählen; bei schiefen Daten Rangtests nutzen.
Woher die Zahlen kommen
Alle Zahlen sind Rechenbeispiele. Auftakt: je 12 simulierte Wandstärken (Startwert 420), Lieferant A um 1,000 mm, B um 1,018 mm, Streuung 20 µm, auf 1 µm gerundet; gemessener Unterschied 17,9 µm, t-Test mit gepoolter Streuung p = 0,027; 1.000 zufällige Neuverteilungen der Etiketten (Startwert 77), Anteil mindestens so großer Unterschiede 3,0 %. Trennschärfe in Normalnäherung bei 18 µm Unterschied, 20 µm Streuung, α = 5 %: übersehen bei 5, 12, 30 Teilen 70, 40 und 6 %. Signal gegen Rauschen: t = 18 ÷ (20 × Wurzel(2/n)), p bei n = 5, 20, 80: 0,19, 0,007, unter 0,001. Varianzanalyse: drei Schichten mit je 10 simulierten Werten (Startwert 903), F = 9,53, p < 0,001. Fehlalarm bei k Tests: 1 − 0,95ᵏ, also 5,0, 14,3 und 40,1 %. Konfidenzintervalle: Unterschied ± t(0,975; 2n − 2) × s × Wurzel(2/n); Teams 0,125 Tage (s 0,8, n 1.000), Vorlage 1,4 Tage (s 1,1, n 20), Pilot 0,8 Tage (s 1,3, n 8). Alles mit SciPy nachgerechnet.
Hinweis zu Inhalten und Grafiken
Alle Grafiken sind eigene, vereinfachte Darstellungen; Zahlen sind simuliert oder als Rechenbeispiel gekennzeichnet. Bekannte Modelle werden im Text ihren Urhebern zugeordnet. Normen und Vorschriften beschreibt diese Seite nur allgemein und in eigenen Worten; verbindlich ist allein der jeweilige Originaltext. Alle Personen, Unternehmen und Fälle in den Beispielen sind frei erfunden; Ähnlichkeiten mit realen Personen oder Unternehmen wären zufällig.
Weiterlesen: Übersicht Daten – dort führt jedes Kapitel in seinen Themenbereich.