Kann ein Test die Hypothese bestätigen?
Hypothese bestätigen: was ein statistischer Test wirklich zeigt
Viele Studierende glauben, ein signifikanter Test sei der endgültige Beweis für ihre These. Doch die Statistik kennt hier klare Grenzen. Dieser Guide erklärt dir Schritt für Schritt, was ein Test tatsächlich leistet, welche Risiken hinter jedem Urteil stecken und wie du dein Ergebnis wissenschaftlich sauber formulierst.
Nicht-Verwerfen richtig einordnen
Ein statistischer Test kann eine Nullhypothese verwerfen oder nicht verwerfen, eine Bestätigung im Sinn eines Beweises liefert er in keinem der beiden Fälle. Ein Testergebnis beschreibt damit eine formale Entscheidung zur Nullhypothese. Es ersetzt keine Aussage, dass eine Hypothese inhaltlich wahr ist.
Das Statistik-Skript der Universität Bonn erläutert einen p-Wert-Ansatz mit einem zuvor bestimmten Signifikanzniveau. In seinem Rechenbeispiel beträgt dieses Niveau 5 Prozent. Der beobachtete Wert liegt dort unter der Schwelle, die für eine Ablehnung nötig wäre. Deshalb kann die Nullhypothese in diesem Beispiel nicht verworfen werden. Entscheidend ist hier die Regel zur Testentscheidung, nicht eine Aussage über die inhaltliche Stärke eines Effekts.
Nach demselben Skript folgt aus dem Nicht-Verwerfen keine weitergehende inhaltliche Aussage. Die Daten reichen dann lediglich nicht aus, um die Nullhypothese zu widerlegen. Diese Einschränkung betrifft die Nullhypothese; sie bedeutet nicht, dass eine eigene inhaltliche Hypothese automatisch widerlegt wäre. Für die Ergebnisformulierung ist daher zu prüfen, ob nur ein Nicht-Verwerfen vorliegt, und die Aussage auf diesen Befund zu beschränken.
Hypothesen formulieren verlangt dabei eine klare Trennung zwischen der Nullhypothese und der inhaltlichen Fragestellung. Im Text kann anschließend festgehalten werden, ob die Daten für ein Verwerfen ausreichen oder nicht. Eine Bestätigung der Nullhypothese ergibt sich daraus nicht.

Fehler erster und zweiter Art
Das Biometrie-Skript der Universität Münster ordnet mögliche Entscheidungen in einer Vierfeldertabelle. Ein Fehler erster Art liegt vor, wenn die Nullhypothese verworfen wird, obwohl sie richtig ist. Ein Fehler zweiter Art liegt vor, wenn die Nullhypothese beibehalten wird, obwohl sie falsch ist. Das Signifikanzniveau bildet eine Obergrenze für die Wahrscheinlichkeit des Fehlers erster Art.
| Merkmal | Fehler erster Art | Fehler zweiter Art |
|---|---|---|
| Bedingung | Die Nullhypothese ist richtig. | Die Nullhypothese ist falsch. |
| Entscheidung | Die Nullhypothese wird verworfen. | Die Nullhypothese wird beibehalten. |
| Festlegung | Das Niveau begrenzt seine Wahrscheinlichkeit nach oben. | Das Niveau ist hierfür nicht als Obergrenze definiert. |
| Übliche Werte des Niveaus | 0,05, 0,01 oder 0,001 | Keine Werte hierzu genannt |
| Wer das Niveau festlegt | Die Versuchsleitung bestimmt es vor dem Test. | Keine eigene Festlegung hierzu genannt |
Das Skript nennt 0,05, 0,01 und 0,001 als gebräuchliche Niveaus. Die Wahl richtet sich dort nach den Folgen, die ein Fehler erster Art im jeweiligen Fall hätte. Diese Angaben beschreiben keine Vorgabe für eine bestimmte Untersuchung.
Hypothesentest bedeutet in diesem Zusammenhang, die Entscheidung und ihre mögliche Fehlerart getrennt zu betrachten. Vor einer Formulierung lässt sich daher prüfen, ob die Entscheidung ein Verwerfen oder ein Beibehalten der Nullhypothese war und welche Fehlerart dazu gehört.
Testfunktion, Ablehnbereich und Annahmebereich
Das Vorlesungsskript der Universität Bremen beschreibt einen statistischen Test als Abbildung für mögliche Beobachtungen. Einer Beobachtung wird dabei entweder eins oder null zugeordnet. Eins steht für das Verwerfen der Nullhypothese und die Entscheidung für die Alternativhypothese. Null steht für ein Nicht-Verwerfen der Nullhypothese.
Die Beobachtungen, die zum Verwerfen führen, heißen dort Ablehnbereich oder kritischer Bereich. Die übrige Menge wird Annahmebereich genannt. Das Skript führt außerdem den Alpha-Fehler als Fehler erster Art ein: Eine zutreffende Nullhypothese wird dabei fälschlich abgelehnt.
Die Definition ist im Skript allgemein für statistische Tests formuliert und nicht an ein konkretes Testverfahren gebunden. Für die Einordnung eines Ergebnisses kann deshalb zunächst geprüft werden, welchem Bereich die Beobachtung zugeordnet ist. Liegt sie im Annahmebereich, bedeutet dies nur ein Nicht-Verwerfen. Daraus wird kein Beweis, dass die Nullhypothese richtig ist.
Eine passende Textformulierung bleibt bei der formalen Entscheidung: Die Beobachtung führte zum Verwerfen oder sie führte nicht zum Verwerfen. Aussagen über eine bewiesene Richtigkeit der Nullhypothese gehen über diese Definition hinaus.
Kritischer Wert und Testentscheidung
Das Skript zur Mathematischen Statistik der Universität Münster erläutert eine Teststatistik anhand eines kritischen Werts. Dazu wird eine Konstante festgelegt. Überschreitet die Teststatistik diese Konstante, wird die Nullhypothese verworfen. Andernfalls wird sie beibehalten.
Nach dem Skript ist die Wahl des kritischen Werts ein Abwägen zwischen den Wahrscheinlichkeiten eines Fehlers erster und eines Fehlers zweiter Art. Ein kritischer Wert, der beide Fehler zugleich ausschließt, besteht dort nicht. Die Wahl betrifft damit die beiden Fehlerarten und nicht den Nachweis einer inhaltlichen Aussage.
p-Wert und Signifikanz werden im Bonner Rechenbeispiel über ein vorgegebenes Signifikanzniveau verbunden: Der p-Wert wird mit diesem Niveau verglichen. Dieses Niveau ist auch der Maßstab, mit dem der kritische Wert für die Entscheidung festgelegt wird.
Signifikanzniveau Bedeutung hat hier einen klaren Bezug zur formalen Testregel. Für den eigenen Text ist zu prüfen, ob die Teststatistik den kritischen Wert überschreitet oder nicht. Danach kann die Entscheidung als Verwerfen oder Beibehalten der Nullhypothese beschrieben werden.

Testergebnisse im Kontext formulieren
Ein Verwerfen und ein Nicht-Verwerfen der Nullhypothese sind keine Beweise. Die Testentscheidungen sind nach den Skripten mit dem Risiko eines Fehlers erster oder zweiter Art verbunden. Beim ersten Fehler wird eine richtige Nullhypothese verworfen; beim zweiten wird eine falsche Nullhypothese beibehalten.
Vor der Interpretation kann geprüft werden, ob das Ergebnis im Ablehnbereich oder im Annahmebereich liegt. Das Bremer Skript ordnet den Ablehnbereich dem Verwerfen zu; die Gegenmenge ist der Annahmebereich. Die Formulierung im eigenen Text lässt sich an diese Entscheidung anpassen: Im Ablehnbereich steht das Verwerfen, im Annahmebereich das Nicht-Verwerfen der Nullhypothese.
Statistik und SPSS im Überblick: Für die Schlussfolgerung ist zunächst die formale Testentscheidung festzuhalten. Danach lässt sich prüfen, ob die Aussage über das Ergebnis hinausgeht. Ein Nicht-Verwerfen darf nicht als Beweis für die Nullhypothese formuliert werden. Auch ein Verwerfen beweist nach dieser Einordnung keine inhaltliche Wirkung.
Die konkrete Formulierung im eigenen Text sollte abschließend mit der betreuenden Person oder dem Methodenleitfaden des Fachbereichs abgestimmt werden. Dabei kann geprüft werden, ob die gewählte Aussage nur die dokumentierte Testentscheidung und die genannten Fehlerarten wiedergibt.
Quellen und Stand
- Universität Bonn, Institut für Angewandte Mathematik: Einführung in die Statistik, Andreas Eberle, Skript 2024: wt.iam.uni-bonn.de (geprüft am 2026-09-18)
- Universität Münster, Medizinische Fakultät, Institut für Biometrie: JUMBO-Skript, Statistische Tests und Versuchsplanung: www.medizin.uni-muenster.de (geprüft am 2026-09-18)
- Universität Bremen, Fachbereich Mathematik: Methoden der Statistik, Vorlesungsskript Thorsten Dickhaus: user.math.uni-bremen.de (geprüft am 2026-09-18)
- Universität Münster, Fachbereich Mathematik und Informatik: Skript zur Vorlesung Mathematische Statistik, Kapitel 10: www.uni-muenster.de (geprüft am 2026-09-18)
Im Zusammenhang „Kann ein Test die Hypothese bestätigen?“ werden die zentralen Punkte gebündelt.