Die Daten sind erhoben, die Tabelle ist voll, und nun stellt sich die Frage: Welcher Test ist der richtige? Für viele Doktorandinnen und Doktoranden in der Medizin ist die Statistik der Teil der Arbeit, vor dem sie den größten Respekt haben, zumal die letzte Biometrie-Vorlesung oft lange zurückliegt. Dieser Ratgeber zeigt, wie Sie die Statistik in der medizinischen Doktorarbeit planen, durchführen und verständlich darstellen.
1. Statistik beginnt vor der Datenerhebung
Der häufigste Fehler ist, die Statistik erst zu bedenken, wenn die Daten vorliegen. Dann zeigt sich manchmal, dass wichtige Variablen fehlen, die Fallzahl zu klein ist oder die Fragestellung mit den vorhandenen Daten nicht beantwortet werden kann. Gute Statistik beginnt deshalb mit einer präzisen Fragestellung.
Formulieren Sie Ihre Hypothese so konkret wie möglich. Statt „Einfluss von Diabetes auf die Wundheilung“ also zum Beispiel: „Haben Patientinnen und Patienten mit Diabetes mellitus nach Implantation einer Hüftendoprothese häufiger Wundheilungsstörungen als Patientinnen und Patienten ohne Diabetes?“ Aus dieser Frage ergeben sich Zielgröße, Vergleichsgruppen und die passenden Verfahren.
Tipp: Legen Sie vor der Erhebung ein Codebuch an. Darin steht für jede Variable, wie sie heißt, wie sie kodiert wird (zum Beispiel 0 = nein, 1 = ja), welche Einheit sie hat und wie fehlende Werte gekennzeichnet werden.
2. Fallzahlplanung
Die Fallzahl entscheidet darüber, ob Ihre Studie überhaupt in der Lage ist, einen relevanten Unterschied zu erkennen. Für eine Fallzahlplanung benötigen Sie Annahmen über den erwarteten Effekt, die Streuung, das Signifikanzniveau und die gewünschte Teststärke (Power). Die Annahmen stammen meist aus der Literatur oder aus Vorstudien. Für die Berechnung gibt es spezialisierte Software, zum Beispiel G*Power.
Bei retrospektiven Arbeiten ist die Fallzahl oft durch die vorhandenen Daten begrenzt. Dann sollten Sie zumindest abschätzen, welche Effekte mit dieser Datenmenge erkennbar sind, und diese Grenze in der Diskussion offen benennen. Viele Ethikkommissionen erwarten eine begründete Fallzahl; mehr dazu im Ratgeber zum Ethikvotum für die Doktorarbeit.
3. Deskriptive Statistik
Am Anfang jeder Auswertung steht die Beschreibung Ihrer Stichprobe. Sie zeigt, wer untersucht wurde, und ist die Grundlage für die Einordnung aller weiteren Ergebnisse. Üblich sind:
- Kategoriale Variablen wie Geschlecht, Raucherstatus oder Komplikation ja/nein: absolute und relative Häufigkeiten.
- Normalverteilte stetige Variablen wie Körpergröße: Mittelwert und Standardabweichung.
- Schief verteilte Variablen wie Liegedauer oder CRP-Werte: Median und Interquartilsabstand.
In vielen medizinischen Arbeiten wird die Stichprobe in einer ersten Tabelle nach Gruppen getrennt dargestellt, etwa Patientinnen und Patienten mit und ohne Komplikation.
4. Inferenzstatistik und typische Tests
Die schließende Statistik prüft, ob beobachtete Unterschiede oder Zusammenhänge über die Stichprobe hinaus verallgemeinert werden können. Welcher Test passt, hängt vom Skalenniveau, der Verteilung und dem Studiendesign ab.
Vergleich von Gruppen
Für den Vergleich zweier unabhängiger Gruppen bei normalverteilten Daten eignet sich der t-Test, bei nicht normalverteilten Daten der Mann-Whitney-U-Test. Bei mehr als zwei Gruppen kommen die Varianzanalyse (ANOVA) oder der Kruskal-Wallis-Test infrage. Bei verbundenen Messungen, etwa vor und nach einer Therapie bei denselben Personen, nutzen Sie den gepaarten t-Test oder den Wilcoxon-Test.
Häufigkeiten und Zusammenhänge
Für den Vergleich von Häufigkeiten zwischen Gruppen ist der Chi-Quadrat-Test üblich, bei kleinen erwarteten Häufigkeiten der exakte Test nach Fisher. Zusammenhänge zwischen zwei stetigen Variablen beschreiben Korrelationskoeffizienten nach Pearson oder Spearman.
Regressionsmodelle
Wenn mehrere Einflussfaktoren gleichzeitig betrachtet werden sollen, etwa Alter, Body-Mass-Index und Diabetes als mögliche Risikofaktoren, sind Regressionsmodelle das Mittel der Wahl: lineare Regression für stetige Zielgrößen, logistische Regression für binäre Zielgrößen. So lassen sich Störgrößen berücksichtigen, was gerade bei retrospektiven Studien wichtig ist.
Überlebenszeitanalyse
In der Onkologie, Kardiologie oder Transplantationsmedizin geht es oft um die Zeit bis zu einem Ereignis. Hier sind Kaplan-Meier-Kurven, der Log-Rank-Test und die Cox-Regression verbreitet.
5. Software: SPSS, R und Alternativen
In der Medizin werden häufig SPSS und R verwendet, daneben auch SAS, Stata oder spezielle Programme wie GraphPad Prism. SPSS ist menügesteuert und für Einsteiger leicht zugänglich, und viele Universitäten stellen Lizenzen bereit. R ist kostenfrei, sehr flexibel und macht die Auswertung durch Skripte nachvollziehbar und reproduzierbar, erfordert aber Einarbeitung. Entscheidend ist weniger das Programm als die richtige Wahl der Methode und eine saubere Dokumentation. Fragen Sie Ihre Betreuung, welche Software in der Arbeitsgruppe üblich ist.
Tipp: Viele Fakultäten haben ein Institut für medizinische Biometrie oder Statistik, das Doktorandinnen und Doktoranden berät. Nutzen Sie dieses Angebot möglichst schon in der Planungsphase.
6. Datenaufbereitung: der unterschätzte Arbeitsschritt
Bevor der erste Test gerechnet wird, müssen die Daten geprüft und bereinigt werden. Gerade bei retrospektiven Arbeiten, in denen Werte aus Patientenakten oder dem Laborsystem übertragen wurden, nimmt dieser Schritt oft mehr Zeit in Anspruch als die eigentliche Auswertung. Prüfen Sie jede Variable auf unplausible Werte, etwa ein Körpergewicht von 7 statt 70 Kilogramm oder Laborwerte in unterschiedlichen Einheiten. Klären Sie, wie viele Werte fehlen und ob das Fehlen zufällig ist oder mit bestimmten Patientengruppen zusammenhängt.
Dokumentieren Sie alle Korrekturen und Ausschlüsse nachvollziehbar, am besten in einem Protokoll oder direkt im Auswertungsskript. Wie viele Patientinnen und Patienten ursprünglich erfasst wurden und aus welchen Gründen einzelne Fälle ausgeschlossen wurden, gehört in den Methoden- oder Ergebnisteil, häufig ergänzt durch ein Flussdiagramm. So können Gutachterinnen und Gutachter Ihre Fallzahlen jederzeit nachvollziehen.
7. Ergebnisse richtig darstellen
Im Ergebniskapitel berichten Sie die Befunde sachlich und ohne Interpretation, die Deutung gehört in die Diskussion. Nennen Sie neben dem p-Wert immer auch die Effektgröße mit Konfidenzintervall, zum Beispiel einen Mittelwertsunterschied oder eine Odds Ratio mit 95-%-Konfidenzintervall. Ein p-Wert allein sagt nichts darüber aus, wie groß und klinisch relevant ein Unterschied ist.
Tabellen eignen sich für genaue Werte, Abbildungen für Verläufe und Vergleiche. Boxplots zeigen Verteilungen, Balkendiagramme Häufigkeiten, Kaplan-Meier-Kurven Überlebenszeiten. Jede Tabelle und Abbildung sollte für sich verständlich sein, mit aussagekräftiger Beschriftung, Einheiten und Fallzahlen. Wo Tabellen und Abbildungen in der Arbeit stehen, zeigt unser Ratgeber zur Gliederung der medizinischen Doktorarbeit.
8. Häufige Fehler
Bestimmte Fehler tauchen in medizinischen Doktorarbeiten immer wieder auf. Prüfen Sie Ihre Auswertung anhand dieser Checkliste:
- Viele Tests ohne vorab festgelegte Hypothesen und ohne Korrektur für multiples Testen
- Parametrische Tests trotz deutlich schiefer Verteilung oder sehr kleiner Gruppen
- Verbundene Messungen wie unabhängige Stichproben behandelt
- Fehlende Werte ignoriert oder ohne Begründung ausgeschlossen
- Nicht signifikante Ergebnisse als Beleg für „keinen Unterschied“ gewertet
- Zusammenhänge aus Beobachtungsdaten als Ursache-Wirkungs-Beziehung interpretiert
- Methodenteil ohne Angabe der Software, der Tests und des Signifikanzniveaus
Fazit
Statistik in der medizinischen Doktorarbeit ist gut beherrschbar, wenn sie von Anfang an mitgedacht wird. Eine präzise Fragestellung, ein Codebuch, eine begründete Fallzahl und ein vorab festgelegter Auswertungsplan sind die halbe Miete. Wählen Sie die Tests passend zu Skalenniveau, Verteilung und Design, berichten Sie Effektgrößen mit Konfidenzintervallen und interpretieren Sie Ihre Ergebnisse vorsichtig.
Häufige Fragen zur Statistik in der medizinischen Doktorarbeit
Muss man für die Doktorarbeit SPSS oder R verwenden?
Nein, eine bestimmte Software ist in der Regel nicht vorgeschrieben. Wichtig ist, dass die Methoden passend gewählt und im Methodenteil nachvollziehbar beschrieben sind. Oft richtet man sich nach der Software, die in der Arbeitsgruppe üblich ist.
Was ist, wenn die Ergebnisse nicht signifikant sind?
Auch nicht signifikante Ergebnisse sind Ergebnisse. Sie sollten sachlich berichtet und in der Diskussion eingeordnet werden, etwa im Hinblick auf Fallzahl und Teststärke. Eine Doktorarbeit wird nicht deshalb schlechter, weil sich eine Hypothese nicht bestätigt hat.
Wann sollte man eine statistische Beratung einholen?
Am besten schon in der Planungsphase, bevor die Daten erhoben werden. Dann lassen sich Fragestellung, Variablen und Fallzahl so abstimmen, dass die spätere Auswertung tragfähig ist.
Wenn Sie bei Planung, Auswertung oder Darstellung Unterstützung brauchen, helfen wir Ihnen mit unserer Statistikberatung für die medizinische Doktorarbeit. Auch darüber hinaus begleiten wir Sie mit unserer Unterstützung bei der Dr.-med.-Arbeit, von der Methodik bis zur Diskussion.