STATISTICS FOR BEHAVIORAL SCIENCES
In 60 Sekunden
Dies ist eine Schritt-für-Schritt-Führung durch die Frage, wie Verhaltensforscher aus unordentlichen Zahlen verteidigungsfähige Aussagen machen. Sie beginnt mit Grundgesamtheiten, Stichproben und der unvermeidlichen Lücke zwischen beiden, dem Stichprobenfehler, und baut dann das Werkzeugzeug auf: Häufigkeitsverteilungen, zentrale Tendenz, Variabilität und z-Werte. Wahrscheinlichkeit und die Verteilung der Stichprobenmittelwerte bereiten die Hypothesentestung vor, in der Fehler 1. und 2. Art sowie die Teststärke beheimatet sind. Von dort marschiert das Buch durch t-Tests, Varianzanalysen, Korrelation, Regression, Chi-Quadrat und den Binomialtest und endet mit der Schätzung und dem rechnerischen Apparat, der alles zusammenhält.
Bevor du anfängst
Warum es sich lohnt
Wenn du jemals eine Forschungsarbeit lesen, eine Studie durchführen oder über eine Umfrage streiten wirst, gibt dir dieses Buch die Grammatik dazu. Es ist geschrieben für Studierende der Psychologie und Verhaltenswissenschaft, die Statistiken berechnen, interpretieren und kritisieren müssen – nicht nur wiedererkennen. Jedes Kapitel baut direkt auf dem vorherigen auf, sodass du am Ende eine einzige Logik vom Stichprobenmittelwert bis zum Konfidenzintervall oder zur F-Quotient verfolgen kannst.
15 Ideen in der Reihenfolge des Buchs
Die Kernideen
- 1Kapitel 1
Population, Stichprobe und die Lücke, die sich nie schließt
Eine Psychologin möchte den durchschnittlichen Angstlevel aller College-Studierenden in den USA wissen. Jede einzelne Person zu messen ist unmöglich, also wird die Stichprobe zu 200 Studierenden einer einzigen Universität. Die Psychologin berechnet aus diesen 200 eine Statistik und hofft, dass sie einen Parameter der gesamten Population beschreibt. Das Kapitel unterscheidet deskriptive Statistik ('statistische Verfahren, die verwendet werden, um Daten zusammenzufassen, zu ordnen und zu vereinfachen') von inferenzieller Statistik ('Techniken, die es uns erlauben, Stichproben zu untersuchen und dann Verallgemeinerungen über die Populationen zu machen, aus denen sie ausgewählt wurden'), die beiden allgemeinen Kategorien statistischer Techniken. Zwischen der Stichprobenstatistik und dem Populationsparameter sitzt der Stichprobenfehler, eine natürlich auftretende Diskrepanz, die kein noch so cleveres Design beseitigen kann.
Die Idee
Jede Forschungsschlussfolgerung ist eine Übersetzung von einer kleinen Gruppe auf eine große, und Übersetzung verliert immer etwas. Der Stichprobenfehler ist kein Fehler, den du gemacht hast; er ist der Preis dafür, nur einen Teil einer Population anzusehen. Sobald du akzeptierst, dass die Lücke dauerhaft ist, ergibt der Rest des Buches Sinn: Jede Technik ist eine andere Art, diese Lücke zu messen, einzugrenzen oder mit ihr zu leben.
Probier es aus: Nimm eine beliebige Schlagzeilen-Statistik, die du diese Woche gesehen hast, und schreibe auf, welche Population sie zu beschreiben vorgibt, wer tatsächlich befragt wurde und was zwischen beiden unterschiedlich sein könnte.
- 2Kapitel 2
Den Haufen ordnen: Häufigkeitsverteilungen
Bevor irgendein Test oder eine Theorie kommt, hast du einen Haufen von Werten. Das Buch zeigt den ersten Schritt: eine geordnete Tabellierung der Anzahl von Individuen, die sich in jeder Kategorie auf der Messskala befinden. Aus dieser Tabelle fällt die Proportion sofort als f geteilt durch N heraus, und der Prozentsatz ist einfach diese Proportion mal 100.
Die Idee
Eine Häufigkeitsverteilung ist die Brücke zwischen Rohdaten und jeder Statistik, die folgt. Proportionen und Prozentsätze sind keine Dekoration; sie sind die erste ehrliche Zusammenfassung davon, wer wo gelandet ist. Sich früh mit f/N vertraut zu machen, bedeutet, dass die späteren Ideen über Wahrscheinlichkeiten und erwartete Häufigkeiten vertraut statt fremd wirken.
Probier es aus: Zähle diese Woche eine Kategorie deiner eigenen Daten, E-Mails nach Absender oder Schritte pro Tag, und berechne die Proportion für deine häufigste Kategorie.
- 3Kapitel 3
Der Mittelwert ist ein Gleichgewichtspunkt
Drei Kandidaten kämpfen darum, eine Verteilung zu repräsentieren. Der Mittelwert ist die Summe der Werte geteilt durch die Anzahl der Werte, geschrieben M = ΣX/n für eine Stichprobe und μ = ΣX/N für eine Population. Das Buch stellt fest: 'Der Mittelwert ist der Gleichgewichtspunkt der Verteilung', weil die Gesamtdistanz unterhalb des Mittelwerts gleich der Gesamtdistanz oberhalb ist. Der Median hält den Mittelpunkt, und der Modus beansprucht einfach den häufigsten Wert. Jedes Maß beantwortet eine leicht andere Frage darüber, wo das Zentrum sitzt.
Die Idee
Den Mittelwert als Drehpunkt einer Wippe zu denken, erklärt, warum ein extremer Wert ihn zieht, während der Median unbewegt bleibt. Das Bild vom Gleichgewichtspunkt nimmt auch die Logik der Abweichungen vorweg, die später als Rohmaterial für die Varianz zurückkehren. Die Wahl zwischen Mittelwert, Median und Modus ist die Wahl, welche Art von Typischem du behaupten willst.
Probier es aus: Berechne Mittelwert und Median deiner letzten zehn Einkäufe und achte darauf, welchen der einzelne größte Einkauf bewegt.
- 4Kapitel 4
Variabilität: Wie verteilt ist die Menge?
Zwei Klassen können denselben Durchschnitt teilen und trotzdem grundverschiedene Orte zum Sitzen sein. Die Spannweite, die Differenz zwischen dem größten und dem kleinsten Wert, wird als grobes Maß markiert, weil sie nur auf die Extreme hört. Die eigentliche Arbeit ist die Varianz, das Mittel der quadrierten Abweichungen: σ² = Σ(X−μ)²/N für eine Population, und für eine Stichprobe s² = SS/(n − 1). Die Rechenformel für SS ist ΣX² − (ΣX)²/n. Die Standardabweichung ist die Quadratwurzel der Varianz und bringt die Antwort zurück in Werteinheiten.
Die Idee
Durch n − 1 statt n zu teilen korrigiert die Verzerrung, die entsteht, wenn man Stichprobendaten verwendet, um Populationsvariabilität zu schätzen. Quadrierte Abweichungen wirken abstrakt, bis man die Quadratwurzel zieht und in Einheiten zurücklandet, die man sich vorstellen kann.
Probier es aus: Berechne SS mit der Rechenformel für fünf kleine Zahlen und prüfe, ob es mit der Summe der quadrierten Abweichungen übereinstimmt, die auf die lange Weise gemacht wurde.
- 5Chapter 5
z-scores put every score on one map
One student scores 76 on a psychology exam; another scores 82 on a biology exam. Which performance is better? Raw numbers cannot say, because the exams have different means and spreads. The book converts each score with z = (X − μ)/σ, or z = (X − M)/s for a sample: the sign tells you direction from the mean, the number tells distance in standard deviations. Transforming X values into z-scores creates a standardized distribution with a mean of 0 and a standard deviation of 1, and the shape of the distribution is unchanged. The chapter uses the example of comparing two students' scores on different exams—one student scoring 76 on a psychology exam and another scoring 82 on a biology exam—to show how z-scores allow comparison of scores from different distributions.
Die Idee
A z-score is an address: same shape, new coordinates. That is what makes cross-distribution comparisons legitimate, because both scores now speak the language of standard deviations.
Probier es aus: Find the mean and standard deviation of two different scales you care about, like your sleep hours and your screen time, and convert one recent value of each to a z-score.
- 6Chapter 6
Probability as proportion of the curve
Probability gets a plain definition: a fraction or a proportion of all the possible outcomes, computed as the number of outcomes classified as A over the total number of possible outcomes. For a normal distribution, that proportion is literally area under the curve. The unit normal table becomes the tool of the trade, listing proportions that correspond to each z-score location, so you can find the probability of a score above, below, or between given z values.
Die Idee
This chapter is where location becomes likelihood. Because the z-scores from Chapter 5 standardize any normal distribution, one table serves them all.
Probier es aus: Use a z-table to find the proportion of scores above one standard deviation above the mean, and check it against the 68-95 rule you may already know.
- 7Chapter 7
The distribution of sample means and the central limit theorem
Take every possible random sample of size n from a population and collect all their means: that set is the distribution of sample means, and its center sits exactly at the population mean, μM = μ. The central limit theorem then delivers the payoff: for any population with mean μ and standard deviation σ, the distribution of sample means has mean μ, standard deviation σ/√n, and approaches normal as n grows; with n ≥ 30 it is almost perfectly normal. That standard deviation gets its own name, the standard error of the mean, and it measures the standard distance between a sample mean and the population mean. Bigger samples shrink it, which is the law of large numbers in action.
Die Idee
This is the hinge of the whole book: it explains why a single sample mean can say anything trustworthy about a population. The standard error turns an abstract worry, how far off might my sample be, into a computable number.
Probier es aus: Simulate 30 samples of size 5 and size 30 from any dataset, plot the two sets of means, and watch the spread collapse as n grows.
- 8Chapter 8
Hypothesis testing: four steps, two ways to be wrong
The chapter introduces the four steps of hypothesis testing: (1) state the null and alternative hypotheses, (2) set the criteria for a decision (alpha level, typically .05 or .01), (3) compute the test statistic, and (4) make a decision to reject or fail to reject the null hypothesis (reject H0 if the test statistic is in the critical region). The null hypothesis (H₀) is defined as 'a statement about the population that predicts no effect or no difference'—'the hypothesis that states there is no change, no effect, or no difference'—and the alternative hypothesis (H₁) predicts that there is an effect or difference. To make the stakes human, the book stages a court trial where the null hypothesis is that the defendant is innocent: convicting an innocent person is a Type I error, acquitting a guilty one is a Type II error. The alpha level (level of significance), typically α = .05, is defined as 'a probability value that is used to define the concept of “very unlikely” in a hypothesis test.' It sets the risk of a Type I error and defines the boundaries of the critical region for rejecting the null hypothesis. Beta is the risk of the second, and power, the probability of correctly rejecting a false null, equals 1 − β and grows with bigger samples and bigger effects.
Die Idee
The trial analogy makes the asymmetry unforgettable: the system presumes innocence, so a false alarm and a miss are different crimes with different costs.
Probier es aus: For your next decision, write the null hypothesis in plain words and name what a Type I and a Type II error would each cost you.
- 9Kapitel 9
Wenn σ unbekannt ist: die t-Statistik
Die echte Forschung liefert dir selten die Standardabweichung der Population, also fehlt die entscheidende Zutat des z-Tests. Die Lösung: σ aus dem eigenen s der Stichprobe schätzen, was zu einem geschätzten Standardfehler sM = s/√n und zur Statistik t = (M − μ)/sM führt. Weil du geschätzt hast, zahlst du mit Unsicherheit: Die t-Verteilung ist eine flachere, variablere Annäherung an die Normalverteilung, und ihre genaue Form wird durch die Freiheitsgrade bestimmt, df = n − 1.
Die Idee
Die t-Statistik ist Ehrlichkeit, die in eine Formel eingebaut ist: Ersetzt man einen bekannten Wert durch eine Schätzung, weitet sich die Verteilung, um die zusätzliche Unsicherheit einzugestehen.
Probier es aus: Schlage den kritischen t-Wert für df = 5 und df = 30 bei α = .05 nach und vergleiche jeden mit 1,96, um den Preis kleiner Stichproben zu sehen.
- 10Kapitel 10
Zwei unabhängige Stichproben und gepoolte Varianz
Die Frage ändert jetzt ihre Gestalt: zwei getrennte Gruppen, zwei Mittelwerte, ein Vergleich. Die t-Statistik für unabhängige Messungen dividiert die Differenz M₁ − M₂ durch einen geschätzten Standardfehler, der den Fehler aus beiden Stichproben kombiniert, und die Nullhypothese lautet H₀: μ₁ − μ₂ = 0. Wenn die beiden Stichproben unterschiedlich groß sind, führt das Buch die gepoolte Varianz ein, ein gewichtetes Mittel der beiden Stichprobenvarianzen: s²p = (SS1 + SS2)/(df1 + df2).
Die Idee
Den Fehler aus beiden Stichproben zu kombinieren räumt ein, dass jeder Mittelwert seine eigene Unsicherheit mitbringt, und die Nullhypothese einer Differenz von null gibt dem Test ein präzises Ziel. Dieses Design bereitet auch den Kontrast mit den wiederholten Messungen vor, der als Nächstes kommt.
Probier es aus: Nimm zwei kleine Zahlenlisten unterschiedlicher Länge, berechne jeweils die SS, pool die Varianzen und bestätige, dass die längere Liste die Schätzung dominiert.
- 11Kapitel 11
Dieselben Menschen, zweimal: der t-Test für wiederholte Messungen
Statt zweier Menschenmengen stell dir eine einzige Menge vor, die unter beiden Behandlungen gemessen wird. Der t-Test für wiederholte Messungen arbeitet mit Differenzwerten, D = X2 − X1, und prüft H0: μD = 0 mit t = (MD − μD)/sMD und df = n − 1, wobei n die Paare zählt. Der versteckte Vorteil des Designs: Individuelle Unterschiede heben sich auf. Weil dieselben Versuchspersonen in beiden Behandlungen auftauchen, eliminiert die Analyse die Probleme, die individuelle Unterschiede verursachen. Weniger Störung durch Schwankungen von Person zu Person macht einen echten Behandlungseffekt leichter erkennbar.
Die Idee
Jeder Teilnehmer ist seine eigene Kontrolle, also subtrahieren sich die Eigenheiten, die eine Person bei beiden Messungen hoch ausfallen lassen, aus den Differenzwerten heraus. Diese Varianzreduktion ist kostenlose Power – deshalb locken wiederholte Messungen Forscher mit kleinen Stichproben.
Probier es aus: Verfolge in dieser Woche eine persönliche Kennzahl vor und nach einer kleinen Veränderung, berechne deine Differenzwerte und sieh, wie viel stabiler sie sind als die Rohwerte.
- 12Kapitel 12
ANOVA und die F-Quotient: viele Mittelwerte auf einmal vergleichen
Drei oder mehr Behandlungen machen paarweise t-Tests unhandlich, also kommt die Varianzanalyse ins Spiel: Sie nutzt Stichprobenvarianzen als Grundlage ihrer Analyse, um Mittelwertsunterschiede zwischen Gruppen gleichzeitig zu prüfen. Die Maschinerie besteht aus Quadratsummen: SStotal = ΣX² − (G²/N) mit G als Gesamtsumme, SSwithin als Summe der SS innerhalb jeder Behandlung, SSbetween = SStotal − SSwithin, und den Freiheitsgraden dfbetween = k − 1, dfwithin = N − k, mit MS = SS/df. Der F-Quotient ist das Verhältnis der Varianz zwischen den Behandlungen zur Varianz innerhalb der Behandlungen, F = MSbetween. Ein F-Quotient nahe 1,00 zeigt keinen Behandlungseffekt an.
Die Idee
Die ANOVA rahmt die Frage neu: Statt direkt zu fragen, ob sich Mittelwerte unterscheiden, fragt sie, ob die Varianz zwischen den Gruppen übersteigt, was die Varianz innerhalb der Gruppen zufällig vorhersagen würde. Der Basiswert 1,00 des F-Quotienten gibt dir eine sofortige Plausibilitätsprüfung, bevor du überhaupt eine Tabelle aufschlägst.
Probier es aus: Teile einen deiner Datensätze in drei Gruppen, berechne die Varianz der Gruppenmittelwerte gegenüber der durchschnittlichen Varianz innerhalb der Gruppen und schätze deinen eigenen F-Quotienten grob ab.
- 13Kapitel 13–14
Varianzanalyse mit Messwiederholung und zwei Faktoren auf einmal
Das Design mit denselben Teilnehmern skaliert hoch: In der Varianzanalyse mit Messwiederholung werden individuelle Unterschiede gemessen und aus dem Nenner der F-Quotienten entfernt, was den Test schärft. Dann wächst dem Design eine zweite unabhängige Variable, und die zweifaktorielle Varianzanalyse liefert drei getrennte F-Quotienten: einen Haupteffekt von Faktor A, einen Haupteffekt von Faktor B und die Interaktion zwischen beiden. Eine Interaktion liegt vor, wenn die Effekte eines Faktors von den verschiedenen Stufen eines zweiten Faktors abhängen, und das Buch empfiehlt, die Zellmittelwerte zu grafisch darstellen, um sie zu erkennen.
Die Idee
Individuelle Unterschiede aus dem Nenner zu entfernen ist die Varianzanalyse-Version des Vorteils des t-Tests mit Messwiederholung, angewandt auf viele Bedingungen. Die Interaktion ist oft der eigentliche Befund, denn Haupteffekte können Geschichten verbergen, in denen eine Behandlung auf einer Stufe hilft und auf einer anderen schadet.
Probier es aus: Skizziere zwei Linien in einem Diagramm, eine für jede Stufe von Faktor B über die Stufen von Faktor A hinweg, und entscheide selbst, ob sie eine Interaktionsgeschichte erzählen.
- 14Kapitel 15–16
Korrelation, Regression und die Linie, die passt
Zwei Variablen, ein Streudiagramm: Die Pearson-Korrelation misst Richtung und Grad der linearen Beziehung und läuft von −1,00 für eine perfekte negative bis +1,00 für eine perfekte positive, mit r = SP/√(SSX·SSY). Quadriert ergibt sie das Bestimmtheitsmaß r², den Anteil der Varianz einer Variablen, der durch ihre Beziehung zur anderen erklärt wird. Für Ordinaldaten oder monotonische, aber nichtlineare Muster übernimmt die Rangkorrelation nach Spearman. Das Buch ist unmissverständlich über die Grenzen: Korrelation beweist keine Kausalität, und ein Drittel-Variablen-Problem oder eine umgekehrte Ursache-Wirkungs-Beziehung kann erklären, was du siehst. Die Regression baut dann die Vorhersagelinie Ŷ = bX + a nach der Methode der kleinsten Quadrate auf, mit Steigung b = SP/SSX und Achsenabschnitt a = MY − bMX, und der Standardfehler der Schätzung misst den Standardabstand zwischen der Linie und den tatsächlichen Datenpunkten und fällt nur auf null, wenn r = ±1,00.
Die Idee
Korrelation und Regression sind zwei Ansichten einer Beziehung: r beschreibt ihre Stärke und Richtung, während die Regressionsgleichung sie in Vorhersagen verwandelt.
Probier es aus: Wähle zwei Variablen, die du eine Woche lang täglich notieren kannst, berechne eine grobe Korrelation und liste dann eine dritte Variable auf, die den Zusammenhang erklären könnte, bevor du ihn glaubst.
- 15Kapitel 17–18
Chi-Quadrat und die Binomialverteilung: Kategorien testen
Nicht jeder Datenpunkt ist eine Zahl auf einer Skala; manche sind nur Kategorien. Die Chi-Quadrat-Statistik, χ² = Σ(fO − fE)²/fE, vergleicht beobachtete Häufigkeiten mit erwarteten Häufigkeiten für Nominaldaten. Der Anpassungstest fragt, ob die Stichprobenanteile einer vorgegebenen Populationsverteilung entsprechen, mit df = k − 1 über k Kategorien. Der Unabhängigkeitstest fragt, ob zwei kategoriale Variablen zusammenhängen, und arbeitet mit einer Matrix beobachteter Häufigkeiten, mit df = (R − 1)(C − 1) und erwarteten Zellhäufigkeiten fe = (Zeilensumme × Spaltensumme)/N. Für den Sonderfall von genau zwei Kategorien kommt der Binomialtest zum Zug, und das Beispiel des Kapitels ist ein Forscher, der eine Münze viele Male wirft, um zu sehen, ob die beobachteten Köpfe der Erwartung unter P = Q = 0,50 entsprechen.
Die Idee
Diese Tests befreien dich vollständig von Mittelwerten und Varianzen: Die Daten sind Zählungen, und die Frage ist, ob die Zählungen zu einer Behauptung passen.
Probier es aus: Wirf eine Münze 20 Mal, berechne die erwartete Anzahl von Köpfen unter P = 0,50 und berechne, wie weit deine beobachtete Anzahl abweicht.
Zum Merken
Die besten Zitate
“Das arithmetische Mittel ist der Gleichgewichtspunkt der Verteilung”
“die natürlich auftretende Diskrepanz, oder der Fehler, der zwischen einer Stichprobenstatistik und dem entsprechenden Populationsparameter besteht”
“die Hypothese, die besagt, dass es keine Veränderung, keine Wirkung und keinen Unterschied gibt”
“wenn die Wirkung eines Faktors von den verschiedenen Stufen eines zweiten Faktors abhängt”
Eine faire Kritik
Schwächen
Die Sanftheit des Buches ist zugleich seine Decke: Es stützt sich auf durchgerechnete Verfahren und Formeln statt auf die tieferen mathematischen Hintergründe, sodass Leser, die Herleitungen oder maßtheoretische Grundlagen suchen, anderswo fündig werden müssen. Effektstärken und moderne Themen wie Replikation, Konfidenzintervalle jenseits des Schätzungskapitels und Software-Workflows bekommen im Vergleich zur Handrechnung wenig Raum. Die Auflagen behandeln zudem unterschiedlich die Kritik am klassischen Hypothesentesten. Nimm es als ersten Durchgang, der dich befähigt zu rechnen und zu interpretieren – nicht als letztes Wort zur statistischen Praxis.
In einem Satz
Statistik ist eine Kette von der Stichprobe zur Grundgesamtheit, und jedes Glied, vom Mittelwert bis zum F-Quotienten, existiert, um zu messen, wie sehr deine Stichprobe dich in die Irre führen könnte.
Ist es etwas für dich?
Für wen sich das Buch eignet
Studierende der Psychologie und Verhaltenswissenschaft, die eine Statistikvorlesung bestehen müssen, ohne den Verstand zu verlieren – vor allem solche, die mehr Angst vor Formeln haben als vor dem Scheitern. Ebenso ideal für Forscher und Kliniker, die Studien durchführen, aber endlich verstehen wollen, was ihre Software unter der Haube eigentlich tut.
4 Fragen
Kurzes Quiz: Wie gut kennst du STATISTICS FOR BEHAVIORAL SCIENCES?
0 von 4 beantwortet
