2 + 3[1] 5
Der zweite Teil dieser Einführung ist praktischer Natur. Wir arbeiten in diesem Kurs durchgängig mit R — einer freien, quelloffenen Sprache für Statistik. Alle Analysen, Abbildungen und sogar dieses Buch selbst sind mit R (und dem Publikationssystem Quarto) erstellt. Bevor wir uns mit einzelnen Verfahren beschäftigen, richten wir daher Ihre Arbeitsumgebung ein und schauen uns die ersten Befehle an. Das Datenmanagement — also das Einlesen und Aufbereiten echter Datensätze — besprechen wir bewusst erst in einem späteren Kapitel. Hier geht es nur ums Ankommen.
R ist eine freie, quelloffene Programmiersprache, die speziell für Statistik, Datenanalyse und die Erstellung von Abbildungen entwickelt wurde (R Core Team, 2026). Anders als bei Programmen mit Menüs und Schaltflächen — etwa SPSS oder Excel — schreiben Sie in R Ihre Analysen als Befehle auf. Das wirkt am Anfang ungewohnt, hat aber einen großen Vorteil: Jeder Schritt ist schriftlich festgehalten, nachvollziehbar und jederzeit reproduzierbar. Sie können eine Auswertung Monate später exakt wiederholen oder mit einem Klick auf neue Daten anwenden. Genau diese Nachvollziehbarkeit ist in der wissenschaftlichen Arbeit unverzichtbar. Hinzu kommt, dass R kostenlos ist und durch tausende frei verfügbare Erweiterungen (Pakete) praktisch jedes moderne Verfahren beherrscht.
Ein weiterer Vorteil ist, dass Sprachmodelle wie Mistral, Claude oder ChatGPT hervorragend darin sind zu programmieren und Ihnen dadurch oft gut weiterhelfen können.
RStudio ist dagegen keine eigene Statistik-Software, sondern eine komfortable Arbeitsumgebung um R herum — eine sogenannte IDE (Integrated Development Environment). RStudio bündelt Editor, Konsole, Abbildungen und Hilfeseiten in einem Fenster und nimmt Ihnen viel Schreibarbeit ab. Beide zusammen bilden das Werkzeug, mit dem wir in diesem Kurs durchgängig arbeiten werden.
Man kann sich R als den Motor vorstellen, der im Hintergrund rechnet, und RStudio als das übersichtliche Cockpit, von dem aus Sie ihn bedienen.
Zwei Dinge sind zu installieren, und die Reihenfolge ist wichtig: erst R, dann RStudio.
Schritt 1 — R installieren. Öffnen Sie die Seite des Comprehensive R Archive Network (CRAN) unter https://cran.r-project.org, wählen Sie Ihr Betriebssystem (Windows, macOS oder Linux) und installieren Sie die aktuelle Version mit den Standardeinstellungen.
Schritt 2 — RStudio installieren. Laden Sie anschließend RStudio Desktop (Open-Source-Edition, kostenlos) von Posit herunter: https://posit.co/download/rstudio-desktop/. Auch hier reichen die Standardeinstellungen.
Wenn Sie beim Start von RStudio in der Konsole eine Zeile wie R version 4.x.x sehen, hat RStudio Ihr R gefunden und alles ist bereit.
Nach dem ersten Start sehen Sie im Wesentlichen drei Bereiche (Panes):

Am einfachsten fangen Sie links in der Konsole an. Dort steht ein Prompt-Zeichen > und blinkt ein Cursor. Alles, was Sie eintippen und mit Enter bestätigen, wird sofort ausgewertet. R ist zunächst nichts anderes als ein sehr guter Taschenrechner:
2 + 3[1] 5
Das [1] vor dem Ergebnis ist übrigens kein Tippfehler, sondern eine Positionsangabe — R nummeriert seine Ausgaben. Bei einem einzelnen Wert steht dort immer [1].
Die üblichen Rechenoperationen funktionieren wie erwartet, inklusive Klammern und Punkt-vor-Strich:
(4 + 6) / 2[1] 5
2^10[1] 1024
7 %% 3 # Rest der ganzzahligen Division ("Modulo")[1] 1
Alles hinter einem # ist ein Kommentar und wird von R ignoriert. Kommentare sind für Menschen gedacht — nutzen Sie sie großzügig, um sich (und anderen) zu erklären, was ein Befehl tun soll.
Viele Rechenoperationen sind als Funktionen verfügbar. Eine Funktion hat einen Namen und bekommt ihre Eingaben in runden Klammern übergeben:
sqrt(144)[1] 12
round(3.14159, digits = 2)[1] 3.14
Bei round() sehen Sie ein benanntes Argument (digits = 2). Solche Argumente steuern das Verhalten einer Funktion, ohne dass Sie sich die Reihenfolge merken müssen.
Ergebnisse können Sie in Objekten (Variablen) speichern, um mit ihnen weiterzurechnen. Die Zuweisung geschieht mit dem Pfeil <- (in RStudio praktisch über die Tastenkombination Alt + -):
x <- 5
y <- 3
x * y[1] 15
Wenn Sie einem Objekt etwas zuweisen, gibt R zunächst nichts aus — das Ergebnis liegt jetzt „unsichtbar” im Environment. Tippen Sie den Objektnamen allein ein, wird sein Inhalt angezeigt:
x[1] 5
Ein einzelner Wert ist selten genug. Häufig fassen wir mehrere Werte mit der Funktion c() (für combine) zu einem Vektor zusammen und wenden Funktionen darauf an:
werte <- c(4, 8, 15, 16, 23, 42)
mean(werte)[1] 18
sd(werte)[1] 13.5
Damit haben Sie im Grunde schon das Grundprinzip von R gesehen: Werte in Objekten speichern und Funktionen darauf anwenden. Wie man aus einer echten Datei einen solchen Datensatz macht und ihn aufbereitet, ist Thema des Kapitels zum Datenmanagement.
R bringt von Haus aus schon sehr viele Funktionen mit (das nennt man base R). Der eigentliche Reichtum von R steckt aber in Paketen — Sammlungen zusätzlicher Funktionen, die andere geschrieben und über CRAN zur Verfügung gestellt haben. Für Pakete gilt eine einfache Faustregel:
Einmal installieren, in jeder Sitzung laden.
Installiert wird ein Paket mit install.packages() (in Anführungszeichen). Das machen Sie nur ein einziges Mal pro Rechner:
install.packages("tidyverse")Damit R die Funktionen eines Pakets tatsächlich kennt, müssen Sie es zu Beginn jeder Sitzung mit library() laden (diesmal ohne Anführungszeichen):
library(tidyverse)Das tidyverse ist eine Sammlung eng verzahnter Pakete für Datenmanagement und Visualisierung, die uns später intensiv begleiten wird. Sie können es also schon jetzt installieren — richtig einsetzen werden wir es in den kommenden Kapiteln.
install.packages() braucht eine Internetverbindung und kann beim ersten Mal etwas dauern. library() geht danach sofort.
Niemand kennt alle Funktionen und Argumente auswendig — auch ich nicht. Zu jeder Funktion gibt es eine Hilfeseite, die Sie mit einem vorangestellten Fragezeichen aufrufen:
?mean
help(round)Die Hilfeseite erscheint dann rechts unten im Help-Pane und erklärt, welche Argumente eine Funktion erwartet und was sie zurückgibt. Ganz unten findet sich fast immer ein Abschnitt mit lauffähigen Beispielen — die lohnt es sich, einfach einmal auszuprobieren. Und keine Sorge: Fehlermeldungen gehören zum Programmieren dazu. Sie in Ruhe zu lesen (und notfalls zu googeln) ist eine ganz normale, produktive Tätigkeit.
Neben der eingebauten Hilfe steht Ihnen heute ein weiteres, erstaunlich mächtiges Werkzeug zur Verfügung: große Sprachmodelle (engl. large language models, LLMs). Sie kennen sie vermutlich als Chatbots wie ChatGPT, Claude oder Gemini. Daneben gibt es eine wachsende Zahl offener Modelle — etwa aus den Familien Llama, Mistral, Qwen oder Gemma —, die Sie über die Hochschule, über verschiedene Anbieter oder sogar lokal auf dem eigenen Rechner (z.B. mit Ollama oder LM Studio) nutzen können. Für R und Statistik sind diese Modelle bemerkenswert nützlich — wenn man weiß, wofür sie taugen und wofür nicht.
Am besten stellen Sie sich ein Sprachmodell als einen sehr belesenen, immer geduldigen, aber gelegentlich übermütigen Tutor vor: Es hat unzählige R-Beispiele „gesehen” und formuliert flüssig — aber es versteht nicht wirklich, was es sagt, und irrt sich manchmal mit voller Überzeugung. Genau deshalb ist es ein hervorragendes Hilfsmittel und ein schlechter Ersatz für eigenes Verständnis.
mean() und median() an einem kleinen Beispiel” — Sprachmodelle sind gut darin, Abstraktes an konkreten Fällen festzumachen.tidyverse) aussieht.Wie hilfreich die Antwort ist, hängt stark davon ab, wie Sie fragen. Drei Faustregeln:
tidyverse) arbeiten.Ein paar Formulierungen, die sich bewährt haben (einfach kopieren und anpassen):
Ich bin R-Anfänger:in und arbeite in RStudio. Erkläre mir bitte
diesen Code Zeile für Zeile in einfachen Worten:
werte <- c(4, 8, 15, 16, 23, 42)
mean(werte)
Ich bekomme in R diese Fehlermeldung. Was bedeutet sie, und wie
behebe ich sie? Bitte erkläre mir die Ursache, nicht nur die Lösung.
[hier Ihren Code und die vollständige Fehlermeldung einfügen]
Ich möchte in R den Mittelwert und die Standardabweichung für die
Zahlen 4, 8, 15, 16, 23, 42 berechnen. Schreibe mir den Code und
erkläre kurz, was jede Zeile tut.
Erkläre mir den Unterschied zwischen Standardabweichung und
Standardfehler an einem kleinen, anschaulichen Beispiel — so, als
würdest du es einer Studienanfängerin erklären.
Eine besonders lehrreiche Bitte: „Gib mir zwei Lösungswege und erkläre die Vor- und Nachteile.” So sehen Sie, dass es selten nur einen richtigen Weg gibt — und trainieren genau das kritische Urteil, um das es in diesem Kurs geht.
Damit sind die Vorbereitungen abgeschlossen. Im nächsten Kapitel steigen wir in das Datenmanagement ein — und arbeiten zum ersten Mal mit echten Daten.