Anhang A — Erste Schritte mit R und RStudio

Autor:in

Gerrit Hirschfeld

Der zweite Teil dieser Einführung ist praktischer Natur. Wir arbeiten in diesem Kurs durchgängig mit R — einer freien, quelloffenen Sprache für Statistik. Alle Analysen, Abbildungen und sogar dieses Buch selbst sind mit R (und dem Publikationssystem Quarto) erstellt. Bevor wir uns mit einzelnen Verfahren beschäftigen, richten wir daher Ihre Arbeitsumgebung ein und schauen uns die ersten Befehle an. Das Datenmanagement — also das Einlesen und Aufbereiten echter Datensätze — besprechen wir bewusst erst in einem späteren Kapitel. Hier geht es nur ums Ankommen.

A.1 Was ist R und R Studio

R ist eine freie, quelloffene Programmiersprache, die speziell für Statistik, Datenanalyse und die Erstellung von Abbildungen entwickelt wurde (R Core Team, 2026). Anders als bei Programmen mit Menüs und Schaltflächen — etwa SPSS oder Excel — schreiben Sie in R Ihre Analysen als Befehle auf. Das wirkt am Anfang ungewohnt, hat aber einen großen Vorteil: Jeder Schritt ist schriftlich festgehalten, nachvollziehbar und jederzeit reproduzierbar. Sie können eine Auswertung Monate später exakt wiederholen oder mit einem Klick auf neue Daten anwenden. Genau diese Nachvollziehbarkeit ist in der wissenschaftlichen Arbeit unverzichtbar. Hinzu kommt, dass R kostenlos ist und durch tausende frei verfügbare Erweiterungen (Pakete) praktisch jedes moderne Verfahren beherrscht.

Ein weiterer Vorteil ist, dass Sprachmodelle wie Mistral, Claude oder ChatGPT hervorragend darin sind zu programmieren und Ihnen dadurch oft gut weiterhelfen können.

RStudio ist dagegen keine eigene Statistik-Software, sondern eine komfortable Arbeitsumgebung um R herum — eine sogenannte IDE (Integrated Development Environment). RStudio bündelt Editor, Konsole, Abbildungen und Hilfeseiten in einem Fenster und nimmt Ihnen viel Schreibarbeit ab. Beide zusammen bilden das Werkzeug, mit dem wir in diesem Kurs durchgängig arbeiten werden.

Hinweis

Man kann sich R als den Motor vorstellen, der im Hintergrund rechnet, und RStudio als das übersichtliche Cockpit, von dem aus Sie ihn bedienen.

A.2 R und RStudio installieren

Zwei Dinge sind zu installieren, und die Reihenfolge ist wichtig: erst R, dann RStudio.

  • R ist die eigentliche Statistik-Software — der Motor im Hintergrund, der rechnet.
  • RStudio ist eine komfortable Arbeitsumgebung (eine sogenannte IDE) um R herum, mit Editor, Konsole und vielen Hilfen. RStudio funktioniert nur, wenn R bereits installiert ist.

Schritt 1 — R installieren. Öffnen Sie die Seite des Comprehensive R Archive Network (CRAN) unter https://cran.r-project.org, wählen Sie Ihr Betriebssystem (Windows, macOS oder Linux) und installieren Sie die aktuelle Version mit den Standardeinstellungen.

Schritt 2 — RStudio installieren. Laden Sie anschließend RStudio Desktop (Open-Source-Edition, kostenlos) von Posit herunter: https://posit.co/download/rstudio-desktop/. Auch hier reichen die Standardeinstellungen.

Tipp

Wenn Sie beim Start von RStudio in der Konsole eine Zeile wie R version 4.x.x sehen, hat RStudio Ihr R gefunden und alles ist bereit.

A.3 Die RStudio-Oberfläche

Nach dem ersten Start sehen Sie im Wesentlichen drei Bereiche (Panes):

  • Konsole (links): Hier tippen Sie die R-Befehle direkt ein und bekommen sofort ein Ergebnis. Hier fangen wir gleich an.
  • Environment / History (oben rechts): Hier sehen Sie, welche Objekte (Variablen, Datensätze) aktuell im Speicher liegen.
  • Files / Plots / Packages / Help (unten rechts): Dateibrowser, erzeugte Abbildungen, installierte Pakete und die Hilfeseiten.

Screenshot der Rstudio-Oberfläche

A.4 R als Taschenrechner

Am einfachsten fangen Sie links in der Konsole an. Dort steht ein Prompt-Zeichen > und blinkt ein Cursor. Alles, was Sie eintippen und mit Enter bestätigen, wird sofort ausgewertet. R ist zunächst nichts anderes als ein sehr guter Taschenrechner:

2 + 3
[1] 5

Das [1] vor dem Ergebnis ist übrigens kein Tippfehler, sondern eine Positionsangabe — R nummeriert seine Ausgaben. Bei einem einzelnen Wert steht dort immer [1].

Die üblichen Rechenoperationen funktionieren wie erwartet, inklusive Klammern und Punkt-vor-Strich:

(4 + 6) / 2
[1] 5
2^10
[1] 1024
7 %% 3      # Rest der ganzzahligen Division ("Modulo")
[1] 1

Alles hinter einem # ist ein Kommentar und wird von R ignoriert. Kommentare sind für Menschen gedacht — nutzen Sie sie großzügig, um sich (und anderen) zu erklären, was ein Befehl tun soll.

Viele Rechenoperationen sind als Funktionen verfügbar. Eine Funktion hat einen Namen und bekommt ihre Eingaben in runden Klammern übergeben:

sqrt(144)
[1] 12
round(3.14159, digits = 2)
[1] 3.14

Bei round() sehen Sie ein benanntes Argument (digits = 2). Solche Argumente steuern das Verhalten einer Funktion, ohne dass Sie sich die Reihenfolge merken müssen.

A.5 Objekte und Zuweisungen

Ergebnisse können Sie in Objekten (Variablen) speichern, um mit ihnen weiterzurechnen. Die Zuweisung geschieht mit dem Pfeil <- (in RStudio praktisch über die Tastenkombination Alt + -):

x <- 5
y <- 3
x * y
[1] 15

Wenn Sie einem Objekt etwas zuweisen, gibt R zunächst nichts aus — das Ergebnis liegt jetzt „unsichtbar” im Environment. Tippen Sie den Objektnamen allein ein, wird sein Inhalt angezeigt:

x
[1] 5

Ein einzelner Wert ist selten genug. Häufig fassen wir mehrere Werte mit der Funktion c() (für combine) zu einem Vektor zusammen und wenden Funktionen darauf an:

werte <- c(4, 8, 15, 16, 23, 42)
mean(werte)
[1] 18
sd(werte)
[1] 13.5

Damit haben Sie im Grunde schon das Grundprinzip von R gesehen: Werte in Objekten speichern und Funktionen darauf anwenden. Wie man aus einer echten Datei einen solchen Datensatz macht und ihn aufbereitet, ist Thema des Kapitels zum Datenmanagement.

A.6 Pakete installieren und laden

R bringt von Haus aus schon sehr viele Funktionen mit (das nennt man base R). Der eigentliche Reichtum von R steckt aber in Paketen — Sammlungen zusätzlicher Funktionen, die andere geschrieben und über CRAN zur Verfügung gestellt haben. Für Pakete gilt eine einfache Faustregel:

Einmal installieren, in jeder Sitzung laden.

Installiert wird ein Paket mit install.packages() (in Anführungszeichen). Das machen Sie nur ein einziges Mal pro Rechner:

install.packages("tidyverse")

Damit R die Funktionen eines Pakets tatsächlich kennt, müssen Sie es zu Beginn jeder Sitzung mit library() laden (diesmal ohne Anführungszeichen):

library(tidyverse)

Das tidyverse ist eine Sammlung eng verzahnter Pakete für Datenmanagement und Visualisierung, die uns später intensiv begleiten wird. Sie können es also schon jetzt installieren — richtig einsetzen werden wir es in den kommenden Kapiteln.

Hinweis

install.packages() braucht eine Internetverbindung und kann beim ersten Mal etwas dauern. library() geht danach sofort.

A.7 Hilfe bekommen

Niemand kennt alle Funktionen und Argumente auswendig — auch ich nicht. Zu jeder Funktion gibt es eine Hilfeseite, die Sie mit einem vorangestellten Fragezeichen aufrufen:

?mean
help(round)

Die Hilfeseite erscheint dann rechts unten im Help-Pane und erklärt, welche Argumente eine Funktion erwartet und was sie zurückgibt. Ganz unten findet sich fast immer ein Abschnitt mit lauffähigen Beispielen — die lohnt es sich, einfach einmal auszuprobieren. Und keine Sorge: Fehlermeldungen gehören zum Programmieren dazu. Sie in Ruhe zu lesen (und notfalls zu googeln) ist eine ganz normale, produktive Tätigkeit.

A.8 Mit KI arbeiten

Neben der eingebauten Hilfe steht Ihnen heute ein weiteres, erstaunlich mächtiges Werkzeug zur Verfügung: große Sprachmodelle (engl. large language models, LLMs). Sie kennen sie vermutlich als Chatbots wie ChatGPT, Claude oder Gemini. Daneben gibt es eine wachsende Zahl offener Modelle — etwa aus den Familien Llama, Mistral, Qwen oder Gemma —, die Sie über die Hochschule, über verschiedene Anbieter oder sogar lokal auf dem eigenen Rechner (z.B. mit Ollama oder LM Studio) nutzen können. Für R und Statistik sind diese Modelle bemerkenswert nützlich — wenn man weiß, wofür sie taugen und wofür nicht.

Am besten stellen Sie sich ein Sprachmodell als einen sehr belesenen, immer geduldigen, aber gelegentlich übermütigen Tutor vor: Es hat unzählige R-Beispiele „gesehen” und formuliert flüssig — aber es versteht nicht wirklich, was es sagt, und irrt sich manchmal mit voller Überzeugung. Genau deshalb ist es ein hervorragendes Hilfsmittel und ein schlechter Ersatz für eigenes Verständnis.

A.8.1 Wofür Sprachmodelle sich gut eignen

  • Code erklären lassen. Sie kopieren einen Codeblock hinein und lassen ihn Zeile für Zeile erläutern. Das ist oft schneller verständlich als eine Hilfeseite.
  • Fehlermeldungen entschlüsseln. R-Fehlermeldungen wirken am Anfang kryptisch. Kopieren Sie die vollständige Meldung samt Ihrem Code, und lassen Sie sich erklären, was schiefgelaufen ist.
  • Einen ersten Entwurf schreiben. Beschreiben Sie in Worten, was Sie erreichen wollen, und Sie bekommen einen Code-Vorschlag, den Sie ausprobieren und anpassen können.
  • Konzepte am Beispiel erklären. „Erkläre mir den Unterschied zwischen mean() und median() an einem kleinen Beispiel” — Sprachmodelle sind gut darin, Abstraktes an konkreten Fällen festzumachen.
  • Zwischen Werkzeugen übersetzen. Wenn Sie etwas aus Excel oder SPSS kennen, können Sie fragen, wie dasselbe in R (oder im tidyverse) aussieht.
  • Code aufräumen und kommentieren. Lassen Sie sprechende Variablennamen vorschlagen oder Kommentare ergänzen, damit Ihr Skript auch in einem halben Jahr noch lesbar ist.

A.8.2 Wo Vorsicht geboten ist

  • Erfundene Funktionen. Modelle „halluzinieren” gelegentlich Funktionen, Argumente oder ganze Pakete, die es gar nicht gibt — und das völlig plausibel. Führen Sie vorgeschlagenen Code immer selbst aus und prüfen Sie, ob er das Erwartete tut.
  • Veraltetes Wissen. Der Trainingsstand eines Modells liegt in der Vergangenheit, und Pakete ändern sich. Was das Modell vorschlägt, muss nicht der heute übliche Weg sein.
  • Selbstbewusst daneben. Besonders bei statistischen Fragen kommt manchmal eine sachlich falsche Antwort im Brustton der Überzeugung. Um das zu erkennen, brauchen Sie eigenes Fachwissen — genau das, was dieser Kurs aufbaut.
  • Datenschutz. Geben Sie keine sensiblen oder personenbezogenen Forschungsdaten in fremde Cloud-Dienste ein. Hier spielen offene, lokal laufende Modelle ihren großen Vorteil aus: Die Daten verlassen Ihren Rechner nicht.
  • Das Verständnis nicht auslagern. Wenn das Modell alles schreibt, lernen Sie nichts. Nutzen Sie es, um zu verstehen, nicht um das Verstehen zu vermeiden.

A.8.3 Gute Prompts

Wie hilfreich die Antwort ist, hängt stark davon ab, wie Sie fragen. Drei Faustregeln:

  1. Kontext geben. Sagen Sie, dass Sie Anfänger:in sind und mit R/RStudio (ggf. dem tidyverse) arbeiten.
  2. Konkret werden. Fügen Sie Ihren echten Code, die vollständige Fehlermeldung oder einen kleinen Ausschnitt Ihrer Daten bei.
  3. Erklärung verlangen, nicht nur Lösung. Bitten Sie darum, den Weg zu erläutern — so lernen Sie etwas dabei, statt nur zu kopieren.

Ein paar Formulierungen, die sich bewährt haben (einfach kopieren und anpassen):

Ich bin R-Anfänger:in und arbeite in RStudio. Erkläre mir bitte
diesen Code Zeile für Zeile in einfachen Worten:

werte <- c(4, 8, 15, 16, 23, 42)
mean(werte)
Ich bekomme in R diese Fehlermeldung. Was bedeutet sie, und wie
behebe ich sie? Bitte erkläre mir die Ursache, nicht nur die Lösung.

[hier Ihren Code und die vollständige Fehlermeldung einfügen]
Ich möchte in R den Mittelwert und die Standardabweichung für die
Zahlen 4, 8, 15, 16, 23, 42 berechnen. Schreibe mir den Code und
erkläre kurz, was jede Zeile tut.
Erkläre mir den Unterschied zwischen Standardabweichung und
Standardfehler an einem kleinen, anschaulichen Beispiel — so, als
würdest du es einer Studienanfängerin erklären.
Tipp

Eine besonders lehrreiche Bitte: „Gib mir zwei Lösungswege und erkläre die Vor- und Nachteile.” So sehen Sie, dass es selten nur einen richtigen Weg gibt — und trainieren genau das kritische Urteil, um das es in diesem Kurs geht.

Damit sind die Vorbereitungen abgeschlossen. Im nächsten Kapitel steigen wir in das Datenmanagement ein — und arbeiten zum ersten Mal mit echten Daten.