WMP Sites

Pandas read_html: HTML-Tabellen in Python zuverlässig extrahieren

Lukas Fuchs vor 2 Wochen Datenbanken 3 Min. Lesezeit

Wenn du HTML-Tabellen schnell in DataFrames ziehen willst, ist pandas read_html oft der schnellste Weg. Ich zeige dir, wie ich damit arbeite, wo die Stolperfallen liegen und wie du saubere Ergebnisse bekommst.

pandas read_html extrahieren von html tabellen in python

Wenn ich HTML-Tabellen in Python auslesen will, starte ich fast immer mit pandas.read_html(). Warum? Weil es schnell ist, wenig Code braucht und in vielen Fällen sofort funktioniert. Aber: Es ist nicht magisch. Wenn du die Methode falsch einsetzt, bekommst du Müll, mehrere Tabellen auf einmal oder kaputte Spalten. Ich zeige dir, wie ich pandas read_html extrahieren von html tabellen in python praktisch nutze, welche Fehler ich vermeide und wie du aus rohem HTML saubere Daten machst.

Was macht pandas.read_html überhaupt?

pandas.read_html() liest alle erkennbaren HTML-Tabellen aus einer Webseite, einem lokalen HTML-File oder einem HTML-String und gibt sie als Liste von DataFrames zurück. Das ist wichtig: nicht ein DataFrame, sondern eine Liste.

Ich nutze das vor allem, wenn eine Seite schon eine Tabelle im HTML hat und ich keine unnötige Scraping-Logik bauen will. Wenn die Daten bereits sauber als Tabelle vorliegen, ist das oft der kürzeste Weg.

pandas read_html extrahieren von html tabellen in python: das Grundprinzip

Die einfachste Variante sieht so aus:

import pandas as pd

url = "https://example.com"
tables = pd.read_html(url)

print(len(tables))
print(tables[0].head())

Das Ergebnis:

  • tables ist eine Liste
  • jede Tabelle ist ein DataFrame
  • mit tables[0] greifst du auf die erste Tabelle zu

Wenn du nur eine konkrete Tabelle willst, musst du sie finden. Sonst arbeitest du schnell mit der falschen Tabelle weiter. Genau da machen viele Anfänger Fehler.

Die häufigsten Wege, eine HTML-Tabelle zu laden

1. Direkt von einer URL

import pandas as pd

tables = pd.read_html("https://www.w3schools.com/html/html_tables.asp")
print(tables[0])

Das ist der schnellste Start. Für Tests und einfache Seiten ist das ideal.

2. Aus einer lokalen HTML-Datei

import pandas as pd

tables = pd.read_html("seite.html")
print(tables[0])

Perfekt, wenn du HTML-Dateien lokal speicherst oder mit exportierten Seiten arbeitest.

3. Aus einem HTML-String

import pandas as pd

html = """
NameWert
Alice10
""" tables = pd.read_html(html) print(tables[0])

Das ist praktisch für dynamisch erzeugtes HTML oder Tests.

Wie ich die richtige Tabelle finde

Wenn eine Seite mehrere Tabellen hat, musst du gezielt filtern. Sonst erwischst du die falsche Tabelle und verlierst Zeit.

Mein Ansatz:

  • Alle Tabellen laden und kurz anschauen
  • Mit shape, head() und Spaltennamen prüfen
  • Die Tabelle über Inhalt, Position oder Struktur auswählen
import pandas as pd

tables = pd.read_html("https://www.w3schools.com/html/html_tables.asp")

for i, df in enumerate(tables):
    print(f"Tabelle {i}")
    print(df.head())
    print(df.columns)
    print("---")

Wenn du die Tabelle kennst, kannst du oft mit Parametern wie match oder attrs arbeiten. Das spart Zeit und reduziert Fehler.

Wichtige Parameter für pandas.read_html

Wenn ich effizient arbeiten will, achte ich auf diese Parameter:

  • match: sucht Tabellen mit einem bestimmten Text
  • attrs: filtert nach HTML-Attributen wie id oder class
  • header: definiert die Kopfzeile
  • index_col: setzt eine Spalte als Index
  • skiprows: überspringt Zeilen am Anfang
import pandas as pd

tables = pd.read_html(
    "https://example.com",
    match="Umsatz",
    attrs={"id": "sales-table"}
)

Wichtig: Nicht jeder Parameter funktioniert auf jeder Seite gleich gut. HTML ist oft messy. Du musst testen.

Typische Probleme und wie ich sie löse

Problem 1: Es werden mehrere Tabellen gefunden

Dann ist deine Seite wahrscheinlich voller Tabellen oder Tabellen-ähnlicher Elemente. Ich filtere dann gezielt mit match oder attrs.

Problem 2: Die Spalten sehen falsch aus

Dann liegt es oft an verschachtelten Headern oder leeren Zellen. Hier hilft es, die Tabelle zu bereinigen:

  • unnötige Zeilen entfernen
  • Spaltennamen umbenennen
  • Datentypen konvertieren
  • Leerwerte behandeln

Problem 3: Die Seite lädt Inhalte per JavaScript

Dann kann read_html nur das lesen, was im HTML schon drin ist. Wenn die Tabelle erst im Browser erzeugt wird, reicht das nicht. Dann brauchst du einen Browser-Automation-Ansatz wie Selenium oder du musst die API hinter der Seite finden.

Problem 4: SSL- oder Netzwerkfehler

Bei manchen Seiten blocken Zertifikate oder Serveranfragen. In solchen Fällen lade ich die Seite zuerst mit requests und gebe den HTML-Text an Pandas weiter.

import requests
import pandas as pd

url = "https://example.com"
html = requests.get(url).text
tables = pd.read_html(html)

Die offizielle Doku zu read_html findest du bei Pandas.

So mache ich aus einer HTML-Tabelle saubere Daten

Die Extraktion ist nur Schritt eins. Der echte Wert kommt erst danach. Ich will keine Tabelle, ich will brauchbare Daten.

  • Spaltennamen prüfen und ggf. vereinheitlichen
  • Datentypen konvertieren, z. B. Zahlen oder Datumswerte
  • Duplikate entfernen
  • Leerzeilen löschen
  • Ungültige Werte behandeln
df = tables[0]
df.columns = ["name", "wert"]
df["wert"] = pd.to_numeric(df["wert"], errors="coerce")
df = df.dropna()

Das ist simpel, aber genau da liegt der Hebel. Saubere Daten sparen dir später massiv Zeit.

Wann ich read_html nicht benutze

Ich nutze read_html nicht blind. Wenn die Seite nur halbwegs tabellarisch aussieht, ist das keine Garantie für gute Ergebnisse.

Ich nehme einen anderen Weg, wenn:

  • die Daten per JavaScript nachgeladen werden
  • die Tabelle extrem verschachtelt ist
  • ich nur einzelne Zellen brauche
  • die Struktur stark unregelmäßig ist

Dann ist ein gezieltes Parsen mit BeautifulSoup oder ein API-Call oft besser. Die BeautifulSoup-Doku findest du hier: Beautiful Soup Documentation.

Mein kurzer Workflow für pandas read_html extrahieren von html tabellen in python

  1. Seite oder HTML laden
  2. Alle Tabellen mit read_html extrahieren
  3. Die richtige Tabelle identifizieren
  4. Spalten und Datentypen bereinigen
  5. Ergebnis exportieren oder weiterverarbeiten

Wenn ich das sauber mache, brauche ich oft nur wenige Zeilen Code, um aus HTML echte Daten zu machen. Genau deshalb mag ich diesen Ansatz: schnell, direkt, effektiv.

Fazit: pandas read_html spart Zeit, wenn du es richtig einsetzt

pandas.read_html() ist eines der nützlichsten Tools, wenn du HTML-Tabellen in Python extrahieren willst. Es ist schnell, leicht zu lernen und perfekt für viele Standardfälle. Aber du musst wissen, wie du die richtige Tabelle findest, wie du sie bereinigst und wann du auf andere Tools ausweichen solltest.

Wenn du den Prozess beherrschst, kannst du HTML-Tabellen in Minuten statt Stunden in brauchbare Daten verwandeln. Genau darum geht es bei pandas read_html extrahieren von html tabellen in python.

Weitere Beiträge

Folge uns

Neue Beiträge

Frontend

Die Kunst des Schatten: Box Shadow für visuell beeindruckende Designs

AUTOR • Jul 23, 2026
Frontend

Das HTML Main Tag: Der unverzichtbare Container für den Hauptinhalt deiner Webseite

AUTOR • Jul 22, 2026
Frontend

Einfacher Weg zur Konvertierung von HTML in JSON: So sparst du Zeit und Fehler

AUTOR • Jul 22, 2026
DevOps & Deployment

Die Verzeichnisstruktur von Linux entmystifizieren: Der klare Guide für Einsteiger und Profis

AUTOR • Jul 22, 2026
Frontend

Das HTML-Adress-Element für Landingpages und Kontaktdetails optimieren: So mache ich es sauber, SEO-stark und nutzerfreundlich

AUTOR • Jul 22, 2026
Frontend

CSS Overlays: Transparenz, Positionierung und Effekte für Ihre Website

AUTOR • Jul 22, 2026
Frontend

Freischalten des Input-Typs Select: Die umfassende Anleitung für saubere Formulare

AUTOR • Jul 22, 2026
Frontend

Sprungmarken in HTML: mühelose Navigation und schnelles Scrollen für bessere Nutzerführung

AUTOR • Jul 22, 2026
DevOps & Deployment

Amazon Linux 2 Funktionen, Vorteile und Deployment: Das musst du wirklich wissen

AUTOR • Jul 22, 2026
DevOps & Deployment

Linux vDSO: Die unsichtbare Beschleunigung in modernen Systemen verstehen und nutzen

AUTOR • Jul 21, 2026
JavaScript

Kleiner größer Zeichen: Bedeutung, Anwendung und schnelle Beispiele

AUTOR • Jul 17, 2026
API & Webservices

Gewichte umrechnen: So rechnest du Pfund, Kilogramm und Unzen schnell und fehlerfrei um

AUTOR • Jul 17, 2026
Frontend

Umfang und Fläche vom Kreis berechnen: Formel, Beispiele und schnelle Praxis-Tipps

AUTOR • Jul 17, 2026
JavaScript

Seemeilen in km umrechnen: So rechnest du schnell und genau

AUTOR • Jul 17, 2026
DevOps & Deployment

Welches Bundesland hat das Kennzeichen RW? Bedeutung, Herkunft und Nutzung erklärt

AUTOR • Jul 15, 2026
Frontend

Erstellen von interaktiven Tabellen mit einem HTML-Tabellengenerator: So mache ich Daten sofort nutzbar

AUTOR • Jul 13, 2026
Frontend

HTML-Tabellen mühelos in Markdown umwandeln

AUTOR • Jul 13, 2026
Frontend

HTML Custom Elements erstellen und verwenden: Wiederverwendbare Komponenten sauber aufbauen

AUTOR • Jul 13, 2026
API & Webservices

Fläche und Umfang vom Kreis berechnen: Formel, Beispiele und schnelle Tricks

AUTOR • Jul 13, 2026
API & Webservices

Glückwünsche für die Ehe: So formulierst du persönliche und starke Hochzeitswünsche

AUTOR • Jul 13, 2026

Beliebte Beiträge

DevOps & Deployment

MX Linux installieren: Eine Schritt-für-Schritt-Anleitung für Anfänger

AUTOR • Jan 20, 2026
Frontend

HTML kostenlos meistern: Dein ultimativer Wegweiser

AUTOR • Apr 24, 2024
Frontend

HTML-Schriftart ändern: Eine schrittweise Anleitung zum Anpassen des Erscheinungsbilds Ihrer Website

AUTOR • Apr 24, 2024
Frameworks & Libraries

React: HTML-Strings sicher und effizient rendern

AUTOR • Apr 24, 2024
JavaScript

JavaScript-Dateien: Ihr umfassender Leitfaden zum Verständnis, Verwenden und Optimieren

AUTOR • Apr 24, 2024
Frontend

HTML Trennlinien: So teilst du Inhalte klar und effektiv

AUTOR • Apr 24, 2024
Frontend

HTML target Attribut: Eine umfassende Anleitung

AUTOR • Apr 24, 2024
Frontend

HTML-Telefonnummern: So fügen Sie anklickbare Telefonnummern in Ihre Website ein

AUTOR • Apr 24, 2024
Frontend

Kontaktformulare in HTML: Ein umfassender Leitfaden zur Erstellung effektiver Formulare

AUTOR • Apr 24, 2024
Frontend

Grundlegende HTML-Version von Gmail: Zugriff auf E-Mails ohne JavaScript oder CSS

AUTOR • Apr 24, 2024
Frontend

HTML in Figma mühelos konvertieren: Schritt-für-Schritt-Anleitung

AUTOR • Apr 24, 2024
Frontend

HTML in Text konvertieren: Einfach gemacht

AUTOR • Apr 23, 2024
Frontend

So passen Sie die Größe von HTML-Bildern perfekt an

AUTOR • Apr 23, 2024
Frontend

HTML-Elemente: Bausteine des Webs und wie man sie einsetzt

AUTOR • Apr 23, 2024
Frontend

Kreative Sprüche fürs Gästebuch: Unvergessliche Erinnerungen schaffen

AUTOR • May 12, 2025
JavaScript

Umrechnung von Kilogramm in Gramm: Praktische Tipps und Beispiele

AUTOR • May 09, 2025
API & Webservices

Wie man Quadratmeter in Hektar umwandelt: Einfach erklärt!

AUTOR • May 09, 2025
Frontend

Fläche und Umfang geometrischer Figuren: Alles, was Sie wissen müssen

AUTOR • May 05, 2025
API & Webservices

Kreative Geschenke zum Geburtstag für Männer: Ein umfassender Leitfaden

AUTOR • Jun 24, 2025
Datenbanken

Diffusion und Osmose: Ein tieferer Einblick in den Unterschied

AUTOR • Apr 04, 2025