pandas read_html extrahieren von html tabellen in python
Wenn ich HTML-Tabellen in Python auslesen will, starte ich fast immer mit pandas.read_html(). Warum? Weil es schnell ist, wenig Code braucht und in vielen Fällen sofort funktioniert. Aber: Es ist nicht magisch. Wenn du die Methode falsch einsetzt, bekommst du Müll, mehrere Tabellen auf einmal oder kaputte Spalten. Ich zeige dir, wie ich pandas read_html extrahieren von html tabellen in python praktisch nutze, welche Fehler ich vermeide und wie du aus rohem HTML saubere Daten machst.
Was macht pandas.read_html überhaupt?
pandas.read_html() liest alle erkennbaren HTML-Tabellen aus einer Webseite, einem lokalen HTML-File oder einem HTML-String und gibt sie als Liste von DataFrames zurück. Das ist wichtig: nicht ein DataFrame, sondern eine Liste.
Ich nutze das vor allem, wenn eine Seite schon eine Tabelle im HTML hat und ich keine unnötige Scraping-Logik bauen will. Wenn die Daten bereits sauber als Tabelle vorliegen, ist das oft der kürzeste Weg.
pandas read_html extrahieren von html tabellen in python: das Grundprinzip
Die einfachste Variante sieht so aus:
import pandas as pd
url = "https://example.com"
tables = pd.read_html(url)
print(len(tables))
print(tables[0].head())
Das Ergebnis:
- tables ist eine Liste
- jede Tabelle ist ein DataFrame
- mit
tables[0]greifst du auf die erste Tabelle zu
Wenn du nur eine konkrete Tabelle willst, musst du sie finden. Sonst arbeitest du schnell mit der falschen Tabelle weiter. Genau da machen viele Anfänger Fehler.
Die häufigsten Wege, eine HTML-Tabelle zu laden
1. Direkt von einer URL
import pandas as pd
tables = pd.read_html("https://www.w3schools.com/html/html_tables.asp")
print(tables[0])
Das ist der schnellste Start. Für Tests und einfache Seiten ist das ideal.
2. Aus einer lokalen HTML-Datei
import pandas as pd
tables = pd.read_html("seite.html")
print(tables[0])
Perfekt, wenn du HTML-Dateien lokal speicherst oder mit exportierten Seiten arbeitest.
3. Aus einem HTML-String
import pandas as pd
html = """
Name Wert
Alice 10
"""
tables = pd.read_html(html)
print(tables[0])
Das ist praktisch für dynamisch erzeugtes HTML oder Tests.
Wie ich die richtige Tabelle finde
Wenn eine Seite mehrere Tabellen hat, musst du gezielt filtern. Sonst erwischst du die falsche Tabelle und verlierst Zeit.
Mein Ansatz:
- Alle Tabellen laden und kurz anschauen
- Mit
shape,head()und Spaltennamen prüfen - Die Tabelle über Inhalt, Position oder Struktur auswählen
import pandas as pd
tables = pd.read_html("https://www.w3schools.com/html/html_tables.asp")
for i, df in enumerate(tables):
print(f"Tabelle {i}")
print(df.head())
print(df.columns)
print("---")
Wenn du die Tabelle kennst, kannst du oft mit Parametern wie match oder attrs arbeiten. Das spart Zeit und reduziert Fehler.
Wichtige Parameter für pandas.read_html
Wenn ich effizient arbeiten will, achte ich auf diese Parameter:
- match: sucht Tabellen mit einem bestimmten Text
- attrs: filtert nach HTML-Attributen wie
idoderclass - header: definiert die Kopfzeile
- index_col: setzt eine Spalte als Index
- skiprows: überspringt Zeilen am Anfang
import pandas as pd
tables = pd.read_html(
"https://example.com",
match="Umsatz",
attrs={"id": "sales-table"}
)
Wichtig: Nicht jeder Parameter funktioniert auf jeder Seite gleich gut. HTML ist oft messy. Du musst testen.
Typische Probleme und wie ich sie löse
Problem 1: Es werden mehrere Tabellen gefunden
Dann ist deine Seite wahrscheinlich voller Tabellen oder Tabellen-ähnlicher Elemente. Ich filtere dann gezielt mit match oder attrs.
Problem 2: Die Spalten sehen falsch aus
Dann liegt es oft an verschachtelten Headern oder leeren Zellen. Hier hilft es, die Tabelle zu bereinigen:
- unnötige Zeilen entfernen
- Spaltennamen umbenennen
- Datentypen konvertieren
- Leerwerte behandeln
Problem 3: Die Seite lädt Inhalte per JavaScript
Dann kann read_html nur das lesen, was im HTML schon drin ist. Wenn die Tabelle erst im Browser erzeugt wird, reicht das nicht. Dann brauchst du einen Browser-Automation-Ansatz wie Selenium oder du musst die API hinter der Seite finden.
Problem 4: SSL- oder Netzwerkfehler
Bei manchen Seiten blocken Zertifikate oder Serveranfragen. In solchen Fällen lade ich die Seite zuerst mit requests und gebe den HTML-Text an Pandas weiter.
import requests
import pandas as pd
url = "https://example.com"
html = requests.get(url).text
tables = pd.read_html(html)
Die offizielle Doku zu read_html findest du bei Pandas.
So mache ich aus einer HTML-Tabelle saubere Daten
Die Extraktion ist nur Schritt eins. Der echte Wert kommt erst danach. Ich will keine Tabelle, ich will brauchbare Daten.
- Spaltennamen prüfen und ggf. vereinheitlichen
- Datentypen konvertieren, z. B. Zahlen oder Datumswerte
- Duplikate entfernen
- Leerzeilen löschen
- Ungültige Werte behandeln
df = tables[0]
df.columns = ["name", "wert"]
df["wert"] = pd.to_numeric(df["wert"], errors="coerce")
df = df.dropna()
Das ist simpel, aber genau da liegt der Hebel. Saubere Daten sparen dir später massiv Zeit.
Wann ich read_html nicht benutze
Ich nutze read_html nicht blind. Wenn die Seite nur halbwegs tabellarisch aussieht, ist das keine Garantie für gute Ergebnisse.
Ich nehme einen anderen Weg, wenn:
- die Daten per JavaScript nachgeladen werden
- die Tabelle extrem verschachtelt ist
- ich nur einzelne Zellen brauche
- die Struktur stark unregelmäßig ist
Dann ist ein gezieltes Parsen mit BeautifulSoup oder ein API-Call oft besser. Die BeautifulSoup-Doku findest du hier: Beautiful Soup Documentation.
Mein kurzer Workflow für pandas read_html extrahieren von html tabellen in python
- Seite oder HTML laden
- Alle Tabellen mit
read_htmlextrahieren - Die richtige Tabelle identifizieren
- Spalten und Datentypen bereinigen
- Ergebnis exportieren oder weiterverarbeiten
Wenn ich das sauber mache, brauche ich oft nur wenige Zeilen Code, um aus HTML echte Daten zu machen. Genau deshalb mag ich diesen Ansatz: schnell, direkt, effektiv.
Fazit: pandas read_html spart Zeit, wenn du es richtig einsetzt
pandas.read_html() ist eines der nützlichsten Tools, wenn du HTML-Tabellen in Python extrahieren willst. Es ist schnell, leicht zu lernen und perfekt für viele Standardfälle. Aber du musst wissen, wie du die richtige Tabelle findest, wie du sie bereinigst und wann du auf andere Tools ausweichen solltest.
Wenn du den Prozess beherrschst, kannst du HTML-Tabellen in Minuten statt Stunden in brauchbare Daten verwandeln. Genau darum geht es bei pandas read_html extrahieren von html tabellen in python.