Ratgeber · grundlagen
Wie ein PDF aufgebaut ist: Seiten, Text, Vektor und Raster
PDF stammt aus PostScript und beschreibt Seiten mit fester Größe aus Text, Vektorgrafik und eingebetteten Bildern. Wie das Format aufgebaut ist, warum es überall gleich aussieht und weshalb sich Inhalte daraus nur schwer zurückgewinnen lassen.
Ein PDF öffnest Du auf jedem Gerät, und es sieht überall exakt gleich aus: dieselben Seitenränder, dieselbe Schrift, dieselbe Position jedes Absatzes. Genau das ist der Zweck des Formats. Doch dieselbe Eigenschaft, die ein PDF so verlässlich macht, ist auch der Grund, warum sich Inhalte daraus nur schwer sauber zurückgewinnen lassen. Wenn Du verstehst, wie ein PDF im Inneren aufgebaut ist, wird sofort klar, warum ich für die Umwandlung nach PowerPoint bewusst den bildbasierten Weg gewählt habe. Dieser Ratgeber schaut deshalb unter die Oberfläche.
Woher das Format stammt
PDF steht für Portable Document Format und wurde 1993 von Adobe eingeführt. Die Idee dahinter war radikal einfach für ihre Zeit: ein Dokument so zu beschreiben, dass es auf jedem Bildschirm und jedem Drucker identisch erscheint, unabhängig vom Betriebssystem oder den installierten Schriften.
Technisch ist PDF aus PostScript abgeleitet, einer Seitenbeschreibungssprache, die Adobe schon in den 1980er-Jahren für den professionellen Druck entwickelt hatte. PostScript beschreibt eine Seite als eine Folge von Zeichenbefehlen: Setze diese Linie hierhin, male diesen Buchstaben dorthin. PDF übernimmt dieses Grundprinzip, verzichtet aber auf die volle Programmiersprache von PostScript und ergänzt eine feste Dateistruktur mit direktem Zugriff auf einzelne Seiten.
Lange war PDF ein von Adobe kontrolliertes Format. Das änderte sich 2008: Seither ist PDF ein offener, international genormter Standard, veröffentlicht als ISO 32000. Dass die Spezifikation offen dokumentiert ist, hat einen praktischen Nutzen, denn unabhängige Programme und Bibliotheken können PDFs zuverlässig lesen und schreiben, ohne raten zu müssen, wie der Inhalt kodiert ist. Genau darauf bauen auch Werkzeuge wie pdf.js von Mozilla auf, die ein PDF direkt im Browser darstellen.
Das Grundprinzip: feste Seiten
Der entscheidende Unterschied zu vielen anderen Formaten ist das Konzept der festen Seite. Ein PDF besteht aus einer oder mehreren Seiten, und jede Seite hat eine exakt definierte Größe.
Diese Größe wird in Punkten angegeben. Ein Punkt ist im PDF genau 1/72 Zoll groß. Eine DIN-A4-Seite misst zum Beispiel 595 mal 842 Punkte, ein US-Letter-Blatt 612 mal 792 Punkte. Innerhalb dieser Fläche hat jedes Element eine absolute Position, gemessen vom Nullpunkt in der unteren linken Ecke. Ein Buchstabe steht nicht einfach “im ersten Absatz”, sondern an einer präzisen Koordinate wie x = 72, y = 700.
Das steht im scharfen Gegensatz zu HTML, dem Format des Webs. Eine HTML-Seite ist fließend: Der Text ordnet sich je nach Fenstergröße neu an, Absätze brechen an anderen Stellen um, auf dem Smartphone sieht die Seite anders aus als am großen Monitor. Ein PDF fließt nie. Die Seite ist ein starres Blatt Papier, digital nachgebildet. Diese Starrheit ist gewollt, denn ein Vertrag, eine Rechnung oder eine Präsentationsfolie soll überall identisch aussehen.
Die drei Inhaltsarten auf einer Seite
Alles, was Du auf einer PDF-Seite siehst, gehört zu einer von drei Kategorien. Diese Unterscheidung ist der Schlüssel zum Verständnis des Formats.
| Inhaltsart | Was gespeichert wird | Beispiel |
|---|---|---|
| Text | Positionierte Zeichen mit Verweis auf eine eingebettete Schrift | Fließtext, Überschriften, Beschriftungen |
| Vektorgrafik | Mathematisch beschriebene Pfade, Linien und Flächen | Logos, Diagramme, Rahmen, Tabellenlinien |
| Rasterbild | Ein eingebettetes Pixelbild mit fester Auflösung | Fotos, Screenshots, gescannte Seiten |
Text ist im PDF keine zusammenhängende Zeichenkette, sondern eine Sammlung einzelner Zeichen, die jeweils an einer bestimmten Position platziert werden. Zu jedem Text gehört eine Schrift, und diese Schrift ist in aller Regel direkt in die Datei eingebettet. Deshalb sieht die Schrift überall gleich aus, selbst wenn sie auf dem lesenden Gerät gar nicht installiert ist.
Vektorgrafik wird nicht als Bild gespeichert, sondern als Rechenanweisung: eine Linie von einem Punkt zum nächsten, ein Rechteck mit dieser Füllfarbe, eine Kurve mit diesen Kontrollpunkten. Der große Vorteil ist die Skalierbarkeit. Ein Vektor-Logo bleibt gestochen scharf, egal wie stark Du hineinzoomst.
Rasterbilder dagegen sind eingebettete Pixelbilder mit einer festen Auflösung, etwa ein Foto im JPEG-Format. Zoomst Du zu weit hinein, werden die einzelnen Pixel sichtbar. Eine gescannte Seite ist der Extremfall: Sie ist ein einziges großes Rasterbild, das eine Seite füllt, und enthält gar keinen echten Text, sondern nur das Foto von Text.
Ein Blick in die interne Struktur
Wie ordnet ein PDF diese Inhalte nun intern an? Ohne zu tief einzusteigen, lohnt sich ein grobes Bild. Eine PDF-Datei besteht aus vier Bereichen, die aufeinander folgen:
%PDF-1.7 <- Header (Version)
1 0 obj ... <- Body: nummerierte Objekte
2 0 obj ... (Seiten, Text, Schriften, Bilder)
3 0 obj ...
xref <- Cross-Reference-Tabelle
0000000000 65535 f (Byte-Position jedes Objekts)
trailer <- Verweis auf Wurzel und xref
%%EOF
Der eigentliche Inhalt liegt im Body als eine Menge nummerierter Objekte. Ein Objekt kann eine Seite sein, eine eingebettete Schrift, ein Bild oder ein Stück Seiteninhalt. Die Objekte verweisen mit ihren Nummern aufeinander, ähnlich wie Seiten in einem Wiki sich gegenseitig verlinken.
Die Cross-Reference-Tabelle (kurz xref) am Ende der Datei ist eine Art Inhaltsverzeichnis. Sie hält für jedes Objekt fest, an welcher Byte-Position in der Datei es steht. Dadurch kann ein Programm gezielt zu einem einzelnen Objekt springen, ohne die ganze Datei durchzulesen. Genau das macht PDF für große Dokumente schnell.
Die Seiten selbst sind in einem Seitenbaum organisiert. Von einem Wurzelknoten aus verzweigt sich die Struktur zu den einzelnen Seitenobjekten, und jedes Seitenobjekt verweist auf seinen Inhalt und die verwendeten Ressourcen wie Schriften und Bilder. Wichtig ist dabei: Dieser Baum beschreibt die Reihenfolge der Blätter, nicht die logische Gliederung des Textes in Kapitel oder Absätze.
Warum ein PDF überall gleich aussieht
Aus dem bisher Gesagten ergibt sich die berühmte Verlässlichkeit von selbst. Ein PDF sieht überall gleich aus, weil zwei Prinzipien zusammenwirken.
Erstens ist alles eingebettet. Die Schriften stecken in der Datei, die Bilder stecken in der Datei, sogar Farbprofile können mitgeliefert werden. Das lesende Gerät muss nichts beisteuern und nichts nachladen. Es gibt keine fehlende Schrift, die durch eine andere ersetzt würde, und kein Bild, das nicht gefunden wird.
Zweitens ist alles absolut positioniert. Jedes Zeichen, jede Linie, jedes Bild hat eine feste Koordinate auf einer Seite fester Größe. Es gibt nichts, was neu umbrechen oder sich an eine Fenstergröße anpassen müsste. Der Betrachter zeichnet die Seite einfach so, wie sie beschrieben ist.
Diese beiden Prinzipien machen PDF zum idealen Format für den Austausch fertiger Dokumente. Was einmal gesetzt ist, bleibt gesetzt.
Warum sich Inhalte so schwer zurückgewinnen lassen
Und hier liegt genau der Haken für jede Umwandlung, auch für die nach PowerPoint. Dieselben Eigenschaften, die ein PDF so verlässlich in der Darstellung machen, machen es widerspenstig, wenn man den Inhalt wieder herauslösen und in ein anderes Format bringen will.
Der Kern des Problems ist der Text. Im PDF ist Text, wie oben beschrieben, nur eine Sammlung positionierter Zeichen. Was fehlt, ist die logische Struktur. Ein PDF weiß in aller Regel nicht, dass eine bestimmte Zeile eine Überschrift ist, dass fünf Zeilen zusammen einen Absatz bilden oder dass zwei Textblöcke nebeneinander in Wirklichkeit zwei Spalten sind. Es kennt nur Zeichen an Koordinaten.
Das führt zu handfesten Problemen, sobald man den Inhalt maschinell auslesen will:
- Die Lesereihenfolge ist unsicher. Die Zeichen können in der Datei in einer anderen Reihenfolge stehen, als ein Mensch sie liest. Bei mehrspaltigem Layout, Fußnoten oder Tabellen rät ein Extraktionsprogramm oft falsch.
- Absätze und Überschriften sind nicht markiert. Ob ein Zeilenumbruch das Ende eines Absatzes ist oder nur ein Umbruch innerhalb eines Satzes, muss aus Abständen geschätzt werden.
- Tabellen zerfallen. Was optisch eine Tabelle ist, besteht intern nur aus Text an Koordinaten und ein paar Linien. Der Zusammenhang von Zeile und Spalte ist nicht gespeichert.
Wer versucht, ein PDF durch reines Auslesen der Zeichen in bearbeitbare Folien zu verwandeln, kämpft daher ständig mit vertauschter Reihenfolge, zerrissenen Absätzen und verrutschten Tabellen. Das Ergebnis wirkt oft chaotisch, und das liegt nicht am Werkzeug, sondern am Format selbst. Mehr dazu, wie eine Umwandlung im Grundsatz funktioniert, findest Du im Ratgeber PDF zu PowerPoint: die Grundlagen.
Warum der bildbasierte Weg zu PowerPoint robust ist
Aus dieser Einsicht folgt die Entscheidung, die hinter dem Konverter steckt. Statt zu versuchen, die verlorene Struktur eines PDFs mühsam und fehleranfällig zu erraten, gehen wir den bildbasierten Weg.
Dabei wird jede PDF-Seite exakt so gerendert, wie sie aussieht, und als Bild auf eine PowerPoint-Folie gelegt. Das nutzt genau die Stärke des Formats: Die Seite ist absolut positioniert und vollständig eingebettet, also lässt sie sich pixelgenau zeichnen. Das Ergebnis ist eine Präsentation, deren Folien exakt dem Original entsprechen, ohne verrutschte Absätze und ohne zerfallene Tabellen. Was der PPTX-Container dabei tatsächlich speichert, beschreibt der Ratgeber Das PPTX-Format verstehen.
Der bewusste Preis dieses Weges ist, dass der Text auf den Folien danach nicht mehr direkt bearbeitbar ist, denn er ist Teil des Seitenbildes. Das ist eine ehrliche Abwägung: Zuverlässige, originalgetreue Folien sind in den meisten Fällen wertvoller als angeblich editierbarer Text, der in Wirklichkeit durcheinandergeraten ist.
Die Ausnahme: Tagged PDF und Barrierefreiheit
Der Vollständigkeit halber gehört eine Ausnahme erwähnt. Es gibt PDFs, die sehr wohl eine logische Struktur mitführen. Man nennt sie Tagged PDF, also mit Auszeichnungen versehene PDFs.
Ein Tagged PDF enthält zusätzlich zu den positionierten Zeichen eine unsichtbare Ebene aus Markierungen, die festhält, was eine Überschrift ist, was ein Absatz, was eine Tabellenzelle und in welcher Reihenfolge alles gelesen werden soll. Diese Auszeichnungen sind vor allem für die Barrierefreiheit gedacht, damit Vorleseprogramme das Dokument für blinde Menschen sinnvoll erfassen können. Der Standard PDF/UA baut genau darauf auf.
Wo diese Tags sauber gesetzt sind, ließe sich der Inhalt tatsächlich verlässlicher auslesen. In der Praxis ist das aber die Ausnahme: Sehr viele PDFs sind gar nicht getaggt, und wo Tags vorhanden sind, sind sie oft unvollständig oder fehlerhaft, weil sie beim Erstellen automatisch und ohne Kontrolle erzeugt wurden. Ein robuster Konverter kann sich deshalb nicht darauf verlassen. Genau darum bleibt der bildbasierte Weg die sichere Wahl, die bei jedem PDF funktioniert, ob getaggt oder nicht.
Fazit
Ein PDF beschreibt feste Seiten mit einer in Punkten (1/72 Zoll) definierten Größe. Auf jeder Seite stehen drei Arten von Inhalt: positionierter Text mit eingebetteten Schriften, mathematisch beschriebene Vektorgrafik und eingebettete Rasterbilder. Intern ist alles in nummerierte Objekte, eine Cross-Reference-Tabelle und einen Seitenbaum gegliedert. Weil alles eingebettet und absolut positioniert ist, sieht ein PDF überall gleich aus. Genau deshalb fehlt aber die logische Struktur wie Absätze, Überschriften und Lesereihenfolge, was das Zurückgewinnen von Inhalt schwer und unzuverlässig macht. Aus dieser Erkenntnis folgt der bildbasierte Weg nach PowerPoint, der die Seite originalgetreu abbildet, statt ihre verlorene Struktur zu erraten. Tagged PDFs mit ihrer Struktur für die Barrierefreiheit sind die seltene und meist unzuverlässige Ausnahme.
Hast Du einen Fehler entdeckt oder einen Quellen-Hinweis für uns? Schreib gern an info@akara-solutions.de.
Quellen
- https://www.iso.org/standard/75839.html
- https://en.wikipedia.org/wiki/PDF
- https://mozilla.github.io/pdf.js/
Korrekturen oder bessere Quellen? Schreib an info@akara-solutions.de. Änderungen landen mit Datum auf /korrekturen.
