Ratgeber · grundlagen
Das PPTX-Format verstehen: OOXML, Folien und ZIP
Eine PPTX-Datei ist intern ein ZIP-Archiv aus XML-Dateien nach dem OOXML-Standard. Wie Folien, Layouts und Medien darin abgelegt sind, wie sich PPTX von PDF unterscheidet und warum sich daraus problemlos Bild-Folien erzeugen lassen.
Wenn Du eine PowerPoint-Datei mit der Endung .pptx vor Dir hast, denkst Du wahrscheinlich an eine einzige, geschlossene Datei. Tatsächlich ist eine PPTX-Datei aber ein ganzes Paket: ein ZIP-Archiv, das im Inneren aus vielen kleinen XML-Dateien besteht. Wer versteht, wie dieses Paket aufgebaut ist, versteht auch, warum sich aus einem PDF so unkompliziert eine PowerPoint-Präsentation erzeugen lässt, bei der jede Seite zu einer eigenen Folie wird. Ich habe unser Konvertierungstool gebaut und möchte Dir zeigen, was hinter dem Format steckt.
Woher das Format kommt: Office Open XML
Die Endung .pptx gehört zur Familie der Office-Open-XML-Formate, kurz OOXML. Microsoft hat diese Formate mit Office 2007 eingeführt und damit die alten Binärformate .ppt, .doc und .xls abgelöst. Das kleine x am Ende der Endung steht genau dafür: XML statt Binärformat.
OOXML ist kein reines Microsoft-Hausformat geblieben, sondern wurde standardisiert. Die Spezifikation trägt den Namen ECMA-376 (verabschiedet von der ECMA International) und wurde zusätzlich als internationaler Standard ISO/IEC 29500 anerkannt. Das ist der Grund, warum nicht nur PowerPoint, sondern auch LibreOffice, Google Slides, Apple Keynote und zahlreiche Programmbibliotheken PPTX-Dateien lesen und schreiben können. Das Format ist offen dokumentiert, und jeder kann sich an die Spezifikation halten.
Für Dich als Anwender bedeutet das zweierlei: Erstens ist eine PPTX-Datei portabel und nicht an ein einziges Programm gebunden. Zweitens ist sie transparent aufgebaut, denn XML ist Text, den man lesen kann.
Der Kern: eine PPTX ist ein ZIP-Archiv
Der wichtigste Punkt, den viele nicht wissen: Eine .pptx-Datei ist technisch gesehen ein ganz normales ZIP-Archiv. Es ist nur so benannt, dass PowerPoint es als Präsentation erkennt. Nimmst Du dem Archiv diese Verkleidung, kannst Du direkt hineinschauen.
Genau darin liegt die Idee des OOXML-Formats: Statt alles in einen einzigen, undurchsichtigen Binärblock zu pressen, wird eine Präsentation in viele einzelne Dateien zerlegt und diese Dateien werden zusammen in ein ZIP-Archiv gepackt. Das spart Speicherplatz, weil ZIP komprimiert, und es macht die Struktur nachvollziehbar.
Wenn Du das ZIP-Archiv entpackst, findest Du eine Ordnerstruktur vor, die ungefähr so aussieht:
meine-praesentation.pptx (ein ZIP-Archiv)
│
├── [Content_Types].xml → Verzeichnis aller Dateitypen im Paket
│
├── _rels/
│ └── .rels → oberste Beziehungen (wo geht es los?)
│
├── docProps/
│ ├── core.xml → Titel, Autor, Datum
│ └── app.xml → Programm-Infos, Folienanzahl
│
└── ppt/
├── presentation.xml → das Herz: Reihenfolge und Größe der Folien
├── _rels/
│ └── presentation.xml.rels
├── slides/
│ ├── slide1.xml → Inhalt der ersten Folie
│ ├── slide2.xml → Inhalt der zweiten Folie
│ └── _rels/
│ └── slide1.xml.rels → womit ist Folie 1 verknüpft?
├── slideLayouts/ → Vorlagen (Titelfolie, Inhalt usw.)
├── slideMasters/ → übergeordnete Master-Vorlagen
└── media/
├── image1.png → eingebettete Bilder
└── image2.jpeg
Was die einzelnen Bausteine tun
Es lohnt sich, die wichtigsten Teile kurz einzuordnen, weil daraus das Zusammenspiel klar wird.
Die Datei [Content_Types].xml liegt ganz oben und ist so etwas wie das Inhaltsverzeichnis des Pakets. Sie sagt jedem Programm, welche Arten von Dateien enthalten sind, also ob es sich bei einem Eintrag um XML, ein PNG-Bild oder ein JPEG handelt. Ohne diese Datei weiß ein Programm nicht, wie es die einzelnen Teile behandeln soll.
Die _rels-Ordner enthalten die sogenannten Beziehungen (englisch relationships). Das ist ein zentrales Konzept von OOXML: Keine Datei verweist direkt mit einem Dateipfad auf eine andere. Stattdessen wird jede Verknüpfung über eine ID in einer .rels-Datei aufgelöst. Wenn eine Folie ein Bild anzeigen möchte, steht in der Folie nur eine Beziehungs-ID, und die dazugehörige .rels-Datei löst diese ID zum tatsächlichen Bild im media-Ordner auf. Das klingt umständlich, macht das Format aber robust und leicht umbaubar.
Die Datei ppt/presentation.xml ist das Herzstück. Hier steht, welche Folien in welcher Reihenfolge zur Präsentation gehören und wie groß die Folien sind. Die eigentlichen Folieninhalte liegen darunter im Ordner ppt/slides/, wobei jede Folie ihre eigene XML-Datei bekommt, also slide1.xml, slide2.xml und so weiter.
Die Ordner slideLayouts und slideMasters enthalten die Vorlagen. Ein Slide-Master ist die oberste Vorlage, aus der sich die Layouts ableiten, und ein Layout ist eine konkrete Vorlagenform wie Titelfolie oder Titel-und-Inhalt. Jede echte Folie verweist über eine Beziehung auf ihr Layout. Der Ordner media schließlich sammelt alle Bilder und andere Medien, die in den Folien vorkommen.
Wie eine Folie ihre Inhalte beschreibt
Eine einzelne Folie ist im Kern eine Liste von sogenannten Shapes. Ein Shape kann ein Textrahmen, eine Form, eine Tabelle oder ein Bild sein. Jedes dieser Elemente hat eine Position und eine Größe, und diese Angaben stehen direkt im XML der Folie.
Ein Bild wird dabei nicht in die Folien-XML hineinkopiert. Stattdessen enthält das Bild-Shape nur eine Beziehungs-ID, die auf eine Datei im media-Ordner zeigt. Das eigentliche Bild liegt also einmal physisch im Archiv und die Folie referenziert es nur. Positionen und Maße werden in einer speziellen Einheit angegeben, den English Metric Units, kurz EMU. Eine EMU ist ein sehr kleiner Bruchteil eines Zolls, konkret entspricht ein Zoll genau 914400 EMU. Diese feine Einheit erlaubt sehr präzise Platzierungen ohne Rundungsfehler, egal ob man in Zentimetern oder Zoll denkt.
Die Foliengröße selbst steht in presentation.xml, ebenfalls in EMU. Eine klassische Breitbildfolie im Verhältnis 16:9 ist zum Beispiel 12192000 EMU breit und 6858000 EMU hoch, was 13,33 mal 7,5 Zoll entspricht. Das ältere 4:3-Format ist 9144000 mal 6858000 EMU groß, also 10 mal 7,5 Zoll.
Der Unterschied zu PDF
Jetzt wird es interessant, wenn man PPTX und PDF nebeneinanderstellt. Beide werden oft für Präsentationen verwendet, verfolgen aber gegensätzliche Ziele.
| Merkmal | PPTX (OOXML) | |
|---|---|---|
| Grundidee | strukturiert und bearbeitbar | fixierte, feste Ausgabe |
| innerer Aufbau | ZIP mit vielen XML-Dateien | Objekt- und Seitenbaum, eigenes Format |
| Zweck | Inhalte erstellen und ändern | Inhalte originalgetreu anzeigen und drucken |
| Elemente | echte Folien, Shapes, Textrahmen | feste Seiten mit fixierten Zeichenanweisungen |
| Bearbeitung | Texte, Bilder, Layout frei änderbar | nachträgliche Änderung nur mit Mühe möglich |
| Darstellung | kann je nach Programm leicht variieren | überall pixelgenau gleich |
Ein PDF ist bewusst ein Endformat. Es beschreibt, wo genau welche Zeichen, Linien und Bilder auf einer festen Seite landen, damit das Ergebnis auf jedem Gerät und Drucker identisch aussieht. Der Preis dieser Verlässlichkeit ist die schwere Bearbeitbarkeit: In einem PDF gibt es keine Folie im PowerPoint-Sinn, an der man Shapes verschieben oder Text neu setzen könnte. Wenn Du mehr über den inneren Aufbau von PDF wissen möchtest, findest Du das im Ratgeber PDF-Aufbau verstehen.
Eine PPTX dagegen ist ein Arbeitsformat. Sie hält die Bausteine getrennt und bearbeitbar, damit Du Folien hinzufügen, Texte ändern und Bilder austauschen kannst. Genau dieser Unterschied ist der Grund, warum eine echte, perfekte Rückverwandlung von PDF in vollständig editierbare PowerPoint-Folien mit Text und Formen so schwierig ist. Diesen Punkt vertiefe ich im Ratgeber PDF zu PowerPoint: die Grundlagen.
Warum sich Bild-pro-Folie so leicht erzeugen lässt
Aus der Struktur folgt aber auch eine gute Nachricht. Wenn man das Ziel etwas bescheidener steckt und aus jeder PDF-Seite eine Folie mit genau einem Bild macht, ist das technisch geradezu einfach.
Der Weg ist überschaubar: Jede PDF-Seite wird als Bild gerendert, also in ein PNG oder JPEG verwandelt. Für jedes dieser Bilder wird eine neue Folie angelegt, die Foliengröße wird passend zum Bildverhältnis gesetzt, und in jede Folie wird genau ein Bild-Shape eingebettet, das die Fläche ausfüllt. Danach werden alle Folien in presentation.xml in der richtigen Reihenfolge eingetragen, die Bilder wandern in den media-Ordner, die Beziehungen werden gesetzt, und das Ganze wird als ZIP-Archiv mit der Endung .pptx verpackt. Fertig ist eine gültige PowerPoint-Datei.
Weil das Format offen und die Regeln klar sind, gibt es dafür fertige Programmbibliotheken. Eine davon ist PptxGenJS, die genau in diesem Stil arbeitet: Man erzeugt im Code Folien, weist ihnen Bilder und Positionen zu, und die Bibliothek baut daraus das korrekte ZIP-mit-XML-Paket. Weil das komplett in JavaScript funktioniert, kann diese Arbeit sogar direkt in Deinem Browser passieren, ohne dass Deine Datei jemals einen Server erreicht. Genau so arbeitet auch unser PDF-zu-PowerPoint-Tool: Es rendert die Seiten und setzt sie als Bild-Folien zusammen, lokal auf Deinem Gerät.
Das Ergebnis ist keine bis ins letzte Zeichen editierbare Präsentation, sondern eine saubere Bild-Präsentation. Für den häufigsten Anwendungsfall, nämlich ein PDF schnell und originalgetreu in PowerPoint zeigen zu können, ist das genau richtig.
Praktischer Tipp: schau selbst hinein
Das Schöne am ZIP-Prinzip ist, dass Du es selbst ausprobieren kannst, ganz ohne Spezialsoftware. Lege eine Kopie einer PPTX-Datei an, damit das Original heil bleibt, und benenne die Kopie von praesentation.pptx in praesentation.zip um. Danach kannst Du das Archiv mit dem ganz normalen Entpacker Deines Betriebssystems öffnen.
Du siehst dann genau die Ordnerstruktur mit ppt, slides, media und den _rels-Ordnern. Öffnest Du eine der slideN.xml-Dateien in einem Texteditor, erkennst Du die Shapes und Verweise, und im media-Ordner findest Du alle Bilder als eigenständige Dateien. Nichts davon ist geheim oder verschlüsselt, es ist einfach strukturierter Text und ein paar Bilder in einem komprimierten Paket.
Wenn Du das einmal gesehen hast, verliert das PPTX-Format seinen Schrecken. Es ist kein magischer Block, sondern ein aufgeräumtes Archiv mit klaren Regeln, und genau diese Klarheit macht die Umwandlung von PDF-Seiten in Folien so zuverlässig.
Quellen
- https://ecma-international.org/publications-and-standards/standards/ecma-376/
- https://gitbrent.github.io/PptxGenJS/
- https://learn.microsoft.com/en-us/openspecs/office_standards/ms-pptx/
Korrekturen oder bessere Quellen? Schreib an info@akara-solutions.de. Änderungen landen mit Datum auf /korrekturen.
