Funktionsweise
Fügen Sie Ihre Apache-ORC-Daten-Datei hinzu. MimiFile prüft das Format, konvertiert die Datei in Apache-Parquet-Daten und stellt das Ergebnis vorübergehend zum Download bereit.
ORC in Parquet konvertieren, wenn ein Analyse-, Data-Lake- oder Warehouse-Workflow Parquet statt ORC erwartet.
ORC → PARQUET
Dateien hierher ziehen, einfügen oder auf dem Gerät auswählen.
Dateien werden nur vorübergehend gespeichert und automatisch gelöscht.
Limits: 50 MB pro Datei · 128 MB insgesamt pro Stapel.
Fügen Sie Ihre Apache-ORC-Daten-Datei hinzu. MimiFile prüft das Format, konvertiert die Datei in Apache-Parquet-Daten und stellt das Ergebnis vorübergehend zum Download bereit.
ORC und Parquet verfolgen ähnliche spaltenorientierte Ziele, verwenden aber unterschiedliche physische Encodings und Typmodelle. Die Konvertierung serialisiert die Daten vollständig neu.
Aktuelles Quelllimit : 50 MB pro Datei. Bis zu 10 Dateien können innerhalb des globalen Limits für die Stapelverarbeitung gemeinsam gesendet werden.
Die Daten werden aus ORC gelesen und als neue Parquet-Spalten geschrieben. Kompression, Statistiken und interne Encodings der ORC-Datei werden nicht unverändert übernommen.
Primitive Typen lassen sich meist direkt abbilden. Bei Dezimal-, Zeit- und verschachtelten Typen sollten Sie das Parquet-Schema kontrollieren, bevor die Datei produktiv eingesetzt wird.
Kann ein tabellarisches Zielformat Listen oder Objekte nicht direkt darstellen, werden verschachtelte Werte nach Möglichkeit als JSON-Text serialisiert.
Nullwerte und Zeitangaben bleiben erhalten, wenn das Zielformat sie unterstützt. Binärdaten können in Text- oder Tabellenausgaben als Base64 dargestellt werden.
Prüfen Sie Spaltentypen, Nullwerte, Zeitangaben und verschachtelte Felder, bevor die konvertierte Datei in einer produktiven Datenpipeline eingesetzt wird.