Funcionamento
Adicione o seu ficheiro Apache Arrow IPC. O MimiFile verifica o formato, converte-o para Apache Parquet e disponibiliza o resultado através de uma transferência temporária.
Converta Apache Arrow para Parquet quando quiser transformar dados colunares usados em memória ou intercâmbio num ficheiro colunar persistente orientado a análise. Os dois modelos são próximos, mas a representação física, compressão e metadados não são idênticos.
ARROW → PARQUET
Arraste ou cole um ficheiro, ou selecione-o no dispositivo.
Os ficheiros são temporários e eliminados automaticamente.
Limites: 50 MB por ficheiro · 128 MB no total por lote.
Adicione o seu ficheiro Apache Arrow IPC. O MimiFile verifica o formato, converte-o para Apache Parquet e disponibiliza o resultado através de uma transferência temporária.
Arrow e Parquet partilham uma abordagem colunar, mas não são o mesmo formato. A conversão escreve um novo ficheiro Parquet: confirme o esquema, tipos lógicos, precisão decimal, datas, dicionários e estruturas aninhadas se esses detalhes forem importantes.
Limite atual do ficheiro de origem : 50 MB por ficheiro. Podem ser enviados até 10 ficheiros por lote dentro do limite global.
Arrow é muito usado para representação e intercâmbio eficiente de dados em memória; Parquet foi concebido para armazenamento colunar persistente. A conversão é útil para data lakes, análise e partilha de conjuntos de dados.
Não deve ser assumido. Muitos tipos têm correspondência direta, mas tipos lógicos, extensões, metadados de campo ou estruturas específicas podem ser normalizados ao escrever Parquet.
Não existe uma percentagem garantida. Parquet pode aplicar codificações e compressão eficientes, mas o tamanho depende dos dados, da cardinalidade, dos tipos e das opções de escrita.
Quando um destino tabular não consegue representar diretamente listas ou objetos, os valores aninhados são serializados como texto JSON sempre que possível.
Valores nulos e temporais são preservados quando o destino os suporta. Dados binários podem ser representados em Base64 em saídas de texto ou folha de cálculo.
Verifique tipos de coluna, valores nulos, datas e campos aninhados antes de usar o ficheiro convertido num pipeline de dados em produção.