작동 방식
Apache ORC 데이터 파일을 추가하면 MimiFile이 형식을 확인하고 Apache Parquet 데이터(으)로 변환한 뒤 결과를 임시 다운로드로 제공합니다.
Apache ORC 데이터 데이터를 Apache Parquet 데이터 형식으로 변환합니다. 원본 레코드를 읽어 대상 형식의 구조로 다시 작성하므로 확장자만 바꾸는 방식이 아닙니다.
ORC → PARQUET
파일을 끌어다 놓거나 붙여넣거나 기기에서 선택하세요.
파일은 임시로 보관되며 자동 삭제됩니다.
제한: 파일당 50 MB · 일괄 처리 합계 128 MB.
Apache ORC 데이터 파일을 추가하면 MimiFile이 형식을 확인하고 Apache Parquet 데이터(으)로 변환한 뒤 결과를 임시 다운로드로 제공합니다.
Apache ORC 데이터와 Apache Parquet 데이터는 스키마와 타입 표현 방식이 다를 수 있습니다. 특히 중첩 값, 시간 타입, 바이너리 값은 대상 형식의 기능에 맞춰 표현이 달라질 수 있습니다.
현재 입력 제한 : 50 MB 파일당. 전체 배치 제한 내에서 한 번에 최대 10개의 파일을 보낼 수 있습니다.
ORC의 스키마와 stripe를 읽어 배치 단위로 처리합니다. 대상이 CSV나 JSON처럼 다른 타입 체계를 쓰면 복합 타입의 표현을 변환 후 확인해야 합니다.
Parquet 출력은 열 기반 구조와 타입 스키마를 사용하며 MimiFile의 현재 데이터 워커는 ZSTD 압축, dictionary encoding 및 통계를 사용해 파일을 작성합니다.
대상 Parquet의 열 타입, null 허용 여부, 중첩 필드와 시간 타입을 다시 읽어 검증하세요.
Apache ORC 데이터 원본을 보관하고 Apache Parquet 데이터 결과의 스키마와 주요 레코드를 확인한 뒤 운영 파이프라인에 사용하세요.