कैसे काम करता है
अपनी Apache Avro डेटा फ़ाइल जोड़ें। MimiFile फ़ॉर्मेट की जाँच करता है, उसे Apache Parquet डेटा में बदलता है और परिणाम अस्थायी डाउनलोड के रूप में उपलब्ध कराता है।
Avro को Parquet में बदलें जब स्कीमा-आधारित रिकॉर्ड को कॉलम-आधारित विश्लेषण, डेटा लेक या क्वेरी वर्कफ़्लो के लिए तैयार करना हो। दोनों फ़ॉर्मेट टाइप-युक्त डेटा संभालते हैं, लेकिन उनका स्टोरेज मॉडल अलग है।
AVRO → PARQUET
फ़ाइल को खींचकर छोड़ें, पेस्ट करें या अपने डिवाइस से चुनें।
फ़ाइलें अस्थायी हैं और अपने आप हटा दी जाती हैं।
सीमाएँ: प्रति फ़ाइल 32 MB · प्रति बैच कुल 128 MB।
अपनी Apache Avro डेटा फ़ाइल जोड़ें। MimiFile फ़ॉर्मेट की जाँच करता है, उसे Apache Parquet डेटा में बदलता है और परिणाम अस्थायी डाउनलोड के रूप में उपलब्ध कराता है।
Avro पंक्ति-आधारित सीरियलाइज़ेशन और Parquet कॉलम-आधारित स्टोरेज अलग टाइप सिस्टम और मेटाडेटा नियम उपयोग करते हैं। संगत फ़ील्ड और मान स्थानांतरित हो सकते हैं, लेकिन विशेष लॉजिकल टाइप या मेटाडेटा को पूरी तरह समान मानना सही नहीं है।
वर्तमान स्रोत सीमा : 32 MB प्रति फ़ाइल. कुल सीमा के भीतर एक बैच में अधिकतम 10 फ़ाइलें भेजी जा सकती हैं।
यह CSV जैसे बिना स्कीमा वाले स्रोत की तुलना में टाइप को अधिक स्पष्ट रूप से मैप कर सकता है। फिर भी लक्ष्य Parquet स्कीमा को Avro schema की बाइट-दर-बाइट प्रति नहीं समझें।
Parquet कॉलम के आधार पर स्टोरेज व्यवस्थित करता है, इसलिए विश्लेषण टूल अक्सर चुनिंदा कॉलम पढ़ सकते हैं। रूपांतरण का उद्देश्य फ़ॉर्मेट बदलना है; यह स्रोत डेटा की अर्थगत गुणवत्ता नहीं बदलता।
बदली हुई फ़ाइल को प्रोडक्शन डेटा पाइपलाइन में इस्तेमाल करने से पहले कॉलम टाइप, null, समय और नेस्टेड फ़ील्ड जाँचें।